AI 모델 및 플랫폼

2024년 대형 멀티모달 모델의 등장: 언어 모델의 지형을 형성하다

mm
Unite.AI를 Google의 선호 소스에 추가

우리가 세계를 경험할 때, 우리의 감각(시각, 소리, 냄새)은 다양한 정보를 제공하며, 우리는 다양한 의사소통 방법을 사용하여 자신을 표현한다. 이러한 감각과 의사소통 방법을 모달리티라고 하며, 우리가 정보를 인식하고 의사소통하는 다양한 방법을 나타낸다. 인간의 이러한 능력에서 영감을 얻은 대형 멀티모달 모델(LMM)은 생성과 멀티모달 인공지능의 결합으로, 텍스트, 이미지, 오디오와 같은 다양한 유형의 콘텐츠를 이해하고 생성하기 위해 개발되고 있다. 이 기사에서는 이 새로운 분야를 탐구하여 LMM이 무엇인지, 어떻게 구성되는지, 존재하는 예시, 도전 과제, 그리고 잠재적인 응용 분야를 살펴본다.

2024년 생성 인공지능의 진화: 대형 언어 모델에서 대형 멀티모달 모델로

맥킨지는 2023년을 생성 인공지능의 돌파구로 지정했으며, 이는 많은 분야에서 발전을 가져왔다. 우리는 대형 언어 모델(LLM)의 普遍性를 목격했으며, 이러한 모델은 인간과 같은 언어를 이해하고 생성할 수 있다. 또한, 이미지 생성 모델은 텍스트 프롬프트에서 시각적 콘텐츠를 생성하는 능력을 보여주었다. 그러나, 개별 모달리티에서 상당한 발전에도 불구하고, 생성 인공지능은 이러한 모달리티를 생성 과정에서 무결하게 결합하는 데 도전을 겪었다. 세계는 본질적으로 멀티모달이기 때문에, 인공지능은 멀티모달 정보를 다루는 데 능숙해야 한다. 이는 인간과 의미 있는 상호작용을 하기 위해 그리고 실제 상황에서 성공적으로 작동하기 위해 필수적이다.

따라서, 많은 인공지능 연구자들은 2024년에 LMM의 부상이 인공지능 연구와 개발의 다음 전선이 될 것으로 예상한다. 이 발전하는 전선은 생성 인공지능이 다양한 출력을 처리하고 생성하는 능력을 강화하는 데 중점을 두며, 이는 텍스트, 이미지, 오디오, 비디오 및 기타 모달리티를 포함한다. 모든 멀티모달 시스템이 LMM으로 자격을 얻지 않는다는 점을 강조하는 것이 중요하다. Midjourney와 Stable Diffusion과 같은 모델은 멀티모달이지만, LLM을 포함하지 않기 때문에 LMM 카테고리에 속하지 않는다. 즉, LMM을 LLM의 확장으로 설명할 수 있으며, 다양한 모달리티를 능숙하게 처리하는 능력을 제공한다.

LMM은 어떻게 작동하는가?

연구자들은 LMM을 구성하는 다양한 접근 방식을 탐구했으며, 일반적으로 세 가지 필수 구성 요소와 작동이 포함된다. 첫째, 각 데이터 모달리티에 대한 인코더를 사용하여 해당 모달리티에 특有的 데이터 표현(임베딩이라고 함)을 생성한다. 둘째, 다른 메커니즘을 사용하여 다양한 모달리티의 임베딩을統一한 멀티모달 임베딩 공간으로 정렬한다. 셋째, 생성 모델의 경우, 텍스트 응답을 생성하기 위해 LLM을 사용한다. 입력은 텍스트, 이미지, 비디오 및 오디오로 구성될 수 있기 때문에, 연구자들은 언어 모델이 다양한 모달리티를 고려하여 응답을 생성하는 새로운 방법을 개발 중이다.

2023년 LMM의 개발

아래는 2023년에 개발된 일부 주목할만한 LMM을 간단히 정리한 것이다.

  • LLaVA는 위스콘신 대학교 매디슨, 마이크로소프트 연구소, 컬럼비아 대학교가 공동으로 개발한 오픈소스 LMM이다. 이 모델은 멀티모달 GPT4의 오픈소스 버전을 제공하는 것을 목표로 한다. 메타의 Llama LLM을 활용하여, CLIP 비주얼 인코더를 사용하여 강력한 시각적 이해를 제공한다. LLaVA의 헬스케어에 중점을 둔 변형인 LLaVA-Med는 생물의학 이미지와 관련된 질문에 답변할 수 있다.
  • ImageBind는 메타가 개발한 오픈소스 모델로, 인간의 지각 능력을 모방하여 멀티모달 데이터를 관련시킨다. 이 모델은 6개의 모달리티(텍스트, 이미지/비디오, 오디오, 3D 측정, 온도 데이터, 동작 데이터)를 통합하여 다양한 데이터 유형에 걸친統一한 표현을 학습한다. ImageBind는 사진中的 객체를 소리, 3D 모양, 온도 및 동작과 같은 속성과 연결할 수 있다. 이 모델은 텍스트나 소리로부터 장면을 생성하는 데 사용될 수 있다.
  • SeamlessM4T는 메타가 개발한 멀티모달 모델로, 다국어 커뮤니티 간의 의사소통을 촉진한다. SeamlessM4T는 번역 및 전사 작업에优秀하며, 음성-음성, 음성-텍스트, 텍스트-음성 및 텍스트-텍스트 번역을 지원한다. 이 모델은 비자율적 텍스트-유닛 디코더를 사용하여 이러한 번역을 수행한다. SeamlessM4T의 향상된 버전인 SeamlessM4T v2는 SeamlessExpressive 및 SeamlessStreaming과 같은 모델의 기반이며, 언어 간의 표현을 보존하고 최소한의 지연으로 번역을 제공한다.
  • GPT4는 오픈AI가 출시한 이전 버전인 GPT3.5의 발전이다. 자세한 아키텍처 세부 사항은 공개되지 않았지만, GPT4는 텍스트 전용, 비전 전용 및 오디오 전용 모델을 원활하게 통합하는 것으로 잘 알려져 있다. 이 모델은 텍스트와 그래픽 입력 모두에서 텍스트를 생성할 수 있다. 또한, 이미지의 유머 설명, 스크린샷의 텍스트 요약, 도형이 포함된 시험 문제에 대한 적절한 응답과 같은 다양한 작업에 탁월하다. GPT4는 또한 다양한 입력 데이터 형식을 효과적으로 처리하는 데 적응력이 뛰어나다.
  • Gemini는 구글 딥마인이 개발한 모델로, 본질적으로 멀티모달이며, 다양한 작업에 걸쳐 무결하게 상호작용할 수 있다. 이 모델은 텍스트와 다양한 오디오-비주얼 입력을 모두 원활하게 관리하며, 텍스트와 이미지 형식의 출력을 생성하는 능력을展示한다.

대형 멀티모달 모델의 도전

  • 더 많은 데이터 모달리티 통합: 대부분의 기존 LMM은 텍스트와 이미지에서 작동한다. 그러나, LMM은 텍스트와 이미지 너머로 발전하여, 비디오, 음악 및 3D와 같은 모달리티를 포함해야 한다.
  • 다양한 데이터셋의 가용성: 멀티모달 생성 인공지능 모델을 개발하고 훈련하는 데 필요한 주요 도전은 다양한 모달리티를 포함하는 대규모 데이터셋의 필요성이다. 예를 들어, 텍스트와 이미지 입력을 모두 포함하는 데이터셋이 필요하다.
  • 멀티모달 출력 생성: LMM은 멀티모달 입력을 처리할 수 있지만, 텍스트와 그래픽 또는 애니메이션을 결합하는 출력을 생성하는 것은 여전히 도전이다.
  • 지시를 따르기: LMM은 대화와 지시를 따르는 작업을 마스터하는 데 도전을 겪으며, 단순한 완성을 넘어선다.
  • 멀티모달 추론: 현재 LMM은 한 모달리티를 다른 모달리티로 변환하는 데 탁월하지만, 멀티모달 데이터를 복잡한 추론 작업에 통합하는 것은 여전히 도전이다.
  • LMM의 압축: LMM의 자원 집중적인 특성은重大한 장애물이며, 이를 효율성을 향상시키고 제한된 컴퓨팅 자원을 가진 에지 디바이스에 배포할 수 있도록 압축하는 것은 중요한 연구 영역이다.

잠재적인 사용 사례

  • 교육: LMM은 다양한 학습 자료를 생성하여 교육을 혁신할 수 있다. 또한, 과제에 대한 포괄적인 피드백을 제공하고, 협력적인 학습 플랫폼을 촉진하며, 상호작용적인 시뮬레이션과 실제 예를 통해 기술 개발을 향상시킬 수 있다.
  • 헬스케어: 전통적인 인공지능 진단 시스템과 달리, LMM은 여러 모달리티를 통합하여 의료 진단을 개선한다. 또한, 언어 장벽을 넘어 의료 제공자와 환자 간의 의사소통을 지원하며, 병원 내의 다양한 인공지능 애플리케이션을 위한 중앙 저장소 역할을 한다.
  • 예술 및 음악 생성: LMM은 다양한 모달리티를 결합하여 고유하고 표현력 있는 출력을 생성할 수 있다. 예를 들어, 예술 LMM은 시각적 및 청각적 요소를 결합하여 몰입감 있는 경험을 제공할 수 있다. 마찬가지로, 음악 LMM은 악기와 보컬 요소를 통합하여 역동적이고 표현력 있는 구성물을 생성할 수 있다.
  • 개인화된 추천: LMM은 다양한 모달리티에서 사용자 선호도를 분석하여 영화, 음악, 기사 또는 제품과 같은 콘텐츠 소비를 위한 개인화된 추천을 제공할 수 있다.
  • 기상 예측 및 환경 모니터링: LMM은 위성 이미지, 대기 조건, 역사적 패턴과 같은 다양한 모달리티의 데이터를 분석하여 기상 예측과 환경 모니터링의 정확도를 향상시킬 수 있다.

결론

대형 멀티모달 모델(LMM)의 지형은 생성 인공지능에서重大한 발전을 나타내며, 다양한 분야에서 발전을 약속한다. 이러한 모델이 텍스트, 이미지, 오디오와 같은 다양한 모달리티를 무결하게 통합함에 따라, 헬스케어, 교육, 예술 및 개인화된 추천과 같은 분야에서 변혁적인 응용 분야를 개방한다. 그러나, 더 많은 데이터 모달리티를 통합하고, 자원 집중적인 모델을 압축하는 것과 같은 도전은 LMM의 잠재력을 완전히 실현하기 위한 계속적인 연구 노력을 강조한다.

Dr. Tehseen Zia는 COMSATS University Islamabad의 정교수이며, 오스트리아 비엔나 기술대학교에서 인공지능 박사학위를 취득했습니다. 인공지능, 기계학습, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 유명한 과학 저널에 발표된 논문으로 знач적인 기여를 했습니다. Dr. Tehseen은 주요 연구자로서 다양한 산업 프로젝트를 이끌었으며, 인공지능 컨설턴트로도 활동했습니다.