AI 모델 및 플랫폼
멀티모달 러닝은 AI 개발자 사이에서 두드러지게 나타나고 있다
Venture Beat(VB)에서는 인공 지능 개발에서 멀티모달 러닝의 이점에 대해 한 주간의 보고서를 바쳤습니다. 이 보고서는 ABI Research의 보고서에 근거합니다.
중요한 개념은 “데이터 세트는 AI 시스템의 기본 빌딩 블록”이며, “데이터 세트 없이 모델은 예측에 필요한 관계를 학습할 수 없다”는 것입니다. ABI 보고서는 “2019년에 26.9억 개의 AI 장치가 설치될 것으로 예상되며, 2024년에는 44.7억 개로 증가할 것”이라고 예측합니다. 그러나 “이들 중 비교적 적은 수만이 단기적으로 상호 운용될 수 있을 것입니다.”
이로 인해 상당한 시간, 에너지, 자원이浪費될 수 있습니다. “각각의 장치가 독립적으로 작동하여 데이터를 처리하는 대신, 여러 센서와 입력에서 데이터를 하나의 시스템으로 통합할 수 있습니다. 멀티모달 러닝은 보완적인 정보나 트렌드를 제공할 수 있으며, 이는 데이터가 모두 포함된 학습 과정에서만 나타날 수 있습니다.”
VB에서는 이미지와 텍스트 캡션을 고려한 예시를 제시합니다. “다른 단어가 유사한 이미지와 짝지어질 때, 이러한 단어는 동일한 사물이나 객체를 설명하는 것으로 간주될 수 있습니다. 반대로, 일부 단어가 다른 이미지와 함께 나타날 때, 이는 이러한 이미지가 동일한 객체를 나타낸다는 것을 의미합니다. 따라서 AI 모델은 텍스트 설명에서 이미지 객체를 예측할 수 있어야 하며, 실제로 학술 문헌은 이를 입증했습니다.”
이러한 이점에도 불구하고, ABI는 IBM, Microsoft (MSFT ), Amazon (AMZN ), Google와 같은 기술 대기업이 여전히 주로 유니모달 시스템에 집중하고 있다고 지적합니다. 이러한 전환의 어려움이 그 이유 중 하나입니다.
그러나 ABI 연구진은 “로봇, 소비자, 헬스케어, 미디어 및 엔터테인먼트 분야에서 채택이 증가함에 따라 2017년 394만 개에서 2023년 5.1412억 개로 증가할 것으로 예상됩니다.”라고 예측합니다. 이미 멀티모달 러닝을 적용하고 있는 회사로는 Waymo가 있으며, 하이퍼 어웨어 셀프 드라이빙 차량을 개발하고 있습니다. 또한 Intel (INTC ) Labs에서도 센서 데이터 수집을 위한 기술을 조사하고 있습니다.
Intel Labs의 Omesh Tickoo는 VB와의 인터뷰에서 “시간과 같은 컨텍스트를 파악하는 기술을 사용하여 센서 데이터의 품질을 평가하는 시스템을 구축했습니다. 이 신뢰도 값을 사용하여 센서를 다른 간격으로 가중치로 선택하여 우리가 원하는 답변을 제공합니다.”라고 설명했습니다.
VB는 유니모달 러닝이 이미지 인식과 자연어 처리와 같은 분야에서 여전히 우세할 것으로 예상하지만, “전자 기기가 더 저렴하고 컴퓨팅이 더 확장 가능해짐에 따라 멀티모달 러닝이 더 두드러지게 나타날 것으로 예상합니다.”












