Моделі та платформи ШІ

Розкриття великих багатомодальних моделей: формування ландшафту мовних моделей у 2024 році

mm
Додайте Unite.AI до бажаних джерел у Google

Коли ми переживаємо світ, наші відчуття (зір, звуки, запахи) надають різноманітну масу інформації, і ми виражаємо себе різними засобами спілкування, такими як міміка і жести. Ці відчуття і засоби спілкування називаються модальностями, що представляють різні способи сприйняття і спілкування. Взявши за приклад цю людську здатність, великі багатомодальні моделі (ВБМ), що поєднують генеративні і багатомодальні моделі штучного інтелекту, розробляються для розуміння і створення контенту різних типів, таких як текст, зображення і аудіо. У цій статті ми глибоко вивчаємо цю новоутворену галузь, досліджуючи, що таке ВБМ, як вони побудовані, існуючі приклади, виклики, з якими вони стикаються, і потенційні застосування.

Еволюція генеративного штучного інтелекту у 2024 році: від великих мовних моделей до великих багатомодальних моделей

У своєму останньому звіті McKinsey назвав 2023 рік роком прориву для генеративного штучного інтелекту, що призвело до багатьох досягнень у цій галузі. Ми стали свідками помітного зростання поширення великих мовних моделей, що вміють розуміти і генерувати людську мову. Крім того, моделі генерації зображень значно еволюціонували, демонструючи свою здатність створювати візуальні зображення з текстових підказок. Однак, незважаючи на значний прогрес у окремих модальностях, таких як текст, зображення або аудіо, генеративний штучний інтелект зіштовхнувся з труднощами у безшовному поєднанні цих модальностей у процесі генерації. Оскільки світ є вроджено багатимодальним, штучному інтелекту потрібно осягнути багатимодальну інформацію. Це необхідно для значимого спілкування з людьми і успішної роботи у реальних сценаріях.

Отже, багато дослідників штучного інтелекту передбачають підйом ВБМ як наступний рубіж у дослідженні і розробці штучного інтелекту у 2024 році. Цей еволюційний рубіж зосереджується на підвищенні здатності генеративного штучного інтелекту обробляти і генерувати різноманітні виходи, що охоплюють текст, зображення, аудіо, відео і інші модальності. Необхідно підкреслити, що не всі багатомодальні системи відповідають вимогам ВБМ. Моделі, такі як Midjourney і Stable Diffusion, незважаючи на те, що вони багатимодальні, не входять до категорії ВБМ, головним чином тому, що їм бракує великих мовних моделей, які є фундаментальною складовою ВБМ. Інакше кажучи, ми можемо описати ВБМ як розширення великих мовних моделей, що надають їм здатність ефективно обробляти різні модальності.

Як працюють ВБМ?

Хоча дослідники досліджували різні підходи до побудови ВБМ, вони зазвичай включають три основні компоненти і операції. По-перше, використовуються кодувальники для кожної модальності даних для генерації представлень даних (відому як вкладення) для цієї модальності. По-друге, використовуються різні механізми для вирівнювання вкладень з різних модальностей у єдиний багатимодальний простір вкладень. По-третє, для генеративних моделей використовується велика мовна модель для генерації текстових відповідей. Оскільки вхідні дані можуть складатися з тексту, зображень, відео і аудіо, дослідники працюють над новими способами зробити мовні моделі враховувати різні модальності при генерації відповідей.

Розробка ВБМ у 2023 році

Нижче я коротко описав деякі відомі ВБМ, розроблені у 2023 році.

  • LLaVA – відкрита ВБМ, розроблена університетом Вісконсин-Медісон, дослідницькою лабораторією Microsoft (MSFT ) і Колумбійським університетом. Модель має на меті надати відкриту версію багатимодальної GPT4. Використовуючи Meta’s Llama, вона включає CLIP візуальний кодувальник для надійного візуального сприйняття. Варіант LLaVA, орієнтований на охорону здоров’я, називається LLaVA-Med, і може відповідати на запитання, пов’язані з біомедичними зображеннями.
  • ImageBind – відкрита модель, створена Meta, що імітує здатність людського сприйняття пов’язувати багатимодальні дані. Модель інтегрує шість модальностей – текст, зображення/відео, аудіо, 3D-виміри, температурні дані і рухові дані – вивчаючи єдине представлення цих різних типів даних. ImageBind може пов’язати об’єкти на фотографіях з атрибутами, такими як звук, 3D-фігури, температура і рух. Модель можна використовувати, наприклад, для генерації сцени з тексту або звуків.
  • SeamlessM4T – багатимодальна модель, розроблена Meta для поліпшення спілкування між багатомовними спільнотами. SeamlessM4T excels у завданнях перекладу і транскрипції, підтримуючи мовлення-до-мовлення, мовлення-до-тексту, текст-до-мовлення і текст-до-тексту переклади. Модель використовує некореляційний декодувальник тексту-до-одиниці для виконання цих перекладів. Розширена версія, SeamlessM4T v2, є основою для моделей, таких як SeamlessExpressive і SeamlessStreaming, підкреслюючи збереження виразності між мовами і надання перекладів з мінімальною затримкою.
  • GPT4, запущений OpenAI, є вдосконаленням свого попередника, GPT3.5. Хоча деталі архітектури не розголошуються повністю, GPT4 відомий своєю безшовною інтеграцією текстових, візуальних і аудіо-моделей. Модель може генерувати текст з текстових і графічних вхідних даних. Вона excels у різних завданнях, таких як гумористичний опис зображень, підсумкування тексту з екранних знімків і відповіді на екзаменаційні питання з діаграмами. GPT4 також відомий своєю адаптивністю у ефективній обробці широкого спектра форматів вхідних даних.
  • Gemini, створений Google DeepMind, відрізняється тим, що є вроджено багатимодальним, дозволяючи безшовне взаємодія між різними завданнями без використання окремих моделей. Ця модель легко обробляє текстові і аудіовізуальні вхідні дані, демонструючи свою здатність генерувати виходи у вигляді тексту і зображень.

Виклики великих багатимодальних моделей

  • Включення більше модальностей: Більшість існуючих ВБМ працюють з текстом і зображеннями. Однак ВБМ повинні еволюціонувати за межі тексту і зображень, включаючи модальності, такі як відео, музика і 3D.
  • Розрізноманітнені набори даних: Одним з ключових викликів у розробці і навчанні багатимодальних генеративних моделей штучного інтелекту є потреба у великих і різноманітних наборах даних, що включають кілька модальностей. Наприклад, для навчання моделі генерації тексту і зображень разом потрібно мати набір даних, що включає як текстові, так і зображенні вхідні дані, пов’язані один з одним.
  • Генерація багатимодальних виходів: Хоча ВБМ можуть обробляти багатимодальні вхідні дані, генерація різноманітних виходів, таких як поєднання тексту з графіками або анімацією, залишається викликом.
  • Виконання інструкцій: ВБМ стикаються з викликом освоєння діалогів і виконання інструкцій, рухаючись за межі простого завершення.
  • Багатимодальне мислення: Хоча сучасні ВБМ добре справляються з перетворенням однієї модальності в іншу, безшовна інтеграція багатимодальної інформації для складних завдань мислення, таких як розв’язання письмових задач на основі аудіоінструкцій, залишається складним завданням.
  • Стиснення ВБМ: Ресурсоємність ВБМ становить значну перешкоду, роблячи їх непрактичними для використання на пристроях з обмеженими обчислювальними ресурсами. Стиснення ВБМ для підвищення ефективності і їхньої придатності для розгортання на пристроях з обмеженими ресурсами є важливою сферою тривайних досліджень.

Потенційні випадки використання

  • Освіта: ВБМ мають потенціал революціонізувати освіту, генеруючи різноманітні і привабливі навчальні матеріали, що поєднують текст, зображення і аудіо. ВБМ можуть надавати комплексну зворотню зв’язок щодо завдань, підтримувати платформи колективного навчання, підвищувати розвиток навичок через інтерактивні симуляції і реальні приклади.
  • Охорона здоров’я: На відміну від традиційних систем штучного інтелекту для діагностики, що орієнтуються на одну модальність, ВБМ покращують медичну діагностику, інтегруючи кілька модальностей. Вони також підтримують спілкування через мовні бар’єри між медичними працівниками і пацієнтами, діючи як централізований репозиторій для різних застосунків штучного інтелекту у лікарнях.
  • Генерація мистецтва і музики: ВБМ можуть excels у генерації мистецтва і музики, поєднуючи різні модальності для унікальних і виразних виходів. Наприклад, модель генерації мистецтва ВБМ може поєднувати візуальні і аудіоелементи, забезпечуючи іммерсивний досвід. Аналогічно, музична модель ВБМ може інтегрувати інструментальні і вокальні елементи, результатом чого будуть динамічні і виразні композиції.
  • Персоналізовані рекомендації: ВБМ можуть аналізувати вподобання користувачів у різних модальностях, щоб надавати персоналізовані рекомендації для споживання контенту, такого як фільми, музика, статті чи товари.
  • Прогнозування погоди і моніторинг довкілля: ВБМ можуть аналізувати різні модальності даних, такі як зображення з супутників, атмосферні умови і історичні закономірності, щоб покращити точність прогнозування погоди і моніторингу довкілля.

Висновок

Ландшафт великих багатимодальних моделей (ВБМ) позначає значний прорив у генеративному штучному інтелекті, обіцяючи досягнення у різних галузях. Коли ці моделі безшовно інтегрують різні модальності, такі як текст, зображення і аудіо, їхня розробка відкриває двері до трансформаційних застосунків у сфері охорони здоров’я, освіти, мистецтва і персоналізованих рекомендацій. Однак виклики, такі як включення більше модальностей і стиснення ресурсоємних моделей, підкреслюють тривалі дослідницькі зусилля, необхідні для повної реалізації потенціалу ВБМ.

Доктор Техсін Зія є доцентом COMSATS University Islamabad, який має ступінь PhD з штучного інтелекту у Віденському технічному університеті, Австрія. Спеціалізується на штучному інтелекті, машинному навчанні, науці про дані та комп'ютерному баченні, він зробив значний внесок з публікаціями в авторитетних наукових журналах. Доктор Техсін також очолював різні промислові проекти як головний дослідник і служив консультантом з штучного інтелекту.