Моделі та платформи ШІ

Meta AI’s MILS: Гра для нульової множинної модальної штучної інтелектуальної системи

mm
Додайте Unite.AI до бажаних джерел у Google

Тривалий час Штучна інтелект (ШІ) робила вражаючі відкриття, але завжди мала фундаментальну обмеження у своїй нездатності обробляти різні типи даних так, як це роблять люди. Більшість моделей ШІ є унімодальними, тобто спеціалізуються лише на одному форматі, наприклад тексті, зображеннях, відео чи аудіо. Хоча такий підхід є достатнім для конкретних завдань, він робить ШІ жорстким, не дозволяючи їй зв’язувати точки між різними типами даних і真正 розуміти контекст.

Щоб вирішити цю проблему, була введена множинна модальна штучна інтелект, яка дозволяє моделям працювати з декількома формами введення. Однак побудова цих систем не є легкою. їм потрібні величезні, позначені набори даних, які не лише важко знайти, але й дорогі та трудомісткі для створення. Крім того, ці моделі зазвичай потребують завдання-специфічного доопрацювання, що робить їх ресурсоємними та складними для масштабування до нових доменів.

Meta AI’s Множинна ітеративна розв’язувач LLM (MILS) є розробкою, яка змінює це. На відміну від традиційних моделей, які потребують перезнавчення для кожного нового завдання, MILS використовує нульове навчання, щоб інтерпретувати та обробляти невидані формати даних без попереднього знайомства. Замість того, щоб покладатися на попередньо існуючі позначення, вона доопрацьовує свої виходи в режимі реального часу за допомогою ітеративної системи оцінювання, безперервно покращуючи свою точність без потреби додаткового навчання.

Проблема традиційної множинної модальної штучної інтелектуальної системи

Множинна модальна штучна інтелект, яка обробляє та інтегрує дані з різних джерел для створення єдиної моделі, має величезний потенціал для зміни того, як штучна інтелект взаємодіє зі світом. На відміну від традиційної штучної інтелектуальної системи, яка покладаєся на один тип даних, множинна модальна штучна інтелект може розуміти та обробляти різні типи даних, наприклад конвертувати зображення в текст, генерувати підписи для відео чи синтезувати мову з тексту.

Однак традиційні множинні модальні штучні інтелектуальні системи стикаються з значними проблемами, включаючи складність, високу вимогливість до даних та труднощі з вирівнюванням даних. Ці моделі зазвичай складніші, ніж унімодальні моделі, і потребують суттєвих обчислювальних ресурсів та довшого часу навчання. Величезна різноманітність даних створює серйозні проблеми для якості даних, зберігання та надмірності, що робить такі об’єми даних дорогими для зберігання та обробки.

Щоб працювати ефективно, множинна модальна штучна інтелект потребує великої кількості високоякісних даних з декількох модальностей, і неконсистентна якість даних між модальностями може вплинути на продуктивність цих систем. Крім того, правильне вирівнювання значимих даних з різних типів даних, даних, які представляють той самий час і простір, є складним. Інтеграція даних з різних модальностей є складною, оскільки кожна модальність має свою структуру, формат та вимоги до обробки, що робить ефективні комбінації складними. Крім того, високоякісні позначені набори даних, які включають декілька модальностей, часто не достатньо, а збір та анотація множинних даних є трудомісткими та дорогими.

Визнаючи ці обмеження, Meta AI’s MILS використовує нульове навчання, що дозволяє штучній інтелекту виконувати завдання, на які вона не була явно навчена, та узагальнювати знання в різних контекстах. З нульовим навчанням MILS адаптується та генерує точні виходи без потреби додаткових позначених даних, розширюючи цю концепцію шляхом ітерації над декількома штучно створеними виходами та покращення точності за допомогою інтелектуальної системи оцінювання.

Чому нульове навчання є проривом

Одним з найбільш значимих досягнень у сфері штучної інтелекту є нульове навчання, яке дозволяє моделям штучної інтелекту виконувати завдання чи розпізнавати об’єкти без попереднього спеціального навчання. Традиційне машинове навчання покладаєся на великі, позначені набори даних для кожного нового завдання, тобто моделі повинні бути явно навчені на кожній категорії, яку вони повинні розпізнавати. Цей підхід працює добре, коли є достатньо тренувальних даних, але він стає проблемою в ситуаціях, коли позначені дані є рідкісними, дорогими чи неможливими для отримання.

Нульове навчання змінює це, дозволяючи штучній інтелекту застосовувати існуючі знання до нових ситуацій, подібно до того, як люди роблять висновки з попереднього досвіду. Замість того, щоб покладатися лише на позначені приклади, моделі нульового навчання використовують допоміжну інформацію, таку як семантичні атрибути чи контекстні відносини, щоб узагальнювати завдання. Ця здатність підвищує масштабованість, знижує залежність від даних та покращує адаптивність, роблячи штучну інтелекту значно більш універсальною в реальних застосуваннях.

Наприклад, якщо традиційна модель штучної інтелектуальної системи, навчена лише на тексті, раптом запитана описати зображення, вона буде боротися без явного навчання на візуальних даних. На відміну від цього, модель нульового навчання, така як MILS, може обробляти та інтерпретувати зображення без потреби додаткових позначених прикладів. MILS далі покращує цю концепцію шляхом ітерації над декількома штучно створеними виходами та доопрацювання своїх реакцій за допомогою інтелектуальної системи оцінювання.

Цей підхід є особливо цінним у галузях, де анотовані дані є обмеженими або дорогими для отримання, наприклад у медичній візуалізації, рідкій мовній перекладі та наукових дослідженнях. Здатність моделей нульового навчання швидко адаптуватися до нових завдань без перезнавчення робить їх потужними інструментами для широкого спектра застосунків, від визнання зображень до природної мови обробки.

Як Meta AI’s MILS покращує множинну модальну інтелектуальну систему

Meta AI’s MILS вводить розумніший спосіб для штучної інтелектуальної системи інтерпретувати та доопрацьовувати множинні дані без потреби у суттєвому перезнавченні. Вона досягає цього за допомогою ітеративного двоступінчатого процесу, який працює на двох ключових компонентах:

  • Генератор: Велика мова модель (LLM), така як LLaMA-3.1-8B, яка створює декілька можливих інтерпретацій входу.
  • Оцінювач: попередньо навчена множинна модальна модель, така як CLIP, яка оцінює ці інтерпретації, ранжуючи їх за точністю та актуальністю.

Цей процес повторюється у зворотному зв’язку, безперервно доопрацьовуючи виходи до тих пір, поки не буде досягнуто найбільш точної та контекстно точної реакції, все це без зміни параметрів моделі.

Що робить MILS унікальним, це її оптимізація в режимі реального часу. Традиційні моделі штучної інтелектуальної системи покладаються на фіксовані попередньо навчені ваги та потребують суттєвого перезнавчення для нових завдань. На відміну від цього, MILS адаптується динамічно під час тестування, доопрацьовуючи свої реакції на основі негайної реакції від Оцінювача. Це робить її більш ефективною, гнучкою та менш залежною від великих позначених наборів даних.

MILS може обробляти різні множинні завдання, наприклад:

  • Підписи зображень: Ітеративне доопрацювання підписів з LLaMA-3.1-8B та CLIP.
  • Аналіз відео: Використання ViCLIP для генерації узгоджених описів візуального контенту.
  • Обробка аудіо: Використання ImageBind для опису звуків у природній мові.
  • Генерація зображень з тексту: Покращення промптів перед тим, як вони будуть введені у дифузійні моделі для покращення якості зображень.
  • Передача стилю: Генерація оптимізованих редакторських промптів для забезпечення візуально узгоджених перетворень.

Використовуючи попередньо навчені моделі як механізми оцінювання замість вимог до спеціального навчання, MILS забезпечує потужну нульову продуктивність у різних завданнях. Це робить її трансформаційним підходом для розробників та дослідників, дозволяючи інтегрувати множинну логіку у застосунки без тягаря суттєвого перезнавчення.

Як MILS перевершує традиційну штучну інтелектуальну систему

MILS суттєво перевершує традиційні моделі штучної інтелектуальної системи у декількох ключових областях, зокрема у ефективності навчання та зниженні витрат. Традиційні моделі штучної інтелектуальної системи зазвичай потребують окремого навчання для кожного типу даних, що вимагає не лише великих позначених наборів даних, але й викликає високі обчислювальні витрати. Це розділення створює бар’єр для доступності для багатьох підприємств, оскільки ресурси, необхідні для навчання, можуть бути заборонними.

На відміну від цього, MILS використовує попередньо навчені моделі та доопрацьовує виходи динамічно, суттєво знижуючи ці обчислювальні витрати. Цей підхід дозволяє організаціям впроваджувати передові можливості штучної інтелектуальної системи без фінансового тягаря, зазвичай пов’язаного з суттєвим навчанням моделей.

Крім того, MILS демонструє високу точність та продуктивність у порівнянні з існуючими моделями штучної інтелектуальної системи на різних бенчмарках для підписів відео. Її ітеративний процес доопрацювання дозволяє їй генерувати більш точні та контекстно актуальні результати, ніж моделі однократного навчання, які часто борються з генерацією точних описів з нових типів даних. Безперервно покращуючи свої виходи через зворотний зв’язок між Генератором та Оцінювачем, MILS забезпечує, що кінцеві результати не лише високоякісні, але й адаптовані до конкретних нюансів кожного завдання.

Масштабованість та адаптивність є додатковими сильними сторонами MILS, які відрізняють її від традиційних моделей штучної інтелектуальної системи. Оскільки вона не потребує перезнавчення для нових завдань або типів даних, MILS може бути інтегрована у різні системи штучної інтелектуальної системи у різних галузях. Ця внутрішня гнучкість робить її високо масштабованою та майбутньою, дозволяючи організаціям використовувати її можливості, коли їхні потреби змінюються. Коли підприємства все частіше шукають вигоди від штучної інтелектуальної системи без обмежень традиційних моделей, MILS з’явилася як трансформаційне рішення, яке підвищує ефективність та забезпечує вищу продуктивність у широкому спектрі застосунків.

Основне

Meta AI’s MILS змінює спосіб, у який штучна інтелект обробляє різні типи даних. Замість того, щоб покладатися на великі позначені набори даних або постійне перезнавчення, вона вчиться та покращується під час роботи. Це робить штучну інтелекту більш гнучкою та корисною у різних галузях, чи то аналіз зображень, обробка аудіо чи генерація тексту.

Доопрацьовуючи свої реакції в режимі реального часу, MILS наближає штучну інтелектуальну систему до того, як люди обробляють інформацію, вчиться з phảnедбеку та приймає кращі рішення на кожному етапі. Цей підхід не лише робить штучну інтелектуальну систему розумнішою, але й робить її практичнішою та адаптованою до реальних викликів.

Доктор Ассад Аббас, доцент COMSATS University Islamabad, Пакистан, отримав ступінь доктора філософії в Північному державному університеті Дакоти, США. Його дослідження зосереджені на передових технологіях, включаючи хмарні, туманні та краєві обчислення, великі дані та аналіз штучного інтелекту. Доктор Аббас зробив суттєві внески з публікаціями в авторитетних наукових журналах та конференціях. Він також є засновником MyFastingBuddy.