Моделі та платформи ШІ

Дивись, думай, пояснюй: Зростання моделей мови зору в штучному інтелекті

mm
Додайте Unite.AI до бажаних джерел у Google

Близько десяти років тому штучний інтелект був розділений на розпізнавання зображень та розуміння мови. Моделі зору могли помітити об’єкти, але не могли описати їх, а моделі мови могли генерувати текст, але не могли “бачити”. Сьогодні цей розрив швидко зникає. Моделі мови зору (VLM) тепер поєднують візуальні та мовні навички, дозволяючи їм інтерпретувати зображення та пояснювати їх способами, які майже людські. Що робить їх真正ньо винятковими, це їхній крок за кроком процес мислення, відомий як ланцюг мислення, який допомагає перетворити ці моделі на потужні та практичні інструменти в різних галузях, таких як охорона здоров’я та освіта. У цій статті ми розглянемо, як працюють VLM, чому їхнє мислення має значення, і як вони перетворюють галузі від медицини до самохідних автомобілів.

Розуміння моделей мови зору

Моделі мови зору, або VLM, є типом штучного інтелекту, який може зрозуміти як зображення, так і текст одночасно. На відміну від старих систем штучного інтелекту, які могли обробляти тільки текст або зображення, VLM поєднують ці дві навички. Це робить їх надзвичайно універсальними. Вони можуть подивитися на зображення і описати, що відбувається, відповісти на питання про відео або навіть створити зображення на основі написаного опису.

Наприклад, якщо ви попросите VLM описати фотографію собаки, яка біжить у парку. VLM не просто скаже: “Там собака”. Він може сказати: “Собака гониться за м’ячем біля великого дуба”. Він бачить зображення і пов’язує його зі словами таким чином, що це має сенс. Ця здатність поєднувати візуальне та мовне розуміння створює всілякі можливості, від допомоги у пошуку зображень в Інтернеті до допомоги у більш складних завданнях, таких як медична візуалізація.

У своїй основі VLM працюють шляхом поєднання двох ключових компонентів: системи зору, яка аналізує зображення, і системи мови, яка обробляє текст. Частина зору фіксує деталі, такі як форми та кольори, а частина мови перетворює ці деталі на речення. VLM тренуються на величезних наборах даних, які містять мільярди пар зображень і тексту, що дає їм великий досвід для розвитку глибокого розуміння та високої точності.

Що таке ланцюг мислення в VLM

Ланцюг мислення, або CoT, є способом зробити штучний інтелект мислити крок за кроком, подібно до того, як ми підходимо до проблеми, розбиваючи її на частини. У VLM це означає, що штучний інтелект не просто надає відповідь, коли ви питаєте його щось про зображення, але також пояснює, як він прийшов до цього висновку, пояснюючи кожний логічний крок на своєму шляху.

Наприклад, якщо ви покажете VLM зображення торту з свічками і запитаєте: “Скільки років людині?” Без CoT він міг би просто вгадати число. З CoT він подумає про це крок за кроком: “Окей, я бачу торт зі свічками. Свічки зазвичай показують вік людини. Давайте порахуємо їх, там 10. Отже, людині, ймовірно, 10 років”. Ви можете слідкувати за його міркуваннями, коли вони розгортаються, що робить відповідь набагато більш достовірною.

Аналогічно, коли VLM показують зображення дорожньої ситуації і запитують: “Чи безпечно перейти?” VLM міг би подумати так: “Світлофор для пішоходів червоне, тому не слід переходити. Там також є автомобіль, який повертає, і він рухається, а не зупинився. Це означає, що зараз не безпечно переходити”. Проходячи ці кроки, штучний інтелект показує вам точно, на що він звертає увагу в зображенні і чому він приймає певні рішення.

Чому ланцюг мислення має значення в VLM

Пов’язування ланцюга мислення з VLM приносить кілька ключових переваг.

По-перше, це робить штучний інтелект легшим для довіри. Коли він пояснює свої кроки, ви отримуєте чітке розуміння того, як він прийшов до відповіді. Це важливо в галузях, таких як охорона здоров’я. Наприклад, коли лікар дивиться на зображення МРТ, VLM міг би сказати: “Я бачу тінь на лівій стороні мозку. Ця область контролює мову, і у пацієнта виникли труднощі з мовленням, тому це міг би бути пухлин”. Лікар може слідкувати за цією логікою і відчувати впевненість у висновку штучного інтелекту.

По-друге, це допомагає штучному інтелекту підходити до складних проблем. Розбиваючи все на частини, він може обробляти питання, які потребують більш ніж швидкого погляду. Наприклад, підрахунок свічок простий, але визначення безпеки на зайнятій вулиці потребує кількох кроків, включаючи перевірку світлофорів, виявлення рухомих автомобілів та оцінку швидкості. Ланцюг мислення дозволяє штучному інтелекту обробляти цю складність, розбиваючи все на окремі кроки.

Нарешті, це робить штучний інтелект більш адаптивним. Коли він мислить крок за кроком, він може застосувати свої знання до нових ситуацій. Якщо він ніколи не бачив конкретного типу торту раніше, він все одно може визначити зв’язок між свічками та віком, оскільки він мислить про все крок за кроком, а не просто спирається на запам’ятовані шаблони.

Як ланцяг мислення та VLM змінюють галузі

Поєднання ланцюга мислення та VLM робить значний вплив на різні галузі:

  • Охорона здоров’я: У медицині VLM, такі як Med-PaLM 2 від Google (GOOGL ), використовують ланцюг мислення для розбиття складних медичних питань на менші діагностичні кроки. Наприклад, коли надано рентгенівське зображення грудної клітки та симптоми, такі як кашель і головний біль, штучний інтелект міг би подумати так: “Ці симптоми могли б бути простудою, алергією або чимось серйознішим. Немає збільшених лімфатичних вузлів, тому це, ймовірно, не серйозна інфекція. Легені здаються чистими, тому це, ймовірно, не пневмонія. Простуда найкраще підходить”. Він проходить через варіанти і виходить на відповідь, надавши лікарям чітке пояснення для роботи.
  • Самохідні автомобілі: Для автономних транспортних засобів VLM з ланцюгом мислення покращують безпеку та процес прийняття рішень. Наприклад, самохідний автомобіль може проаналізувати дорожню ситуацію крок за кроком: перевірити сигнали пішоходів, виявити рухомі автомобілі та вирішити, чи безпечно продовжувати рух. Системи, такі як LINGO-1 від Wayve, генерують природний мовний коментар, щоб пояснити дії, такі як зниження швидкості для велосипедиста. Це допомагає інженерам і пасажирам зрозуміти процес мислення транспортного засобу. Крок за кроком логіка також дозволяє краще обробляти незвичайні дорожні умови шляхом поєднання візуальної інформації з контекстними знаннями.
  • Геопросторічний аналіз: Модель Gemini від Google застосовує ланцюг мислення до просторових даних, таких як карти та супутникові зображення. Наприклад, вона може оцінити ушкодження від урагану шляхом інтеграції супутникових зображень, прогнозів погоди та демографічних даних, а потім генерувати чіткі візуалізації та відповіді на складні питання. Ця здатність прискорює реакцію на стихійні лиха, надаючи тим, хто приймає рішення, своєчасні та корисні знання без потреби технічної експертизи.
  • Робототехніка: У робототехніці інтеграція ланцюга мислення та VLM дозволяє роботам краще планувати та виконувати завдання з кількох кроків. Наприклад, коли роботові доручено взяти об’єкт, VLM з ланцюгом мислення дозволяє йому ідентифікувати чашку, визначити найкращі точки захоплення, спланувати шлях без зіткнень та виконати рух, все це пояснюючи кожний крок свого процесу. Проекти, такі як RT-2, демонструють, як ланцюг мислення дозволяє роботам краще адаптуватися до нових завдань та реагувати на складні команди з чітким розумінням.
  • Освіта: У навчанні штучні інтелект-тренери, такі як Khanmigo, використовують ланцюг мислення для навчання краще. Для математичної задачі він міг би провести студента крок за кроком: “Спочатку напишіть рівняння. Потім отримайте змінну окремо, віднявши 5 з обох сторін. Тепер розділіть на 2”. Замість того, щоб давати відповідь, він проходить через процес, допомагаючи студентам зрозуміти концепції крок за кроком.

Висновок

Моделі мови зору (VLM) дозволяють штучному інтелекту інтерпретувати та пояснювати візуальні дані за допомогою людського мислення крок за кроком через процес ланцюга мислення. Цей підхід підвищує довіру, адаптивність та здатність до розв’язання проблем у галузях, таких як охорона здоров’я, самохідні автомобілі, геопросторічний аналіз, робототехніка та освіта. Зміняючи спосіб, у який штучний інтелект підходить до складних завдань та підтримує процес прийняття рішень, VLM встановлюють новий стандарт для надійного та практичного інтелекту.

Доктор Техсін Зія є доцентом COMSATS University Islamabad, який має ступінь PhD з штучного інтелекту у Віденському технічному університеті, Австрія. Спеціалізується на штучному інтелекті, машинному навчанні, науці про дані та комп'ютерному баченні, він зробив значний внесок з публікаціями в авторитетних наукових журналах. Доктор Техсін також очолював різні промислові проекти як головний дослідник і служив консультантом з штучного інтелекту.