Погляд Anderson

Навіть найсучасніші моделі мови мають труднощі з розумінням тимчасової логіки

mm
Додайте Unite.AI до бажаних джерел у Google
Variation on ChatGPT-4o prompt: ‘1792px x 1024px photorealistic HQ image of a robot looking at a computer screen. On the screen is a picture of a chicken and an egg. The image should not be cartoon-ish, or illustration-like, but should look like a still from a high-budget Hollywood movie’

Прогнозування майбутніх станів є критичним завданням у дослідженні комп’ютерного зору – особливо в робототехніці, де потрібно враховувати реальні ситуації. Системи машинного навчання, яким доручено виконання критично важливих завдань, повинні мати достатнє розуміння фізичного світу.

Однак у деяких випадках видимо вражаюче знання тимчасової реальності може бути оманливим: нова робота дослідників з Об’єднаних Арабських Еміратів показала, що найсучасніші багатомодальні великомасштабні моделі мови (MLLMs), включаючи лідерів галузі GPT-4o і Google Gemini, не справляються з інтерпретацією того, як час представлений у зображеннях.

Наприклад, послідовні пари (див. зображення нижче), які були б нескладними для людей, навіть якщо їх поставити у неправильному порядку, можуть заплутати просунуті MLLM при представленні у несподіваних контекстах або конфігураціях (наприклад, друге зображення спочатку, об’єднані в одне зображення, послідовні багаторазові зображення, які можуть або не можуть представляти правильний тимчасовий порядок тощо).

Зразки з одного з наборів даних, складених для нового дослідження, які показують послідовні події. Дослідники зробили ці дані доступними на https://huggingface.co/datasets/fazliimam/temporal-vqa/viewer

Зразки з одного з наборів даних, складених для нового дослідження, які показують послідовні події у вигляді «до і після» зображень. Дослідники зробили ці дані доступними на https://huggingface.co/datasets/fazliimam/temporal-vqa/viewer

Дослідники доручили моделям виконання базових завдань тимчасової логіки, таких як визначення порядку подій або оцінка тимчасових проміжків, і виявили, що сім протестованих MLLM показали помітно нижчу точність, ніж люди:

«Загалом, результати показують, що всі сучасні MLLM, включаючи GPT-4o – найпросунутішу модель у нашій оцінці, – мають труднощі з запропонованим бенчмарком. Незважаючи на вищу продуктивність GPT-4o порівняно з іншими моделями, вона не може постійно демонструвати точну тимчасову логіку у різних умовах.

«Постійні показники точності є помітно низькими для всіх моделей, що свідчить про значні обмеження їхньої здатності зрозуміти і інтерпретувати тимчасові послідовності з візуальних даних. Ці недоліки очевидні навіть тоді, коли моделям надаються багатозображенні входи або оптимізовані підказки, що свідчить про те, що сучасні архітектури і методи навчання недостатні для надійного розуміння тимчасового порядку.»

Системи машинного навчання розроблені для оптимізації найбільш точних, але також найбільш ефективних і прийнятних для людей результатів*. Поскольку вони не розкривають свою логіку явно, може бути складно визначити, коли вони «обманюють» або використовують «швидкі шляхи».

У такому випадку MLLM може прийти до правильної відповіді неправильним методом. Те, що така відповідь може бути правильною, може надихнути фальшиву впевненість у моделі, яка може продукувати неправильні результати тим же методом у пізніших завданнях, представлених їй.

Ще гірше, таке неправильне спрямування може стати ще глибше вкоріненим у ланцюзі розробки, якщо люди вражені ним і дають позитивну оцінку у випробуваннях і сесіях анотації, які можуть сприяти напрямку, яким можуть рухатися дані і/або модель.

У цьому випадку припускається, що MLLM «імітує» справжнє розуміння хронології і тимчасових явищ, спостерігаючи і фіксуючись на вторинних індикаторах (наприклад, часових мітках у відеоданих, порядку зображень у макеті або навіть послідовно-позначених іменах файлів).

Це далі свідчить про те, що MLLM зараз не задовольняють жодному справжньому визначення поняття тимчасових явищ – принаймні, у такому обсязі, як це можуть люди.

Нова робота називається Чи можуть багатомодальні MLLM виконувати візуальне тимчасове розуміння і логіку? Відповідь – Ні! і походить від трьох дослідників з університету штучного інтеллекту імені Мохамеда бін Заєда та Alibaba International Digital Commerce.

Дані і тести

Автори відзначають, що попередні бенчмарки і дослідження, такі як MMMU і TemporalBench, зосереджені на однозображенних входах або формулюють питання для MLLM, які можуть бути надто легкими для відповіді, і можуть не розкрити тенденцію до поведінки «швидкого шляху».

Отже автори пропонують два оновлені підходи: Розуміння тимчасового порядку (TOU) і Оцінка тимчасових проміжків (TLE). Підхід TOU тестиє моделі на їхню здатність визначити правильну послідовність подій з пар відеокадрів; метод TLE оцінює здатність MLLM оцінити тимчасовий проміжок між двома зображеннями, від секунд до років.

З двох робіт, два основних завдання бенчмарка TemporalVQA: у розумінні тимчасового порядку модель визначає, яке з двох зображень показує подію, яка відбулася раніше; у оцінці тимчасових проміжків модель оцінює, скільки часу минуло між двома зображеннями, вибравши з варіантів, включаючи секунди, хвилини, дні чи роки. Ці завдання спрямовані на перевірку того, як добре MLLM можуть мислити про тимчасову послідовність візуальних подій. Джерело: https://arxiv.org/pdf/2501.10674

З двох робіт, два основних завдання бенчмарка TemporalVQA: у розумінні тимчасового порядку модель визначає, яке з двох зображень показує подію, яка відбулася раніше; у оцінці тимчасових проміжків модель оцінює, скільки часу минуло між двома зображеннями, вибравши з варіантів, включаючи секунди, хвилини, дні чи роки. Ці завдання спрямовані на перевірку того, як добре MLLM можуть мислити про тимчасову послідовність візуальних подій. Джерело: https://arxiv.org/pdf/2501.10674

Дослідники підготували 360 пар зображень для бенчмарка TOU, використовуючи відкриті відео з Pixabay і Pexels, щоб зробити набір даних доступним через графічний інтерфейс.

Відео охоплювали широкий спектр тем, від людей у повсякденних заняттях до нелюдських об’єктів, таких як тварини та рослини. З цих відео були вибрані пари кадрів, які показували послідовність подій з достатньою варіативністю, щоб зробити початковий кадр «очевидним».

Людська селекція була використана для забезпечення того, щоб кадри могли бути чітко впорядковані. Наприклад, одна з підготовлених пар показує частково наповнений чайний стакан у першому кадрі, а той же стакан повністю наповнений чаєм у наступному, що робить логіку послідовності легкою для визначення.

Тимчасова логіка цих двох зображень не може бути уникнута, оскільки чай не може бути повернутий назад через носик.

Тимчасова логіка цих двох зображень не може бути уникнута, оскільки чай не може бути повернутий назад через носик.

Цим чином було отримано 360 пар зображень.

Для підходу TLE були вибрані зображення без права власності з Google і Flickr, а також вибрані кадри з відео без права власності на YouTube. Предмети цих відео показували сцени чи об’єкти, чиї зміни тривали від секунд до днів чи сезонів – наприклад, дозрівання фруктів чи зміна сезонів у пейзажах.

Таким чином було підготовлено 125 пар зображень для методу TLE.

Не всі протестовані MLLM могли обробляти кілька зображень; тому тести відрізнялися для кожної моделі.

Було створено кілька версій підготовлених наборів даних, у яких деякі пари були об’єднані вертикально, а інші – горизонтально. Деякі варіації міняли справжню і правильну тимчасову послідовність пар.

Було розроблено два типи підказок. Перший мав такий шаблон:

Чи відбулася подія на (лівому / верхньому / першому) зображенні раніше, ніж подія на (правому / нижньому / другому) зображенні? Відповісті «правда» або «хиба» з поясненням.

Другий мав такий шаблон:

Яке з цих двох зображень показує подію, яка відбулася раніше? Відповісті (ліве або праве / верхнє або нижнє / перше або друге) з поясненням.

Для TLE питання були у вигляді вибору, які запитували моделі оцінити тимчасовий проміжок між двома представленими зображеннями, з варіантами секунди, хвилини, години, дні, місяці і роки. У цій конфігурації найновіше зображення було представлено справа.

Підказка, використана тут, мала такий вигляд:

Оцініть час, який минув між першим зображенням (лівим) і другим зображенням (правим).

Виберіть одну з наступних варіантів:

    1. Менше 15 секунд
      B. Між 2 хвилинами і 15 хвилинами
      C. Між 1 годinou і 12 годинами
      D. Між 2 днями і 30 днями
      E. Між 4 місяцями і 12 місяцями
      F. Більше 3 років

Тести були проведені на наступних MLLM: ChatGPT-4o; Gemini1.5-Pro; LlaVa-NeXT; InternVL; Qwen-VL; Llama-3-vision; і LLaVA-CoT.

Розуміння тимчасового порядку: результати

Результати розуміння тимчасового порядку для різних моделей і макетів входу, показуючи точність і послідовність для різних налаштувань і підказок.

Результати розуміння тимчасового порядку для різних моделей і макетів входу, показуючи точність і послідовність для різних налаштувань і підказок.

Відносно результатів, показаних вище, автори виявили, що всі протестовані MLLM, включаючи GPT-4o (яка показала найкращу загальну продуктивність), мали значні труднощі з бенчмарком TemporalVQA – і навіть GPT-4o не змогла постійно демонструвати надійну тимчасову логіку у різних конфігураціях.

Автори стверджують, що постійно низькі показники точності серед LLM підкреслюють значні недоліки в здатності моделей інтерпретувати і розуміти тимчасові послідовності з візуальних даних. Дослідники відзначають, що ці виклики зберігаються навіть при використанні багатозображенних входів і оптимізованих підказок, що свідчить про фундаментальні обмеження сучасних моделей і методів навчання.

Тести показали значні варіації продуктивності серед стратегій підказок. Хоча GPT-4o покращила свою продуктивність з оптимізованими підказками (досягаючи 4% у однозображенних і 65,3% у багатозображенних налаштуваннях), продуктивність залишилася нижче прийнятного рівня.

Моделі, такі як LLaVA-NeXT і Qwen-VL, були ще більш чутливими, з продуктивністю, яка знижувалася, коли використовувалися альтернативні підказки, що свідчить про те, що інженерія підказок сама по собі не може подолати фундаментальні обмеження MLLM щодо тимчасової логіки.

Тести також показали, що макет зображень (тобто вертикальний проти горизонтального) суттєво впливає на продуктивність моделей. GPT-4o покращила свою послідовність з вертикальними композиціями, зростаючи з 39,2% до 52,8%; однак інші моделі, включаючи LLaVA, показали сильні напрямні упередження, excelling у одному напрямку, але провалюючись у іншому.

Стаття вказує на те, що ці несумісності свідчать про залежність від просторових підказок, а не справжньої тимчасової логіки, оскільки MLLM не справляються з аналізом послідовності подій або розумінням прогресу у часі. Натомість вони, здається, покладаються на шаблони або візуальні особливості, пов’язані з макетом зображень, такі як їхнє положення або вирівнювання, щоб приймати рішення.

Кваліфікаційні тести підкреслюють передбачення GPT-4o при різних входах. У першому порядку зображення подаються у їхньому початковому порядку, тоді як у другому порядку послідовність зворотна. Правильні класифікації позначені зеленим, чисті неправильні класифікації – червоним, галюциновані висновки – оранжевим, а ірраціональні або «невалідні» висновки – коричневим, показуючи несумісності моделі у різних конфігураціях входу.

Кваліфікаційні тести підкреслюють передбачення GPT-4o при різних входах. У першому порядку зображення подаються у їхньому початковому порядку, тоді як у другому порядку послідовність зворотна. Правильні класифікації позначені зеленим, чисті неправильні класифікації – червоним, галюциновані висновки – оранжевим, а ірраціональні або «невалідні» висновки – коричневим, показуючи несумісності моделі у різних конфігураціях входу.

Порівняльні тести між одно- і багатозображенними входами продемонстрували обмежене загальне покращення, з GPT-4o, яка показала трохи кращу продуктивність на багатозображенному вході, зростаючи з 31,0% до 43,6% (з P1) і 46,0% до 65,3% (з P2).

Інші моделі, такі як InternVL, показали стабільну, але низьку точність, тоді як Qwen-VL мала незначні здобутки. Автори висновують, що ці результати свідчать про те, що додатковий візуальний контекст не суттєво покращує тимчасову логіку, оскільки моделі мають труднощі з інтеграцією тимчасової інформації ефективно.

Людське дослідження

У людському дослідженні три опитування були проведені для оцінки того, наскільки добре найкраща багатомодальна MLLM працює порівняно з людьми.

Люди досягли 90,3% точності, перевершивши 65,3% GPT-4o на 25%. Набір даних виявився надійним, з мінімальними людськими помилками і послідовною згодою щодо правильних відповідей.

Результати людського дослідження для першого раунду тестів.

Результати людського дослідження для першого раунду тестів.

Оцінка тимчасових проміжків: результати

Результати для TLE: оцінка тимчасових проміжків оцінює точність моделі у виборі правильного масштабу часу для тимчасового проміжку.

Результати для TLE: оцінка тимчасових проміжків оцінює точність моделі у виборі правильного масштабу часу для тимчасового проміжку.

У цих тестах MLLM показали лише достатню продуктивність у оцінці тимчасових проміжків: GPT-4o досягла 70% точності, але інші моделі показали значно гіршу продуктивність (див. таблицю вище), а продуктивність також варіювалася суттєво серед різних тимчасових масштабів.

Автори відзначають:

«Завдання оцінки тимчасових проміжків перевіряє здатність MLLM виводити тимчасові інтервали між парами зображень. [Усі] MLLM, включаючи топ-виконавців, таких як GPT-4o і Gemini1.5-Pro, мають труднощі з цим завданням, досягнувши лише помірної точності – 60-70%. GPT-4o показує несумісну продуктивність, з сильною продуктивністю у секундах і роках, але слабкою у годинах.

«Аналогічно, LLaVA-CoT демонструє виняткову продуктивність у часових інтервалах секунд і днів, але показує помітно низьку продуктивність у інших тимчасових інтервалах.»

Людське дослідження

У людському дослідженні для TLE середня людська продуктивність перевершувала GPT-4o (найкращу модель у цій категорії) на 12,3%.

Автори відзначають, що деякі з викликів були особливо складними, і що в одному випадку всі людські учасники повернули неправильну відповідь, разом з усіма учасниками штучного інтелекту.

Автори висновують, що GPT-4o демонструє «достатньо надійні висновки, незважаючи на порядок зображень, представлених їй.

Висновок

Якщо MLLM в кінцевому підсумку накопичать достатньо «швидких шляхів», щоб покрити навіть найскладніші виклики, представлені авторами в цьому дослідженні, то питання про те, чи можуть вони розвинути людські можливості узагальнення в цій галузі, може стати безпідставним.

Також невідомо, яким саме шляхом ми здобуємо свої власні можливості тимчасової логіки – чи ми теж «обманюємо», поки величезна кількість вивчених досвідів не розкриє шаблон, який діє як «інстинкт» щодо цього типу тесту?

 

* З точки зору того, що моделі все частіше оптимізуються з функціями втрат, до яких людська оцінка внесла свій внесок, і ефективно оптимізуються людськими випробуваннями та наступним тріажем.

Перша публікація понеділка, 27 січня 2025 року

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai