Моделі та платформи ШІ

Бенчмарк Michelangelo від DeepMind: розкриття обмежень моделей LLM з довгим контекстом

mm
Додайте Unite.AI до бажаних джерел у Google

Оскільки штучний інтелект (AI) продовжує розвиватися, здатність обробляти та розуміти довгі послідовності інформації стає все більш важливою. Системи AI зараз використовуються для складних завдань, таких як аналіз довгих документів, підтримка розширених розмов та обробка великих обсягів даних. Однак багато сучасних моделей мають труднощі з довгим контекстним rozumінням. Коли вхідні дані стають довшими, вони часто втрачають важливі деталі, що призводить до менш точних або несумісних результатів.

Ця проблема особливо проблематична у сфері охорони здоров’я, юридичних послуг та фінансів, де інструменти AI повинні обробляти детальні документи або тривалі розмови, забезпечуючи точні та контекстно-чутливі відповіді. Одним із загальних викликів є контекстний дрифт, коли моделі втрачають огляд раніше отриманої інформації під час обробки нових даних, що призводить до менш актуальних результатів.

Для вирішення цих обмежень компанія DeepMind розробила бенчмарк Michelangelo. Цей інструмент суворо тестує, наскільки добре моделі AI обробляють довгоконтекстне rozumіння. На відміну від попередніх бенчмарків, які зосереджені на короткоконтекстних завданнях, таких як завершення речень або базове питання-відповідь, бенчмарк Michelangelo акцентує увагу на завданнях, які вимагають від моделей розуміти довгі послідовності даних, часто включаючи відволікаючу або неважливу інформацію.

Бенчмарк Michelangelo використовує Latent Structure Queries (LSQ) framework для тестування моделей AI. Цей метод вимагає від моделей знаходити значущі закономірності у великих наборах даних, фільтруючи неважливу інформацію, подібно до того, як люди просіюють складні дані, щоб зосередитися на тому, що важливо. Бенчмарк зосереджується на двох основних областях: природній мові та коді, вводячи завдання, які перевіряють не тільки витягання даних.

Одним із важливих завдань є завдання Latent List. У цьому завдання модель отримує послідовність операцій з Python-списками, таких як додавання, видалення або сортування елементів, а потім повинна вивести правильний остаточний список. Щоб зробити завдання складнішим, воно включає неважливі операції, такі як зміна порядку списку або скасування попередніх кроків. Це перевіряє здатність моделі зосередитися на критичних операціях, імітуючи те, як системи AI обробляють великі набори даних з змішаною актуальністю.

Іншим важливим завданням є завдання Multi-Round Co-reference Resolution (MRCR). Це завдання вимірює, наскільки добре модель може відстежувати посилання у довгих розмовах з перекриваються або невизначеними темами. Викликом для моделі є зв’язування посилань, зроблених пізно в розмові, з попередніми пунктами, навіть якщо ці посилання приховані під неважливими деталями. Це завдання відображає реальні розмови, де теми часто змінюються, і системи AI повинні точно відстежувати та вирішувати посилання, щоб підтримувати узгоджену комунікацію.

Крім того, Michelangelo включає завдання IDK, яке перевіряє здатність моделі визнавати, коли вона не має достатньої інформації для відповіді на питання. У цьому завдання модель отримує текст, який може не містити відповідної інформації для відповіді на конкретне запитання. Викликом для моделі є ідентифікація випадків, коли правильною відповіддю є “Я не знаю“, а не надання правдоподібної, але неправильної відповіді. Це завдання відображає критичний аспект надійності AI — визнання невизначеності.

Через завдання, подібні до цих, Michelangelo рухається за межі простого витягання даних, щоб протестувати здатність моделі rozumіти, синтезувати та обробляти довгоконтекстні вхідні дані. Він вводить масштабований, синтетичний та не виточений бенчмарк для довгоконтекстного rozumіння, забезпечуючи більш точну міру поточного стану та майбутнього потенціалу моделей LLM.

Розуміння довгоконтекстного rozumіння в AI

Довгоконтекстне rozumіння полягає у здатності моделі AI зберігати узгодженість та точність над довгими текстовими, кодовими або розмовними послідовностями. Моделі, такі як GPT-4 та PaLM-2, добре працюють з короткими або середньовантажними вхідними даними. Однак їм потрібно покращення для роботи з довшими контекстами. Коли довжина вхідних даних збільшується, ці моделі часто втрачають огляд важливих деталей з попередніх частин. Це призводить до помилок у розумінні, підсумовуванні або прийнятті рішень. Ця проблема відома як обмеження контекстного вікна. Спроможність моделі зберігати та обробляти інформацію зменшується з ростом контексту.

Ця проблема суттєва у реальних застосуваннях. Наприклад, у сфері юридичних послуг моделі AI аналізують контракти, справи або нормативні акти, які можуть складатися з сотень сторінок. Якщо ці моделі не можуть ефективно зберігати та rozumіти такі довгі документи, вони можуть пропустити важливі пункти або неправильно тлумачити юридичні терміни. Це може привести до неточних порад або аналізу. У сфері охорони здоров’я системи AI повинні синтезувати медичні історії, плани лікування та інші дані, які охоплюють роки або навіть десятиліття. Якщо модель не може точно nhớти важливу інформацію з попередніх записів, вона може рекомендувати неправильне лікування або неправильно діагностувати пацієнтів.

Бенчмарк Michelangelo: концепція та підхід

Бенчмарк Michelangelo вирішує проблеми довгоконтекстного rozumіння, тестуючи моделі LLM на завданнях, які вимагають від них зберігати та обробляти інформацію над довгими послідовностями. На відміну від попередніх бенчмарків, які зосереджені на короткоконтекстних завданнях, таких як завершення речень або базове питання-відповідь, бенчмарк Michelangelo акцентує увагу на завданнях, які вимагають від моделей rozumіти довгі дані послідовності, часто включаючи відволікаючу або неважливу інформацію.

Бенчмарк Michelangelo використовує Latent Structure Queries (LSQ) framework для тестування моделей AI. Цей метод вимагає від моделей знаходити значущі закономірності у великих наборах даних, фільтруючи неважливу інформацію, подібно до того, як люди просіюють складні дані, щоб зосередитися на тому, що важливо. Бенчмарк зосереджується на двох основних областях: природній мові та коді, вводячи завдання, які перевіряють не тільки витягання даних.

Вплив на дослідження та розвиток AI

Результати бенчмарку Michelangelo мають суттєві наслідки для розвитку AI. Бенчмарк показує, що сучасні моделі LLM потребують покращення архітектури, особливо у механізмах уваги та системах пам’яті. Наразі більшість моделей LLM використовують механізми самоуваги. Ці механізми ефективні для коротких завдань, але мають труднощі з довгими контекстами. Це призводить до проблеми контекстного дрифту, коли моделі забувають або переплутують попередні деталі. Для вирішення цієї проблеми дослідники вивчають моделі з пам’яттю. Ці моделі можуть зберігати важливу інформацію з попередніх частин розмови або документів, дозволяючи системі AI згадувати та використовувати її, коли потрібно.

Іншим перспективним підходом є ієрархічна обробка. Цей метод дозволяє системі AI розбивати довгі вхідні дані на менші, керовані частини, що допомагає їй зосередитися на найбільш важливих деталях на кожному етапі. Таким чином, модель може краще обробляти складні завдання без перевантаження великою кількістю інформації одночасно.

Покращення довгоконтекстного rozumіння матиме суттєвий вплив. У сфері охорони здоров’я це може означати краще аналіз медичних історій, коли система AI може відстежувати історію пацієнта з часом та надавати більш точні рекомендації щодо лікування. У сфері юридичних послуг ці вдосконалення можуть привести до систем AI, які можуть аналізувати довгі контракти або нормативні акти з більшою точністю, забезпечуючи більш надійні висновки для юристів та юридичних фахівців.

Висновок

Бенчмарк Michelangelo відкрив нові можливості для розуміння того, як моделі AI обробляють складні довгоконтекстні завдання, підкресливши їхні сильні та слабкі сторони. Цей бенчмарк сприяє інноваціям у розвитку AI, заохочуючи покращення архітектури моделей та систем пам’яті. Потенціал для трансформації галузей, таких як охорона здоров’я та юридичні послуги, є цікавим, але супроводжується етичними відповідальностями.

Проблеми конфіденційності, дезінформації та справедливості повинні бути вирішені під час розвитку AI, яке стає все більш здатним обробляти великі обсяги інформації. Ріст AI повинен залишатися зорієнтованим на надання користі суспільству вдумливо та відповідально.

Доктор Ассад Аббас, доцент COMSATS University Islamabad, Пакистан, отримав ступінь доктора філософії в Північному державному університеті Дакоти, США. Його дослідження зосереджені на передових технологіях, включаючи хмарні, туманні та краєві обчислення, великі дані та аналіз штучного інтелекту. Доктор Аббас зробив суттєві внески з публікаціями в авторитетних наукових журналах та конференціях. Він також є засновником MyFastingBuddy.