Моделі та платформи ШІ

Лабораторія Агентів: Віртуальна команда досліджень від AMD і Джона Хопкінса

mm
Додайте Unite.AI до бажаних джерел у Google

Хоча всі говорили про агентів штучного інтелекту та автоматизацію, AMD і Університет Джона Хопкінса працювали над покращенням співпраці між людьми та штучним інтелектом у дослідженнях. Їхня нова відкрита框架, Лабораторія Агентів, є повною переробкою того, як науковим дослідженням можна прискорити співпрацю між людьми та штучним інтелектом.

Після огляду численних рамок штучного інтелекту для досліджень, Лабораторія Агентів виділяється своєю практичною підходом. Замість того, щоб замінювати людських дослідників (як багато існуючих рішень), вона зосереджується на підвищенні їхніх можливостей, обробляючи часоємні аспекти досліджень, залишаючи людей у водії.

Основна інновація тут проста, але потужна: Замість того, щоб переслідувати повністю автономні дослідження (що часто призводить до сумнівних результатів), Лабораторія Агентів створює віртуальну лабораторію, де кілька спеціалізованих агентів штучного інтелекту працюють разом, кожний з яких займається різними аспектами процесу дослідження, залишаючись прив’язаними до керівництва людини.

Розбивка Віртуальної Лабораторії

Подумайте про Лабораторію Агентів як про добре організовану команду досліджень, але з агентами штучного інтелекту, які грають спеціалізовані ролі. Як і в реальній лабораторії, кожен агент має конкретні обов’язки та експертизу:

  • Агент PhD займається літературними оглядами та плануванням досліджень
  • Агенти постдоків допомагають удосконалювати експериментальні підходи
  • Агенти інженерів штучного інтелекту займаються технічною реалізацією
  • Агенти професорів оцінюють та оцінюють результати досліджень

Що робить цю систему особливо цікавою, це її робочий процес. На відміну від традиційних інструментів штучного інтелекту, які працюють у ізоляції, Лабораторія Агентів створює колаборативне середовище, де ці агенти взаємодіють та будують один на одному.

Процес слідує природному прогресу досліджень:

  1. Літературний огляд: Агент PhD переглядає академічні статті за допомогою архіву arXiv, збираючи та організовуючи відповідні дослідження
  2. Формулювання плану: Агенти PhD та постдоків спільно створюють детальні плани досліджень
  3. Реалізація: Агенти інженерів штучного інтелекту пишуть та тестують код
  4. Аналіз та документація: Команда працює разом, щоб інтерпретувати результати та генерувати комплексні звіти

Але ось де це стає особливо практичним: Фреймворк є гнучким щодо обчислювальних ресурсів, що означає, що дослідники можуть розподіляти ресурси на основі їхнього доступу до обчислювальної потужності та бюджетних обмежень. Це робить його інструментом, призначеним для реальних дослідницьких середовищ.

Schmidgall et al.

Людський Фактор: Де Штучний Інтелект Зустрічається з Експертизою

Хоча Лабораторія Агентів має вражаючі можливості автоматизації, справжня магія відбувається в тому, що вони називають “режимом співпілотування”. У цьому режимі дослідники можуть надавати відгуки на кожному етапі процесу, створюючи справжню співпрацю між людською експертизою та підтримкою штучного інтелекту.

Дані про відгуки у режимі співпілотування показують деякі переконливі висновки. У автономному режимі статті, створені Лабораторією Агентів, отримали середню оцінку 3,8/10 у людській оцінці. Але коли дослідники брали участь у режимі співпілотування, ці оцінки підскочили до 4,38/10. Що особливо цікаво, це те, де ці покращення показалися – статті отримали значно вищі оцінки за ясністю (+0,23) та презентацією (+0,33).

Але ось реальна перевірка: навіть з людським втручанням ці статті все ще отримали оцінки близько 1,45 пунктів нижче середньої прийнятої статті NeurIPS (яка складає 5,85). Це не є провалом, але це важливий висновок про те, як штучний інтелект та людська експертиза повинні доповнювати одна одну.

Оцінка показала ще щось цікаве: агенти штучного інтелекту постійно оцінювали статті на 2,3 пункти вище, ніж людські оглядачі. Ця прогалина підкреслює, чому людський нагляд залишається важливим у оцінці досліджень.

Schmidgall et al.

Розбивка Цифр

Що справді важливо у дослідницькому середовищі? Вартість та продуктивність. Підхід Лабораторії Агентів до порівняння моделей показує деякі несподівані вигоди з точки зору ефективності.

GPT-4o виявився чемпіонем зі швидкості, завершивши весь робочий процес за лише 1 165,4 секунди – це в 3,2 раза швидше, ніж o1-mini, і в 5,3 раза швидше, ніж o1-preview. Але що ще важливіше, це те, що це коштує лише 2,33 долари за статтю. У порівнянні з попередніми автономними методами досліджень, які коштували близько 15 доларів, ми бачимо зниження вартості на 84%.

Оглядаючи продуктивність моделей:

  • o1-preview отримав найвищу оцінку за корисність та ясність
  • o1-mini досяг найкращих оцінок за експериментальну якість
  • GPT-4o відставав у метриках, але лідирував у вартісній ефективності

Реальні наслідки тут суттєві.

Дослідники тепер можуть вибирати свій підхід на основі своїх конкретних потреб:

  • Потрібно швидке прототипування? GPT-4o пропонує швидкість та вартісну ефективність
  • Приоритет експериментальної якості? o1-mini може бути вашим найкращим вибором
  • Шукаєте найбільш полішовані виходи? o1-preview показує перспективи

Ця гнучкість означає, що дослідницькі команди можуть адаптувати фреймворк до своїх ресурсів та вимог, а не бути закріпленими за один-єдиний рішення.

Нова Глава у Дослідженнях

Після вивчення можливостей та результатів Лабораторії Агентів, я переконаний, що ми дивимося на суттєву зміну того, як будуть проводитися дослідження. Але це не розповідь про заміну, яка часто домінує в заголовках – це щось набагато тонше та потужніше.

Хоча статті Лабораторії Агентів ще не досягають стандартів топ-конференцій самостійно, вони створюють новий парадигму для прискорення досліджень. Подумайте про це, як про команду агентів штучного інтелекту для досліджень, які ніколи не сплять, кожний з яких спеціалізується на різних аспектах наукового процесу.

Наслідки для дослідників глибокі:

  • Час, витрачений на літературні огляди та базове програмування, можна перенаправити на творчу ідею
  • Дослідницькі ідеї, які могли бути полиші через обмеження ресурсів, стають життєздатними
  • Можливість швидко прототипувати та тестувати гіпотези може привести до швидших проривів

Поточні обмеження, такі як розрив між оцінками штучного інтелекту та людини, є можливостями. Кожна ітерація цих систем приносить нас ближче до більш складної співпраці між людьми та штучним інтелектом.

Оглядаючи майбутнє, я бачу три ключові розробки, які можуть змінити наукове відкриття:

  1. Більш складні моделі співпраці між людьми та штучним інтелектом з’являться, коли дослідники навчаться ефективно використовувати ці інструменти
  2. Економія коштів та часу може демократизувати дослідження, дозволяючи меншим лабораторіям та установам проводити більш амбіційні проекти
  3. Можливості швидкого прототипування можуть привести до більш експериментальних підходів у дослідженнях

Ключ до максимізації цього потенціалу? Поняття того, що Лабораторія Агентів та подібні фреймворки є інструментами для посилення, а не автоматизації. Майбутнє досліджень не полягає у виборі між людською експертизою та можливостями штучного інтелекту – це про знаходження інноваційних способів їхнього поєднання.

Алекс Макфарленд - журналіст та письменник з питань штучного інтелекту, який досліджує останні розробки в галузі штучного інтелекту. Він співпрацював з численними стартапами та виданнями з штучного інтелекту у світі.