Моделі та платформи ШІ

Наскільки хороші агенти штучного інтелекту у реальних дослідженнях? Всередині звіту Deep Research Bench

mm
Додайте Unite.AI до бажаних джерел у Google

Як більші моделі мови (LLM) швидко еволюціонують, так само й їхнє обіцяння як потужних дослідницьких помічників. Все частіше вони не просто відповідають на прості фактичні питання – вони займаються “глибокими дослідженнями”, які включають багатокрокове міркування, оцінку суперечливої інформації, джерела даних з усього інтернету та синтез їх у суцільний висновок.

Ця нова здатність зараз рекламується під різними брендовими назвами великими лабораторіями – OpenAI називає її “Глибокими дослідженнями”, Anthropic називають її “Розширеним мисленням”, Gemini від Google (GOOGL ) пропонує функції “Пошук + Pro”, а Perplexity називає свої “Професійним пошуком” або “Глибокими дослідженнями”. Але наскільки ефективні ці пропозиції на практиці? Новий звіт FutureSearch, озаглавлений Deep Research Bench (DRB): Оцінка веб-дослідницьких агентів, пропонує найсуворіше оцінювання на сьогоднішній день – і результати показують як вражаючі можливості, так і критичні недоліки.

Що таке Deep Research Bench?

Створений командою FutureSearch, Deep Research Bench – це ретельно сконструйований бенчмарк, призначений для оцінки продуктивності агентів штучного інтелекту при виконанні багатокрокових веб-досліджень. Це не прості питання з прямими відповідями – вони відображають заплутані, відкриті завдання, з якими стикаються аналітики, політики та дослідники в реальних умовах.

Бенчмарк включає 89 різних завдань у 8 категоріях, таких як:

  • Знайти число: наприклад, “Скільки відкликань медичних приладів класу II FDA відбулося?”
  • Перевірити твердження: наприклад, “Чи є ChatGPT у 10 разів більш енергозатратним, ніж пошук Google?”
  • Складати набір даних: наприклад, “Тенденції зайнятості розробників програмного забезпечення в США з 2019 по 2023 рік”

Кожен тип завдання ретельно структурований з перевіреними людьми відповідями та оцінюється за допомогою замороженого набору веб-сторінок, відомого як RetroSearch. Це забезпечує узгодженість під час оцінки моделей, уникнення коливань стану живого інтернету.

Архітектура агента: ReAct і RetroSearch

У серці Deep Research Bench лежить архітектура ReAct, скорочення від “Розум + Дія”. Цей метод імітує те, як людський дослідник міг би підходити до проблеми – подумавши про завдання, виконавши дію, таку як виконання веб-пошуку, спостерігаючи результати та вирішуючи, чи продовжувати чи закінчити.

Хоча попередні моделі слідують цьому циклу явно, нові “думаючі” моделі часто спрощують процес, вкладаючи міркування більш плавно у свої дії. Для забезпечення узгодженості під час оцінювання DRB вводить RetroSearch – спеціально створену, статичну версію інтернету. Замість того, щоб покладатися на живий інтернет, який постійно змінюється, агенти звертаються до кураторської архіву веб-сторінок, отриманих за допомогою інструментів, таких як Serper, Playwright та ScraperAPI. Масштаб вражаючий – для завдань високої складності, таких як “Зібрати докази”, RetroSearch може надати доступ до понад 189 000 сторінок, усі заморожені в часі, забезпечуючи справедливе та репліковане середовище тестування.

Які агенти штучного інтелекту виконують найкраще?

У числі усіх учасників виділився о3 від OpenAI, який набрав 0,51 бала з можливих 1,0 на Deep Research Bench. Хоча це може здатися скромним результатом, важливо зрозуміти складність бенчмарка – через двозначність завдань та оцінювання навіть ідеальний агент, ймовірно, досягне лише 0,8 – те, що дослідники називають “стелею шуму”. Інакше кажучи, навіть найкращі моделі сьогодні все ще не дотягують до добре інформованих, методичних людських дослідників.

Все ж таки, таблиця лідерів пропонує відкриваючі ідеї. О3 не тільки очолив групу, але й зробив це з швидкістю та послідовністю, демонструючи сильну продуктивність майже у всіх типах завдань. Claude 3.7 Sonnet від Anthropic слідував йому близько, демонструючи універсальність як у “думаючому”, так і в “недумаючому” режимах. Gemini 2.5 Pro, флагманська модель Google, виділився своєю здатністю виконувати завдання, які вимагають структурованого планування та крокового міркування. Тоді як відкритий DeepSeek-R1 приніс приємну несподіванку – він тримався на рівні з GPT-4 Turbo та звузив розрив у продуктивності між відкритими та закритими моделями.

По всій таблиці виділився чіткий шаблон – нові “думаючі” моделі постійно перевершували своїх попередників, а закриті моделі зберігали помітну перевагу над відкритими альтернативами.

Де агенти штучного інтелекту мають труднощі?

Читання звітів про моделі штучного інтелекту в Deep Research Bench відчувалося досить знайомим. Одним з найбільш розчаровуючих аспектів, з яким я особисто стикався – особливо під час довгих досліджень чи створення контенту – є те, коли агент штучного інтелекту просто забуває, що ми робили. Коли вікно контексту розтягується, модель часто починає втрачати нитку – ключові деталі стираються, цілі стають нечіткими, і раптом відповіді здаються роз’єднаними чи безцільними. У якийсь момент я навчився, що часто краще припинити та почати заново, навіть якщо це означає викинути все, що було сгенеровано досі.

Така забуваність не просто анекдотична – це найважливіший передбачувач невдачі в оцінюванні Deep Research Bench. Але це не єдина повторювана проблема. Звіт також підкреслює, як деякі моделі потрапляють у повторене використання інструментів, виконуючи той самий пошук знову і знову, як ніби застрягли в циклі. Інші демонструють погану формулювання запитів, ледве зіставляючи ключові слова замість критичного мислення про те, як ефективно шукати. І надто часто агенти стають жертвами передчасних висновків – надсилають напівутворену відповідь, яка технічно відповідає запитові, але не дотягує до справжнього розуміння.

Навіть серед найкращих моделей розбіжності вражаючі. GPT-4 Turbo, наприклад, показав помітну схильність забувати попередні кроки, тоді як DeepSeek-R1 був більш схильний до галюцинацій або вигадування правдоподібних, але неправильних, відомостей. По всій таблиці моделі часто не перевіряли джерела чи не підтверджували свої висновки перед остаточним висновком. Для тих, хто покладався на штучний інтелект для серйозної роботи, ці проблеми будуть надто знайомі – і вони підкреслюють, як далеко нам ще потрібно піти у будівництві агентів, які можуть справді мислити та досліджувати як люди.

Що щодо продуктивності, заснованої на пам’яті?

Цікаво, що Deep Research Bench також оцінював те, що називається “безінструментальними” агентами – мовними моделями, які працюють без доступу до зовнішніх інструментів, таких як веб-пошук чи пошук документів. Ці агенти повністю покладаються на свої внутрішні навчальні дані та пам’ять, генеруючи відповіді лише на основі того, що вони раніше вивчили під час навчання. На практиці це означає, що вони не можуть нічого шукати чи перевіряти інформацію – вони просто здогадуються на основі того, що “запам’ятали”.

Дивно, але ці безінструментальні агенти майже так само добре виконували певні завдання, як і повноцінні дослідницькі агенти. Наприклад, на завданнях “Перевірити твердження” – де метою було оцінити правдоподібність твердження – вони набрали 0,61 бала, майже збігшись з середнім показником 0,62 для агентів, які мали доступ до інструментів. Це свідчить про те, що моделі, подібні до о3 та Claude, мають сильні внутрішні припущення та часто можуть розпізнавати правдивість звичайних тверджень без потреби у веб-пошуку.

Але на більш складних завданнях – таких як “Визначити число”, яке вимагає складання декількох значень з різних джерел, або “Зібрати докази”, яке залежить від пошуку та оцінки різних фактів у контексті – ці безінструментальні моделі повністю розвалилися. Без свіжої інформації чи можливості пошuku в режимі реального часу вони просто не мали засобів для генерації точних чи повних відповідей.

Цей контраст підкреслює важливу нюанс – хоча сучасні великі мовні моделі можуть імітувати “знання” великої кількості інформації, глибокі дослідження залежать не лише від спогадів, але й від міркування з актуальною, верифікованою інформацією – чого можуть забезпечити лише агенти, доповнені інструментами.

Остаточні думки

Звіт DRB робить одне питання ясним – хоча найкращі агенти штучного інтелекту сьогодні можуть перевершувати середніх людей у вузько визначених завданнях, вони все ще відстають від кваліфікованих дослідників-універсалів – особливо коли мова йде про стратегічне планування, адаптацію в процесі та нюансироване міркування.

Цей розрив стає особливо очевидним під час довгих або складних сесій – щось, з чим я особисто стикався, коли агент поступово втрачав розуміння мети завдання, що призводило до розчаровуючого розриву в узгодженості та корисності.

Що робить Deep Research Bench так цінним, так це те, що воно не просто перевіряє поверхневе знання – воно досліджує перетин використання інструментів, пам’яті, міркування та адаптації, пропонуючи ближчу аналогію до реальних досліджень, ніж бенчмарки типу MMLU або GSM8k.

Як великі мовні моделі продовжують інтегруватися у серйозну наукову роботу, інструменти FutureSearch, такі як DRB, будуть життєво важливими для оцінки не лише того, що ці системи знають, але й того, як добре вони насправді працюють.

Deep Research Bench – це не просто бенчмарк – це інструмент для розуміння того, як штучний інтелект може допомогти нам у наших дослідженнях та роботі. І хоча агенти штучного інтелекту ще не досконалі, вони вже зараз можуть бути корисними інструментами у наших руках.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.