Модели и платформы ИИ

Насколько хорошо выполняют AI-агенты реальные исследования? Внутри отчета Deep Research Bench

mm
Добавьте Unite.AI в избранные источники в Google

По мере того, как большие языковые модели (LLM) быстро эволюционируют, растет и их потенциал в качестве мощных помощников в исследованиях. Все чаще они не только отвечают на простые фактические вопросы, но и выполняют задачи “глубоких исследований”, которые включают многоступенчатое рассуждение, оценку противоречивой информации, поиск данных из всего интернета и синтез их в связный вывод.

Эта появляющаяся возможность сейчас продвигается под разными брендовыми названиями крупными лабораториями – OpenAI называет ее “Глубокими исследованиями”, Anthropic именует ее “Расширенным мышлением”, флагманская модель Google Gemini предлагает функции “Поиск + Pro”, а Perplexity обозначает свою как “Продвинутый поиск” или “Глубокие исследования”. Но насколько эффективны эти предложения на практике? Отчет FutureSearch, озаглавленный Deep Research Bench (DRB): Оценка веб-агентов исследования, предлагает наиболее строгую оценку на сегодняшний день – и результаты показывают как впечатляющие возможности, так и критические недостатки.

Что такое Deep Research Bench?

Созданный командой FutureSearch, Deep Research Bench – это тщательно сконструированный эталон, предназначенный для оценки производительности AI-агентов при выполнении многоступенчатых веб-исследований. Это не простые вопросы с прямыми ответами – они отражают запутанные, открытые проблемы, с которыми сталкиваются аналитики, политики и исследователи в реальных условиях.

Эталон включает 89 различных задач из 8 категорий, таких как:

  • Найти число: например, “Сколько отзывов медицинских устройств класса II FDA произошло?”
  • Проверить утверждение: например, “Является ли ChatGPT в 10 раз более энергоемким, чем Google Поиск?”
  • Собрать набор данных: например, “Тенденции занятости разработчиков программного обеспечения в США с 2019 по 2023 год”

Каждый тип задачи тщательно структурирован с проверенными людьми ответами и оценивается с помощью замороженного набора веб-страниц, известного как RetroSearch. Это обеспечивает последовательность при оценке моделей, избегая меняющегося состояния живого интернета.

Архитектура агента: ReAct и RetroSearch

В основе Deep Research Bench лежит архитектура ReAct, что означает “Рассуждение + Действие”. Этот метод имитирует, как человек-исследователь может подойти к проблеме – подумав над задачей, выполнив действие, такое как веб-поиск, наблюдая результаты и затем решая, следует ли продолжать или завершить.

Хотя более ранние модели следуют этому циклу явно, новые “мышления” модели часто упрощают процесс, более жидко встраивая рассуждение в свои действия. Чтобы обеспечить последовательность при оценке, DRB вводит RetroSearch – специально построенную, статическую версию веба. Вместо того, чтобы полагаться на живой интернет, который постоянно меняется, агенты обращаются к отобранному архиву веб-страниц, полученному с помощью инструментов, таких как Serper, Playwright и ScraperAPI. Масштаб впечатляет: для задач высокой сложности, таких как “Собрать доказательства”, RetroSearch может предоставить доступ к более чем 189 000 страницам, все из которых заморожены во времени, обеспечивая справедливую и воспроизводимую среду тестирования.

Какие AI-агенты работают лучше всего?

Среди всех претендентов модель o3 от OpenAI оказалась лучшей, набрав 0,51 из возможных 1,0 на Deep Research Bench. Хотя это может показаться скромным, важно понять сложность эталона: из-за двусмысленности определений задач и оценок даже безупречный агент, скорее всего, достигнет максимума около 0,8 – что исследователи называют “потолком шума”. Другими словами, даже лучшие модели сегодня все еще отстают от хорошо информированных, методичных человеческих исследователей.

Тем не менее, таблица лидеров предлагает откровенные идеи. o3 не только возглавила список, но и сделала это с быстротой и последовательностью, показав сильную производительность почти во всех типах задач. Модель Claude 3.7 Sonnet от Anthropic последовала за ней, продемонстрировав универсальность как в “мышлении”, так и в “немышлении” режимах. Модель Gemini 2.5 Pro от Google выделилась своей способностью справляться с задачами, требующими структурированного планирования и пошагового рассуждения. Тем временем, открытая модель DeepSeek-R1 доставила приятный сюрприз – она поспевала за GPT-4 Turbo и сузила разрыв в производительности между открытыми и закрытыми моделями.

На протяжении всей доски лидеров четкая закономерность появилась: новые, “думывающие” модели последовательно превосходили своих более ранних аналогов, а закрытые модели сохраняли заметное преимущество над открытыми альтернативами.

Где агенты испытывают трудности?

Чтение через закономерности неудач, выделенные в отчете Deep Research Bench, чувствовалось удивительно знакомо. Одним из самых раздражающих аспектов, с которыми я лично столкнулся – особенно во время длинных исследований или сессий создания контента – является когда AI-агент просто забывает, что мы делали. По мере того, как контекстное окно растягивается, модель часто начинает терять нить: ключевые детали тускнеют, цели становятся неясными, и вдруг ответы кажутся несвязанными или бессмысленными. В какой-то момент я научился лучше прекращать потери и начинать заново, даже если это означает выбрасывание всего, что было сгенерировано до этого.

Такая забывчивость не является просто анекдотической – это наиболее значимый предиктор неудачи в оценке Deep Research Bench. Но это не единственная повторяющаяся проблема. Отчет также подчеркивает, как некоторые модели попадают в повторяющееся использование инструментов, выполняя один и тот же поиск снова и снова, как будто застряли в цикле. Другие демонстрируют плохое формирование запросов, лениво сопоставляя ключевые слова вместо того, чтобы критически мыслить о том, как эффективно искать. И слишком часто агенты становятся жертвами преждевременных выводов – доставляя полуфабрикат ответа, который технически удовлетворяет коробке, но не достигает真正щего прозрения.

Даже среди лучших моделей различия резки. GPT-4 Turbo, например, показала заметную тенденцию забывать предыдущие шаги, в то время как DeepSeek-R1 была более склонна галлюцинировать или выдумывать правдоподобно звучащую, но неверную информацию. На протяжении всей доски модели часто терпели неудачу в проверке источников или подтверждении выводов до окончательного формирования своего вывода. Для всех, кто полагался на AI для серьезной работы, эти проблемы будут казаться слишком знакомыми – и они подчеркивают, как далеко нам еще предстоит пройти в построении агентов, которые могут действительно мыслить и исследовать как люди.

Что насчет производительности, основанной на памяти?

Интересно, что Deep Research Bench также оценил то, что он называет “безинструментальными” агентами – языковые модели, работающие без доступа к внешним инструментам, таким как веб-поиск или извлечение документов. Эти агенты полагаются исключительно на свои внутренние обучающие данные и память, генерируя ответы на основе только того, что они узнали во время обучения. На практике это означает, что они не могут посмотреть ничего или проверить информацию – они угадывают на основе того, что они “помнят”.

Удивительно, что эти безинструментальные агенты показали почти такую же хорошую производительность, как и полноценные исследовательские агенты, на определенных задачах. Например, на задаче “Проверить утверждение” – где цель состоит в том, чтобы оценить правдоподобие утверждения – они набрали 0,61, почти совпадая с средним показателем 0,62 для инструментально-обеспеченных агентов. Это говорит о том, что модели, такие как o3 и Claude, имеют сильные внутренние приоритеты и могут часто распознавать истинность общих утверждений без необходимости поиска в интернете.

Но на более требовательных задачах – таких как “Получить число”, которое требует сборки нескольких значений из различных источников, или “Собрать доказательства”, которое зависит от нахождения и оценки разнообразных фактов в контексте – эти безинструментальные модели полностью развалились. Без свежей информации или возможностей реального времени они просто не имели средств для производства точных или всесторонних ответов.

Этот контраст подчеркивает важную нюанс: хотя современные LLM могут имитировать “знание” многое, глубокие исследования зависят не только от воспоминания, но и от рассуждения с актуальной, проверяемой информацией – что могут обеспечить только инструментально-усиленные агенты.

Окончательные мысли

Отчет DRB делает одно ясным: хотя лучшие AI-агенты сегодня могут превосходить средних людей на узко определенных задачах, они все еще отстают от опытных исследователей-универсалов – особенно когда речь идет о стратегическом планировании, адаптации в процессе и нюансированном рассуждении.

Этот разрыв становится особенно очевидным во время длинных или сложных сессий – что я испытал на себе, когда агент постепенно теряет нить задачи, что приводит к разочаровывающему разрушению связности и полезности.

То, что делает Deep Research Bench так ценным, заключается в том, что он не только тестирует поверхностные знания – он исследует пересечение использования инструментов, памяти, рассуждения и адаптации, предлагая более близкий аналог реальным исследованиям, чем эталоны, такие как MMLU или GSM8k.

По мере того, как LLM продолжают интегрироваться в серьезную научную работу, инструменты FutureSearch, такие как DRB, будут необходимы для оценки не только того, что эти системы знают, но и того, насколько хорошо они действительно работают.

Использование инструментов, памяти, рассуждения и адаптации, предлагая более близкий аналог реальным исследованиям, чем эталоны, такие как MMLU или GSM8k. По мере того, как LLM продолжают интегрироваться в серьезную научную работу, инструменты FutureSearch, такие как DRB, будут необходимы для оценки не только того, что эти системы знают, но и того, насколько хорошо они действительно работают на основе инструментов, памяти, рассуждения и адаптации, предлагая более близкий аналог реальным исследованиям, чем эталоны, такие как MMLU или GSM8k. По мере того, как LLM продолжают интегрироваться в серьезную научную работу, инструменты FutureSearch, такие как DRB, будут необходимы для оценки не только того, что эти системы знают, но и того, насколько хорошо они действительно работают.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.