Модели и платформы ИИ
Лаборатория Агентов: Виртуальная исследовательская команда от AMD и Johns Hopkins

Пока все обсуждают агентов ИИ и автоматизацию, AMD и Университет Джонса Хопкинса работают над улучшением сотрудничества между людьми и ИИ в исследованиях. Их новый открытый фреймворк, Лаборатория Агентов, является полным переосмыслением того, как научные исследования могут быть ускорены посредством совместной работы человека и ИИ.
После изучения многочисленных фреймворков исследований ИИ, Лаборатория Агентов выделяется своим практическим подходом. Вместо того, чтобы пытаться заменить человеческих исследователей (как многие существующие решения), она фокусируется на расширении их возможностей, обрабатывая время-consuming аспекты исследований, сохраняя при этом людей в роли руководителей.
Основной инновацией здесь является простая, но мощная идея: вместо того, чтобы преследовать полностью автономные исследования (которые часто приводят к сомнительным результатам), Лаборатория Агентов создает виртуальную лабораторию, где несколько специализированных агентов ИИ работают вместе, каждый из которых обрабатывает различные аспекты процесса исследования, сохраняя при этом связь с человеческим руководством.
Разбор Виртуальной Лаборатории
Представьте себе Лабораторию Агентов как хорошо скоординированную исследовательскую команду, но с агентами ИИ, играющими специализированные роли. Как и в реальной исследовательской лаборатории, каждый агент имеет конкретные обязанности и экспертизу:
- Агент PhD занимается обзором литературы и планированием исследований
- Агенты постдоков помогают усовершенствовать экспериментальные подходы
- Агенты инженеров ИИ занимаются технической реализацией
- Агенты профессоров оценивают и оценивают результаты исследований
Что делает эту систему особенно интересной, так это ее рабочий процесс. В отличие от традиционных инструментов ИИ, которые работают в изоляции, Лаборатория Агентов создает совместную среду, где эти агенты взаимодействуют и строят на основе работы друг друга.
Процесс следует естественной прогрессии исследований:
- Обзор Литературы: Агент PhD просматривает академические статьи с помощью API arXiv, собирая и организуя соответствующие исследования
- Формулирование Плана: Агенты PhD и постдоков работают вместе, чтобы создать подробные планы исследований
- Реализация: Агенты инженеров ИИ пишут и тестируют код
- Анализ и Документация: Команда работает вместе, чтобы интерпретировать результаты и генерировать всесторонние отчеты
Но вот где это становится действительно практичным: Фреймворк является гибким в отношении вычислительных ресурсов, что означает, что исследователи могут распределять ресурсы на основе доступа к вычислительной мощности и ограничений бюджета. Это делает его инструментом, предназначенным для реальных исследовательских сред.

Schmidgall et al.
Человеческий Фактор: Где ИИ Встречается с Экспертизой
Хотя Лаборатория Агентов имеет впечатляющие возможности автоматизации,真正е чудо происходит в том, что они называют “режимом совместного пилотирования”. В этой настройке исследователи могут предоставлять обратную связь на каждом этапе процесса, создавая настоящее сотрудничество между человеческой экспертизой и помощью ИИ.
Данные обратной связи в режиме совместного пилотирования показывают некоторые убедительные выводы. В автономном режиме документы, сгенерированные Лабораторией Агентов, получили среднюю оценку 3,8/10 в человеческой оценке. Но когда исследователи взаимодействовали в режиме совместного пилотирования, эти оценки возросли до 4,38/10. Что особенно интересно, так это то, где эти улучшения проявились – документы получили значительно более высокие оценки за ясность (+0,23) и представление (+0,33).
Но вот реальность: даже с участием человека эти документы все еще получили оценку примерно на 1,45 пункта ниже средней принятой NeurIPS статьи (которая составляет 5,85). Это не является провалом, но это важный урок о том, как ИИ и человеческая экспертиза должны дополнять друг друга.
Оценка показала еще одну интересную вещь: рецензенты ИИ последовательно оценивали документы примерно на 2,3 пункта выше, чем человеческие рецензенты. Этот разрыв подчеркивает, почему человеческий надзор остается важным в оценке исследований.

Schmidgall et al.
Разбор Цифр
Что действительно имеет значение в исследовательской среде? Стоимость и производительность. Подход Лаборатории Агентов к сравнению моделей показывает некоторые удивительные выигрыши в эффективности в этом отношении.
GPT-4o вышел победителем в скорости, завершив весь рабочий процесс всего за 1 165,4 секунды – это в 3,2 раза быстрее, чем o1-mini, и в 5,3 раза быстрее, чем o1-preview. Но что еще более важно, это стоит всего 2,33 доллара за документ. По сравнению с предыдущими автономными методами исследований, которые стоили около 15 долларов, мы видим снижение стоимости на 84%.
Взглянув на производительность модели:
- o1-preview получил высший балл за полезность и ясность
- o1-mini достиг лучших оценок качества экспериментов
- GPT-4o отстал в метриках, но лидировал в стоимости
Реальные последствия здесь значительны.
Исследователи теперь могут выбирать подход на основе своих конкретных потребностей:
- Нужна быстрая прототипизация? GPT-4o предлагает скорость и эффективность стоимости
- Приоритизируете качество экспериментов? o1-mini может быть вашим лучшим выбором
- Ищете наиболее отполированный вывод? o1-preview показывает перспективы
Эта гибкость означает, что исследовательские команды могут адаптировать фреймворк к своим ресурсам и требованиям, а не быть привязанными к единому решению.
Новая Глава в Исследованиях
После изучения возможностей и результатов Лаборатории Агентов я убежден, что мы смотрим на значительный сдвиг в том, как будут проводиться исследования. Но это не повествование о замене, которое часто доминирует в заголовках – это что-то гораздо более тонкое и мощное.
Хотя документы Лаборатории Агентов еще не достигают лучших стандартов конференций самостоятельно, они создают новую парадигму для ускорения исследований. Представьте себе, что у вас есть команда агентов ИИ-исследователей, которые никогда не спят, каждый из которых специализируется на различных аспектах научного процесса.
Последствия для исследователей глубоки:
- Время, потраченное на обзор литературы и базовое кодирование, может быть перенаправлено на творческую идеацию
- Идеи исследований, которые могли быть отложены из-за ограничений ресурсов, становятся жизнеспособными
- Возможность быстро прототипировать и тестировать гипотезы может привести к более быстрым прорывам
Текущие ограничения, такие как разрыв между оценками ИИ и человеческими, являются возможностями. Каждая итерация этих систем приближает нас к более сложному сотрудничеству между людьми и ИИ.
Взглянув вперед, я вижу три ключевых развития, которые могут изменить научные открытия:
- Более сложные модели сотрудничества между человеком и ИИ будут появляться, когда исследователи научатся эффективно использовать эти инструменты
- Экономия средств и времени может демократизировать исследования, позволяя меньшим лабораториям и учреждениям преследовать более амбициозные проекты
- Возможности быстрой прототипизации могут привести к более экспериментальным подходам в исследованиях
Ключ к максимизации этого потенциала? Понимание того, что Лаборатория Агентов и подобные фреймворки являются инструментами для усиления, а не автоматизации. Будущее исследований не о том, чтобы выбирать между человеческой экспертизой и возможностями ИИ – это о том, чтобы находить инновационные способы их объединения.












