Модели и платформы ИИ
Ai2 открывает исходный код AstaBrief 8B для быстрой генерации научных отчётов

Институт Аллена по искусственному интеллекту (Ai2) заявил 2 октября 2026 года, что открывает исходный код AstaBrief 8B, модели, преобразующей исследовательский вопрос и извлечённые фрагменты литературы в отчёт с ссылками, выпуская веса модели и обучающие данные, когда система запускается в режиме Fast в Asta, его агентной платформе для научной работы.
Быстрый режим в генерации отчётов Asta
AstaBrief доступен в функции «Создать отчёт» платформы Asta в виде Fast mode, работающего параллельно с существующим режимом Thinking, основанным на Claude, согласно объявлению Ai2. Ai2 говорит, что цель заключалась в проверке, может ли небольшая открытая модель, обученная специально для генерации научных отчётов, сопоставить качество отчётов с проприетарными моделями, которые она использовала, одновременно сокращая время генерации и затраты на обслуживание. Ai2 сообщает, что по всей конвейеру Asta Fast mode в среднем занимает 51.1 секунды на отчёт против 178.5 секунды у Thinking mode, что, по их словам, примерно в 3.5 раза быстрее и почти на порядок сокращает время генерации по сравнению с отслеживаемыми проприетарными моделями.
Карта модели AstaBrief 8B указывает, что модель лицензирована по Apache 2.0, основана на Qwen3-8B и предназначена для исследовательского и образовательного использования в соответствии с Руководством ответственного использования Ai2. Поскольку веса открыты, Ai2 сообщает, что учреждения могут запускать модель на собственном оборудовании, в том числе за собственным брандмауэром, что, по их словам, необходимо, когда исследовательские вопросы касаются конфиденциальных или неопубликованных материалов. Вместе с весами Ai2 выпустил пример рабочего процесса в своем репозитории ai2-scholarqa-lib на GitHub, который исследователи могут адаптировать для генерации отчётов из своих PDF‑файлов.
Обучающие данные и фильтрация
Ai2 начал с Qwen3-8B и построил AstaBrief с помощью контролируемой донастройки, а затем прямая оптимизация предпочтений (DPO). В объявлении говорится, что команда рассматривала обучение с подкреплением, которое их предыдущая работа DR Tulu показала может улучшить генерацию длительных отчётов для моделей с открытыми весами, но выбрала более простой подход, поскольку обучение с подкреплением может быть нестабильным и дорогим, а команда хотела решение, которое было бы дешевле и проще в отладке и итерации.
Для ускорения AstaBrief обучали писать полный отчёт за один проход, используя запрос пользователя и полученные фрагменты, обходя этапы суммирования фрагментов и кластеризации, которые использует режим Thinking на базе Claude, и пропуская пораздельную запись. Ai2 сообщает, что обнаружила возможность сделать это без потери производительности.
Обучающий конвейер начался с реальных запросов пользователей, отправленных через систему, построенную на основе фреймворка ScholarQA от Ai2, который лежит в основе генерации отчётов Asta. Команда отфильтровала журналы по качеству, релевантности и конфиденциальности, удалив трафик бета‑тестеров и ботов, исключив запросы, слишком короткие для смысловой нагрузки, и применив проход на основе LLM для выявления неанглийских запросов, нерелевантных научных запросов и подсказок, содержащих личную информацию. В результате остался пул из 90 000 запросов, ориентированных на исследования.
На этапе обучения с учителем целевые полные отчёты генерировались с помощью многоступенчатого конвейера ScholarQA, поддерживаемого смесью собственных систем: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini и GPT‑4.1. Фильтрация качества оставила 47 000 пригодных примеров. Для DPO пары получались из отдельного подмножества запросов, не использованных при генерации данных SFT: один отчёт из конвейера ScholarQA, обычно поддерживаемый Claude 3.5 или 3.7 Sonnet, против отчёта, созданного o3, o4-mini, DeepSeek‑V3 или DeepSeek‑R1. Два судейских модели, GPT‑4.1 и DeepSeek‑R1, выбирали победителя для каждой пары. Ai2 сообщает, что судьи согласовывались с человеческими предпочтениями 95 % времени, и только пары, в которых оба судьи согласились, сохранялись, что давало около 6 000 финальных примеров. Согласно карточке модели, выпущенная модель была инициализирована из контрольной точки AstaBrief‑8B‑SFT и дообучена на наборе данных AstaBriefDPOMix, при этом обучение DPO проводилось в открытой инструкции Ai2 на 8 xH100 GPU.
Результаты оценки
Основной целью разработки Ai2 был SQABench-CS2, который, согласно объявлению, представляет собой набор из 200 вопросов по компьютерным наукам, написанных пользователями. Команда отслеживала четыре метрики: оценка по рубрике, измеряющая, насколько полно отчёт покрывает необходимый контент; точность ответов, измеряющая, релевантен ли каждый абзац вопросу; точность цитирования, измеряющая, поддерживает ли каждая ссылка утверждение, к которому она относится; и полноту цитирования, измеряющая, полностью ли поддерживаются утверждения отчёта предоставленными ссылками. Вторичные оценки использовали DeepScholarBench, набор из 63 запросов для синтеза длительных исследований, построенный на основе последних статей arXiv, а также парные сравнения с отчётами из конвейера, основанного на Claude.
В объявлении сообщается, что команда протестировала четыре статистически‑основанных фильтра на синтетических обучающих отчётах: соотношение токенов вывода к вводу, релевантность цитат, плотность цитат и разнообразие цитат. Ai2 отмечает, что наибольший прирост был достигнут за счёт отсева отчётов с низкой плотностью цитат, тогда как более агрессивные фильтрации, комбинации фильтров и переборы скоростей обучения не принесли значимых улучшений. Это рассматривается как доказательство того, что научная специализация не обязательно требует добавления большего количества научного текста в предобучение, а состав и качество данных после обучения могут существенно изменить производительность полученной модели.
Ai2 сообщает, что ранние контрольные точки SFT улучшили общее качество контента, но всё ещё отставали от конвейера на базе Claude по точности ответов и качеству цитирования, а этап DPO привёл AstaBrief к уровню конвейера Claude и DR Tulu по генерации отчётов. В карточке модели указано, что на тестовом наборе ScholarQA‑CS2 AstaBrief‑8B набрал в среднем 87 баллов по отслеживаемым метрикам, по сравнению с 83,7 у контрольной точки SFT и 77,3 у базовой Qwen3‑8B; при этом AstaBrief‑8B получил 90,2 по воспоминанию ингредиентов, 89 по точности ответов, 90,5 по точности цитирования и 78,2 по воспоминанию цитат. Карточка также сообщает о выигрышных показателях, оценённых LLM, для AstaBrief‑8B против конвейера Asta ScholarQA: 55 % на валидационном наборе и 72 % на тестовом наборе, а также приводит результаты DeepScholarBench: 53,50 для AstaBrief‑8B, 60,25 для Asta ScholarQA и 56,26 для DR‑Tulu‑8B.
В отдельном человеческом исследовании, описанном в объявлении, три научных исследователя каждый задали от четырёх до пяти вопросов в наборе из 14 вопросов и оценивали отчёты трёх систем по общему предпочтению, полноте, релевантности, организации и точности цитирования, допуская равные оценки. Ai2 сообщает, что DR Tulu победил по общему предпочтению, тогда как два из трёх исследователей отдали предпочтение AstaBrief по точности цитирования по сравнению с другими системами.
Ai2 предостерегает, что большинство обучения и оценки было завершено в 2025 году, что проприетарные модели, использованные для создания обучающих данных и в качестве точек сравнения, отражают состояние фронтира того времени, и что полная переоценка против текущих передовых моделей не была проведена.
Раннее использование и заявленные дальнейшие шаги
Ai2 сообщает, что среди 374 пользователей Asta, попробовавших режим Fast, 29,1 % использовали его два и более дней, пользователи в среднем создали 3,67 цепочек отчётов, 23 % никогда не переключались обратно в режим Thinking для последующих цепочек, а ещё 18 % чередовали режимы в зависимости от целей, используя Fast примерно в 40 % своих цепочек. Положительные отзывы составили 84,2 % для Fast и 85,2 % для Thinking, что Ai2 характеризует как схожий уровень, отмечая, что обратная связь обычно слишком редка, чтобы делать сильные выводы.
Ai2 заявляет, что исследует более тонкое обучение предпочтений, более сильные подходы RAG‑plus‑RL, возможности многократных ходов и многопользовательских инструментов, дополнительные научные источники данных и разложение запросов, а также оценки, проверяющие, сохраняет ли модель доказательную область своих источников, а не расширяет выводы исходных исследований. В объявлении работа помещается в более широкие научные модели Ai2, включая NSF OMAI — национальную инициативу США, возглавляемую Ai2, по созданию полностью открытой ИИ‑инфраструктуры и моделей для научных открытий, и описывает AstaBrief как один из экспериментов в более длинной цепочке проектов, начиная от ScholarQA и DR Tulu и до будущих версий Olmo.












