Моделі та платформи ШІ

Ai2 відкриває вихідний код AstaBrief 8B для швидкого створення наукових звітів

mm
Додайте Unite.AI до бажаних джерел у Google

Allen Institute for AI (Ai2) повідомив 2 жовтня 2026 року, що відкриває вихідний код AstaBrief 8B — моделі, яка перетворює наукове питання та отримані уривки літератури у звіт з посиланнями, випускаючи ваги моделі та навчальні дані, коли система запускається в режимі Fast у Asta, його агентній платформі для наукової роботи.

Швидкий режим у генерації звітів Asta

AstaBrief доступний у функції «Створити звіт» в Asta як Швидкий режим, який працює паралельно з існуючим режимом Thinking, що працює на Claude, згідно оголошення Ai2. Ai2 зазначає, що мета полягала у перевірці, чи може невелика відкрита модель, спеціально навчена для створення наукових звітів, досягти якості звітів, яку забезпечують пропрієтарні моделі, які вона використовувала, при цьому скоротивши час генерації та витрати на обслуговування. Ai2 повідомляє, що в межах усього конвеєра Asta Швидкий режим у середньому займає 51.1 секунди на звіт у порівнянні з 178.5 секунди для режиму Thinking, різниця описується як приблизно в 3.5 рази швидше та майже на порядок швидше щодо часу генерації порівняно з пропрієтарними моделями, які відстежували.

У карті моделі AstaBrief 8B зазначено, що модель ліцензована під Apache 2.0, базується на Qwen3-8B і призначена для досліджень та освітнього використання відповідно до Керівництва з відповідального використання Ai2. Оскільки ваги відкриті, Ai2 стверджує, що установи можуть запускати модель на власному обладнанні, включаючи за власним брандмауером, що, за їх словами, необхідно, коли дослідницькі питання стосуються чутливих або неопублікованих робіт. Поряд з вагами Ai2 випустив приклад робочого процесу у своєму репозиторії ai2-scholarqa-lib GitHub, який дослідники можуть адаптувати для створення звітів зі своїх PDF‑файлів.

Навчальні дані та фільтрація

Ai2 розпочав з Qwen3-8B і створив AstaBrief за допомогою наглядового тонкого налаштування, а потім пряма оптимізація уподобань (DPO). У оголошенні зазначено, що команда розглядала навчання на основі підкріплювального навчання, яке їхня попередня робота DR Tulu показала, що може покращити генерацію довгих звітів для моделей з відкритими вагами, але обрали простіший підхід, оскільки навчання RL може бути нестабільним і дорогим, і команда хотіла налаштування, яке буде дешевшим та легшим у налагодженні та ітераціях.

Для швидкості AstaBrief був навчений писати повний звіт за один прохід від запиту користувача та отриманих уривків, минаючи етапи підсумовування уривків і кластеризації, які використовує режим Thinking на базі Claude, та пропускаючи написання розділ за розділом. Ai2 стверджує, що це було можливим без втрати продуктивності.

Навчальний конвеєр розпочався з реальних запитів користувачів, поданих через систему під Framework Ai2 ScholarQA, який лежить в основі генерації звітів Asta. Команда відфільтрувала журнали за якістю, релевантністю та конфіденційністю, видаливши трафік бета‑тестувальників і ботів, відкидаючи запити, занадто короткі для змісту, та використовуючи проходження на базі LLM для виявлення неанглійських запитів, не наукових запитів і підказок, що містять особисту інформацію. У результаті залишилося 90 000 запитів, орієнтованих на дослідження.

Для етапу з наглядом цільові повнорозгорнуті звіти генерувалися за допомогою багатокрокового конвеєра ScholarQA, підкріпленого сумішшю власних систем: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini та GPT-4.1. Після фільтрації за якістю залишилося 47 000 придатних прикладів. Для DPO пари формувалися з окремого підмножини запитів, які не використовувалися під час створення даних SFT: один звіт із конвеєра ScholarQA, зазвичай підкріплений Claude 3.5 або 3.7 Sonnet, проти звіту, згенерованого o3, o4-mini, DeepSeek-V3 або DeepSeek-R1. Два суддівські моделі, GPT-4.1 і DeepSeek-R1, обирали переможця для кожної пари. Ai2 повідомляє, що судді погоджувалися з людськими уподобаннями у 95 відсотках випадків, і лише пари, у яких обидва судді погоджувалися, залишалися, що дало близько 6 000 остаточних прикладів. За даними картки моделі, випущена модель була ініціалізована з контрольної точки AstaBrief-8B-SFT і донавчена на наборі даних AstaBriefDPOMix, причому навчання DPO проводилося в рамках відкритого інструкційного середовища Ai2 на 8 xH100 GPU.

Результати оцінювання

Головною ціллю розробки Ai2 був SQABench-CS2, який у оголошенні описується як набір з 200 користувачами написаних питань з комп’ютерних наук. Команда відстежувала чотири метрики: оцінка за рубрикою, що вимірює, наскільки необхідний вміст охоплює звіт; точність відповідей, що вимірює, чи кожен абзац відповідає питанню; точність цитувань, що вимірює, чи кожна цитата підтримує відповідну заяву; та відтворюваність цитувань, що вимірює, чи заяви звіту повністю підкріплені наданими цитатами. Додаткові оцінки використовували DeepScholarBench, бенчмарк з 63 запитів для довгої дослідницької синтези, створений на основі недавніх статей arXiv, а також парні порівняння зі звітами з конвеєра, що працює на Claude.

У оголошенні зазначено, що команда протестувала чотири фільтри, засновані на статистиці, на синтетичних навчальних звітах: співвідношення токенів вихід/вхід, релевантність цитат, щільність цитат та різноманітність цитат. Ai2 стверджує, що найсильніші покращення отрималися завдяки відфільтруванню звітів з низькою щільністю цитат, тоді як більш агресивне фільтрування, комбінації фільтрів та перебори швидкості навчання не принесли значних вигод. Це розглядається як ширший висновок, що наукова спеціалізація не обов’язково полягає у додаванні більшої кількості наукового тексту до передтренування, і що склад та якість даних після навчання можуть суттєво змінити продуктивність отриманої моделі.

Ai2 стверджує, що ранні контрольні точки SFT покращили загальну якість контенту, але все ще відставали від конвеєра, що працює на Claude, за точністю відповідей та якістю цитувань, і що етап DPO привів AstaBrief до рівня конвеєра Claude та DR Tulu у генерації звітів. У модельній картці зазначено, що на тестовому наборі ScholarQA‑CS2 AstaBrief‑8B у середньому отримав 87 за відстежуваними метриками, у порівнянні з 83,7 для контрольної точки SFT і 77,3 для базової Qwen3‑8B, причому AstaBrief‑8B набрав 90,2 за відтворенням інгредієнтів, 89 за точністю відповідей, 90,5 за точністю цитувань і 78,2 за відтворенням цитувань. У картці також зазначено, що LLM‑оцінені показники перемоги AstaBrief‑8B проти конвеєра Asta ScholarQA склали 55 % на розділі розробки та 72 % на тестовому розділі, а також наведено результати DeepScholarBench: 53,50 для AstaBrief‑8B, 60,25 для Asta ScholarQA та 56,26 для DR‑Tulu‑8B.

У окремому людському дослідженні, описаному в оголошенні, три наукових дослідника кожен внесли чотири‑п’ять питань у набір із 14 питань і оцінювали звіти трьох систем за загальними уподобаннями, повнотою, релевантністю, організацією та точністю цитувань, допускаючи рівні результати. Ai2 повідомляє, що DR Tulu переміг за загальними уподобаннями, тоді як два з трьох дослідників віддали перевагу AstaBrief щодо точності цитувань.

Ai2 застерігає, що більшість навчання та оцінювання було завершено у 2025 році, що пропрієтарні моделі, використані для створення навчальних даних і слугували точками порівняння, відображають стан технології того часу, і що повне оцінювання проти сучасних передових моделей ще не було повторено.

Початкове використання та заявлені подальші кроки

Ai2 повідомляє, що серед 374 користувачів Asta, які спробували режим Fast, 29,1 % використовували його два або більше днів, користувачі створювали в середньому 3,67 потоків звітів, 23 % ніколи не переходили назад у режим Thinking для майбутніх потоків, а ще 18 % чергували між режимами залежно від своїх цілей, використовуючи Fast у приблизно 40 % своїх потоків. Позитивний зворотний зв’язок склав 84,2 % для Fast порівняно з 85,2 % для Thinking, що Ai2 охарактеризував як подібний рівень, зазначивши, що відгуки загалом надто рідкі, щоб робити сильні висновки.

Ai2 повідомляє, що досліджує більш детальне навчання уподобань, потужніші підходи RAG‑plus‑RL, можливості багатокрокових діалогів і багатофункціональних інструментів, додаткові наукові джерела даних та розкладання запитів, а також оцінювання, які перевіряють, чи модель зберігає доказову межу своїх джерел, а не розширює те, що встановили первинні дослідження. Оголошення розміщує цю роботу в рамках ширших наукових моделей Ai2, включаючи NSF OMAI, національну ініціативу США, очолювану Ai2, зі створення повністю відкритої інфраструктури ШІ та моделей для наукових відкриттів, і описує AstaBrief як один експеримент у довгій лінії робіт, що простягаються від ScholarQA та DR Tulu до майбутніх версій Olmo.

Jonas Reeve є аналітиком, створеним штучним інтелектом, у Unite.AI, зосередженим на когнітивному ШІ, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, міркування, пам’ять і абстракція виникають як у біологічних, так і в штучних системах, встановлюючи зв’язки між сучасними архітектурами ШІ та довготривалими питаннями когнітивної науки та філософії розуму.

З концептуальним та рефлексивним підходом Jonas досліджує такі рамки, як моделі міркування, агентні системи, емерджентна когніція та теорія вирівнювання, прагнучи уточнити, що насправді означає прогрес у напрямку AGI — і що це не означає. Замість того, щоб гонитись за терміновими датами чи гіпом, він наголошує на фундаментальних принципах, концептуальній суворості та межах поточних моделей.

Статті, написані Jonas Reeve, створені штучним інтелектом і перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій ШІ.