Modele i platformy AI

Ai2 udostępnia AstaBrief 8B do szybkiego generowania raportów naukowych

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Instytut Allen dla Sztucznej Inteligencji (Ai2) powiedział 2 października 2026 r., że udostępnia AstaBrief 8B, model, który zamienia pytanie badawcze i pobrane fragmenty literatury w raport z cytatami, udostępniając wagi modelu i dane treningowe, gdy system uruchamia się w trybie Fast w Asta, jego agentycznej platformie do pracy naukowej.

Tryb Fast w generowaniu raportów Asta

AstaBrief jest dostępny w funkcji „Generate a report” w Asta jako tryb Fast, działający równolegle z istniejącym trybem Thinking opartym na Claude, zgodnie z ogłoszeniem Ai2. Ai2 mówi, że celem było sprawdzenie, czy mały, otwarty model wytrenowany specjalnie do generowania raportów naukowych może dorównać jakości raportów własnościowych modeli, z których korzystano, jednocześnie skracając czas generowania i koszty obsługi. Ai2 informuje, że w całym potoku Asta tryb Fast średnio zajmuje 51,1 s na raport w porównaniu z 178,5 s w trybie Thinking, co opisuje jako około 3,5‑krotne przyspieszenie i prawie dziesięciokrotną redukcję czasu generowania w stosunku do śledzonych modeli własnościowych.

W karcie modelu AstaBrief 8B podano, że model jest licencjonowany na licencji Apache 2.0, oparty jest na Qwen3-8B i przeznaczony do użytku badawczego i edukacyjnego zgodnie z Wytycznymi Odpowiedzialnego Użytkowania Ai2. Ponieważ wagi są otwarte, Ai2 twierdzi, że instytucje mogą uruchamiać model na własnym sprzęcie, w tym za własną zaporą sieciową, co opisuje jako niezbędne, gdy pytania badawcze dotyczą wrażliwych lub nieopublikowanych prac. Oprócz wag, Ai2 udostępnił przykładowy przepływ pracy w swoim repozytorium ai2-scholarqa-lib na GitHub, który badacze mogą dostosować do generowania raportów z własnych plików PDF.

Dane treningowe i filtrowanie

Ai2 rozpoczął od Qwen3-8B i zbudował AstaBrief przy użyciu nadzorowanego dopasowywania, po czym zastosował bezpośrednią optymalizację preferencji (DPO). Ogłoszenie mówi, że zespół rozważał trening oparty na uczeniu ze wzmocnieniem, co wcześniejsze badania DR Tulu wykazały, że może poprawić generowanie długich raportów w modelach o otwartych wagach, ale wybrano prostszą metodę, ponieważ trening RL może być niestabilny i kosztowny, a zespół chciał rozwiązanie tańsze i łatwiejsze w debugowaniu oraz iteracji.

W celu zwiększenia szybkości AstaBrief został wytrenowany do napisania pełnego raportu w jednym przebiegu na podstawie zapytania użytkownika i pobranych fragmentów, pomijając etapy podsumowywania i grupowania fragmentów, które wykorzystuje tryb Thinking oparty na Claude, oraz pomijając pisanie sekcja po sekcji. Ai2 twierdzi, że udało się to osiągnąć bez utraty wydajności.

Potok treningowy rozpoczął się od rzeczywistych zapytań użytkowników przesyłanych przez system oparty na frameworku ScholarQA firmy Ai2, który stanowi podstawę generowania raportów w Asta. Zespół przefiltrował logi pod kątem jakości, trafności i prywatności, usuwając ruch od beta‑testerów i botów, odrzucając zapytania zbyt krótkie, aby były znaczące, oraz wykorzystując etap oparty na LLM do wykrywania zapytań nieanglojęzycznych, nie‑naukowych oraz poleceń zawierających dane osobowe. Pozostał w ten sposób zbiór 90K zapytań skoncentrowanych na badaniach.

W etapie nadzorowanym cele pełnych raportów generowano przy użyciu wieloetapowego potoku ScholarQA, wspieranego przez mieszankę systemów własnościowych: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini oraz GPT-4.1. Po filtracji jakościowej pozostało 47 tys. użytecznych przykładów. W przypadku DPO pary pochodziły z odrębnego podzbioru zapytań, które nie były wykorzystywane podczas generowania danych SFT: jeden raport z potoku ScholarQA, zazwyczaj wspierany przez Claude 3.5 lub 3.7 Sonnet, przeciwko raportowi wygenerowanemu przez o3, o4-mini, DeepSeek-V3 lub DeepSeek-R1. Dwa modele sędziujące, GPT-4.1 i DeepSeek-R1, wybierały zwycięzcę dla każdej pary. Ai2 podaje, że sędziowie zgadzali się z preferencjami ludzkimi w 95 procentach przypadków, a jedynie pary, w których obaj sędziowie się zgodzili, były zachowywane, co dało około 6 tys. ostatecznych przykładów. Zgodnie z kartą modelu, udostępniony model został zainicjowany z punktu kontrolnego AstaBrief-8B-SFT i dopracowany na zestawie danych AstaBriefDPOMix, przy czym trening DPO prowadzono w otwartym frameworku Ai2 open‑instruct na 8 xGPU H100.

Wyniki oceny

Głównym celem rozwojowym Ai2 był SQABench‑CS2, który w ogłoszeniu opisano jako zestaw 200 pytań badawczych z dziedziny informatyki napisanych przez użytkowników. Zespół monitorował cztery metryki: wynik rubryki, mierzący, jak dużo niezbędnej treści obejmuje raport; precyzję odpowiedzi, oceniającą, czy każdy akapit jest istotny w odniesieniu do pytania; precyzję cytowań, sprawdzającą, czy każde odwołanie wspiera przypisane mu twierdzenie; oraz przywołanie cytowań, mierzące, czy twierdzenia raportu są w pełni poparte podanymi cytatami. Dodatkowe oceny wykorzystano DeepScholarBench, benchmark składający się z 63 zapytań do syntezy długich prac badawczych, oparty na najnowszych artykułach z arXiv, oraz porównania parami z raportami z potoku opartego na Claude.

W ogłoszeniu podano, że zespół przetestował cztery filtry oparte na statystykach na syntetycznych raportach treningowych: stosunek tokenów wyjściowych do wejściowych, trafność cytowań, gęstość cytowań oraz różnorodność cytowań. Ai2 twierdzi, że największe korzyści uzyskano dzięki odrzuceniu raportów o niskiej gęstości cytowań, podczas gdy bardziej agresywne filtrowanie, kombinacje filtrów i przeszukiwania zakresów współczynników uczenia nie przyniosły istotnych zysków. Opisuje to szersze wnioski jako dowód na to, że specjalizacja naukowa nie musi polegać na dodawaniu większej ilości tekstu naukowego do wstępnego treningu, a skład i jakość danych po‑treningowych mogą znacząco wpłynąć na wydajność powstałego modelu.

Ai2 informuje, że wczesne punkty kontrolne SFT poprawiły ogólną jakość treści, ale nadal pozostawały w tyle za potokiem opartym na Claude pod względem precyzji odpowiedzi i jakości cytowań, a etap DPO przybliżył AstaBrief do zakresu potoku Claude i DR Tulu w generowaniu raportów. Karta modelu podaje, że w zestawie testowym ScholarQA‑CS2 AstaBrief‑8B uzyskał średnio 87 punktów w śledzonych metrykach, w porównaniu z 83,7 dla punktu kontrolnego SFT i 77,3 dla bazowego Qwen3‑8B, przy czym AstaBrief‑8B uzyskał 90,2 w przywoływaniu składników, 89 w precyzji odpowiedzi, 90,5 w precyzji cytowań i 78,2 w przywoływaniu cytowań. Karta informuje również o wskaźnikach wygranej ocenianych przez LLM dla AstaBrief‑8B w porównaniu z potokiem Asta ScholarQA: 55 % w podziale rozwojowym i 72 % w podziale testowym, oraz podaje wyniki DeepScholarBench: 53,50 dla AstaBrief‑8B, 60,25 dla Asta ScholarQA i 56,26 dla DR‑Tulu‑8B.

W odrębnym badaniu z udziałem ludzi opisanym w ogłoszeniu trzej naukowcy każdy wnieśli cztery‑pięć pytań do zestawu 14 pytań i oceniali raporty z trzech systemów pod kątem ogólnej preferencji, kompletności, trafności, organizacji i dokładności cytowań, przy dopuszczaniu remisów. Ai2 podaje, że DR Tulu wygrał pod względem ogólnej preferencji, podczas gdy dwaj z trzech badaczy preferowali AstaBrief pod względem dokładności cytowań w stosunku do pozostałych systemów.

Ai2 ostrzega, że większość treningu i oceny została zakończona w 2025 r., że własnościowe modele użyte do generowania danych treningowych i służące jako punkty odniesienia odzwierciedlają stan techniki z tego czasu, oraz że nie przeprowadzono ponownej pełnej oceny względem aktualnych modeli wiodących.

Wczesne użycie i określone kolejne kroki

Ai2 informuje, że wśród 374 użytkowników Asta, którzy wypróbowali tryb Fast, 29,1 % korzystało z niego w co najmniej dwóch dniach, użytkownicy generowali średnio 3,67 wątków raportów, 23 % nigdy nie powróciło do trybu Thinking w kolejnych wątkach, a kolejne 18 % przełączało się między trybami w zależności od celów, używając trybu Fast w około 40 % swoich wątków. Pozytywna opinia wyniosła 84,2 % dla trybu Fast w porównaniu z 85,2 % dla trybu Thinking, co Ai2 określa jako podobny wskaźnik, jednocześnie zauważając, że opinie są zazwyczaj zbyt rzadkie, aby wyciągać mocne wnioski.

Ai2 informuje, że bada bardziej szczegółowe uczenie preferencji, silniejsze podejścia RAG‑plus‑RL, możliwości wielo‑tur i wielo‑narzędziowe, dodatkowe źródła danych naukowych oraz dekompozycję zapytań, wraz z ocenami sprawdzającymi, czy model zachowuje zakres dowodowy swoich źródeł, zamiast rozszerzać to, co ustaliły pierwotne badania. Ogłoszenie umieszcza tę pracę w szerszych działaniach Ai2 nad modelami naukowymi, w tym w ramach NSF OMAI, amerykańskiej inicjatywy prowadzonej przez Ai2 mającej na celu stworzenie w pełni otwartej infrastruktury AI i modeli dla odkryć naukowych, i opisuje AstaBrief jako jeden eksperyment w dłuższej serii prac, począwszy od ScholarQA i DR Tulu, aż po przyszłe wersje Olmo.

Jonas Reeve jest analitykiem generowanym przez SI w Unite.AI, koncentrującym się na kognitywnej SI, sztucznej ogólnej inteligencji (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja wyłaniają się zarówno w systemach biologicznych, jak i sztucznych, tworząc powiązania między współczesnymi architekturami SI a długoletnimi pytaniami w naukach kognitywnych i filozofii umysłu.

Z koncepcyjnym i refleksyjnym podejściem Jonas bada ramy takie jak modele rozumowania, systemy agentowe, emergentna kognicja i teoria zgodności, dążąc do wyjaśnienia, co tak naprawdę oznacza postęp w kierunku AGI — a czego nie. Zamiast gonić za terminami czy hype’em, podkreśla pierwsze zasady, rygor konceptualny oraz ograniczenia obecnych modeli.

Artykuły autorstwa Jonasa Reeve są generowane przez SI i recenzowane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, przejrzystość i odpowiedzialną dyskusję zaawansowanych koncepcji SI.