Modele și platforme AI

Ai2 publică open-source AstaBrief 8B pentru generarea rapidă de rapoarte științifice

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Institutul Allen pentru Inteligență Artificială (Ai2) a declarat pe 2 octombrie 2026 că publică open-source AstaBrief 8B, un model care transformă o întrebare de cercetare și fragmente de literatură recuperate într-un raport cu citări, lansând greutățile modelului și datele de antrenament pe măsură ce sistemul devine disponibil în modul Rapid în Asta, platforma sa agentică pentru munca științifică.

Modul Rapid în generarea rapoartelor din Asta

AstaBrief este disponibil în funcția „Generează un raport” a lui Asta, ca Mod Rapid, rulând alături de modul existent „Thinking” alimentat de Claude, conform anunțului Ai2. Ai2 spune că scopul său a fost să testeze dacă un model mic, open, antrenat special pentru generarea de rapoarte științifice poate egala calitatea rapoartelor modelelor proprietare pe care le folosea, reducând totodată timpul de generare și costurile de servire. Ai2 raportează că, în întregul pipeline Asta, Modul Rapid are în medie 51.1 secunde pe raport, comparativ cu 178.5 secunde pentru modul Thinking, o diferență pe care o descrie ca fiind aproximativ 3.5 ori mai rapidă și aproape o reducere de un ordin de mărime a timpului de generare în raport cu modelele proprietare monitorizate.

fișa modelului AstaBrief 8B afirmă că modelul este licențiat sub Apache 2.0, se bazează pe Qwen3-8B și este destinat utilizării în cercetare și educație conform Ghidurilor de Utilizare Responsabilă ale Ai2. Deoarece greutățile sunt deschise, Ai2 spune că instituțiile pot rula modelul pe propriul hardware, inclusiv în spatele propriului firewall, pe care îl descrie ca fiind necesar atunci când întrebările de cercetare ating subiecte sensibile sau lucrări nepublicate. În paralel cu greutățile, Ai2 a lansat un flux de lucru exemplu în depozitul său ai2-scholarqa-lib GitHub, pe care cercetătorii îl pot adapta pentru a genera rapoarte din propriile PDF-uri.

Date de antrenament și filtrare

Ai2 a pornit de la Qwen3-8B și a construit AstaBrief prin ajustare fină supervizată, urmată de optimizare directă a preferințelor (DPO). Anunțul spune că echipa a luat în considerare antrenamentul bazat pe învățare prin recompensă, pe care munca lor anterioară DR Tulu demonstrase că poate îmbunătăți generarea de rapoarte de lungă durată pentru modele cu greutăți deschise, dar a ales rețeta mai simplă deoarece antrenamentul RL poate fi instabil și costisitor, iar echipa dorea o soluție mai ieftină și mai ușor de depanat și iterat.

Pentru viteză, AstaBrief a fost antrenat să scrie raportul complet într-un singur pas, pornind de la interogarea utilizatorului și fragmentele recuperate, ocolind etapele de rezumat și grupare a fragmentelor pe care le folosește modul Thinking bazat pe Claude și sărind scrierea secțiune cu secțiune. Ai2 spune că a constatat că acest lucru este posibil fără a sacrifica performanța.

Pipeline-ul de antrenament a început cu interogări reale ale utilizatorilor trimise prin sistemul din spatele cadrului ScholarQA al Ai2, care susține generarea rapoartelor în Asta. Echipa a filtrat jurnalele pentru calitate, relevanță și confidențialitate, eliminând traficul de beta-testeri și roboți, eliminând interogările prea scurte pentru a fi semnificative și utilizând un pas bazat pe LLM pentru a prinde interogări non-engleze, cereri non-științifice și solicitări care conțin informații personale. Aceasta a lăsat un pool de 90K interogări orientate spre cercetare.

Pentru etapa supravegheată, țintele de raport complet au fost generate cu pipeline‑ul multi‑pas ScholarQA susținut de un amestec de sisteme proprietare: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4‑mini și GPT‑4.1. Filtrarea de calitate a lăsat 47K exemple utilizabile. Pentru DPO, perechile au provenit dintr-un subset separat de interogări neutilizat în timpul generării datelor SFT: un raport din pipeline‑ul ScholarQA, de obicei susținut de Claude 3.5 sau 3.7 Sonnet, comparat cu un raport generat de o3, o4‑mini, DeepSeek‑V3 sau DeepSeek‑R1. Două modele de judecată, GPT‑4.1 și DeepSeek‑R1, au ales un câștigător pentru fiecare pereche. Ai2 afirmă că judecătorii au fost de acord cu preferințele umane în 95 la sută din cazuri, iar doar perechile pe care ambii judecători au fost de acord au fost păstrate, producând aproximativ 6K exemple finale. Conform fișei modelului, modelul lansat a fost inițializat din punctul de control AstaBrief-8B-SFT și ajustat fin pe setul de date AstaBriefDPOMix, cu antrenament DPO realizat în cadrul framework‑ului open‑instruct al Ai2 pe 8xH100 GPUs.

Rezultatele evaluării

Obiectivul principal de dezvoltare al Ai2 a fost SQABench‑CS2, pe care anunțul îl descrie ca un set de 200 de întrebări de cercetare în informatică scrise de utilizatori. Echipa a urmărit patru metrici: scorul rubricii, care măsoară cât de mult conținut necesar acoperă un raport; precizia răspunsului, care evaluează dacă fiecare paragraf este relevant pentru întrebare; precizia citării, care verifică dacă fiecare citare susține afirmația asociată; și rechemarea citărilor, care măsoară dacă afirmațiile raportului sunt pe deplin susținute de citările furnizate. Evaluările secundare au folosit DeepScholarBench, un benchmark de 63 de interogări pentru sinteza de cercetare pe termen lung construit din lucrări recente de pe arXiv, plus comparații în pereche cu rapoartele generate de pipeline‑ul alimentat de Claude.

Anunțul raportează că echipa a testat patru filtre bazate pe statistici pe rapoarte de antrenament sintetice: raportul token‑output la token‑input, relevanța citărilor, densitatea citărilor și diversitatea citărilor. Ai2 spune că cele mai mari câștiguri au venit din filtrarea rapoartelor cu densitate scăzută a citărilor, în timp ce filtrarea mai agresivă, combinațiile de filtre și ajustările ratei de învățare nu au adus câștiguri semnificative. Descrie lecția mai amplă ca dovadă că specializarea științifică nu este neapărat o chestiune de a adăuga mai mult text științific la pre-antrenare și că compoziția și calitatea datelor post‑antrenament pot modifica în mod substanțial performanța modelului rezultat.

Ai2 spune că primele puncte de control SFT au îmbunătățit calitatea generală a conținutului, dar au rămas în urma conductei alimentate de Claude în ceea ce privește precizia răspunsurilor și calitatea citărilor, și că etapa DPO a adus AstaBrief în intervalul conductei Claude și al DR Tulu la generarea rapoartelor. Fișa modelului raportează că pe setul de testare ScholarQA-CS2, AstaBrief-8B a înregistrat o medie de 87 la metricile urmărite, comparativ cu 83.7 pentru punctul de control SFT și 77.3 pentru base Qwen3-8B, cu AstaBrief-8B obținând 90.2 la ingredient recall, 89 la answer precision, 90.5 la citation precision și 78.2 la citation recall. Fișa mai raportează ratele de victorie evaluate de LLM pentru AstaBrief-8B în comparație cu pipeline-ul Asta ScholarQA de 55 percent pe diviziunea de dezvoltare și 72 percent pe diviziunea de testare, și enumeră scorurile DeepScholarBench de 53.50 pentru AstaBrief-8B, 60.25 pentru Asta ScholarQA și 56.26 pentru DR-Tulu-8B.

Într-un studiu uman separat descris în anunț, trei cercetători științifici au contribuit fiecare cu patru până la cinci întrebări dintr-un set de 14 întrebări și au clasificat rapoartele celor trei sisteme în funcție de preferința generală, completitudine, relevanță, organizare și acuratețea citărilor, cu posibilitatea egalităților. Ai2 raportează că DR Tulu a câștigat la preferința generală, în timp ce doi dintre cei trei cercetători au preferat AstaBrief față de celelalte sisteme în ceea ce privește acuratețea citărilor.

Ai2 avertizează că cea mai mare parte a antrenamentului și evaluării a fost finalizată în 2025, că modelele proprietare utilizate pentru a genera datele de antrenament și ca puncte de comparație reflectă nivelul de frontieră de atunci și că nu a reluat evaluarea completă împotriva modelelor de frontieră actuale.

Utilizare timpurie și pașii următori declarați

Ai2 raportează că, dintre cei 374 de utilizatori Asta care au încercat Fast mode, 29.1 percent l-au folosit în două sau mai multe zile, utilizatorii au generat în medie 3.67 fire de rapoarte, 23 percent nu s-au întors niciodată la Thinking mode pentru firele viitoare și alți 18 percent au alternat între moduri în funcție de obiectivele lor, utilizând Fast mode pentru aproximativ 40 percent din firele lor. Feedbackul pozitiv a fost de 84.2 percent pentru Fast mode versus 85.2 percent pentru Thinking mode, pe care Ai2 îl caracterizează ca o rată similară, menționând totuși că feedbackul este în general prea sărac pentru a susține concluzii puternice.

Ai2 spune că explorează învățarea preferințelor mai detaliată, abordări RAG-plus-RL mai puternice, capabilități multi-turn și multi-tool, surse suplimentare de date științifice și descompunerea interogărilor, alături de evaluări care testează dacă un model păstrează domeniul probator al surselor sale în loc să extindă ceea ce studiile de bază au stabilit. Anunțul plasează munca în cadrul eforturilor mai largi ale lui Ai2 privind modelele științifice, inclusiv NSF OMAI, o inițiativă națională a SUA condusă de Ai2 pentru a construi o infrastructură și modele AI complet deschise pentru descoperirea științifică, și descrie AstaBrief ca un experiment dintr-o linie mai lungă de lucru care pornește de la ScholarQA și DR Tulu către versiuni viitoare ale Olmo.

Jonas Reeve este un analist generat de AI la Unite.AI, concentrându‑se pe inteligența cognitivă AI, inteligența artificială generală (AGI) și fundamentele teoretice ale inteligenței mașinilor. Munca sa explorează modul în care învățarea, raționamentul, memoria și abstractizarea apar atât în sistemele biologice, cât și în cele artificiale, stabilind legături între arhitecturile moderne de AI și întrebările de lungă durată din știința cognitivă și filosofia minții.

Printr‑o abordare conceptuală și reflexivă, Jonas examinează cadre precum modele de raționament, sisteme agențiale, cogniție emergentă și teoria aliniamentului, vizând să clarifice ce înseamnă cu adevărat progresul către AGI — și ce nu înseamnă. În loc să urmărească termene limită sau hype‑ul, el pune accent pe principii de bază, rigurozitate conceptuală și limitele modelelor actuale.

Articolele scrise de Jonas Reeve sunt generate de AI și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea, claritatea și discuția responsabilă a conceptelor avansate de AI.