AI-mallit ja alustat
Ai2 avaa lähdekoodin AstaBrief 8B:lle nopeaa tieteellistä raportin luontia varten

Allen Institute for AI (Ai2) ilmoitti 2. lokakuuta 2026, että se julkaisee AstaBrief 8B:n avoimena mallina, joka muuntaa tutkimuskysymyksen ja haetut kirjallisuusotaukset viitteistettyyn raporttiin, julkaisten mallin painot ja koulutusdatan järjestelmän siirtyessä Fast mode -tilaan Asta, sen agenttipohjaisessa tieteellisessä työalustassa.
Fast Mode Astan raportinluonnissa
AstaBrief on saatavilla Astan “Generate a report” -toiminnossa Fast mode -tilana, toimien rinnakkain olemassa olevan Claude‑voiman Thinking mode -tilan kanssa, Ai2:n ilmoituksen mukaan. Ai2 kertoo tavoitteensa olleen testata, voisiko pieni, avoin malli, joka on koulutettu erityisesti tieteellisten raporttien luontiin, vastata omistettujen mallien raporteissa saavutettavaa laatua samalla kun se lyhentää luontiaikaa ja palvelukustannuksia. Ai2 raportoi, että koko Asta‑putkessa Fast mode kestää keskimäärin 51,1 sekuntia raporttia kohti verrattuna 178,5 sekuntiin Thinking mode -tilassa, mikä on noin 3,5‑kertainen nopeuslisäys ja lähes kymmenkertainen lyhennys luontiajassa verrattuna seurattuihin omistettuihin malleihin.
AstaBrief 8B -mallikortti kertoo, että malli on lisensoitu Apache 2.0 -lisenssillä, perustuu Qwen3-8B:hen ja on tarkoitettu tutkimus- ja opetuskäyttöön Ai2:n Responsible Use Guidelines -ohjeiden mukaisesti. Koska painot ovat avoimia, Ai2 sanoo, että organisaatiot voivat ajaa mallin omalla laitteistollaan, myös oman palomuurinsa takana, mikä on tarpeellista, kun tutkimuskysymykset koskevat arkaluonteista tai julkaisematonta materiaalia. Painojen lisäksi Ai2 julkaisi esimerkkityönkulun ai2-scholarqa-lib GitHub -tietovarastossaan, jonka tutkijat voivat mukauttaa omista PDF-tiedostoistaan raporttien luomiseen.
Koulutusdata ja suodatus
Ai2 aloitti Qwen3-8B:stä ja rakensi AstaBriefin valvotulla hienosäädöllä, jonka jälkeen toteutettiin suora mieltymysoptimointi (DPO). Ilmoituksen mukaan tiimi harkitsi vahvistusoppimiseen perustuvaa koulutusta, jonka aiempi DR Tulu -työ oli osoittanut parantavan pitkän muodon raporttien luontia avoimien painojen malleissa, mutta valitsi yksinkertaisemman lähestymistavan, koska RL‑koulutus voi olla epävakaata ja kallista, ja tiimi halusi edullisemman ja helpommin virheenkorjattavan sekä iteratiivisen ratkaisun.
Nopeuden vuoksi AstaBrief koulutettiin kirjoittamaan koko raportti yhdellä läpikäynnillä käyttäjän kyselystä ja haetuista otteista, ohittaen otteiden tiivistys- ja ryhmittelyvaiheet, joita Claude‑pohjainen Thinking mode käyttää, sekä ohittaen osio kerrallaan -kirjoittamisen. Ai2 toteaa löytäneensä tämän mahdolliseksi ilman suorituskyvyn heikkenemistä.
Koulutusputki alkoi todellisista käyttäjäkyselyistä, jotka lähetettiin Ai2:n ScholarQA‑kehyksen takana toimivan järjestelmän kautta, mikä tukee Astan raportinluontia. Tiimi suodatti logit laadun, merkityksellisyyden ja yksityisyyden perusteella, poistaen beta-testaajien ja bottien liikenteen, hyläten liian lyhyet kyselyt ja käyttämällä LLM-pohjaista läpikäyntiä havaitakseen ei-englanninkieliset kyselyt, ei-tieteelliset pyynnöt ja henkilökohtaisia tietoja sisältävät kehotteet. Jäljelle jäi 90 000 tutkimuskeskeistä kyselyä.
Valvotussa vaiheessa täyden raportin kohteet luotiin monivaiheisella ScholarQA‑putkella, jota tukivat useat omistettujen järjestelmien yhdistelmät: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini ja GPT-4.1. Laadunsuodatus jätti 47 000 käyttökelpoista esimerkkiä. DPO‑vaiheessa parit saatiin erillisestä kyselyosasta, jota ei käytetty SFT‑datan luomisessa: yksi raportti ScholarQA‑putkesta, tyypillisesti Claude 3.5‑ tai 3.7‑Sonnet‑taustalla, verrattuna raporttiin, jonka on tuottanut o3, o4-mini, DeepSeek-V3 tai DeepSeek-R1. Kaksi arviointimallia, GPT-4.1 ja DeepSeek-R1, valitsivat voittajan jokaiselle parille. Ai2 kertoo, että arvostelijat olivat samaa mieltä ihmisten mieltymysten kanssa 95 % ajasta, ja vain ne parit, joilla molemmat arvostelijat olivat yhtä mieltä, säilytettiin, mikä tuotti noin 6 000 lopullista esimerkkiä. Mallikortin mukaan julkaistu malli alustettiin AstaBrief-8B-SFT‑tarkistuspisteestä ja hienosäädettiin AstaBriefDPOMix‑aineistoon, jossa DPO‑koulutus suoritettiin Ai2:n open‑instruct‑kehyksessä 8 × H100‑GPUilla.
Arviointitulokset
Ai2:n tärkein kehityskohde oli SQABench-CS2, jonka ilmoitus kuvaa 200 käyttäjän kirjoittaman tietojenkäsittelytieteen tutkimuskysymyksen kokoelmaksi. Tiimi seurasi neljää mittaria: rubriikkipistemäärä, joka mittaa, kuinka paljon tarvittavaa sisältöä raportti kattaa; vastaustarkkuus, joka mittaa, onko kukin kappale relevantti kysymykseen; viiteluotarkkuus, joka mittaa, tukevatko viitteet niihin liitettyä väitettä; ja viitteiden palautus, joka mittaa, onko raportin väitteet täysin tuettuja annetuilla viitteillä. Toissijaisissa arvioinneissa käytettiin DeepScholarBench‑testiä, 63‑kyselyn vertailuarviointia pitkän muodon tutkimussynteesille, joka on rakennettu uusimmista arXiv‑papereista, sekä parillisia vertailuja Claude‑pohjaisen putken raportteihin.
Ilmoituksen mukaan tiimi testasi neljää tilastoperusteista suodatinta synteettisissä koulutusraporteissa: syötteen ja tuotoksen token-suhde, viitteiden merkityksellisyys, viitteiden tiheys ja viitteiden monimuotoisuus. Ai2 toteaa, että suurimmat parannukset saatiin suodattamalla pois raportit, joissa viitteiden tiheys oli alhainen, kun taas aggressiivisempi suodatus, suodatinyhdistelmät ja oppimisnopeuden säätö eivät tuoneet merkittäviä hyötyjä. Se kuvaa laajemman opituksen todisteena siitä, että tieteellinen erikoistuminen ei välttämättä riipu pelkästään lisääntyneestä tieteellisestä tekstistä esikoulutuksessa, ja että jälkikoulutuksen datan koostumus ja laatu voivat merkittävästi vaikuttaa mallin suorituskykyyn.
Ai2:n mukaan varhaiset SFT‑tarkistuspisteet paransivat sisällön kokonaislaatua, mutta ne jäivät edelleen jälkeen Claude‑voimaisesta putkesta vastaustarkkuudessa ja lähdeviitteiden laadussa, ja että DPO‑vaihe toi AstaBriefin Claude‑putken ja DR Tulu:n tasolle raporttien tuottamisessa. Mallikortti raportoi, että ScholarQA‑CS2‑testijoukossa AstaBrief-8B keskimäärin saavutti 87 seuratuissa mittareissa, verrattuna 83.7 SFT‑tarkistuspisteessä ja 77.3 perus‑Qwen3-8B:ssä, ja että AstaBrief-8B sai 90.2 ainesosien palautuksessa, 89 vastaustarkkuudessa, 90.5 lähdeviitteiden tarkkuudessa ja 78.2 lähdeviitteiden palautuksessa. Kortti raportoi myös LLM:n arvioimat voittoprosentit AstaBrief-8B:n ja Asta ScholarQA -putken välillä: 55 prosenttia kehitysjakson osuudessa ja 72 prosenttia testijakson osuudessa, ja luettelee DeepScholarBench‑pisteet: 53.50 AstaBrief-8B:lle, 60.25 Asta ScholarQA:lle ja 56.26 DR‑Tulu-8B:lle.
Erillisessä ihmistutkimuksessa, jonka Ai2 ilmoituksessa kuvaa, kolme tieteellistä tutkijaa antoivat kukin neljä‑viisi kysymystä 14‑kysymyksen sarjassa ja arvioivat kolmen järjestelmän raportit kokonaismieltymyksen, täydellisyyden, merkityksellisyyden, organisoinnin ja lähdeviitteiden tarkkuuden perusteella, sallien tasapelit. Ai2 raportoi, että DR Tulu voitti kokonaismieltymyksessä, kun taas kaksi kolmesta tutkijasta suosivat AstaBriefiä muihin järjestelmiin verrattuna lähdeviitteiden tarkkuudessa.
Ai2 varoittaa, että suurin osa koulutuksesta ja arvioinnista valmistui vuonna 2025, että koulutusdatassa käytetyt omistusoikeudelliset mallit ja vertailupisteinä toimivat mallit heijastavat tuon ajan huippua, eikä se ole suorittanut täyttä arviointia uudelleen nykyisiä huippumalleja vastaan.
Varhainen käyttö ja ilmoitetut seuraavat askeleet
Ai2 raportoi, että 374 Asta‑käyttäjästä, jotka ovat kokeilleet Fast‑tilaa, 29.1 prosenttia käytti sitä kahdessa tai useammassa päivässä, käyttäjät tuottivat keskimäärin 3.67 raporttiketjua, 23 prosenttia ei koskaan siirtynyt takaisin Thinking‑tilaan tulevia ketjuja varten, ja toiset 18 prosenttia vaihtoivat tilojen välillä tavoitteidensa mukaan, käyttäen Fast‑tilaa noin 40 prosenttia ketjuistaan. Positiivista palautetta saatiin 84.2 prosenttia Fast‑tilassa verrattuna 85.2 prosenttia Thinking‑tilassa, minkä Ai2 kuvaa samankaltaiseksi tasoksi, vaikka huomauttaa, että palaute on yleisesti liian niukkaa vahvojen johtopäätösten tueksi.
Ai2 kertoo tutkivansa tarkempaa mieltymysoppimista, vahvempia RAG‑plus‑RL‑lähestymistapoja, monen vuoron ja monen työkalun kykyjä, lisätieteellisiä tietolähteitä ja kyselyn jakamista osiin, sekä arviointeja, jotka testaavat, säilyttääkö malli lähteidensä todistuksellisen laajuuden sen sijaan, että laajentaisi alitutkimusten asettamaa raja‑aluetta. Ilmoitus sijoittaa työn Ai2:n laajempiin tieteellisten mallien hankkeisiin, mukaan lukien NSF OMAI, Yhdysvaltain kansallinen aloitus, jota Ai2 johtaa täysin avoimen tekoäly‑infrastruktuurin ja mallien rakentamiseksi tieteelliseen löytöön, ja kuvaa AstaBriefiä kokeiluna pidemmällä sarjalla, joka ulottuu ScholarQA:sta ja DR Tulu:sta tuleviin Olmo‑versioihin.












