Model dan platform AI
Ai2 Membuka Sumber AstaBrief 8B untuk Pembuatan Laporan Ilmiah Cepat

Allen Institute for AI (Ai2) mengatakan pada 2 Oktober 2026 bahwa mereka membuka sumber AstaBrief 8B, sebuah model yang mengubah pertanyaan riset dan kutipan literatur yang diambil menjadi laporan yang disitasi, merilis bobot model dan data pelatihan seiring sistem diluncurkan sebagai Fast mode di Asta, platform agenik mereka untuk pekerjaan ilmiah.
Fast Mode dalam Pembuatan Laporan Asta
AstaBrief tersedia dalam fitur Generate a report milik Asta sebagai Fast mode, berjalan berdampingan dengan Thinking mode yang didukung Claude, menurut pengumuman Ai2. Ai2 mengatakan tujuannya adalah menguji apakah model kecil yang terbuka dan dilatih khusus untuk pembuatan laporan ilmiah dapat menyamai kualitas laporan model proprietari yang mereka gunakan sekaligus mengurangi waktu pembuatan dan biaya layanan. Ai2 melaporkan bahwa di seluruh pipeline Asta, Fast mode rata‑rata memerlukan 51.1 detik per laporan dibandingkan 178.5 detik untuk Thinking mode, selisih yang mereka gambarkan sebagai sekitar 3.5 kali lebih cepat dan hampir satu orde besarnya pengurangan waktu pembuatan dibandingkan model proprietari yang dipantau.
kartu model AstaBrief 8B menyatakan bahwa model ini dilisensikan di bawah Apache 2.0, berbasis Qwen3-8B, dan ditujukan untuk penggunaan riset dan pendidikan sesuai Pedoman Penggunaan Bertanggung Jawab Ai2. Karena bobotnya terbuka, Ai2 mengatakan institusi dapat menjalankan model ini pada perangkat keras mereka sendiri, termasuk di belakang firewall mereka, yang mereka gambarkan sebagai diperlukan ketika pertanyaan riset menyentuh pekerjaan sensitif atau yang belum dipublikasikan. Selain bobot, Ai2 merilis contoh alur kerja di repositori ai2-scholarqa-lib GitHub yang dapat disesuaikan peneliti untuk menghasilkan laporan dari PDF mereka sendiri.
Data Pelatihan dan Penyaringan
Ai2 memulai dari Qwen3-8B dan membangun AstaBrief dengan fine‑tuning terawasi diikuti oleh optimisasi preferensi langsung (DPO). Pengumuman tersebut menyatakan tim mempertimbangkan pelatihan berbasis reinforcement learning, yang pekerjaan DR Tulu sebelumnya telah menunjukkan dapat meningkatkan pembuatan laporan bentuk panjang untuk model berbobot terbuka, namun mereka memilih resep yang lebih sederhana karena pelatihan RL dapat tidak stabil dan mahal serta tim menginginkan konfigurasi yang lebih murah dan lebih mudah untuk debug serta iterasi.
Untuk kecepatan, AstaBrief dilatih menulis laporan lengkap dalam satu langkah dari pertanyaan pengguna dan potongan yang diambil, melewati tahap rangkuman potongan dan pengelompokan yang digunakan oleh Thinking mode berbasis Claude serta mengabaikan penulisan per bagian. Ai2 mengatakan mereka menemukan hal ini memungkinkan tanpa mengorbankan kinerja.
Pipeline pelatihan dimulai dengan kueri pengguna nyata yang dikirim melalui sistem di belakang kerangka kerja ScholarQA milik Ai2, yang menjadi dasar pembuatan laporan Asta. Tim menyaring log untuk kualitas, relevansi, dan privasi, menghapus lalu lintas beta‑tester dan bot, menyingkirkan kueri yang terlalu pendek untuk bermakna, serta menggunakan proses berbasis LLM untuk menangkap kueri non‑Inggris, permintaan non‑ilmiah, dan prompt yang berisi informasi pribadi. Hal ini menghasilkan kumpulan 90 ribu kueri yang berfokus pada riset.
Untuk tahap terawasi, target laporan lengkap dihasilkan dengan pipeline ScholarQA bertahap yang didukung oleh campuran sistem proprietari: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini, dan GPT-4.1. Penyaringan kualitas menyisakan 47 ribu contoh yang dapat digunakan. Untuk DPO, pasangan diambil dari subset kueri terpisah yang tidak digunakan selama pembuatan data SFT: satu laporan dari pipeline ScholarQA, biasanya didukung oleh Claude 3.5 atau 3.7 Sonnet, melawan laporan yang dihasilkan oleh o3, o4-mini, DeepSeek-V3, atau DeepSeek-R1. Dua model penilai, GPT-4.1 dan DeepSeek-R1, memilih pemenang untuk setiap pasangan. Ai2 mengatakan penilai setuju dengan preferensi manusia 95 persen waktu, dan hanya pasangan yang disetujui kedua penilai yang dipertahankan, menghasilkan sekitar 6 ribu contoh akhir. Menurut kartu model, model yang dirilis diinisialisasi dari checkpoint AstaBrief-8B-SFT dan di‑fine‑tune pada dataset AstaBriefDPOMix, dengan pelatihan DPO dilakukan dalam kerangka kerja open‑instruct Ai2 pada 8×H100 GPU.
Hasil Evaluasi
Target pengembangan utama Ai2 adalah SQABench-CS2, yang dalam pengumuman digambarkan sebagai kumpulan 200 pertanyaan riset ilmu komputer yang ditulis pengguna. Tim melacak empat metrik: skor rubrik, yang mengukur seberapa banyak konten yang diperlukan tercakup dalam laporan; presisi jawaban, yang mengukur apakah setiap paragraf relevan dengan pertanyaan; presisi sitasi, yang mengukur apakah setiap sitasi mendukung klaim yang terkait; dan recall sitasi, yang mengukur apakah klaim laporan sepenuhnya didukung oleh sitasi yang diberikan. Evaluasi sekunder menggunakan DeepScholarBench, benchmark 63 kueri untuk sintesis riset bentuk panjang yang dibangun dari makalah arXiv terbaru, serta perbandingan berpasangan melawan laporan dari pipeline berbasis Claude.
Pengumuman tersebut melaporkan bahwa tim menguji empat filter berbasis statistik pada laporan pelatihan sintetis: rasio token output‑to‑input, relevansi sitasi, kepadatan sitasi, dan keragaman sitasi. Ai2 mengatakan peningkatan terbesar berasal dari penyaringan laporan dengan kepadatan sitasi rendah, sementara penyaringan yang lebih agresif, kombinasi filter, dan penyesuaian learning‑rate tidak menambah peningkatan berarti. Mereka menggambarkan pelajaran yang lebih luas sebagai bukti bahwa spesialisasi ilmiah tidak selalu berarti menambah lebih banyak teks ilmiah pada pra‑pelatihan, dan bahwa komposisi serta kualitas data pasca‑pelatihan dapat secara material mengubah kinerja model yang dihasilkan.
Ai2 mengatakan bahwa checkpoint SFT awal meningkatkan kualitas konten secara keseluruhan namun masih tertinggal dari pipeline berbasis Claude dalam hal presisi jawaban dan kualitas sitasi, serta bahwa tahap DPO membawa AstaBrief ke kisaran pipeline Claude dan DR Tulu dalam pembuatan laporan. Kartu model melaporkan bahwa pada set tes ScholarQA‑CS2, AstaBrief‑8B meraih rata‑rata 87 pada metrik yang dilacak, dibandingkan dengan 83,7 untuk checkpoint SFT dan 77,3 untuk Qwen3‑8B dasar, dengan AstaBrief‑8B mencetak 90,2 pada recall bahan, 89 pada presisi jawaban, 90,5 pada presisi sitasi, dan 78,2 pada recall sitasi. Kartu tersebut juga melaporkan tingkat kemenangan yang dinilai LLM untuk AstaBrief‑8B melawan pipeline Asta ScholarQA sebesar 55 % pada split pengembangan dan 72 % pada split tes, serta mencantumkan skor DeepScholarBench sebesar 53,50 untuk AstaBrief‑8B, 60,25 untuk Asta ScholarQA, dan 56,26 untuk DR‑Tulu‑8B.
Dalam studi manusia terpisah yang dijelaskan dalam pengumuman, tiga peneliti ilmiah masing‑masing menyumbangkan empat hingga lima pertanyaan dari kumpulan 14 pertanyaan dan memberi peringkat laporan dari ketiga sistem berdasarkan preferensi keseluruhan, kelengkapan, relevansi, organisasi, dan akurasi sitasi, dengan mengizinkan ikatan. Ai2 melaporkan bahwa DR Tulu menang dalam hal preferensi keseluruhan, sementara dua dari tiga peneliti lebih memilih AstaBrief dibandingkan sistem lain dalam akurasi sitasi.
Ai2 memperingatkan bahwa sebagian besar pelatihan dan evaluasi selesai pada tahun 2025, bahwa model proprietari yang digunakan untuk menghasilkan data pelatihan dan menjadi titik perbandingan mencerminkan frontier pada saat itu, dan bahwa mereka belum menjalankan kembali evaluasi penuh terhadap model frontier terkini.
Penggunaan Awal dan Langkah Selanjutnya yang Dinyatakan
Ai2 melaporkan bahwa di antara 374 pengguna Asta yang telah mencoba mode Fast, 29,1 % menggunakannya selama dua hari atau lebih, pengguna menghasilkan rata‑rata 3,67 rangkaian laporan, 23 % tidak pernah beralih kembali ke mode Thinking untuk rangkaian selanjutnya, dan 18 % lainnya bergantian antara mode tergantung pada tujuan mereka, menggunakan mode Fast untuk kira‑kira 40 % rangkaian mereka. Umpan balik positif tercatat sebesar 84,2 % untuk mode Fast versus 85,2 % untuk mode Thinking, yang Ai2 gambarkan sebagai tingkat yang serupa sambil mencatat bahwa umpan balik umumnya terlalu jarang untuk mendukung kesimpulan yang kuat.
Ai2 mengatakan bahwa mereka sedang mengeksplorasi pembelajaran preferensi yang lebih halus, pendekatan RAG‑plus‑RL yang lebih kuat, kemampuan multi‑turn dan multi‑tool, sumber data ilmiah tambahan, serta dekomposisi kueri, bersama dengan evaluasi yang menguji apakah model mempertahankan ruang lingkup bukti dari sumbernya alih‑alih memperluas apa yang telah ditetapkan oleh studi mendasar. Pengumuman tersebut menempatkan pekerjaan ini dalam upaya model‑ilmiah yang lebih luas dari Ai2, termasuk NSF OMAI, sebuah inisiatif nasional AS yang dipimpin oleh Ai2 untuk membangun infrastruktur AI terbuka sepenuhnya dan model untuk penemuan ilmiah, dan menggambarkan AstaBrief sebagai satu eksperimen dalam rangkaian kerja yang lebih panjang mulai dari ScholarQA dan DR Tulu hingga versi Olmo di masa depan.












