Yapay zeka modelleri ve platformları
Ai2, Hızlı Bilimsel Rapor Oluşturma için AstaBrief 8B’yi Açık Kaynak Yapıyor

Allen Institute for AI (Ai2), 2 Ekim 2026 tarihinde AstaBrief 8B’yi açık kaynak yaptığını, araştırma sorusunu ve alınan literatür alıntılarını atıflı bir rapora dönüştüren bir model olduğunu, model ağırlıklarını ve eğitim verilerini sistem Fast mode’da Asta’da, bilimsel çalışmalar için ajan platformu olarak canlıya alındığında yayınladığını söyledi.
Asta’nın Rapor Oluşturmadaki Fast Mode
AstaBrief, Asta’nın “Generate a report” özelliğinde Fast mode olarak mevcut ve mevcut Claude destekli Thinking mode ile birlikte çalışıyor, Ai2’nin duyurusuna göre. Ai2, amacının özellikle bilimsel rapor oluşturma için eğitilmiş küçük bir açık modelin, kullandıkları tescilli modellerin rapor kalitesiyle eşleşip eşleşemeyeceğini test etmek ve aynı zamanda oluşturma süresi ve hizmet maliyetlerini azaltmak olduğunu söylüyor. Ai2, tam Asta işlem hattı boyunca Fast mode’un rapor başına ortalama 51.1 saniye, Thinking mode için ise 178.5 saniye olduğunu rapor ediyor; bu farkı yaklaşık 3.5 kat daha hızlı ve tescilli modellerine kıyasla neredeyse bir mertebe azalma olarak tanımlıyor.
AstaBrief 8B model kartı, modelin Apache 2.0 altında lisanslandığını, Qwen3-8B temelli olduğunu ve Ai2’nin Sorumlu Kullanım Kılavuzları kapsamında araştırma ve eğitim amaçlı kullanılmasını öngördüğünü belirtiyor. Ağırlıkların açık olması nedeniyle, Ai2 kurumların modeli kendi donanımlarında, kendi güvenlik duvarları arkasında çalıştırabileceğini, bunun hassas veya yayınlanmamış çalışmalarla ilgili araştırma soruları için gerekli olduğunu belirtiyor. Ağırlıkların yanı sıra, Ai2 ai2-scholarqa-lib GitHub deposunda araştırmacıların kendi PDF’lerinden rapor üretmek için uyarlayabilecekleri bir örnek iş akışı yayınladı.
Eğitim Verileri ve Filtreleme
Ai2, Qwen3-8B’den başlayarak AstaBrief’i denetimli ince ayar ve ardından doğrudan tercih optimizasyonu (DPO) ile geliştirdi. Duyuru, ekibin pekiştirmeli öğrenmeye dayalı eğitimi düşündüğünü, önceki DR Tulu çalışmasının açık ağırlıklı modellerde uzun biçimli rapor oluşturmayı iyileştirebileceğini göstermesine rağmen, RL eğitiminin istikrarsız ve maliyetli olabileceği ve ekibin daha ucuz ve hata ayıklaması ile yineleme yapması daha kolay bir yapı istediği için daha basit yöntemi seçtiğini belirtiyor.
Hız için, AstaBrief, kullanıcı sorgusu ve alınan alıntılardan tam raporu tek seferde yazacak şekilde eğitildi; Claude tabanlı Thinking mode’un kullandığı alıntı özetleme ve kümelendirme aşamalarını atlayarak bölüm bölüm yazmayı da geçiyor. Ai2, bunun performanstan ödün vermeden mümkün olduğunu belirtiyor.
Eğitim işlem hattı, Asta’nın rapor oluşturmasını destekleyen Ai2’nin ScholarQA çerçevesinin arkasındaki sistem üzerinden gönderilen gerçek kullanıcı sorgularıyla başladı. Ekip, günlükleri kalite, alaka ve gizlilik açısından filtreleyerek beta-testçi ve bot trafiğini kaldırdı, anlamlı olmaktan kısa sorguları eledi ve LLM tabanlı bir geçişle İngilizce olmayan sorguları, bilim dışı istekleri ve kişisel bilgi içeren istemleri yakaladı. Böylece 90 K araştırma odaklı sorgu kaldı.
Denetimli aşama için, tam rapor hedefleri, Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini ve GPT-4.1 gibi tescilli sistemlerin bir karışımıyla desteklenen çok adımlı ScholarQA işlem hattı ile üretildi. Kalite filtresi 47 K kullanılabilir örnek bıraktı. DPO için, çiftler SFT veri üretimi sırasında kullanılmayan ayrı bir sorgu alt kümesinden geldi: genellikle Claude 3.5 veya 3.7 Sonnet tarafından desteklenen ScholarQA işlem hattından bir rapor, o3, o4-mini, DeepSeek-V3 veya DeepSeek-R1 tarafından üretilen bir raporla karşılaştırıldı. İki yargı modeli, GPT-4.1 ve DeepSeek-R1, her çift için bir kazanan seçti. Ai2, yargıların insan tercihleriyle %95 oranında aynı fikirde olduğunu ve yalnızca her iki yargının da aynı fikirde olduğu çiftlerin tutulup yaklaşık 6 K son örnek üretildiğini belirtiyor. Model kartına göre, yayınlanan model AstaBrief-8B-SFT kontrol noktasından başlatıldı ve AstaBriefDPOMix veri kümesi üzerinde ince ayar yapıldı; DPO eğitimi Ai2’nin open-instruct çerçevesinde 8xH100 GPU’larda gerçekleştirildi.
Değerlendirme Sonuçları
Ai2’nin ana geliştirme hedefi, duyurunun 200 kullanıcı tarafından yazılmış bilgisayar bilimi araştırma sorusundan oluşan bir set olarak tanımladığı SQABench-CS2 idi. Ekip, dört metriği izledi: rubrik puanı, bir raporun ne kadar gerekli içeriği kapsadığını ölçen; cevap doğruluğu, her paragrafın soruyla ne kadar ilgili olduğunu ölçen; atıf doğruluğu, her atıfın ona ekli iddiayı destekleyip desteklemediğini ölçen; ve atıf geri çağırma, bir raporun iddialarının sağlanan atıflarla tamamen desteklenip desteklenmediğini ölçen. İkincil değerlendirmeler, son arXiv makalelerinden oluşturulan uzun biçimli araştırma sentezi için 63 sorgulu bir ölçüt olan DeepScholarBench’i ve Claude destekli işlem hattından gelen raporlarla çift karşılaştırmaları kullandı.
Duyuru, ekibin sentetik eğitim raporları üzerinde dört istatistik temelli filtreyi test ettiğini rapor ediyor: çıktı‑girdi token oranı, atıf alaka düzeyi, atıf yoğunluğu ve atıf çeşitliliği. Ai2, en büyük kazanımların düşük atıf yoğunluğuna sahip raporların filtrelenmesinden geldiğini, daha agresif filtreleme, filtre kombinasyonları ve öğrenme oranı taramalarının ise anlamlı bir kazanç sağlamadığını belirtiyor. Daha geniş dersi, bilimsel uzmanlaşmanın mutlaka ön eğitimde daha fazla bilimsel metin eklemekle ilgili olmadığını ve eğitim sonrası veri bileşimi ve kalitesinin ortaya çıkan modelin performansını maddi olarak değiştirebileceğine dair bir kanıt olarak tanımlıyor.
Ai2, erken SFT kontrol noktalarının genel içerik kalitesini artırdığını ancak yanıt kesinliği ve atıf kalitesi açısından Claude destekli hattın gerisinde kaldığını ve DPO aşamasının AstaBrief’i Claude hattı ve DR Tulu ile rapor üretiminde aynı seviyeye getirdiğini belirtiyor. Model kartı, ScholarQA‑CS2 test setinde AstaBrief‑8B’nin izlenen metriklerde ortalama 87 puan aldığını, SFT kontrol noktasının 83,7 ve temel Qwen3‑8B’nin 77,3 puan aldığını rapor ediyor; AstaBrief‑8B, içerik hatırlama puanında 90,2, yanıt kesinliğinde 89, atıf kesinliğinde 90,5 ve atıf hatırlamasında 78,2 puan elde etti. Kart ayrıca, AstaBrief‑8B’nin Asta ScholarQA hattına karşı geliştirme bölümü splitinde %55 ve test splitinde %72 LLM‑tarafından belirlenen kazanma oranlarını ve DeepScholarBench puanlarını sırasıyla AstaBrief‑8B için 53,50, Asta ScholarQA için 60,25 ve DR‑Tulu‑8B için 56,26 olarak listeliyor.
Duyuruda açıklanan ayrı bir insan çalışmasında, üç bilimsel araştırmacı 14 soruluk bir set içinde dört‑beş soru katkısında bulunmuş ve raporları genel tercih, tamlık, alaka, organizasyon ve atıf doğruluğu açısından sıralamış; eşitliklere izin verilmiştir. Ai2, DR Tulu’nun genel tercih açısından birinci olduğunu, üç araştırmacıdan ikisinin ise atıf doğruluğu açısından diğer sistemlere göre AstaBrief’i tercih ettiğini rapor ediyor.
Ai2, eğitimin ve değerlendirmenin büyük kısmının 2025 yılında tamamlandığını, eğitim verilerini üreten ve karşılaştırma noktası olarak kullanılan tescilli modellerin o zamanki sınırları yansıttığını ve mevcut sınır modellerine karşı tam bir değerlendirme yeniden çalıştırmadığını vurguluyor.
Erken Kullanım ve Belirtilen Sonraki Adımlar
Ai2, Fast modunu deneyen 374 Asta kullanıcısından %29,1’inin iki ya da daha fazla gün kullandığını, kullanıcıların ortalama 3,67 rapor dizisi oluşturduğunu, %23’ünün gelecekteki diziler için Thinking moduna geri dönmediğini ve bir diğer %18’inin hedeflerine bağlı olarak modlar arasında geçiş yaptığını; Fast modunu dizilerinin yaklaşık %40’ında kullandığını rapor ediyor. Fast mod için olumlu geri bildirim %84,2 iken Thinking mod için %85,2 idi; Ai2 bu oranları benzer olarak nitelendiriyor ancak geri bildirimin genellikle güçlü sonuçlar çıkarmak için çok seyrek olduğunu belirtiyor.
Ai2, daha ince ayrıntılı tercih öğrenimi, daha güçlü RAG‑plus‑RL yaklaşımları, çok‑tur ve çok‑araç yetenekleri, ek bilimsel veri kaynakları ve sorgu ayrıştırma üzerinde çalıştığını ve ayrıca bir modelin kaynaklarının kanıtlama kapsamını koruyup korumadığını, altındaki çalışmaların ortaya koyduklarını genişletip genişletmediğini test eden değerlendirmeler geliştirdiğini söylüyor. Duyuru, bu çalışmayı Ai2’nin daha geniş bilimsel‑model çabaları içinde konumlandırıyor; bunlar arasında NSF OMAI, Ai2 tarafından yürütülen ve bilimsel keşif için tamamen açık AI altyapısı ve modelleri inşa etmeyi amaçlayan ABD ulusal girişimi yer alıyor ve AstaBrief’i ScholarQA ve DR Tulu’dan Olmo’nun gelecekteki sürümlerine uzanan uzun bir çalışma dizisindeki bir deney olarak tanımlıyor.












