AIモデルとプラットフォーム

Ai2、AstaBrief 8Bを高速科学レポート生成向けにオープンソース化

mm
Unite.AI を Google の優先ソースに追加

Allen Institute for AI(Ai2)は2026年10月2日、研究質問と取得した文献抜粋を引用付きレポートに変換するモデルであるAstaBrief 8Bをオープンソース化すると発表した。同時に、モデルの重みと学習データを公開し、同システムはAstaのFastモードとして稼働開始する。Astaは科学的作業のためのエージェントプラットフォームである。

Astaのレポート生成におけるFastモード

AstaBriefはAstaの「レポート生成」機能でFastモードとして利用可能で、既存のClaude搭載Thinkingモードと並行して動作すると、Ai2の発表で述べられている。Ai2は、科学レポート生成に特化して訓練された小規模なオープンモデルが、これまで使用していたプロプライエタリモデルのレポート品質に匹敵しつつ、生成時間とサービスコストを削減できるかをテストすることを目的としたと述べている。Ai2によると、Asta全体のパイプラインでFastモードのレポート平均生成時間は51.1秒で、Thinkingモードの178.5秒と比較して約3.5倍速く、プロプライエタリモデルに比べてほぼ1桁の時間短縮になると説明している。

The AstaBrief 8Bモデルカードは、モデルがApache 2.0でライセンスされ、Qwen3-8Bをベースとし、Ai2のResponsible Use Guidelinesに基づく研究・教育利用を目的としていると記載している。重みがオープンであるため、Ai2は機関が自前のハードウェア、さらには自社のファイアウォールの背後でモデルを実行できると述べており、これは研究質問が機密または未公開の作業に関わる場合に必要と説明している。重みと共に、Ai2はai2-scholarqa-lib GitHubリポジトリで例示的なワークフローを公開しており、研究者はこれを自分のPDFからレポートを生成するように適応できる。

トレーニングデータとフィルタリング

Ai2はQwen3-8Bを出発点とし、教師ありファインチューニングの後に直接嗜好最適化 (DPO)を行ってAstaBriefを構築した。発表によれば、チームは強化学習ベースの訓練も検討したが、以前のDR Tuluの研究でオープンウェイトモデルの長文レポート生成が改善されることが示されているものの、RL訓練は不安定でコストが高く、より安価でデバッグや反復が容易な手法を求めたため、シンプルな手順を選択したという。

高速化のため、AstaBriefはユーザーの質問と取得したスニペットから一度のパスで全文レポートを書き出すように訓練され、ClaudeベースのThinkingモードが使用するスニペット要約やクラスタリング段階、さらにはセクションごとの執筆を省略した。Ai2は、性能を犠牲にせずにこれが可能であることを確認したと述べている。

トレーニングパイプラインは、Astaのレポート生成の基盤となるAi2のScholarQAフレームワークの背後で提出された実際のユーザークエリから始まった。チームはログを品質、関連性、プライバシーの観点でフィルタリングし、ベータテスターやボットからのトラフィックを除去し、意味のない短すぎるクエリを削除し、LLMベースの処理で英語以外のクエリ、科学的でない要求、個人情報を含むプロンプトを検出した。その結果、90K件の研究志向クエリが残った。

教師あり段階では、マルチステップのScholarQAパイプラインを用いて、Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini、GPT-4.1といったプロプライエタリシステムの組み合わせでフルレポートのターゲットを生成した。品質フィルタリングの結果、47Kの使用可能な例が残った。DPOでは、SFTデータ生成時に使用されなかった別のクエリサブセットからペアを作成し、ScholarQAパイプラインからのレポート(主にClaude 3.5または3.7 Sonnetが支援)と、o3、o4-mini、DeepSeek-V3、DeepSeek-R1のいずれかで生成されたレポートを比較した。審査モデルとしてGPT-4.1とDeepSeek-R1が各ペアで勝者を選出した。Ai2によれば、審査員は95%の確率で人間の好みと一致し、両審査員が合意したペアのみが残され、最終的に約6Kの例が得られた。モデルカードによると、公開されたモデルはAstaBrief-8B-SFTチェックポイントから初期化され、AstaBriefDPOMixデータセットでファインチューニングされ、DPO訓練はAi2のopen-instructフレームワーク上で8×H100 GPUで実施された。

評価結果

Ai2の主な開発目標はSQABench-CS2で、発表では200件のユーザー作成コンピュータサイエンス研究質問の集合と説明されている。チームは4つの指標を追跡した:ルブリックスコア(レポートが必要な内容をどれだけカバーしているかを測定)、回答精度(各段落が質問に対して関連しているかを測定)、引用精度(各引用がそれに付随する主張を支持しているかを測定)、引用再現率(レポートの主張が提供された引用によって完全に裏付けられているかを測定)。二次評価には、最近のarXiv論文から構築された長文研究統合用63問ベンチマークのDeepScholarBenchと、Claude搭載パイプラインからのレポートとのペア比較が使用された。

発表によれば、チームは合成トレーニングレポートに対して4つの統計ベースのフィルタ(出力‑入力トークン比、引用の関連性、引用密度、引用多様性)をテストした。Ai2は、最も大きな改善は引用密度が低いレポートを除外することで得られ、より積極的なフィルタやフィルタの組み合わせ、学習率のスイープは有意な効果をもたらさなかったと述べている。これにより、科学的専門性は必ずしも事前学習により多くの科学テキストを追加することだけで達成されるわけではなく、事後学習データの構成と質がモデルの性能に実質的な影響を与えるという教訓が得られたと説明している。

Ai2 は、初期の SFT チェックポイントにより全体的なコンテンツ品質が向上したものの、回答の正確性と引用の品質において Claude ベースのパイプラインに遅れを取っていたこと、そして DPO ステージにより AstaBrief が Claude パイプラインおよび DR Tulu と同等のレポート生成性能を実現したと述べています。モデルカードによると、ScholarQA‑CS2 テストセットにおいて AstaBrief‑8B は追跡された指標で平均 87 を記録し、SFT チェックポイントの 83.7、ベースの Qwen3‑8B の 77.3 と比較されています。また、AstaBrief‑8B は ingredient recall が 90.2、answer precision が 89、citation precision が 90.5、citation recall が 78.2 とスコア付けされています。カードはさらに、AstaBrief‑8B が Asta ScholarQA パイプラインに対して開発分割で 55%、テスト分割で 72%の LLM 判定勝率を示したこと、そして DeepScholarBench のスコアとして AstaBrief‑8B が 53.50、Asta ScholarQA が 60.25、DR‑Tulu‑8B が 56.26 であることを列挙しています。

発表で説明された別のヒューマンスタディでは、3 人の科学研究者がそれぞれ 14 問のセットから 4〜5 問を作成し、3 つのシステムからのレポートを全体的な好み、完全性、関連性、構成、引用精度の観点で順位付け(同点可)しました。Ai2 は、全体的な好みでは DR Tulu が勝ち、引用精度に関しては 3 人の研究者のうち 2 人が AstaBrief を他のシステムよりも好んだと報告しています。

Ai2 は、トレーニングおよび評価の大部分が 2025 年に完了しており、トレーニングデータ生成や比較対象として使用された独自モデルは当時の最先端を反映していること、そして現在の最先端モデルに対して完全な再評価は実施していないことに注意を促しています。

初期の利用状況と今後の方針

Ai2 の報告によると、Fast モードを試した 374 人の Asta ユーザーのうち 29.1%が 2 日以上利用し、ユーザーは平均 3.67 本のレポートスレッドを生成、23%は今後のスレッドで Thinking モードに戻らず、さらに 18%は目的に応じてモードを切り替え、スレッドの約 40%で Fast モードを使用していました。Fast モードの肯定的フィードバックは 84.2%、Thinking モードは 85.2%で、Ai2 はこれをほぼ同等の割合と位置付けつつ、フィードバックが全般的に不足しており強い結論を導くには不十分であると指摘しています。

Ai2 は、より細分化された嗜好学習、強化された RAG‑plus‑RL 手法、マルチターン・マルチツール機能、追加の科学データソース、クエリ分解などを検討しており、さらにモデルがソースの証拠範囲を保持し、基礎となる研究が示す範囲を拡大しないかをテストする評価も行っています。この発表は、NSF OMAI を含む Ai2 の広範な科学モデル活動の一環として位置付けられ、NSF OMAI は Ai2 が主導する米国の国家イニシアティブで、科学的発見のための完全にオープンな AI インフラとモデルの構築を目指しています。また、AstaBrief は ScholarQA や DR Tulu から将来の Olmo バージョンに至る長期的な取り組みの一つの実験として説明されています。

Jonas Reeve は Unite.AI のAI生成アナリストで、認知AI、汎用人工知能(AGI)、および機械知能の理論的基盤に焦点を当てています。彼の研究は、学習、推論、記憶、抽象化が生物学的システムと人工システムの両方でどのように現れるかを探求し、現代のAIアーキテクチャと認知科学や心の哲学における長年の問いとのつながりを描き出します。

概念的かつ省察的なアプローチで、Jonas は推論モデル、エージェントシステム、出現認知、アラインメント理論といったフレームワークを検討し、AGI への進展が実際に何を意味するのか、そして何を意味しないのかを明らかにしようとします。タイムラインや誇大宣伝に追随するのではなく、第一原理、概念的厳密さ、そして現行モデルの限界を重視しています。

Jonas Reeve が執筆した記事は AI 生成であり、Unite.AI の編集チームがレビューして正確性、明瞭さ、そして高度な AI 概念に関する責任ある議論を保証しています。