AIモデルとプラットフォーム
アレンAIのTülu 3がDeepSeekの意外なライバルになった

ニュースは続く。 DeepSeekのモデル はベンチマークに挑戦し、新しい基準を設定し、大きな話題を振り撒いている。しかし、AI研究の場で面白いことが起こったので、注目しておきたい。
Allen AI は静かに新しい Tülu 3 ファミリーのモデルをリリースし、405BパラメーターのバージョンはDeepSeekと競合しているのではなく、重要なベンチマークで勝ち越している。
状況を整理してみましょう。
405B Tülu 3モデルは、DeepSeek V3 を含むトップパフォーマーと幅広いタスクで対決している。数学の問題、コーディングの課題、正確な指示の実行など、多くの分野で同等かそれ以上のパフォーマンスを発揮している。また、完全にオープンなアプローチで実現している。
完全なトレーニングパイプライン、コード、そして革新的な強化学習方法であるVerifiable Rewardsを使用したReinforcement Learning (RLVR) を公開している。
最近の開発は、トップレベルのAI開発の方法を変えている。完全にオープンソースのモデルが、閉じたモデルと同等のパフォーマンスを発揮できるようになれば、以前は企業の壁の中に閉じ込められていた可能性が開かれる。
技術的な戦い
Tülu 3が注目される理由は何だったのか?それは従来のアプローチを超えたユニークな4段階のトレーニングプロセスに帰着する。
Allen AIがこのモデルをどのように構築したかを見てみましょう。
ステージ1: 戦略的なデータ選択
チームは、モデル品質はデータ品質から始まると理解していた。既存のデータセット seperti WildChat と Open Assistant を組み合わせ、カスタム生成コンテンツを作成した。しかし、ここが重要な洞察である:単にデータを集めるのではなく、数学的推論やコーディング能力のような特定のスキル向けにターゲットを絞ったデータセットを作成した。
ステージ2: ベターなレスポンスの構築
2段階目で、Allen AIはモデルに特定のスキルを教えることに焦点を当てた。数学、コーディング、一般的なタスク用の異なるトレーニングデータセットを作成し、これらの組み合わせを繰り返しテストすることで、モデルがどこで優れており、どこで改善が必要かを明確に把握することができた。この反復プロセスにより、Tülu 3が各分野で達成できる本当の潜在能力が明らかになった。
ステージ3: 比較から学ぶ
ここでAllen AIは創造的なアプローチを取った。Tülu 3のレスポンスを他のトップモデルと即座に比較できるシステムを構築した。また、モデルが長いレスポンスをただ長くするだけでなく、質と目的を持ったレスポンスを生成するように学習させるためのアプローチ、長さ正規化されたDirect Preference Optimization (DPO) を使用した。
結果は、レスポンスが質と目的を持ったものになった。
AIモデルが好み(どちらのレスポンスがより良いのか)から学ぶとき、長いレスポンスが常に優れていると考えられる偏りを発展させる傾向がある。質よりも量を優先するレスポンスを生成するのではなく、モデルが質を優先するように学習させることが重要である。
長さ正規化されたDPOは、モデルが好みから学ぶ方法を調整することでこの問題を解決する。単にどちらのレスポンスが優れているかではなく、各レスポンスの長さも考慮に入れる。レスポンスの質を単語あたりの質で判断するのではなく、全体的な影響力で判断するのである。
これが重要な理由は、Tülu 3が正確で効率的なレスポンスを生成する能力を学習できるからである。レスポンスを長くするために余分な単語を追加するのではなく、必要な長さで価値を提供するように学習するのである。
これは小さな詳細のように思えるかもしれないが、自然なコミュニケーションを実現するために非常に重要である。最も優れた人間の専門家は、簡潔に伝えるべき時と、詳細に伝えるべき時を知っている。長さ正規化されたDPOは、モデルがこのバランスを学習できるようにする。
ステージ4: RLVRの革新
これは注目に値する技術的なブレークスルーである。RLVRは主観的な報酬モデルを具体的な検証可能な報酬に置き換える。
ほとんどのAIモデルは、複雑な報酬モデルのシステムを通じて学習する。基本的に、良いレスポンスとは何かについての教育を受けた推測である。しかし、Allen AIはRLVRで異なるアプローチを取った。
現在のAIモデルのトレーニング方法について考えてみましょう。通常、他のAIモデル(報酬モデルと呼ばれる)がレスポンスが良いか悪いかを判断する必要がある。主観的で複雑で、しばしば一貫性がない。あるレスポンスは良さそうに見えるかもしれないが、微妙なエラーを含んでいる可能性がある。
RLVRはこのアプローチを逆転させる。主観的な判断に頼るのではなく、具体的な検証可能な結果を使用する。モデルが数学の問題を試みると、正解か不正解か、明確な二元的なフィードバックが得られる。コードを書くとき、コードが正しく動作するかどうか、明確な二元的なフィードバックが得られる。
ここで興味深いことが起こる。
- モデルは即時的な二元的なフィードバックを受ける:正解の場合10点、不正解の場合0点
- 部分的な評価や曖昧な評価の余地はない
- 学習が集中して正確になる
- モデルは、妥当ではあるが不正確なレスポンスよりも、正確性を優先することを学習する

RLVRトレーニング(Allen AI)
結果は、Tülu 3が正解が重要なタスクで大幅な改善を見せた。数学的推論(GSM8Kベンチマーク)やコーディング課題でのパフォーマンスが著しく向上し、指示の実行もより正確になった。モデルは、具体的な正確さを優先することを学習したからである。
これが特に興味深いのは、オープンソースAIのゲームチェンジャーとなる可能性がある。従来のアプローチでは、技術的なタスクで閉じたモデルの精度に匹敵することが難しかった。RLVRは、適切なトレーニングアプローチがあれば、オープンソースモデルも同等の信頼性を達成できることを示している。
数字を見てみよう
405BパラメーターのTülu 3は、分野のトップモデルと直接競合している。どこで優れているか、そしてこれがオープンソースAIにとって何を意味するかを見てみよう。
数学
Tülu 3は複雑な数学的推論に優れている。GSM8KやMATHなどのベンチマークでは、DeepSeekのパフォーマンスに匹敵する。モデルは多段階の問題を処理し、強力な数学的推論能力を示す。
コード
コーディングの結果も同様に印象的である。RLVRトレーニングのおかげで、Tülu 3は問題を効果的に解決するコードを書く。コーディング指示を理解し、機能的なソリューションを生成する能力が強みである。
正確な指示の実行
モデルの指示の実行能力は、特に際立った強みである。多くのモデルが近似または一般化する指示を実行するのに対し、Tülu 3は、正確に何が求められているかを理解し、実行する能力を示す。
AI開発のブラックボックスを開く
Allen AIは、強力なモデルと開発プロセスを全て公開した。
トレーニングプロセスのすべての側面が文書化され、利用可能である。4段階のアプローチ、データ準備方法、RLVRの実装など、プロセス全体が研究と複製のためにオープンにされている。透明性は、高性能AI開発の新しい基準を設定する。
開発者は包括的なリソースを受け取る。
- 完全なトレーニングパイプライン
- データ処理ツール
- 評価フレームワーク
- 実装仕様
これにより、チームは次のことができる。
- トレーニングプロセスを変更する
- 特定のニーズに合わせて方法を適応させる
- 既証されたアプローチを基盤として構築する
- 特殊な実装を作成する
このオープンアプローチは、分野全体のイノベーションを加速する。研究者は検証された方法を基盤として構築でき、開発者は改善に集中できる。
オープンソースの優位性の台頭
Tülu 3の成功は、オープンソースAI開発の重要な瞬間である。当オープンソースモデルがプライベートの代替モデルと同等かそれ以上のパフォーマンスを示すとき、業界全体に大きな変化をもたらす。世界中の研究チームが検証された方法にアクセスでき、革新を生み出し、さらに技術の進歩を促進する。プライベートAIラボは、透明性を高めるか、技術の境界をさらに押し広げる必要がある。
先を見て、Tülu 3の検証可能な報酬とマルチステージトレーニングのブレークスルーは、未来へのヒントを与える。チームはこれらの基盤を基にして、パフォーマンスをさらに高める可能性がある。コードは存在し、方法は文書化されており、新しいAI開発の波が始まっている。開発者や研究者にとって、改善の機会は新しい章の始まりを标する。
Tülu 3についてのよくある質問(FAQ)
Tülu 3とは何か?その主な特徴は何か?
Tülu 3は、Allen AIによって開発されたオープンソースLLMファミリーである。Llama 3.1アーキテクチャを基盤としており、8B、70B、405Bパラメーターのバージョンがある。Tülu 3は、知識、推論、数学、コーディング、指示の実行、安全性などの多様なタスクで優れたパフォーマンスを発揮するように設計されている。
Tülu 3のトレーニングプロセスは何か?どのようなデータが使用されるか?
Tülu 3のトレーニングにはいくつかの重要なステージがある。まず、チームは既存のデータセットとシンセティックデータを組み合わせ、特定のスキル向けにターゲットを絞ったデータセットを作成する。次に、指示の実行、数学、コーディングデータの混合で監督フィーネチューニング(SFT)を実行する。次に、人間とLLMのフィードバックから生成された好みデータで直接の好み最適化(DPO)を使用する。最後に、検証可能な正解のタスクで強化学習with Verifiable Rewards(RLVR)を使用する。Tülu 3では、各ステージでカーブしたデータセットを使用する。
Tülu 3は安全性をどのようにアプローチし、どのようなメトリクスを使用して評価するか?
安全性は、Tülu 3の開発の重要な側面である。SFT中に安全性に特化したデータセットを使用し、これは他のタスク向けデータと大きく異なることがわかった。
RLVRとは何か?
RLVRは、モデルを検証可能な報酬、たとえば正解の正確さに最適化する技術である。これは、伝統的なRLHFが報酬モデルを使用するのとは異なる。検証可能な報酬を使用することで、モデルは主観的な判断ではなく、具体的な結果に基づいて学習することができる。













