AIモデルとプラットフォーム

リフレクション 70B: 自己修正認知と先進的なパフォーマンスを実現した LLM

mm
Unite.AI を Google の優先ソースに追加
Reflection 70B, large language models, AI self-correction, Reflection-Tuning, open-source AI, HyperWrite

リフレクション 70B は、HyperWrite によって開発されたオープンソースの大規模言語モデル (LLM) です。この新しいモデルは、言語処理から高度な問題解決まで、さまざまな分野で AI システムとのやり取りと依存関係を再定義する可能性を持つ、AI の認知に対する新しいアプローチを導入しています。

リフレクション・チューニング を活用し、モデルは自身のミスをリアルタイムで自己評価および修正できるようになり、GPT-4Claude 3.5 Sonnet を超える業界トップレベルのパフォーマンスを実現しました。これは、MMLUMATHHumanEval などのベンチマークで実証されています。

リフレクション 70B は、Llama 3.1-70B アーキテクチャを基盤としていますが、その自己修正メカニズムが大きな特徴です。反復的な自己反省、エラー検出、出力精製のサイクルを通じて、モデルは人間の認知を前例のない形で模倣し、AI が達成できることの境界を拡大します。結果として、リフレクション 70B は、無比の精度だけでなく、決定プロセスに対する深い洞察も提供します。これは、透明性と精度が極めて重要なアプリケーションでは不可欠な機能です。

リフレクション 70B とは

リフレクション 70B の核となる部分は、Meta のオープンソース Llama 3.1-70B Instruct モデル に基づいています。しかし、真正にそれを際立たせるのは、その人間の反省に似たプロセスへの参加能力です。これは、リフレクション・チューニング というテクニックに由来し、モデルがリアルタイムで自身のエラーを特定および修正できるようになります。これにより、精度と信頼性が向上します。

Matt Shumer、HyperWrite の CEO は、リフレクション 70B を “世界最高のオープンソース AI モデル” と紹介しました。しかし、このモデルが特別な理由は何でしょうか? また、GPT-4 や Claude 3.5 Sonnet などの業界巨頭と比較してどうでしょうか? それを見てみましょう。

選択的リフレクション・チューニング: AI トレーニングにおけるパラダイムシフト

選択的 リフレクション・チューニング は、インストラクション・チューニング に新しいアプローチを導入します。ここでの目標は、インストラクション・データの品質 と、それをファインチューニングする 学生モデル との互換性の両方を向上させることです。従来の方法は、データ自体の改善に焦点を当てていますが、強化されたデータのペアがモデル自身の学習目標とどれほど一致するかは見落とされています。選択的リフレクション・チューニングは、このギャップを埋め、教師モデル がデータを自己反省し、改良されたインストラクション・レスポンスのペアを提供する 教師・学生のコラボレーション を促進します。一方、学生モデル はこれらの改善が自身のトレーニングニーズに最も適しているかどうかを評価します。

選択的リフレクション・チューニング方法、教師モデルと学生モデルのコラボレーションを示す

このプロセスは、2 つの重要な段階で構成されます:

  1. 選択的インストラクション・リフレクション: 教師モデルは、与えられたサンプルのインストラクションを反省し、改良されたインストラクション・レスポンスのペアを生成します。学生モデルは、インストラクション・フォロイング・ディフィカルト (IFD) というメトリックに基づいて、この新しいインストラクションが有益であるかどうかを評価します。IFD スコアは、サンプルが学生モデルにとってどれほど難しいかを評価し、適切に挑戦されるデータのみを保持します。
  2. 選択的レスポンス・リフレクション: この段階では、教師モデルは最初の段階で生成されたレスポンスを反省します。学生モデルは、これらのレスポンスを リバース・インストラクション・フォロイング・ディフィカルト (r-IFD) で評価します。これは、学生モデルがレスポンスに基づいてインストラクションを推測するのがどれほど実行可能かを測定するメトリックです。これにより、レスポンスはモデル自身の推論を改善するだけでなく、学生モデルの既存の知識とよく一致します。

IFD と r-IFD の両方を適用することで、選択的リフレクション・チューニングは、追加のデータセットを必要とせずに、モデルをより効率的にトレーニングできる、課題的でありながら実行可能なデータ・ペアを生成します。結果として、より サンプル効率が高く高性能 な LLM が実現し、多くの大規模モデルを上回るパフォーマンスを発揮します。

思考のアーキテクチャ: リフレクション 70B の “思考” プロセス

リフレクション 70B の基礎となるアーキテクチャは、思考プロセスを複数の段階に分割することで、AI の推論を新たなレベルに引き上げます。各段階では、自己反省を通じてモデルが改善され、人間の認知に似たプロセスが実現します:

  1. 初期データとレスポンス: モデルは、与えられたインストラクションに対するレスポンスを生成し始めます。この初期出力は、標準的な LLM 出力と似ています。
  2. 選択的インストラクション・リフレクション: 初期レスポンスを生成した後、モデルは インストラクション・リフレクション・フェーズ に入ります。教師モデルは元のインストラクションを反省し、改良を提案します。これらの提案は、学生モデルによって IFD スコア を使用して評価され、改良されたインストラクション・レスポンスのペアがさらに適切かどうかを判断します。
  3. 選択的レスポンス・リフレクション: インストラクションに関する反省の後、モデルはレスポンス自体を改良する段階に移ります。ここで、教師モデルは更新されたインストラクションに基づいて新しいレスポンスを生成します。学生モデルは、r-IFD スコア を使用して、インストラクションをより効率的に推測するのに役立つかどうかを評価します。
  4. 最終的なインストラクション・チューニング: 最適なインストラクション・レスポンスのペアが選択されると、それはモデルをファインチューニングするために使用される最終的なデータセットに追加されます。このマルチステージ・プロセスにより、最も効果的で一貫性のあるインストラクション・レスポンスのペアのみがファインチューニング・データに含まれることを保証します。

この 構造化された反省 プロセスにより、ユーザーはモデルが思考プロセスをどのように反復するかを観察でき、透明性と精度が大幅に向上します。

ベンチマークでの輝き: リフレクション 70B の実践

リフレクション 70B の選択的リフレクション・チューニングは、より洗練されたトレーニング・プロセスを提供するだけでなく、複数のベンチマークで業界トップレベルのパフォーマンスを達成しています。モデル自身の自己評価メカニズムを通じて、より大規模なプロプライエタリ・モデルを上回ります。

  1. MMLU (Massive Multitask Language Understanding): リフレクション 70B は 72.2% のスコアを達成し、他の大規模なオープンソース・モデルである LLaMA 2 を上回りました。
  2. Math Benchmark: 数学的推論タスクでは、モデルは GPT-4 と Claude 3.5 を大きな差で上回り、複雑な問題解決シナリオでの強みを示しました。
  3. IFEval と GSM8K: リフレクション 70B はまた、IFEval で優れた成績を収め、ここではインストラクション・レスポンスの整合性が評価されました。また、GSM8K でも数学的問題解決ベンチマークで優れました。自己反省的なチューニングにより、モデルは複雑で繊細な問題をより効果的に処理できました。

選択的リフレクション・チューニングを使用することで、リフレクション 70B は、サイズが唯一の要因ではないことを実証しました。出力の自己修正と反省能力により、より強固で一貫性のある推論 が可能になり、より大きなモデルを上回ることができました。

sRecycled WizardLM 7B と他のモデルのパフォーマンス比較チャート。sRecycled WizardLM 7B の強力なパフォーマンスを、さまざまなモデルに対する勝利、引き分け、敗北の詳細な分解で強調しています

sRecycled WizardLM 7B 対他のモデルのパフォーマンス比較

現実世界での応用: リフレクション 70B の潜在

リフレクション 70B のリアルタイムでのエラー修正と透明な意思決定プロセスは、さまざまな分野で新たな可能性を解き放ちます。以下は、いくつかの実用例です:

複雑な問題解決

リフレクション 70B の強みは、複雑な問題を解決する能力にあります。例として、挑戦的な数学の問いがあります:


<p>ユーザー: "方程式 2x^2 + 5x - 3 = 0 を解く"
リフレクション 70B:</p>

<p>&lt;思考&gt; 二次方程式の公式を適用しています...&lt;/思考&gt;
&lt;反省&gt; 計算の修正...&lt;/反省&gt;
&lt;出力&gt; 解は x = 1/2 と x = -3 です。&lt;/出力&gt;

文化的感受性を伴う言語翻訳

通常の翻訳モデルとは異なり、リフレクション 70B は言語翻訳を文化的背景に合わせて適応させます:

ユーザー: "'It's raining cats and dogs' をフランス語に翻訳してください。文化的背景を考慮してください。"
リフレクション 70B:

<p>思考: 文字通りの翻訳は "Il pleut des chats et des chiens" ですが... 思考;
反省: 文化的に適切な翻訳は "Il pleut des cordes" です。反省;
出力: 翻訳を提供します。

コードのデバッグと最適化の強化

リフレクション 70B のエラー修正能力により、コードのデバッグと最適化に最適なモデルとなります:

ユーザー: "この Python コードをデバッグしてください..."
リフレクション 70B: &lt;思考&gt; ステップごとに分析しています...&lt;/思考&gt;
&lt;反省&gt; 無限ループを検出しました。&lt;/反省&gt;
&lt;出力&gt; 正しい再帰のある修正されたコードのバージョン。&lt;/出力&gt;

70B モデルの競合環境の拡大

リフレクション 70B が注目を集めている間、それは 70 億パラメータ・モデルのより広いエコシステムの一部です。以下は、それが他のモデルと比較してどうなっているかです:

  • Meta の Llama 3.1-70B: 一般的な応用に適した堅固な基礎モデルとして知られています。
  • Claude 2 70B (Anthropic): 倫理的な AI に焦点を当て、推論と長文の生成に優れています。
  • GPT-3.5 70B (OpenAI): GPT-4 の軽量版で、パフォーマンスと効率のバランスに優れています。
  • BLOOM 70B: 自然言語とプログラミング言語の両方で訓練された多言語モデルです。
  • Falcon 70B: 訓練と推論の効率性で知られています。

70B モデルの効率的な実行: 最新のテクニック

この規模のモデルを効率的に実行するのは、容易なタスクではありません。パフォーマンスを最大化するために、以下の最新の戦略があります:

1. 量子化

モデル重みの精度を低減することで、メモリ使用量と推論時間が削減されます。 4 ビット量子化 技術を使用して、BitsAndBytes を活用し、リフレクション 70B を小規模な GPU で効率的に実行できます。

例:

from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-2-70b-hf", load_in_4bit=True)

2. モデル・シャーディング

モデルを複数の GPU (例: DeepSpeed Zero を使用) に分割することで、大規模なモデルを GPU のメモリを超えることなく処理できます。

from xformers.ops import memory_efficient_attention
model.attention = memory_efficient_attention

3. 混合精度と効率的な注意

FlashAttentionxformers を使用すると、注意のオーバーヘッドが削減され、大規模な入力シーケンスの処理時間が改善されます。

from xformers.ops import memory_efficient_attention
model.attention = memory_efficient_attention

4. CPU オフローディングとプルーニング

CPU オフローディング と、重要でない重みのプルーニングにより、モデルをより小規模なハードウェアで実行しながらパフォーマンスを維持できます。

from accelerate import cpu_offload
model = cpu_offload(model)

未来への展望: リフレクション 405B

HyperWrite の次のフロンティアは、リフレクション 70B を上回るスケールとパフォーマンスを目指す リフレクション 405B の開発です。このモデルは、オープンソース AI の境界を押し広げ、GPT-5 などの最先端のプロプライエタリ・モデルに挑戦することを目指しています。

結論

リフレクション・チューニング を通じて、リフレクション 70B は主要なベンチマークで業界トップレベルのパフォーマンスを達成しました。同時に、透明性と精度のレベルを維持しています。これは、特に精度が極めて重要な分野であるコーディング、言語翻訳、複雑な問題解決などで大きな利点をもたらします。

私は過去5年間、機械学習とディープラーニングの魅力的世界に没頭してきました。私の情熱と専門知識は、AI/MLに特に焦点を当てた50以上の多様なソフトウェアエンジニアリングプロジェクトに貢献することになりました。私の継続的な好奇心は、自然言語処理という分野にも私を引き付け、さらに探求したいと思っています。