ソートリーダー
人工知能の成功のために人間の専門知識が不可欠である合成データの真実

LLM開発者は、開発を迅速化し、コストを削減するために、合成データを使用することが増えています。LLama 3、Qwen 2、DeepSeek R1などのトップモデルを開発した研究者たちは、研究論文で合成データを使用してモデルをトレーニングしたことを述べています。外部から見ると、これは完璧な解決策のようです。開発を迅速化し、コストを削減するための情報の無限の源です。しかし、この解決策には、ビジネスリーダーが無視できない隠れたコストが伴います。
簡単に言えば、合成データは、LLMやAIエージェントのトレーニング、ファインチューニング、評価のためにAIモデルによって生成される人工的なデータセットです。伝統的な人間によるアノテーションに比べて、データパイプラインを迅速にスケールさせることができます。これは、AI開発の高速で競争的な環境では不可欠です。
企業は、金融やヘルスケアの設定で機密情報を保護するために「偽の」データを使用することもあります。合成データは、プロプライエタリデータが利用できない場合、たとえば製品の発売前に、またはデータが外部クライアントに属する場合の良い代替手段です。
合成データは、AI開発を革命的に変えているのでしょうか。簡単に言えば、合成データは大きな潜在性を持っていますが、厳格な人間の監視なしにLLMやエージェントに重大な脆弱性を暴露する可能性もあります。LLM製造者やAIエージェント開発者は、不十分に検証された合成データでトレーニングされたAIモデルが不正確または偏った出力を生成したり、評判の危機を引き起こしたり、業界や倫理基準に準拠しない可能性があることを発見するかもしれません。合成データを精製するための人間の監視への投資は、利益を保護し、利害関係者の信頼を維持し、責任あるAIの採用を保証するための直接的な投資です。
人間の入力により、合成データは高品質のトレーニングデータに変換できます。生成されたデータを使用する前に、3つの重要な理由で精製する必要があります。ソースモデル知識のギャップを埋めること、データ品質を向上させてサンプルサイズを削減すること、人間の価値観に合うようにすることです。
独自の知識を捉える必要がある
合成データは、主にインターネット上で公開されている情報でトレーニングされたLLMによって生成されます。これには、固有の制限があります。公開されたコンテンツは、実際の仕事で使用される実践的な知識を捉えることはほとんどありません。マーケティングキャンペーンの設計、財務予測の準備、市場分析の実施などの活動は、通常、オンラインでドキュメント化されることはありません。また、ソースは、米国中心の言語と文化を反映する傾向があり、グローバルな表現を制限します。
これらの制限を克服するために、専門家を巻き込んで、合成データ生成モデルがカバーできない領域のデータサンプルを作成することができます。企業の例に戻すと、最終的なモデルが財務予測や市場分析を効果的に処理するには、トレーニングデータにこれらの分野からのリアルなタスクを含める必要があります。これらのギャップを特定し、専門家が作成したサンプルで合成データを補足することが重要です。
専門家は、プロジェクトの初期段階で、作業のスコープを定義するために関与します。これには、モデルが実行する必要がある知識の特定の分野を概説したタクソノミーの作成が含まれます。たとえば、ヘルスケアでは、一般的な医学は、栄養、心血管健康、 аллергияなどに分割できます。ヘルスケアに焦点を当てたモデルは、カバーする予定のすべてのサブ分野でトレーニングを受ける必要があります。タクソノミーがヘルスケア専門家によって定義された後、LLMは、典型的な質問と回答でデータポイントを迅速に大量に生成できます。ただし、人間の専門家は、コンテンツが正確でだけでなく、安全で、状況に適切であることを確認するために、レビュー、修正、改善する必要があります。この品質保証プロセスは、データの正確性を確保し、潜在的な危害を軽減するために、ヘルスケアなどの高リスクアプリケーションで不可欠です。
質の優先:より少ない、より優れたサンプルでモデル効率を向上させる
ドメイン専門家がLLMやAIエージェントのトレーニングデータを作成する場合、データセットのタクソノミーを作成したり、プロンプトを書いたり、理想的な回答を作成したり、特定のタスクをシミュレートしたりします。すべてのステップは、モデルの目的を考慮して慎重に設計されており、品質は対応する分野の専門家によって保証されています。
合成データ生成は、このプロセスを完全に再現しません。生成されたデータの品質は、人間がキュレーションしたデータに比べて、しばしば低いです。これは、合成データが、満足のいく結果を得るために、より大きなボリュームを必要とすることを意味し、計算コストと開発時間が増加します。
複雑なドメインでは、人間の専門家だけが特定できるニュアンスがあります。特に、外れ値やエッジケースでは、人間がキュレーションしたデータは、はるかに優れたモデルのパフォーマンスを提供します。人間の専門知識をデータ作成プロセスに戦略的に統合することで、モデルが効果的に実行するために必要なサンプルの数を削減できます。
私たちの経験では、この課題に対処する最善の方法は、専門家を合成データセットの構築に参加させることです。専門家がデータ生成のルールを設計し、データタクソノミーを定義し、生成されたデータをレビューまたは修正する場合、最終的なデータ品質は大幅に高まります。このアプローチにより、クライアントは、より少ないデータサンプルを使用して強力な結果を達成し、より迅速で効率的なプロダクションへの道を実現することができます。
信頼を築く:AIの安全性と整合性における人間の役割
自動化システムは、すべての脆弱性を予測したり、人間の価値観との整合性を確保したりすることはできません。特に、エッジケースや曖昧なシナリオでは、専門家のレビュアーは、リスクを特定し、倫理的な結果を確保する上で不可欠な役割を果たします。これは、AIが現在では完全に提供できない保護層です。
したがって、強力なレッドチームデータセットを構築するには、合成データだけでは不十分です。セキュリティ専門家をプロセスの初期段階で関与させることが重要です。彼らは、潜在的な攻撃の種類をマッピングし、データセットの構造をガイドすることができます。LLMは、高容量の例を生成できます。次に、専門家は、データが現実的で、高品質で、AIシステムのテストに役立つものであることを確認するために、データを検証および改良する必要があります。たとえば、LLMは、標準的なハッキングプロンプトを数千件生成できますが、人間のセキュリティ専門家は、AIが独自に発明するのが難しい、社会工学的な攻撃を心理的な偏見を利用して作成できます。
LLMの整合性を自動化されたフィードバックで実現することで、重大な進歩が達成されています。論文「RLAIF vs. RLHF:AIフィードバックを使用した人間のフィードバックからの強化学習のスケーリング」では、研究者は、AIベースの整合性が多くの場合、人間のフィードバックと同等のパフォーマンスを発揮することを示しています。しかし、AIフィードバックがモデルが改善されるにつれて改善される一方で、私たちの経験は、RLAIFが複雑なドメインやエッジケース、外れ値で苦労することを示しています。人間の専門家は、タスクのニュアンスやコンテキストを扱うのにより効果的であり、整合性のためにより信頼性が高いです。
AIエージェントも、幅広い安全性リスクに対処する自動テストから利益を得ます。仮想テスト環境では、生成されたデータを使用して、エージェントの動作をシミュレートします。現実的なシナリオでテストカバレッジを最大化するには、人間の専門知識がテストケースを設計し、自動評価の結果を検証し、脆弱性を報告する上で不可欠です。
合成データの未来
合成データは、特にスケーリングと迅速な展開が重要な今日の高速な風景では、LLMの開発にとって非常に有価値なテクニックです。合成データ自体に根本的な欠陥はありませんが、最大の価値を発揮し、最大の価値を提供するには、精製が必要です。自動データ生成と人間の専門知識を組み合わせたハイブリッドアプローチは、有能で信頼性の高いモデルを開発するための非常に効果的な方法です。AIを使用してスケールを拡大し、人間の専門家を使用して検証することで、より有能で安全性の向上されたモデルを生成できます。これは、ユーザーの信頼を築き、責任ある展開を保証するために不可欠です。












