AIモデルとプラットフォーム

AIの新しい直感:賢く考えることが長く考えるよりも重要

mm
Unite.AI を Google の優先ソースに追加

人工知能(AI)の進歩は、データと計算能力の増加によってパフォーマンスが向上するという信念によって推進されてきました。この「力ずく」アプローチにより、GPT-3のような印象的なAIシステムが開発され、数年間で優れた成果を収めてきました。しかし、このパラダイムは限界に達しています。AIの問題がより複雑になるにつれて、単に処理能力を増やすだけでは、長期的な進歩のための持続可能な解決策にはなりません。この認識により、研究者はAI開発へのアプローチを再考するようになりました。この文脈で、Deep CogitoのCogito v2モデルは、AI開発の未来を変える可能性のある新しいアプローチを導入しました。より多くの処理能力や長い推論に頼るのではなく、Cogito v2は内部の「直感」を開発し、モデルが正しいパスを特定する前に検索を開始することを可能にします。これは、AIが開発される方法におけるパラダイムシフトであり、より賢く考え、長く考えないことを重視しています。

AI開発の変化

多くの年間、AIの進歩の原動力は、「より多くがより良い」という考えでした。このアプローチにより、複雑な問題を解決するために広範な推論チェーンを生成するAIモデルが開発されました。OpenAIのモデル、たとえばGPT-3は、このアプローチの例であり、長い推論チェーンが困難なタスクで優れた結果につながりました。この方法は印象的な結果をもたらしましたが、重大な欠点もあります。長い推論チェーンにはより多くの計算リソースが必要であり、推論時間が遅くなり、運用コストが増加します。さらに、研究によると、これらの長いプロセスはしばしば減少する収穫と効率の低下につながり、長い推論はより多くのバイアスと低効率につながります。根本的な問題は、長い推論チェーンと計算能力の増加に頼ることは、複雑なAIの問題に対処するための効果的な解決策ではなくなっているということです。これらのアプローチは、巨大な処理時間とメモリ要件によって制限されています。

AIにおける「直感」の重要性

現在のAIシステムが長い推論に頼るのとは異なり、人間は問題を解決するために「直感」(迅速な直観的な判断の一種)を頼ることがよくあります。直感は抽象的な概念のように思えるかもしれませんが、実際には、迅速な決定を下すために必要な年月の経験、学習、コンテキスト処理の結果であることが多いです。これは、生の計算と人間のような推論を区別するものです。人間はパターン認識と蓄積された経験を通じて「直感」を構築し、すべての詳細を完全に分析せずに決定を下すことができます。AIの新しい「直感」は、このプロセスを模倣することを目的としています。
このアイデアは、「知能先験」(intelligence prior)とも呼ばれ、AIシステムに人間のような推論を与え、より効率的にするための重要な鍵となり得ます。強力な知能先験を持つAIモデルは、広範な計算を行うことなく、どの解決策が成功する可能性が高いかを予測できます。広範な検索方法に頼るのではなく、直感により、AIシステムは以前の知識を活用し、最も効果的な解決策へのパスに焦点を当てることができます。

Cogito v2が「直感」をどのように取り入れたか

Cogitoは、最近リリースされたモデルCogito v2で、「直感」(より技術的に言えば、知能先験)の概念を取り入れています。このアイデアは、反復蒸留と増幅(IDA)と呼ばれるメカニズムを使用して統合されました。このメカニズムにより、モデルは自身の推論プロセスから学び、問題解決スキルを時間の経過とともに洗練することができます。静的なプロンプトや固定の教師ではなく、IDAにより、AIは成功した推論パスを自身のコアモデルパラメータに蒸留することができます。この自己改善プロセスにより、モデルは推論能力を時間の経過とともに洗練し、正確な答えだけでなく、最も効率的な思考方法に最適化します。

  • 反復蒸留と増幅(IDA)

IDAのしくみを理解するために、二重プロセス理論を参照することができます。この理論では、人間の思考を二つのシステム、システム1とシステム2に分類します。システム1は迅速な直観的な意思決定を指し、システム2はより遅くてより慎重な推論を指します。この理論によれば、人間はほとんどのタスクでシステム1を使用し、より複雑な決定に直面したときにシステム2に切り替わります。

IDAは二つのステップ、増幅と蒸留で構成されます。増幅段階では、モデルは広範な計算方法を使用して、高品質の解決策または推論トレースを生成します。これはシステム2の思考に相当し、AIは潜在的な解決策を慎重に評価する時間を取ります。蒸留段階では、モデルは増幅段階からの洞察を内部化し、推論プロセスをシステム2からシステム1に変換します。人間の運転手が経験を積むにつれてより直観的に運転するように、IDAを使用するAIモデルは、時間の経過とともにより迅速で効率的な決定を下すことができます。

IDAの重要な考え方は、増幅段階で計算的に集中した推論を使用し、蒸留段階で推論をモデルパラメータに戻すことです。このプロセスにより、モデルは効果的な推論戦略を内部化し、問題を解決する能力を構築することができます。IDAサイクルを繰り返すことで、AIシステムは計算リソースを減らしながら決定を下す能力を継続的に改善します。

AIに「直感」を統合することの利点

AIの「直感」の主な利点の1つは、効率性です。Cogito v2のようなモデルは、競合するモデルよりも60%短い推論チェーンを示しています。これは、より少ない内部ステップで答えに到達できることを意味し、推論に必要な時間とリソースを削減します。たとえば、DeepSeek R1が200トークン以上で解決する問題を、Cogito v2は100トークン未満で解決できます。

さらに、Cogito v2のトレーニングコストは、従来のAIモデルよりも大幅に低くなります。Cogito v2のトレーニングプロセス全体のコストは、広範なパラメータをカバーして、350万ドル以下でした。これは、GPT-4のような大規模モデルに関連する通常の費用よりもはるかに低いです。

Cogito v2は、明示的にトレーニングされていない分野でも新しい能力を実証しています。たとえば、主にテキストでトレーニングされたにもかかわらず、Cogito v2は画像について推論し、画像構成と生息地についての洞察を提供できます。このクロスモーダル推論能力は、汎用知能(AGI)への重要なステップであり、AIの発展において重要な里程標です。

AI開発の再考

知能先験の成功は、AI開発戦略が根本的に変化する必要があることを示唆しています。モデルサイズの増加や計算リソースの増加ではなく、AI開発は、システムが自身の認知戦略を開発し、洗練する能力を構築することに焦点を当てるべきです。この変化は、人間の認知発達を反映しています。知能は、より大きな脳やより多くの思考時間の結果ではなく、より良い精神モデルと推論戦略の結果であるからです。このアプローチの変化は、長期的な影響を及ぼす可能性があります。賢く考え、力ずくで考えないことを強調することで、AIはより汎用性が高く、適応性が高く、複雑な課題に対処できるようになります。この変化は、ヘルスケア、サイバーセキュリティ、自動運転などの業界でのAIの応用を促進し、AIシステムをより効率的、費用対効果が高く、影響力のあるものにする可能性があります。

結論

Cogito v2の成功は、AIの未来はモデルをスケールアップしたり計算能力を増強したりすることではなく、推論アーキテクチャを洗練し、賢い問題解決を最適化することにあることを示しています。この変化は、AIシステムが計算リソースに大きく依存せずに継続的に改善し、適応できる、より持続可能でアクセスしやすいAIの未来を約束しています。賢い推論に焦点を当てることで、AIは複雑な現実世界の問題に対処する能力を高めることができます。

Dr. Tehseen ZiaはCOMSATS University Islamabadの正教授であり、オーストリアのVienna University of TechnologyでAIのPh.D.を取得しています。人工知能、機械学習、データサイエンス、コンピュータビジョンを専門とし、信頼性の高い科学雑誌に掲載された出版物で著しい貢献をしています。Dr. Tehseenは、主な調査員としてさまざまな産業プロジェクトを率い、AIコンサルタントとしても務めています。