AGIと未来のAI
Inflection-2.5:GPT-4とGoogleのGeminiに匹敵する強力なLLM
Inflection AIは、最近のInflection-2.5の発表により、大規模言語モデル(LLM)分野で注目を集めています。このモデルは、OpenAIのGPT-4やGoogleのGeminiなどの世界トップクラスのLLMと競合しています。
Inflection AIの急成長は、13億ドルの巨額資金調達によってさらに後押しされました。この資金調達は、Microsoft (MSFT ) 、NVIDIA (NVDA ) 、Reid Hoffman、Bill Gates、Eric Schmidtなどの業界の大手によって主導されています。この資金調達により、会社の総資金調達額は15.25億ドルに達しました。
CoreWeave (CRWV ) とNVIDIAとの協力により、Inflection AIは世界最大のAIクラスターを構築中です。このクラスターは、22,000のNVIDIA H100 Tensor Core GPUで構成されています。この巨大なコンピューティングパワーは、新しい大規模AIモデルのトレーニングと展開をサポートし、Inflection AIが個人用AIの分野で何が可能かを追求することを可能にします。
会社の画期的な成果はすでに実を結んでおり、Inflection AIクラスター(現在、3,500のNVIDIA H100 Tensor Core GPUで構成)は、MLPerfというオープンソースベンチマークで最先端のパフォーマンスを発揮しています。CoreWeaveとNVIDIAとの共同提出により、クラスターは大規模言語モデルの参考トレーニングタスクを11分で完了し、このベンチマークで最速のクラスターとしての地位を固めました。
この成果は、Inflection AIのインハウス大規模言語モデル(LLM)であるInflection-1の発表に続くものです。Inflection-1は、GPT-3.5、LLaMA、Chinchilla、PaLM-540Bなどの業界の大手と比較するために一般的に使用されるベンチマークで、同じコンピューティングクラスのベストモデルと評価されています。Inflection-1により、ユーザーはInflection AIの個人用AIであるPiと簡単かつ自然なやり取りが可能になり、迅速で関連性の高い情報とアドバイスを受け取ることができます。
Inflection AIの透明性と再現性への取り組みは、Inflection-1の評価とパフォーマンスに関する技術メモの公開に表れています。このメモは、Inflection-1がPaLM-540Bと同じコンピューティングクラスのモデルを上回るパフォーマンスを発揮していることを示しています。
Inflection-1の成功と会社のコンピューティングインフラストラクチャーの急速なスケーリングは、Inflection AIが個人用AIを作成するという使命を達成するという決意を強調しています。Inflection-1をPiに統合することで、ユーザーは個人用AIの力を体験し、共感的な性格、有用性、安全性の基準から利益を得ることができます。
Inflection-2.5
Inflection-2.5は、現在、Piのユーザー全員に、ウェブ(pi.ai)、iOS、Android、デスクトップアプリを含む複数のプラットフォームで利用可能です。この統合は、Inflection AIが個人用AIを作成するという使命の重要な里程標です。生の能力と共感的な性格、安全性の基準を組み合わせたものです。
パフォーマンスの向上 Inflection AIの前のモデルであるInflection-1は、GPT-4のトレーニングFLOPS(浮動小数点演算)のおよそ4%を使用し、さまざまなIQ指向タスクで平均72%のパフォーマンスを発揮しました。Inflection-2.5では、Inflection AIはPiの知的能力を大幅に向上させ、特にコーディングと数学に焦点を当てています。
モデルの業界ベンチマークでのパフォーマンスは、その能力を示しています。GPT-4の平均パフォーマンスの94%以上を達成し、特にSTEM分野で優れています。この驚異的な成果は、Inflection AIが技術の最前線を推進しながらユーザーエクスペリエンスと安全性に焦点を当てているという決意を示しています。
コーディングと数学の能力 Inflection-2.5はコーディングと数学で優れています。BIG-Bench-Hardという大規模言語モデルの課題では、Inflection-1よりも10%以上の改善を示しています。MBPP+とHumanEval+という2つのコーディングベンチマークでは、Inflection-1よりも大幅な改善を示し、コーディング分野で強力な存在感を示しています。
MBPP+ベンチマークでは、Inflection-2.5は前身モデルを大幅に上回り、GPT-4と同等のパフォーマンスを発揮しています。HumanEval+ベンチマークでは、Inflection-2.5はInflection-1を上回り、GPT-4と同等のパフォーマンスに近づいています。
業界ベンチマークでの優位性
Inflection-2.5は業界ベンチマークで優位性を示しています。MMLUベンチマークとGPQA Diamondベンチマークでは、Inflection-1よりも大幅な改善を示しています。これらのベンチマークでのモデルのパフォーマンスは、幅広いタスクを処理する能力を示しています。
STEM試験での優位性 モデルの能力はSTEM試験でも発揮されています。ハンガリー数学試験と物理GREでは、特に優れたパフォーマンスを示しています。ハンガリー数学試験では、Inflection-2.5は提供されたfew-shotプロンプトとフォーマットを活用し、再現性を容易にします。
物理GREでは、Inflection-2.5は人類のテスト参加者の85パーセンタイルに達し、物理問題解決における強力な存在感を示しています。さらに、モデルのmaj@32でのパフォーマンスは、複雑な物理問題を高い精度で解決する能力を示しています。
ユーザーエクスペリエンスの向上 Inflection-2.5はPiのユーザーエクスペリエンスを向上させ、生の能力と共感的な性格、安全性の基準を組み合わせたものを提供します。現在の出来事について話すことから、ローカルな推奨事項を求めること、試験の勉強、コーディング、さらにはカジュアルな会話まで、PiとInflection-2.5はユーザーに豊かなエクスペリエンスを提供します。
Inflection-2.5の強力な能力により、ユーザーはPiとより幅広いトピックについてやり取りすることができます。モデルの複雑なタスクを処理する能力と共感的な性格、リアルタイムのWeb検索機能により、ユーザーは高品質で最新の情報とガイダンスを受け取ることができます。
ユーザーの採用とエンゲージメント Inflection-2.5のPiへの統合は、ユーザーのセンチメント、エンゲージメント、リテンションメトリクスに既に影響を与えています。Inflection AIは、1日あたり100万人、月あたり600万人のアクティブユーザーがPiと4億件以上のメッセージを交換するという急激な有機的なユーザーの成長を経験しています。
Piとの会話は平均33分間続き、10人に1人が1日あたり1時間以上の会話をします。さらに、Piと会話した人は、次の週にも約60%が戻ってきます。これは、業界の主要な競合他社よりも高い月次のスティックネスを示しています。
技術的詳細とベンチマークの透明性
Inflection AIの透明性と再現性への取り組みは、Inflection-2.5の技術的結果と業界ベンチマークでのパフォーマンスに関する詳細な情報を提供することにも表れています。
例えば、MT-Benchデータセットの修正バージョンでは、Inflection-2.5は他のベンチマークに基づいて期待されるパフォーマンスを示しています。
Inflection AIは、HellaSwagとARC-Cという共通のベンチマークでもInflection-2.5を評価しており、強力なパフォーマンスを示しています。
ただし、提供された評価はPiを動かすモデルのものですが、ユーザーエクスペリエンスは、Webの取得(ベンチマークでは使用されない)、few-shotプロンプトの構造、他のプロダクション側の違いなどの要因によって若干異なる場合があります。
結論
Inflection-2.5は、大規模言語モデルの分野で重要な進歩を表し、GPT-4やGeminiなどの業界を牽引するモデルと競合しながら、コンピューティングリソースを大幅に削減しています。さまざまなベンチマークで優れたパフォーマンスを発揮し、特にSTEM分野、コーディング、数学で優れています。Inflection-2.5はAIの風景の中で強力な存在感を示しています。
Inflection-2.5をPiに統合することで、ユーザーは生の能力と共感的な性格、安全性の基準を組み合わせた豊かなエクスペリエンスを体験することができます。Inflection AIがLLMの境界を押し広げ続けるにつれ、AIコミュニティはこの先駆的な企業からの次のイノベーションとブレークスルーを熱心に待ち望んでいます。














