AIモデルとプラットフォーム
Thinking Machines Lab、200msのリアルタイムインタラクションを実現した最初のモデルを出荷

Thinking Machines Lab、OpenAIの元CTOであるMira Muratiによって設立されたAIスタートアップは、2026年5月11日に、自社の最初のインハウスモデルに関する研究プレビューを公開し、約1年間の沈黙を終わらせた。このシステムは、ユーザーがターンを終了するのを待たずに、オーディオ、ビデオ、テキストを200ミリ秒ずつのチャンクで処理するように設計された、マルチモーダルアーキテクチャである。
モデルは、TML-Interaction-Smallと呼ばれ、276億パラメータの専門家の混合システムで、12億のアクティブパラメータを持つ。同社の発表ブログ投稿によると、これは、約20億ドルの資金を調達し、120億ドルの評価額で、ファインチューニングツール以外の製品を出荷していなかった研究所からの最初の製品である。リリースは、人材の離脱や、次の資金調達ラウンドが停滞している状況の中で行われた。
インタラクションモデルが実際に何をするか
Thinking Machinesは、現在の最先端モデル、例えばOpenAIのGPT-RealtimeやGoogleのGemini Liveは、ターンベースのアーキテクチャに、ボイスアクティビティ検出などの外部コンポーネントを使用して、リアルタイム動作を追加しているという。ユーザーが話し終わるのを待ってから、発話をモデルに渡し、モデルは応答を生成する間に、世界の認識が凍結する。
インタラクションモデルは、このようなサポートを時間同期マイクロターンに置き換える。システムは、200ミリ秒の入力と出力を同時に処理し、トークンストリームを同じクロックサイクルで交互に配置する。这种構造により、モデルはユーザーの発話の中断、視覚的な合図への反応、またはライブ翻訳などのタスクでユーザーと同時に話すことができる。
アーキテクチャは、独立したエンコーダーを省略する。オーディオは、dMel featuresとして、軽量な埋め込み層を介して入力され、画像は40×40のパッチに分割され、すべてのコンポーネントはトランスフォーマーとともにスクラッチから共同でトレーニングされる。別のバックグラウンドモデルは、非同期で実行され、より深い推論、ツール呼び出し、ウェブブラウジングを扱い、インタラクションモデルは会話に留まる。
同社の報告されたベンチマークによると、TML-Interaction-Smallは、FD-bench V1で0.40秒のターン取り合い遅延を記録し、GPT-Realtime-2.0の最小思考モードでは1.18秒、Gemini-3.1-flash-liveでは0.57秒を記録した。FD-bench V1.5では、ユーザーの割り込み、バックチャンネル、バックグラウンドスピーチを含むインタラクションの品質を評価し、モデルは77.8を記録し、GPT-Realtime-2.0の最小思考モードでは46.8、Gemini-3.1-flash-liveの高思考モードでは45.5を記録した。数字は自己報告されたものである。
長らく待ちに待った最初の出荷
リリースは、資金調達と製品出荷の間の長いギャップを埋めた。Thinking Machinesは2025年2月に設立され、同年7月に、120億ドルの評価額で20億ドルのシードラウンドを閉じた。ラウンドはAndreessen Horowitzが主導し、Nvidia (NVDA ) 、AMD、Cisco、Accel、ServiceNow (NOW ) 、Jane Streetが参加した。現在までに、同社が出荷した唯一の製品は、2025年10月にリリースされた、オープンウェイトモデルをファインチューニングするためのAPIであるTinkerであった。
その間、同社は人材の流出や、資金調達ラウンドの停滞など、困難に直面していた。共同創設者であるBarret ZophとLuke Metzは、2026年1月にOpenAIに戻り、Muratiは同社がZophと「別れた」と発表した。Andrew Tullochは、Mark Zuckerbergが同社を全額購入するための約10億ドルのオファーを拒否した後、MetaのSuperintelligence Labsに移籍した。Metaは、以来、研究所の5人の創設メンバーを雇用した。Muratiは、PyTorchの共同創設者であるSoumith ChintalaをCTOに昇格させた。2025年末までに、約500億ドルの評価額で次のラウンドを閉じることができなかった。
コンピューティングの話は、逆の方向に進んだ。3月、Thinking Machinesは、Nvidiaとのパートナーシップを発表し、非公開の投資と、少なくとも1ギガワットの次世代Vera Rubinシステムの展開を含む。研究所はまた、Nvidia GB300ハードウェア上での最先端モデルトレーニングを含むGoogle Cloudとの関係を拡大した。
注目すべき点
インタラクションモデルはまだ、企業や一般に公開されていない。Thinking Machinesは、限定的な研究プレビューが近くに選ばれたパートナーに公開され、2026年後半により広く公開される予定であると述べている。同社は、現在の276Bパラメータバージョンは、必要な遅延で提供できる最小のバリアントであると述べ、より大きなインタラクションモデルを公開する予定である。
ベンチマークの主張の独立した検証が、すぐに解決すべき疑問である。FD-benchは、インタラクションの品質を対象とする少数のパブリックベンチマークの1つであり、Thinking Machinesのスコアはまだ、現実的な負荷の下で第三者によって再現されていない。同社が導入した視覚的な合図のためのプロアクティブテスト、例えばRepCount-A、ProactiveVideoQA、Charadesの改訂バージョンは、新しいツールであり、確立されたベースラインがない。
戦略的な賭けは、より明確である。OpenAI、Anthropic、Googleが、自律エージェントの機能を推進してきた一方で、Thinking Machinesは、次の競争軸が、人間がAIとどのようにコミュニケーションするか、つまり連続的な会話ではなく、一連のプロンプトであるという点にあると賭けている。インタラクションモデルは、OpenAI、Google (GOOGL ) 、そして成長しているスピーチに焦点を当てたスタートアップからのリアルタイムボイスAIシステムと最も直接競合する。アーキテクチャが、長いセッション、信頼性の低い接続、リアルタイム拒否の安全性制約などの生産ワークロードとの接触に耐えられるかどうかが、次のプレビューラウンドで課せられるテストである。












