Modèles et plateformes d’IA

Le laboratoire Thinking Machines expédie son premier modèle avec une interaction en temps réel de 200 ms

mm
Ajouter Unite.AI à vos sources préférées sur Google

Le laboratoire Thinking Machines, la startup d’IA fondée par l’ancien CTO d’OpenAI Mira Murati, a publié une préversion de recherche de son premier modèle interne le 11 mai 2026, mettant fin à plus d’un an de silence sur ce que le laboratoire allait réellement construire. L’entreprise appelle le système un “modèle d’interaction” – une architecture multimodale formée à partir de zéro pour traiter l’audio, la vidéo et le texte en blocs de 200 millisecondes plutôt que d’attendre que les utilisateurs terminent un tour.

Le modèle, nommé TML-Interaction-Small, est un système de mélange d’experts de 276 milliards de paramètres avec 12 milliards de paramètres actifs. Selon l’annonce de l’entreprise sur son blog, il s’agit du premier produit d’un laboratoire qui a levé environ 2 milliards de dollars à une valorisation de 12 milliards de dollars sans expédier quoi que ce soit au-delà d’un outil de fine-tuning. La sortie intervient au milieu d’une pression soutenue due aux départs de talents et à un cycle de financement suivant bloqué.

Qu’est-ce qu’un modèle d’interaction fait réellement

Thinking Machines soutient que les modèles de pointe actuels – y compris GPT-Realtime d’OpenAI et Gemini Live de Google (GOOGL ) – greffent un comportement en temps réel sur des architectures basées sur des tours en utilisant un “harnais” de composants externes comme la détection d’activité vocale. Ces composants décident lorsque l’utilisateur a cessé de parler, puis transmettent une énonciation terminée au modèle. Alors que le modèle génère une réponse, sa perception du monde se fige.

Le modèle d’interaction remplace cet échafaudage avec ce que l’entreprise appelle des micro-tours synchronisés dans le temps. Le système traite en continu 200 millisecondes d’entrée tout en générant 200 millisecondes de sortie, avec les deux flux de jetons entrelacés sur le même cycle d’horloge. Cette structure permet au modèle d’interrompre un utilisateur en pleine phrase, de réagir à des indices visuels sans être invité, ou de parler en même temps que l’utilisateur pour des tâches comme la traduction en direct.

L’architecture omet les encodeurs autonomes lourds. L’audio est alimenté sous forme de fonctionnalités dMel via une couche d’intégration légère, les images sont divisées en patchs de 40×40, et tous les composants sont formés ensemble à partir de zéro avec le transformateur. Un modèle de fond séparé s’exécute de manière asynchrone, gérant une réflexion plus approfondie, des appels d’outils et une navigation Web tandis que le modèle d’interaction reste présent dans la conversation.

Selon les benchmarks signalés par l’entreprise, TML-Interaction-Small affiche une latence de prise de tour de 0,40 seconde sur FD-bench V1, par rapport à 1,18 seconde pour GPT-Realtime-2.0 en mode de réflexion minimale et 0,57 seconde pour Gemini-3.1-flash-live. Sur FD-bench V1.5, qui évalue la qualité d’interaction sur les interruptions de l’utilisateur, les canaux de retour et la parole de fond, le modèle obtient un score de 77,8 contre 46,8 pour GPT-Realtime-2.0 minimal et 45,5 pour Gemini-3.1-flash-live en mode de réflexion élevée. Les chiffres sont auto-déclarés.

Un premier lancement attendu depuis longtemps

La sortie met fin à un long intervalle entre le financement et le produit. Thinking Machines a été fondé en février 2025 et en juillet de la même année, il a clôturé un cycle de financement initial de 2 milliards de dollars à une valorisation de 12 milliards de dollars – largement rapporté comme le plus grand cycle de financement initial enregistré. Le cycle a été mené par Andreessen Horowitz avec la participation de Nvidia (NVDA ), AMD, Cisco, Accel, ServiceNow (NOW ) et Jane Street. Jusqu’à présent, le seul produit expédié par l’entreprise était Tinker, une API pour le fine-tuning des modèles à poids ouvert qui a été lancée en octobre 2025.

Les mois intermédiaires ont apporté de la turbulence. Les co-fondateurs Barret Zoph et Luke Metz ont quitté l’entreprise en janvier 2026 pour retourner chez OpenAI, Murati annonçant que l’entreprise avait “rompu” avec Zoph. Andrew Tulloch a quitté Meta pour les Superintelligence Labs après que l’offre de rachat de l’entreprise pour 1 milliard de dollars par Mark Zuckerberg ait été rejetée. Meta a depuis embauché cinq membres fondateurs du laboratoire. Murati a répondu en promouvant Soumith Chintala, co-créateur de PyTorch, au poste de CTO. Un cycle de financement suivant à une valorisation d’environ 50 milliards de dollars n’a pas été clôturé d’ici la fin de 2025.

L’histoire de l’informatique a évolué dans la direction opposée. En mars, Thinking Machines a annoncé un partenariat avec Nvidia couvrant un investissement non divulgué et le déploiement d’au moins un gigawatt de systèmes Vera Rubin de nouvelle génération. Le laboratoire a également élargi sa relation avec Google Cloud pour couvrir la formation de modèles de pointe sur le matériel Nvidia GB300.

Qu’il faut surveiller

Le modèle d’interaction n’est pas encore disponible pour les entreprises ou le public. Thinking Machines indique qu’une préversion de recherche limitée sera ouverte à des partenaires sélectionnés dans les prochains mois, avec une sortie plus large plus tard en 2026. L’entreprise prévoit également de sortir des modèles d’interaction plus grands, notant que la version actuelle de 276 milliards de paramètres est la plus petite variante qu’elle peut servir à la latence requise.

La vérification indépendante des revendications de benchmark est la question immédiate. FD-bench est l’un des rares benchmarks publics ciblant la qualité d’interaction, et les scores de Thinking Machines n’ont pas encore été reproduits par des tiers sous charge réaliste. Les tests de proactivité que l’entreprise a introduits pour les indices visuels, notamment des versions adaptées de RepCount-A, ProactiveVideoQA et Charades, sont de nouveaux instruments sans ligne de base établie.

Le pari stratégique est plus pointu. Alors qu’OpenAI, Anthropic et Google ont passé l’année dernière à pousser les capacités d’agent autonome, Thinking Machines mise sur le fait que le prochain axe de concurrence sera la façon dont les humains communiquent avec l’IA – plus proche d’une conversation continue que d’une série de invites. Le modèle d’interaction concurrence directement les systèmes d’IA vocale en temps réel expédiés par OpenAI, Google et une couche croissante de startups axées sur la parole. Que l’architecture survive au contact avec les charges de travail de production – longues sessions, connectivité non fiable et contraintes de sécurité de refus en temps réel – est le test que le prochain cycle de préversion imposera.

Alex McFarland est un journaliste et écrivain en intelligence artificielle qui explore les derniers développements en intelligence artificielle. Il a collaboré avec de nombreuses startups et publications en intelligence artificielle dans le monde entier.