AI-modellen en platforms
Denktank Thinking Machines Lab levert eerste model met real-time interactie van 200 ms

Thinking Machines Lab, het AI-startup opgericht door voormalig OpenAI-CTO Mira Murati, heeft een onderzoeksvoorbeeld van zijn eerste in-huismodel vrijgegeven op 11 mei 2026, waarmee een jaar van stilte over wat het lab zou gaan bouwen, is beëindigd. Het bedrijf noemt het systeem een “interactiemodel” – een multimodaal architectuur getraind van scratch om audio, video en tekst te verwerken in stukken van 200 milliseconden in plaats van te wachten tot gebruikers een beurt hebben voltooid.
Het model, genaamd TML-Interaction-Small, is een 276 miljard-parameter mengsel van expertsystemen met 12 miljard actieve parameters. Volgens de aankondigingsblogpost van het bedrijf is dit het eerste product van een lab dat ongeveer $2 miljard heeft opgehaald bij een waardering van $12 miljard zonder iets te verschepen behalve een fine-tuningtool. De release vindt plaats te midden van aanhoudende druk van het vertrek van talent en een stilgevallen follow-on financieringsronde.
Wat een interactiemodel eigenlijk doet
Thinking Machines stelt dat de huidige frontiermodellen – waaronder OpenAI’s GPT-Realtime en Google’s Gemini Live – real-time gedrag toevoegen aan turn-based architectuur met behulp van een “harnas” van externe componenten zoals spraakactiviteitsdetectie. Die componenten beslissen wanneer de gebruiker is gestopt met spreken en geven dan een voltooide uiting aan het model. Terwijl het model een antwoord genereert, bevriest zijn perceptie van de wereld.
Het interactiemodel vervangt die steigerwerk door wat het bedrijf noemt tijd-geliciteerde micro-beurten. Het systeem verwerkt continu 200 milliseconden invoer terwijl het 200 milliseconden uitvoer genereert, met beide tokenstromen verweven op dezelfde klokcyclus. Die structuur laat het model toe om een gebruiker halverwege een zin te onderbreken, te reageren op visuele signalen zonder dat daarom wordt gevraagd, of tegelijkertijd met de gebruiker te spreken voor taken zoals live-vertaling.
De architectuur slaat zware zelfstandige encoders over. Audio wordt ingevoerd als dMel-kenmerken via een lichtgewicht embeddelinglaag, afbeeldingen worden gesplitst in 40×40 patches en alle componenten worden getraind van scratch met de transformatie. Een aparte achtergrondmodel draait asynchroon, waarbij dieper redeneren, toolaanroepen en webbrowsen worden afgehandeld terwijl het interactiemodel aanwezig blijft in het gesprek.
Op de door het bedrijf gerapporteerde benchmarks, behaalt TML-Interaction-Small een beurt-nemingslatentie van 0,40 seconden op FD-bench V1, vergeleken met 1,18 seconden voor GPT-Realtime-2.0 in zijn minimale denkmodus en 0,57 seconden voor Gemini-3.1-flash-live. Op FD-bench V1.5, die interactiekwaliteit meet over gebruikersonderbrekingen, achtergrondgeluid en spraak, scoort het model 77,8 tegen 46,8 voor GPT-Realtime-2.0 minimale en 45,5 voor Gemini-3.1-flash-live in zijn hoge denkmodus. De cijfers zijn zelf gerapporteerd.
Een lang verwachte eerste zending
De release sluit een lange kloof tussen financiering en product. Thinking Machines werd opgericht in februari 2025 en sloot in juli van dat jaar een financieringsronde van $2 miljard af bij een waardering van $12 miljard – breed gerapporteerd als de grootste seedronde ooit. De ronde werd geleid door Andreessen Horowitz met deelname van Nvidia (NVDA ), AMD, Cisco, Accel, ServiceNow (NOW ) en Jane Street. Tot nu toe was het enige product dat het bedrijf had verscheept Tinker, een API voor fine-tuning van open-gewichtsmodellen die in oktober 2025 werd gelanceerd.
De tussenliggende maanden brachten turbulentie. Mede-oprichters Barret Zoph en Luke Metz verlieten in januari 2026 om terug te keren naar OpenAI, met Murati die aankondigde dat het bedrijf “uit elkaar was gegaan” met Zoph. Andrew Tulloch verliet voor Meta’s Superintelligence Labs nadat Mark Zuckerberg’s gerapporteerde aanbod van $1 miljard om het bedrijf rechtstreeks te kopen, was afgewezen. Meta heeft sindsdien vijf oprichters van het lab in dienst genomen. Murati reageerde door Soumith Chintala, een mede-creator van PyTorch, tot CTO te benoemen. Een gerapporteerde follow-on ronde bij een waardering van ongeveer $50 miljard werd niet afgesloten tegen het einde van 2025.
Het verhaal over de rekenkracht bewoog in de tegenovergestelde richting. In maart kondigde Thinking Machines een partnership met Nvidia aan, waaronder een onbekend bedrag aan investeringen en de inzet van ten minste één gigawatt aan next-generation Vera Rubin-systemen. Het lab breidde ook zijn relatie met Google Cloud uit om frontiermodeltraining op Nvidia GB300-hardware te dekken.
Wat te kijken
Het interactiemodel is nog niet beschikbaar voor ondernemingen of het publiek. Thinking Machines zegt dat een beperkte onderzoeksvoorbeeld binnenkort zal worden geopend voor geselecteerde partners, met een bredere release later in 2026. Het bedrijf plant ook om grotere interactiemodellen vrij te geven, waarbij wordt opgemerkt dat de huidige 276B parameter-versie de kleinste variant is die het kan serveren bij de vereiste latentie.
Onafhankelijke verificatie van de benchmarkclaims is de onmiddellijke vraag. FD-bench is een van de weinige openbare benchmarks die interactiekwaliteit richten, en de scores van Thinking Machines zijn nog niet gereproduceerd door derden onder realistische belasting. De proactiviteitstests die het bedrijf heeft geïntroduceerd voor visuele signalen, waaronder aangepaste versies van RepCount-A, ProactiveVideoQA en Charades, zijn nieuwe instrumenten zonder een gevestigde baseline.
De strategische inzet is scherper. Terwijl OpenAI, Anthropic en Google het afgelopen jaar autonome agentcapaciteiten hebben gestimuleerd, wedt Thinking Machines dat de volgende as van concurrentie zal zijn hoe mensen communiceren met AI – dichter bij een continue conversatie dan een reeks prompts. Het interactiemodel concurreert het meest direct met de real-time spraak-AI-systemen die worden verzonden door OpenAI, Google en een groeiende laag van spraakgerichte startups. Of de architectuur overleeft contact met productieworkloads – lange sessies, onbetrouwbare connectiviteit en de veiligheidsbeperkingen van real-time weigering – is de test die de volgende voorbeeldronde zal opleggen.












