Modelli e piattaforme di IA

Il Laboratorio Thinking Machines Spedisce Il Primo Modello Con Interazione in Tempo Reale da 200ms

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Thinking Machines Lab, la startup di intelligenza artificiale fondata dall’ex CTO di OpenAI Mira Murati, ha rilasciato un’anteprima di ricerca del suo primo modello interno l’11 maggio 2026, ponendo fine a più di un anno di silenzio su cosa la lab avrebbe effettivamente costruito. La società chiama il sistema un “modello di interazione” — un’architettura multimodale addestrata da zero per elaborare audio, video e testo in blocchi di 200 millisecondi anziché aspettare che gli utenti finiscano di parlare.

Il modello, chiamato TML-Interaction-Small, è un sistema a 276 miliardi di parametri con 12 miliardi di parametri attivi. Secondo il post di annuncio del blog della società , si tratta del primo prodotto di un laboratorio che ha raccolto circa 2 miliardi di dollari a una valutazione di 12 miliardi di dollari senza spedire nulla al di là di uno strumento di fine-tuning. Il rilascio arriva in mezzo a una pressione sostenuta dovuta alle partenze di talenti e a un round di finanziamento successivo bloccato.

Cosa Fa Effettivamente Un Modello Di Interazione

Thinking Machines sostiene che i modelli di frontiera di oggi — tra cui GPT-Realtime di OpenAI e Gemini Live di Google — aggiungono un comportamento in tempo reale a architetture basate su turni utilizzando una “struttura” di componenti esterni come la rilevazione dell’attività vocale. Tali componenti decidono quando l’utente ha smesso di parlare, quindi passano un’enunciazione completata al modello. Mentre il modello genera una risposta, la sua percezione del mondo si blocca.

Il modello di interazione sostituisce quella struttura con ciò che la società chiama micro-turni allineati con il tempo. Il sistema elabora continuamente 200 millisecondi di input mentre genera 200 millisecondi di output, con entrambi i flussi di token intrecciati nello stesso ciclo di clock. Quella struttura consente al modello di interrompere un utente a metà frase, reagire a segnali visivi senza essere richiesto o parlare contemporaneamente all’utente per attività come la traduzione in tempo reale.

L’architettura salta gli encoder autonomi pesanti. L’audio viene inserito come caratteristiche dMel attraverso uno strato di incorporamento leggero, le immagini vengono divise in patch di 40×40 e tutti i componenti vengono co-addestrati da zero con il trasformatore. Un modello di sfondo separato funziona in modo asincrono, gestendo un ragionamento più profondo, chiamate di strumenti e navigazione web mentre il modello di interazione rimane presente nella conversazione.

Sui benchmark segnalati dalla società, TML-Interaction-Small segna una latenza di turn-taking di 0,40 secondi su FD-bench V1, rispetto a 1,18 secondi per GPT-Realtime-2.0 nella sua modalità di pensiero minimo e 0,57 secondi per Gemini-3.1-flash-live. Su FD-bench V1.5, che valuta la qualità dell’interazione attraverso interruzioni dell’utente, canali di ritorno e discorso di sfondo, il modello segna 77,8 contro 46,8 per GPT-Realtime-2.0 minimo e 45,5 per Gemini-3.1-flash-live nella sua modalità di pensiero elevato. I dati sono autosegnalati.

Una Prima Spedizione A Lungo Attesa

Il rilascio chiude un lungo divario tra finanziamento e prodotto. Thinking Machines è stata fondata a febbraio 2025 e a luglio di quell’anno ha chiuso un round di semina da 2 miliardi di dollari a una valutazione di 12 miliardi di dollari — ampiamente segnalato come il più grande round di semina nella storia. Il round è stato guidato da Andreessen Horowitz con la partecipazione di Nvidia, AMD, Cisco, Accel, ServiceNow e Jane Street. Fino a ora, l’unico prodotto spedito dalla società è stato Tinker, un’API per il fine-tuning di modelli open-weight che è stata lanciata a ottobre 2025.

I mesi intermedi hanno portato turbolenza. I co-fondatori Barret Zoph e Luke Metz hanno lasciato a gennaio 2026 per tornare a OpenAI, con Murati che ha annunciato che la società aveva “preso strade diverse” con Zoph. Andrew Tulloch ha lasciato per Meta’s Superintelligence Labs dopo che l’offerta di Mark Zuckerberg di acquisire la società a 1 miliardo di dollari è stata respinta. Meta ha successivamente assunto cinque membri fondatori del laboratorio. Murati ha risposto promuovendo Soumith Chintala, co-creatore di PyTorch, a CTO. Un round di follow-on a una valutazione di circa 50 miliardi di dollari non si è chiuso entro la fine del 2025.

La storia del calcolo si è mossa nella direzione opposta. A marzo, Thinking Machines ha annunciato una partnership con Nvidia che copre un investimento non divulgato e il dispiegamento di almeno un gigawatt di sistemi Vera Rubin di prossima generazione. Il laboratorio ha anche ampliato la sua relazione con Google Cloud per coprire l’addestramento di modelli di frontiera su hardware Nvidia GB300.

Cosa Guardare

Il modello di interazione non è ancora disponibile per le imprese o il pubblico. Thinking Machines afferma che un’anteprima di ricerca limitata sarà aperta ai partner selezionati nei prossimi mesi, con un rilascio più ampio più tardi nel 2026. La società prevede anche di rilasciare modelli di interazione più grandi, notando che la versione attuale da 276 miliardi di parametri è la variante più piccola che può servire alla latenza richiesta.

La verifica indipendente delle affermazioni di benchmark è la domanda immediata. FD-bench è uno dei pochi benchmark pubblici che mirano alla qualità dell’interazione e i punteggi di Thinking Machines non sono ancora stati riprodotti da terze parti sotto carico realistico. I test di proattività che la società ha introdotto per i segnali visivi, tra cui versioni adattate di RepCount-A, ProactiveVideoQA e Charades, sono nuovi strumenti senza una base stabilita.

Scommessa strategica è più diretta. Mentre OpenAI, Anthropic e Google hanno trascorso l’ultimo anno spingendo le capacità degli agenti autonomi, Thinking Machines sta scommettendo che il prossimo asse di concorrenza sarà come gli esseri umani comunicano con l’AI — più vicino a una conversazione continua che a una serie di prompt. Il modello di interazione compete più direttamente con i sistemi di intelligenza artificiale vocale in tempo reale che vengono spediti da OpenAI, Google e un crescente livello di startup focalizzate sulla parlata. Se l’architettura sopravvive al contatto con i carichi di lavoro di produzione — lunghe sessioni, connettività non affidabile e le restrizioni di sicurezza del rifiuto in tempo reale — è il test che il prossimo round di anteprima imporrà.

Alex McFarland è un giornalista e scrittore di intelligenza artificiale che esplora gli ultimi sviluppi nel campo dell'intelligenza artificiale. Ha collaborato con numerose startup di intelligenza artificiale e pubblicazioni in tutto il mondo.