Modele i platformy AI

Laboratorium Thinking Machines wysyła pierwszy model z interakcją w czasie rzeczywistym 200ms

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Laboratorium Thinking Machines, startup załoÅžony przez byłego dyrektora technicznego OpenAI Mira Murati, opublikował zapowiedÅš badawczą swojego pierwszego modelu wewnętrznego w dniu 11 maja 2026 r., kończąc ponad rok milczenia na temat tego, co laboratorium tak naprawdę zbuduje. Firma nazywa system “modelem interakcji” — wielomodalną architekturą wyszkoloną od podstaw do przetwarzania dÅšwięku, wideo i tekstu w 200-milisekundowych porcjach, zamiast czekania, aÅž uÅžytkownicy skończą swoją turę.

Model, nazwany TML-Interaction-Small, to system mieszany z 276 miliardami parametrÃģw i 12 miliardami aktywnych parametrÃģw. Zgodnie z ogłoszeniem blogu firmy, jest to pierwszy produkt z laboratorium, ktÃģre zebrało około 2 miliardÃģw dolarÃģw przy wycenie 12 miliardÃģw dolarÃģw, nie wysyłając nic poza narzędziem do fine-tuningu. Wydanie następuje w okresie trwającej presji ze strony odejść talentÃģw i wstrzymania rundy finansowania.

Czym tak naprawdę jest model interakcji

Thinking Machines twierdzi, Åže dzisiejsze modele graniczne — w tym GPT-Realtime OpenAI i Gemini Live Google (GOOGL ) — dodają zachowanie w czasie rzeczywistym do architektur opartych na turach przy uÅžyciu “uprzęŞy” zewnętrznych komponentÃģw, takich jak wykrywanie aktywności głosowej. Te komponenty decydują, kiedy uÅžytkownik przestał mÃģwić, a następnie przekazują ukończoną wypowiedÅš modelowi. Podczas gdy model generuje odpowiedÅš, jego percepcja świata zamarza.

Model interakcji zastępuje tę konstrukcję tym, co firma nazywa mikro-turami czasowo wspÃģłliniowymi. System ciągle przetwarza 200 milisekund wejścia, generując 200 milisekund wyjścia, z obiema strumieniami tokenÃģw przeplatanymi w tym samym cyklu zegarowym. Ta struktura pozwala modelowi przerwać uÅžytkownikowi w trakcie zdania, zareagować na wskazÃģwki wizualne bez pytania, lub mÃģwić jednocześnie z uÅžytkownikiem w zadaniach, takich jak tłumaczenie na Åžywo.

Architektura pomija cięŞkie samodzielne kodery. DÅšwięk jest podawany w postaci funkcji dMel przez lekki warstwę osadzania, obrazy są dzielone na fragmenty 40×40, a wszystkie komponenty są wspÃģłszkolone od podstaw z transformatorami. Oddzielny model tła działa asynchronicznie, obsługując głębsze rozumowanie, wywołania narzędzi i przeglądanie sieci, podczas gdy model interakcji pozostaje obecny w rozmowie.

W oparciu o opublikowane przez firmę benchmarki, TML-Interaction-Small osiąga opÃģÅšnienie w turach o wartości 0,40 sekundy w teście FD-bench V1, w porÃģwnaniu z 1,18 sekundami dla GPT-Realtime-2.0 w trybie minimalnego myślenia i 0,57 sekundami dla Gemini-3.1-flash-live. W teście FD-bench V1.5, ktÃģry ocenia jakość interakcji w przypadku przerwań uÅžytkownika, kanałÃģw wstecznych i mowy w tle, model osiąga wynik 77,8 w porÃģwnaniu z 46,8 dla GPT-Realtime-2.0 minimal i 45,5 dla Gemini-3.1-flash-live w trybie wysokiego myślenia. Wartości te są samoopisujące się.

Długo oczekiwana pierwsza dostawa

Wydanie zamyka długą lukę między finansowaniem a produktem. Thinking Machines zostało załoÅžone w lutym 2025 r., a w lipcu tego samego roku zamknęło rundę seed o wartości 2 miliardÃģw dolarÃģw przy wycenie 12 miliardÃģw dolarÃģw — powszechnie zgłaszane jako największa runda seed w historii. Rundę tę poprowadził Andreessen Horowitz z udziałem Nvidia (NVDA ), AMD, Cisco, Accel, ServiceNow (NOW ) i Jane Street. Do tej pory jedynym produktem, jaki firma wydała, było Tinker, API do fine-tuningu modeli o otwartych wagach, ktÃģre zostało uruchomione w paÅšdzierniku 2025 r.

Przez następne miesiące nastąpiły burzliwe wydarzenia. WspÃģłzałoÅžyciele Barret Zoph i Luke Metz opuścili firmę w styczniu 2026 r., aby wrÃģcić do OpenAI, a Murati ogłosiła, Åže firma “rozstała się” z Zophem. Andrew Tulloch opuścił firmę, aby dołączyć do Meta’s Superintelligence Labs po tym, jak Mark Zuckerberg złoÅžył ofertę wartą 1 miliard dolarÃģw na wykup firmy, ktÃģrą odrzucono. Meta zatrudniła od tego czasu pięciu członkÃģw załoÅžycieli laboratorium. W odpowiedzi Murati awansowała Soumith Chintalę, wspÃģłtwÃģrcę PyTorch, na stanowisko dyrektora technicznego. Planowana runda finansowania o wycenie około 50 miliardÃģw dolarÃģw nie została zamknięta do końca 2025 r.

Historia obliczeniowa poszła w przeciwnym kierunku. W marcu Thinking Machines ogłosiło partnerstwo z Nvidia, obejmujące nieujawnioną inwestycję i wdroÅženie co najmniej jednego gigawata następnych systemÃģw Vera Rubin. Laboratorium rÃģwnieÅž rozszerzyło swoją relację z Google Cloud, aby objąć szkolenie modeli granicznych na sprzęcie Nvidia GB300.

Co obserwować

Model interakcji nie jest jeszcze dostępny dla przedsiębiorstw ani publiczności. Thinking Machines twierdzi, Åže ograniczona wersja zapowiedzi badawczej zostanie otwarta dla wybranych partnerÃģw w nadchodzących miesiącach, a szersze wydanie nastąpi pÃģÅšniej w 2026 r. Firma planuje rÃģwnieÅž wydać większe modele interakcji, zauwaÅžając, Åže obecna wersja 276B parametrÃģw jest najmniejszą wersją, ktÃģrą moÅže obsłuÅžyć przy wymaganym opÃģÅšnieniu.

Niezbędna jest niezaleÅžna weryfikacja roszczeń dotyczących benchmarkÃģw. FD-bench jest jednym z nielicznych publicznych benchmarkÃģw ukierunkowanych na jakość interakcji, a wyniki Thinking Machines nie zostały jeszcze odtworzone przez strony trzecie pod realistycznym obciÄ…Åženiem. Testy proaktywności, ktÃģre firma wprowadziła dla wskazÃģwek wizualnych, w tym zmodyfikowane wersje RepCount-A, ProactiveVideoQA i Charades, to nowe instrumenty bez ustanowionego punktu odniesienia.

Strategiczna stawka jest bardziej ukierunkowana. Podczas gdy OpenAI, Anthropic i Google spędzili miniony rok na rozwijaniu zdolności agentÃģw autonomicznych, Thinking Machines stawia, Åže następny oś centrÃģw konkurencji będzie taki, jak ludzie komunikują się z AI — bliÅžej ciągłej rozmowy niÅž serii wskazÃģwek. Model interakcji konkurował bezpośrednio z systemami głosowymi AI w czasie rzeczywistym wysyłanymi przez OpenAI, Google i rosnącą warstwę startupÃģw skupionych na mowie. Czy architektura przetrwa kontakt z obciÄ…Åženiami produkcyjnymi — długimi sesjami, niezawodnym połączeniem i ograniczeniami bezpieczeństwa odmowy w czasie rzeczywistym — jest testem, jaki następna runda podglądu nałoÅžy.

Alex McFarland jest dziennikarzem i pisarzem zajmującym się sztuczną inteligencją, ktÃģry bada najnowsze rozwoje w dziedzinie sztucznej inteligencji. WspÃģłpracował z licznymi startupami i wydawnictwami związanymi z sztuczną inteligencją na całym świecie.