Modele i platformy AI

Laboratorium Thinking Machines wysyła pierwszy model z interakcją w czasie rzeczywistym 200ms

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Laboratorium Thinking Machines, startup założony przez byłego dyrektora technicznego OpenAI Mira Murati, opublikował zapowiedź badawczą swojego pierwszego modelu wewnętrznego w dniu 11 maja 2026 r., kończąc ponad rok milczenia na temat tego, co laboratorium tak naprawdę zbuduje. Firma nazywa system “modelem interakcji” — wielomodalną architekturą wyszkoloną od podstaw do przetwarzania dźwięku, wideo i tekstu w 200-milisekundowych porcjach, zamiast czekania, aż użytkownicy skończą swoją turę.

Model, nazwany TML-Interaction-Small, to system mieszany z 276 miliardami parametrów i 12 miliardami aktywnych parametrów. Zgodnie z ogłoszeniem blogu firmy, jest to pierwszy produkt z laboratorium, które zebrało około 2 miliardów dolarów przy wycenie 12 miliardów dolarów, nie wysyłając nic poza narzędziem do fine-tuningu. Wydanie następuje w okresie trwającej presji ze strony odejść talentów i wstrzymania rundy finansowania.

Czym tak naprawdę jest model interakcji

Thinking Machines twierdzi, że dzisiejsze modele graniczne — w tym GPT-Realtime OpenAI i Gemini Live Google — dodają zachowanie w czasie rzeczywistym do architektur opartych na turach przy użyciu “uprzęży” zewnętrznych komponentów, takich jak wykrywanie aktywności głosowej. Te komponenty decydują, kiedy użytkownik przestał mówić, a następnie przekazują ukończoną wypowiedź modelowi. Podczas gdy model generuje odpowiedź, jego percepcja świata zamarza.

Model interakcji zastępuje tę konstrukcję tym, co firma nazywa mikro-turami czasowo współliniowymi. System ciągle przetwarza 200 milisekund wejścia, generując 200 milisekund wyjścia, z obiema strumieniami tokenów przeplatanymi w tym samym cyklu zegarowym. Ta struktura pozwala modelowi przerwać użytkownikowi w trakcie zdania, zareagować na wskazówki wizualne bez pytania, lub mówić jednocześnie z użytkownikiem w zadaniach, takich jak tłumaczenie na żywo.

Architektura pomija ciężkie samodzielne kodery. Dźwięk jest podawany w postaci funkcji dMel przez lekki warstwę osadzania, obrazy są dzielone na fragmenty 40×40, a wszystkie komponenty są współszkolone od podstaw z transformatorami. Oddzielny model tła działa asynchronicznie, obsługując głębsze rozumowanie, wywołania narzędzi i przeglądanie sieci, podczas gdy model interakcji pozostaje obecny w rozmowie.

W oparciu o opublikowane przez firmę benchmarki, TML-Interaction-Small osiąga opóźnienie w turach o wartości 0,40 sekundy w teście FD-bench V1, w porównaniu z 1,18 sekundami dla GPT-Realtime-2.0 w trybie minimalnego myślenia i 0,57 sekundami dla Gemini-3.1-flash-live. W teście FD-bench V1.5, który ocenia jakość interakcji w przypadku przerwań użytkownika, kanałów wstecznych i mowy w tle, model osiąga wynik 77,8 w porównaniu z 46,8 dla GPT-Realtime-2.0 minimal i 45,5 dla Gemini-3.1-flash-live w trybie wysokiego myślenia. Wartości te są samoopisujące się.

Długo oczekiwana pierwsza dostawa

Wydanie zamyka długą lukę między finansowaniem a produktem. Thinking Machines zostało założone w lutym 2025 r., a w lipcu tego samego roku zamknęło rundę seed o wartości 2 miliardów dolarów przy wycenie 12 miliardów dolarów — powszechnie zgłaszane jako największa runda seed w historii. Rundę tę poprowadził Andreessen Horowitz z udziałem Nvidia (NVDA ), AMD, Cisco, Accel, ServiceNow (NOW ) i Jane Street. Do tej pory jedynym produktem, jaki firma wydała, było Tinker, API do fine-tuningu modeli o otwartych wagach, które zostało uruchomione w październiku 2025 r.

Przez następne miesiące nastąpiły burzliwe wydarzenia. Współzałożyciele Barret Zoph i Luke Metz opuścili firmę w styczniu 2026 r., aby wrócić do OpenAI, a Murati ogłosiła, że firma “rozstała się” z Zophem. Andrew Tulloch opuścił firmę, aby dołączyć do Meta’s Superintelligence Labs po tym, jak Mark Zuckerberg złożył ofertę wartą 1 miliard dolarów na wykup firmy, którą odrzucono. Meta zatrudniła od tego czasu pięciu członków założycieli laboratorium. W odpowiedzi Murati awansowała Soumith Chintalę, współtwórcę PyTorch, na stanowisko dyrektora technicznego. Planowana runda finansowania o wycenie około 50 miliardów dolarów nie została zamknięta do końca 2025 r.

Historia obliczeniowa poszła w przeciwnym kierunku. W marcu Thinking Machines ogłosiło partnerstwo z Nvidia, obejmujące nieujawnioną inwestycję i wdrożenie co najmniej jednego gigawata następnych systemów Vera Rubin. Laboratorium również rozszerzyło swoją relację z Google Cloud, aby objąć szkolenie modeli granicznych na sprzęcie Nvidia GB300.

Co obserwować

Model interakcji nie jest jeszcze dostępny dla przedsiębiorstw ani publiczności. Thinking Machines twierdzi, że ograniczona wersja zapowiedzi badawczej zostanie otwarta dla wybranych partnerów w nadchodzących miesiącach, a szersze wydanie nastąpi później w 2026 r. Firma planuje również wydać większe modele interakcji, zauważając, że obecna wersja 276B parametrów jest najmniejszą wersją, którą może obsłużyć przy wymaganym opóźnieniu.

Niezbędna jest niezależna weryfikacja roszczeń dotyczących benchmarków. FD-bench jest jednym z nielicznych publicznych benchmarków ukierunkowanych na jakość interakcji, a wyniki Thinking Machines nie zostały jeszcze odtworzone przez strony trzecie pod realistycznym obciążeniem. Testy proaktywności, które firma wprowadziła dla wskazówek wizualnych, w tym zmodyfikowane wersje RepCount-A, ProactiveVideoQA i Charades, to nowe instrumenty bez ustanowionego punktu odniesienia.

Strategiczna stawka jest bardziej ukierunkowana. Podczas gdy OpenAI, Anthropic i Google spędzili miniony rok na rozwijaniu zdolności agentów autonomicznych, Thinking Machines stawia, że następny oś centrów konkurencji będzie taki, jak ludzie komunikują się z AI — bliżej ciągłej rozmowy niż serii wskazówek. Model interakcji konkurował bezpośrednio z systemami głosowymi AI w czasie rzeczywistym wysyłanymi przez OpenAI, Google i rosnącą warstwę startupów skupionych na mowie. Czy architektura przetrwa kontakt z obciążeniami produkcyjnymi — długimi sesjami, niezawodnym połączeniem i ograniczeniami bezpieczeństwa odmowy w czasie rzeczywistym — jest testem, jaki następna runda podglądu nałoży.

Alex kieruje operacjami informacyjnymi Unite.AI opartymi na sztucznej inteligencji, łącząc dziennikarstwo, badania i automatyzację, aby wspierać terminowe i skalowalne relacjonowanie sztucznej inteligencji. Jego praca pomaga zapewnić, że nowe osiągnięcia w dziedzinie AI są prezentowane efektywnie, przy jednoczesnym zachowaniu standardów redakcyjnych publikacji.