AI 모델 및 플랫폼

실시간 200ms 상호작용 모델을 갖춘 Thinking Machines Lab의 첫 번째 모델 출하

mm
Unite.AI를 Google의 선호 소스에 추가

Thinking Machines Lab, 전 오픈AI CTO였던 Mira Murati가 설립한 AI 스타트업은 2026년 5월 11일, 첫 번째 자체 모델의 연구 예측을 발표했으며, 이는 약 1년 동안의 침묵을 깨뜨린 것으로, 이 랩이 실제로 무엇을 구축할지에 대한 궁금증을 해소했다. 이 회사는 이 시스템을 “상호작용 모델”이라고 부르며, 이는 오디오, 비디오, 텍스트를 200밀리초 단위로 처리하는 멀티모달 아키텍처로, 사용자가 턴을 끝낼 때까지 기다리지 않고 200밀리초 단위로 처리한다.

이 모델은 TML-Interaction-Small이라고 불리며, 2760억 파라미터의 전문가 혼합 시스템으로, 120억 개의 활성 파라미터를 갖는다. 회사의 발표 블로그 게시물에 따르면, 이는 약 2억 달러의 자금을 조달하고 120억 달러의 평가를 받은 후 실제로 출하된 첫 번째 제품이다. 이 출시에는 인재 유출과 후속 자금 조달이 지연되는 등 지속적인 압력이 가해지고 있다.

상호작용 모델이 실제로 하는 일

Thinking Machines는 현재 전위 모델,包括 오픈AI의 GPT-Realtime와 Google의 Gemini Live가 실제 시간 동작을 턴 기반 아키텍처에 볼트하는 것을 주장한다. 이러한 구성 요소는 사용자가 말하는 것을 중지했는지 결정한 다음 완성된 발화를 모델에 전달한다. 모델이 응답을 생성하는 동안, 모델의 세계에 대한 인식은 동결된다.

상호작용 모델은 이러한 스카폴딩을 시간 정렬 마이크로 턴으로 대체한다. 시스템은 200밀리초의 입력을 처리하는 동시에 200밀리초의 출력을 생성하며, 두 개의 토큰 스트림은 동일한 클록 사이클에서 교차한다. 이러한 구조로 인해 모델은 사용자의 문장 중간에 중단할 수 있으며, 요청 없이 시각적 신호에 반응하거나, 라이브 번역과 같은 작업을 위해 사용자와 동시에 말할 수 있다.

오디오는 dMel 특징을 통해 가벼운 임베딩 레이어를 통해 입력되며, 이미지들은 40×40 패치로 분할되며, 모든 구성 요소는 트랜스포머와 함께 스크래치에서 공동으로 교육된다. 별도의 백그라운드 모델은 비동기적으로 실행되며, 더 깊은推論, 도구 호출 및 웹 브라우징을 처리하는 반면 상호작용 모델은 대화에서 현재 상태를 유지한다.

회사의 보고된 벤치마크에 따르면, TML-Interaction-Small은 FD-bench V1에서 0.40초의 턴 테이킹 지연을 나타낸다. 이는 GPT-Realtime-2.0의 1.18초 및 Gemini-3.1-flash-live의 0.57초와 비교된다. FD-bench V1.5에서, 사용자 Interruptions, 백채널 및 배경 음성에 대한 상호작용 품질을 평가하며, 모델은 77.8의 점수를 얻는다. 이는 GPT-Realtime-2.0의 46.8 및 Gemini-3.1-flash-live의 45.5와 비교된다. 이러한 수치는 자체 보고된 수치이다.

오랜 시간 기다려온 첫 번째 출하

이 출시로 인해 자금과 제품 사이의 간격이 닫혔다. Thinking Machines는 2025년 2월에 설립되었으며, 같은 해 7월에 120억 달러의 평가를 받은 2억 달러의 시드 ра운드를 마감했다. 이 라운드는 Andreessen Horowitz가 주도했으며, Nvidia (NVDA ), AMD, Cisco, Accel, ServiceNow (NOW ), Jane Street가 참여했다. 지금까지 회사의 유일한 출하 제품은 Tinker였으며, 이는 2025년 10월에 출시된 오픈 웨이트 모델을 미세 조정하기 위한 API이다.

그 사이에 회사는 혼란을 겪었다. 공동 설립자 Barret Zoph와 Luke Metz는 2026년 1월에 오픈AI로 돌아갔으며, Murati는 회사가 “Zoph와의 관계를 끊었다”고 발표했다. Andrew Tulloch는 Mark Zuckerberg의 10억 달러의 인수 제안을 거부한 후 Meta의 Superintelligence Labs로 이동했다. Meta는 이후 랩의 5명의 창립 멤버를 고용했다. Murati는 PyTorch의 공동 창립자인 Soumith Chintala를 CTO로 승진시켰다. 약 500억 달러의 평가를 받은 후속 라운드는 2025년 말까지 마감되지 않았다.

컴퓨팅 스토리는 반대 방향으로 이동했다. 3월에 Thinking Machines는 Nvidia와의 파트너십을 발표했으며, 이는 공개되지 않은 투자와 최소 1ギ가와트의 차세대 Vera Rubin 시스템의 배치를 포함했다. 랩은 또한 Nvidia GB300 하드웨어에서 프론티어 모델 훈련을 포함하는 Google Cloud 관계를 확대했다.

시청할 것

상호작용 모델은 아직 기업이나 대중에게 공개되지 않았다. Thinking Machines는 제한된 연구 예측이 향후 몇 개월 안에 선택된 파트너에게 공개될 것이라고 말했으며, 더 넓은 출시가 2026년 말에 이루어질 것이라고 말했다. 회사는 또한 더 큰 상호작용 모델을 출시할 계획이며, 현재 2760억 파라미터 버전은 필요한 지연 시간에서 제공할 수 있는 가장 작은 변형이라고 말했다.

벤치마크 주장의 독립적 검증은 즉각적인 질문이다. FD-bench는 상호작용 품질을 대상으로 하는 몇 가지 공개 벤치마크 중 하나이며, Thinking Machines의 점수는 아직 제3자에 의해 현실적인 부하에서 재현되지 않았다. 회사가 도입한 시각적 신호를 위한 프로액티브 테스트, 포함된 RepCount-A, ProactiveVideoQA 및 Charades의 적응된 버전은 새로운 도구로, 기존 기준이 없다.

전략적 베팅은 더 뚜렷하다. 오픈AI, Anthropic, Google가 지난 1년 동안 자율 에이전트 기능을 강화하는 동안, Thinking Machines는 다음 경쟁 축이 인간과 AI가 어떻게 소통하는지에 관한 것이라고 베팅하고 있다. 이는 연속적인 대화보다는 일련의 프롬프트에 더 가깝다. 상호작용 모델은 오픈AI, Google 및 성장하는 스피치 중심 스타트업에서 출하되는 실제 시간 음성 AI 시스템과 가장 직접적으로 경쟁한다. 이 아키텍처가 생산 워크로드, 긴 세션, 신뢰할 수 없는 연결 및 실제 시간 거부의 안전 제약과 접촉했을 때 살아남는지 여부는 다음 미리 보기 라운드에서 테스트할 것이다.

Alex McFarland은 인공 지능의 최신 개발을 탐구하는 AI 저널리스트이자 작가입니다. 그는 전 세계의 수많은 AI 스타트업과 출판물들과 협력했습니다.