โมเดลและแพลตฟอร์ม AI
ห้องปฏิบัติการ Thinking Machines ส่งมอบโมเดลแรกพร้อมการโต้ตอบแบบเรียลไทม์ใน 200 มิลลิวินาที

ห้องปฏิบัติการ Thinking Machines ซึ่งเป็นสตาร์ทอัพ AI ที่ก่อตั้งโดย Mira Murati อดีต CTO ของ OpenAI ได้เปิดตัวการแสดงตัวอย่างการวิจัยของโมเดลในบ้านแรกเมื่อวันที่ 11 พฤษภาคม 2026 ซึ่งเป็นการปิดช่องว่างมากกว่าหนึ่งปีของความเงียบเกี่ยวกับสิ่งที่ห้องปฏิบัติการจะสร้างจริงๆ บริษัทเรียกระบบนี้ว่า “โมเดลการโต้ตอบ” — สถาปัตยกรรมแบบหลายโหมดที่ฝึกฝนจากศูนย์เพื่อประมวลผลเสียง วิดีโอ และข้อความใน 200 มิลลิวินาที แทนที่จะรอให้ผู้ใช้เสร็จสิ้นการเปลี่ยน
โมเดลที่มีชื่อว่า TML-Interaction-Small เป็นระบบผสมผสานผู้เชี่ยวชาญ 276 พันล้านพารามิเตอร์ โดยมีพารามิเตอร์ 12 พันล้านพารามิเตอร์ที่ใช้งานอยู่ ตามที่ระบุใน โพสต์บล็อกประกาศ ของบริษัท เป็นผลิตภัณฑ์แรกจากห้องปฏิบัติการที่ได้รับเงิน约 2 พันล้านดอลลาร์ที่มีมูลค่า 12 พันล้านดอลลาร์ โดยไม่ได้ส่งมอบอะไรนอกจากเครื่องมือปรับแต่งที่ดี การเปิดตัวเกิดขึ้นระหว่างที่มีการกดดันอย่างต่อเนื่องจากผู้ที่ลาออกและรอบการระดมทุนต่อเนื่องที่หยุดชะงัก
สิ่งที่โมเดลการโต้ตอบทำจริงๆ
Thinking Machines แย้งว่าโมเดลแนวหน้าที่มีอยู่ในปัจจุบัน รวมถึง GPT-Realtime ของ OpenAI และ Gemini Live ของ Google (GOOGL ) ติดพฤติกรรมแบบเรียลไทม์เข้ากับสถาปัตยกรรมแบบเปลี่ยนโดยใช้ “อุปกรณ์” ของส่วนประกอบภายนอก เช่น การตรวจจับการเคลื่อนไหวของเสียง ส่วนประกอบเหล่านั้นตัดสินว่าผู้ใช้หยุดพูดแล้ว จากนั้นจึงส่งคำพูดที่เสร็จสมบูรณ์ไปยังโมเดล ในขณะที่โมเดลสร้างคำตอบ การรับรู้ของโมเดลเกี่ยวกับโลกจะหยุดชะงัก
โมเดลการโต้ตอบแทนที่โครงสร้างนั้นด้วยสิ่งที่บริษัทเรียกว่า ไมโคร-การเปลี่ยนที่สอดคล้องกับเวลา ระบบประมวลผล 200 มิลลิวินาทีของอินพุตในขณะที่สร้าง 200 มิลลิวินาทีของเอาต์พุต โดยมีกระแสโทเค็นซ้อนทั้งสองสอดคล้องกันในรอบนาฬิกีเดียวกัน โครงสร้างนั้นช่วยให้โมเดลสามารถขัดจังหวะผู้ใช้กลางประโยค ทำปฏิกิริยาต่อคำเตือนภาพโดยไม่ต้องขอ หรือพูดพร้อมกับผู้ใช้สำหรับงาน เช่น การแปลแบบเรียลไทม์
สถาปัตยกรรมนี้ข้ามตัวเข้ารหัสแบบสแตนด์อโลนอย่างหนัก เสียงถูกป้อนเข้ามาในรูปแบบ คุณลักษณะ dMel ผ่านชั้นการฝังที่เบา ภาพถูกแบ่งออกเป็นแพทช์ 40×40 และทุกส่วนประกอบจะถูกฝึกฝนจากศูนย์พร้อมกับทรานส์ฟอร์เมอร์ โมเดลพื้นหลังที่แยกออกมาจะทำงานแบบไม่สอดคล้องกัน โดยจัดการเหตุผลที่ลึกซึ้งยิ่งขึ้น การเรียกเครื่องมือ และการสำรวจเว็บ ในขณะที่โมเดลการโต้ตอบยังคงอยู่ในบทสนทนา
ตามที่บริษัทรายงาน TML-Interaction-Small โพสต์ความหน่วงในการเปลี่ยนของ 0.40 วินาทีใน FD-bench V1 เมื่อเทียบกับ 1.18 วินาทีสำหรับ GPT-Realtime-2.0 ในโหมดการคิดน้อยที่สุด และ 0.57 วินาทีสำหรับ Gemini-3.1-flash-live ในโหมดการคิดสูง ใน FD-bench V1.5 ซึ่งให้คะแนนคุณภาพการโต้ตอบทั่วการขัดจังหวะผู้ใช้ ช่องทางหลัง และเสียงพื้นหลัง โมเดลได้คะแนน 77.8 เมื่อเทียบกับ 46.8 สำหรับ GPT-Realtime-2.0 น้อยที่สุด และ 45.5 สำหรับ Gemini-3.1-flash-live ในโหมดการคิดสูง ตัวเลขเหล่านี้เป็นตัวเลขที่รายงานโดยบริษัทเอง
การจัดส่งครั้งแรกที่รอคอยมานาน
การเปิดตัวครั้งนี้ปิดช่องว่างระหว่างการระดมทุนและการส่งมอบผลิตภัณฑ์ Thinking Machines ก่อตั้งขึ้นในเดือนกุมภาพันธ์ 2025 และในเดือนกรกฎาคมของปีนั้นได้ปิดรอบการระดมทุน 2 พันล้านดอลลาร์ที่มีมูลค่า 12 พันล้านดอลลาร์ — ซึ่งรายงานอย่างกว้างขวางว่าเป็นรอบการระดมทุนเริ่มต้นที่ใหญ่ที่สุดในประวัติศาสตร์ รอบการระดมทุนนี้นำโดย Andreessen Horowitz โดยมีการเข้าร่วมจาก Nvidia (NVDA ), AMD, Cisco, Accel, ServiceNow (NOW ) และ Jane Street จนถึงตอนนี้ ผลิตภัณฑ์เดียวที่บริษัทจัดส่งคือ Tinker ซึ่งเป็น API สำหรับการปรับแต่งแบบโมเดลที่เปิดเผยหน่วยความจำ ซึ่งเปิดตัวในเดือนตุลาคม 2025
เดือนที่ผ่านมามีความไม่สงบ Co-ผู้ก่อตั้ง Barret Zoph และ Luke Metz ออกจากบริษัทในเดือนมกราคม 2026 เพื่อกลับไปที่ OpenAI โดย Murati ประกาศว่าบริษัทได้ “แยกทาง” กับ Zoph Andrew Tulloch ออกจากไปที่ Meta’s Superintelligence Labs หลังจากที่ Mark Zuckerberg มีข้อเสนอที่จะซื้อบริษัทโดยตรงด้วยมูลค่า 1 พันล้านดอลลาร์ ซึ่งถูกปฏิเสธ Meta ได้จ้างสมาชิกผู้ก่อตั้งห้าคนของห้องปฏิบัติการแล้ว Murati ตอบโต้โดยเลื่อน Soumith Chintala ซึ่งเป็นผู้สร้าง PyTorch ขึ้นเป็น CTO รอบการระดมทุนที่รายงานซึ่งมีมูลค่าประมาณ 50 พันล้านดอลลาร์ไม่ได้ปิดก่อนสิ้นปี 2025
เรื่องราวการประมวลผลเปลี่ยนไปในทางตรงกันข้าม ในเดือนมีนาคม Thinking Machines ประกาศความร่วมมือกับ Nvidia ซึ่งครอบคลุมการลงทุนที่ไม่ได้ระบุและติดตั้งระบบ Vera Rubin รุ่นต่อไปอย่างน้อยหนึ่ง گیกะวัตต์ ห้องปฏิบัติการยังขยายความสัมพันธ์กับ Google Cloud เพื่อให้ครอบคลุมการฝึกโมเดลแนวหน้าบนฮาร์ดแวร์ Nvidia GB300
สิ่งที่ต้องดู
โมเดลการโต้ตอบยังไม่มีให้บริการแก่ธุรกิจหรือสาธารณะ Thinking Machines ระบุว่าการแสดงตัวอย่างการวิจัยแบบจำกัดจะพร้อมให้กับคู่ค้าที่ได้รับการคัดเลือกในเดือนที่จะถึงนี้ โดยจะมีการเปิดตัวในวงกว้างมากขึ้นในภายหลังในปี 2026 บริษัทยังวางแผนจะปล่อยโมเดลการโต้ตอบที่ใหญ่ขึ้น โดยระบุว่าเวอร์ชันพารามิเตอร์ 276B ที่ใช้งานอยู่ในปัจจุบันเป็นรุ่นที่เล็กที่สุดที่สามารถให้บริการได้ที่ความหน่วงต่ำที่ต้องการ
การตรวจสอบอิสระของข้อเรียกร้องเกี่ยวกับเบンチมาร์กเป็นคำถามทันที FD-bench เป็นหนึ่งในเบンチมาร์กสาธารณะไม่กี่ตัวที่มุ่งเป้าไปที่คุณภาพการโต้ตอบ และคะแนนของ Thinking Machines ยังไม่ได้รับการยืนยันโดยบุคคลที่สามภายใต้ภาระการทำงานที่สมจริง การทดสอบความกระตือรือร้นสำหรับคำเตือนภาพที่บริษัทแนะนำ รวมถึงเวอร์ชันที่ปรับให้เหมาะสมของ RepCount-A, ProactiveVideoQA และ Charades เป็นเครื่องมือใหม่ที่ไม่มีเส้นฐานที่กำหนด
การเดิมพันเชิงกลยุทธ์มีความชัดเจนยิ่งขึ้น ในขณะที่ OpenAI, Anthropic และ Google ใช้เวลาหนึ่งปีที่ผ่านมาเพื่อผลักดันความสามารถของตัวแทนอิสระ Thinking Machines กำลังเดิมพันว่าแกนการแข่งขันครั้งถัดไปจะเป็น วิธีที่มนุษย์สื่อสารกับ AI — มากกว่าการเปลี่ยนเป็นการสนทนาต่อเนื่อง แทนที่จะเป็นชุดคำสั่ง โมเดลการโต้ตอบแข่งขันกับ ระบบ AI เสียงแบบเรียลไทม์ ที่กำลังจัดส่งจาก OpenAI, Google และสตาร์ทอัพขนาดใหญ่ที่เน้นการประมวลผลเสียงที่เติบโตขึ้นเรื่อยๆ การที่สถาปัตยกรรมสามารถทนต่อการทำงานในระดับผลิตได้หรือไม่ — การทำงานในระยะยาว การเชื่อมต่อที่ไม่น่าเชื่อถือ และข้อจำกัดด้านความปลอดภัยของการปฏิเสธแบบเรียลไทม์ — เป็นการทดสอบที่รอบการแสดงตัวอย่างครั้งถัดไปจะกำหนด












