สัมภาษณ์

Kismat Singh, ผู้ร่วมก่อตั้งและซีอีโอของ MachGen AI – ชุดสัมภาษณ์

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Kismat Singh, ผู้ร่วมก่อตั้งและซีอีโอของ MachGen AI, เป็นผู้บริหารด้านโครงสร้างพื้นฐาน AI และวิศวกรรมที่มีประสบการณ์มากกว่าสองทศวรรษในการสร้างระบบคอมพิวเตอร์ประสิทธิภาพสูงและระบบการเรียนรู้ของเครื่อง ก่อนที่จะร่วมก่อตั้ง MachGen AI, Singh ทำหน้าที่เป็นรองประธานฝ่ายวิศวกรรมสำหรับ AI Frameworks ที่ Intel และก่อนหน้านั้นดำรงตำแหน่งวิศวกรรมอาวุโสที่ NVIDIA, AMD, HP, และบริษัทเทคโนโลยีอื่น ๆ งานของเขารวมถึงการมีส่วนร่วมในไลบรารีและคอมไพเลอร์ deep learning, การปรับแต่ง AI framework, และการปรับปรุงความทนทานของการฝึกสอนในระดับ hyperscale ที่ Intel, เขามีส่วนร่วมอย่างใกล้ชิดกับโครงการ PyTorch ของบริษัทและได้พูดต่อสาธารณะเกี่ยวกับการทำให้ AI framework เข้าถึงได้ง่ายขึ้นบนแพลตฟอร์มฮาร์ดแวร์ที่หลากหลาย

MachGen AI เป็นบริษัทโครงสร้างพื้นฐาน AI ที่มุ่งเน้นทำให้โมเดลภาพและวิดีโอเชิงสร้างสรรค์ทำงานได้เร็วขึ้นและประหยัดต้นทุนอย่างมาก บริษัทก่อตั้งโดย Kismat Singh และ Manoj Krishnan กำลังพัฒนา stack การสรุปผลและการปรับจูนที่มีประสิทธิภาพสูงโดยออกแบบเฉพาะสำหรับโมเดล diffusion แทนการปรับใช้โครงสร้างพื้นฐานที่สร้างมาสำหรับโมเดลภาษาใหญ่ MachGen ปรับปรุงส่วนต่าง ๆ รวมถึงการคำนวณ attention, การแคช, เคอร์เนล GPU, การจัดการหน่วยความจำ, การทำงานขนาน, การกำหนดเวลา, และการปรับใช้ เพื่อลดความหน่วงของการสร้างขณะยังคงคุณภาพของโมเดล แพลตฟอร์มของบริษัทให้ API สำหรับการสร้างจากข้อความเป็นภาพ, ภาพเป็นภาพ, ข้อความเป็นวิดีโอ, ภาพเป็นวิดีโอ, และอ้างอิงเป็นวิดีโอ โดยเทคโนโลยีพื้นฐานมุ่งเน้นเปิดใช้งานแอปพลิเคชันความหน่วงต่ำ เช่น การสร้างเนื้อหาแบบโต้ตอบ, อวาตาร์แบบเรียลไทม์, เกม, และโฆษณาแบบส่วนบุคคล

คุณได้ทำงานด้านวิดีโอ, การคำนวณ GPU, และประสิทธิภาพ AI มากกว่าสองทศวรรษ รวมถึง TensorRT ที่ NVIDIA, ซอฟต์แวร์ AI ที่ Intel, การปรับแต่ง GPU ที่ AMD, และงานก่อนหน้านี้เกี่ยวกับการเข้ารหัสวิดีโอแบบเรียลไทม์ คุณเห็นอะไรบ้างในช่วงเวลานั้นที่ทำให้คุณตัดสินใจลาออกจากบริษัทเทคโนโลยีขนาดใหญ่และร่วมก่อตั้ง MachGen, และทำไมคุณเชื่อว่าการสรุปผล diffusion เป็นปัญหาโครงสร้างพื้นฐานที่คุ้มค่าที่จะสร้างบริษัทรอบ ๆ มัน?

ผู้ร่วมก่อตั้งของฉัน Manoj และฉันเล่นแบดมินตันที่ยิมเดียวกันเกือบ 10 ปี ส่วนใหญ่ของช่วงเวลานั้นเราพยายามจะจ้างกันและกัน ในที่สุดเราตัดสินใจว่าการทำงานร่วมกันง่ายกว่าการสรรหาให้กันและกันต่อไป

เหตุผลที่เราเลือกปัญหานี้คือเราทั้งสองได้เฝ้าดูสแตกการสรุปผลเติบโตจากภายใน ฉันช่วยสร้างทีมแพลตฟอร์มการสรุปผลของ NVIDIA แล้วต่อมานำทีมซอฟต์แวร์ AI ที่ Intel Manoj สร้างโครงสร้างพื้นฐานการฝึกโมเดลขนาดใหญ่เบื้องหลัง PyTorch ที่ Meta เราได้เห็นงานหลายปีเกี่ยวกับการแคช, การจัดกลุ่ม, การกำหนดเวลา, และเคอร์เนล ที่ทำให้ระบบวิจัย LLM ขั้นต้นเปลี่ยนเป็นโครงสร้างพื้นฐานการผลิตที่ให้บริการหลายแสนล้านโทเค็น

Diffusion อยู่ในระดับที่คล้ายกับการสรุปผลของ LLM เมื่อสามปีที่แล้ว โมเดลภาพและวิดีโอได้พัฒนาอย่างรวดเร็ว แต่ระบบที่ให้บริการยังคงช้า, มีค่าใช้จ่ายสูง, และยากต่อการขยายขนาด โครงสร้างพื้นฐานส่วนใหญ่ที่มีอยู่ถูกออกแบบมาสำหรับ LLM โดยที่ diffusion ถูกเพิ่มเข้ามาภายหลัง

สามประการที่ทำให้เวลานี้เหมาะสม: โมเดลมีคุณภาพเพียงพอที่จะสร้างผลิตภัณฑ์จริงได้, ปัญหาต้องการทักษะที่เราฝึกฝนมาตลอดอาชีพ, และผลกระทบมีขนาดใหญ่พอที่จะสร้างบริษัทรุ่นใหม่ได้ เมื่อวิดีโอที่เคยใช้เวลาหลายนาทีในการสร้างสามารถทำได้ในไม่กี่วินาทีด้วยต้นทุนเพียงส่วนเล็ก ๆ การสร้างแบบโต้ตอบ, โฆษณาแบบส่วนบุคคล, อวาตาร์เรียลไทม์, และผลิตภัณฑ์สร้างสรรค์ใหม่ทั้งหมดจึงเป็นไปได้

MachGen กล่าวว่าหลายเทคนิคที่ทำให้การสรุปผลของโมเดลภาษาใหญ่เปลี่ยนแปลงอย่างมากไม่สามารถถ่ายโอนไปยังโมเดล diffusion ได้อย่างราบรื่น สิ่งที่แตกต่างอย่างพื้นฐานในการให้บริการโมเดลภาพและวิดีโอคืออะไร, และจุดคอขวดด้านประสิทธิภาพที่ใหญ่ที่สุดที่โครงสร้างพื้นฐาน AI แบบดั้งเดิมมักมองข้ามอยู่ที่ไหน?

LLM และโมเดล diffusion มีรูปแบบการคำนวณที่แตกต่างอย่างพื้นฐาน LLM เป็นแบบออโต้รีเกรสซีฟ, มีขั้นตอน prefill ที่ใช้การคำนวณหนักตามด้วยการ decode ทีละโทเค็นที่ผูกกับหน่วยความจำ เทคนิคเช่น KV caching และการแยก prefill/decode ถูกออกแบบมาสำหรับโครงสร้างนั้น

โมเดล diffusion ไม่ใช่ออโต้รีเกรสซีฟและยังคงเป็นการคำนวณที่ใช้ทรัพยากรตลอดกระบวนการลดสัญญาณรบกวน การสร้างวิดีโอยังเกี่ยวข้องกับข้อมูลเชิงพื้นที่และเชิงเวลาในปริมาณมาก ทำให้ความต้องการต่าง ๆ เกี่ยวกับ attention, หน่วยความจำ, การสื่อสาร, และการทำงานขนานแตกต่างกัน

ผลก็คือหลายการปรับแต่งที่พัฒนาสำหรับ LLM ไม่สามารถถ่ายโอนได้อย่างราบรื่น KV caching แบบดั้งเดิมไม่แก้ปัญหาเดียวกัน การทำงานขนานมาตรฐานอาจทำให้เกิดภาระการสื่อสารที่มาก และเคอร์เนลโอเพ่นซอร์สที่มีอยู่ยังไม่สมบูรณ์นัก ตัวกำหนดเวลา, โมเดลหน่วยความจำ, ยุทธศาสตร์การแคช, เคอร์เนล, และการทำงานขนานทั้งหมดต้องออกแบบโดยคำนึงถึง diffusion เอง นั่นคือเหตุผลที่เราสร้าง MachGen โดยให้ diffusion เป็นส่วนสำคัญระดับแรก

MachGen รายงานว่ามีความหน่วงเวลาต่ำกว่าประมาณ 4–6 เท่าในบางโมเดลภาพและประมาณ 6 เท่าในหลายโมเดลวิดีโอขณะใช้โมเดลต้นฉบับที่ยังไม่ได้ทำ distillation สิ่งก้าวหน้าทางเทคนิคที่สำคัญที่สุดที่ทำให้ได้ผลลัพธ์เหล่านี้คืออะไร, และคุณทำอย่างไรเพื่อให้การปรับปรุงประสิทธิภาพไม่กระทบต่อคุณภาพของผลลัพธ์?

ผลการเพิ่มประสิทธิภาพมาจากหลายส่วนของสแตกที่ทำงานร่วมกัน การให้ความสนใจ (attention) ครอบคลุมส่วนใหญ่ของงบประมาณการคำนวณในโมเดลวิดีโอหลายตัว ดังนั้นเราจึงมุ่งเน้นที่สูตรความแม่นยำต่ำ (lower‑precision), attention แบบกระจาย (sparse attention) และเทคนิคที่เกี่ยวข้อง เราได้พัฒนาวิธีการแคชที่ใช้ประโยชน์จากความซ้ำซ้อนเชิงพื้นที่และเชิงเวลา, เคอร์เนลที่ปรับแต่งอย่างสูงสำหรับสถาปัตยกรรม diffusion, และเทคนิคการทำงานแบบขนานที่ลดภาระการสื่อสาร

เมื่อรวมกัน การปรับปรุงเหล่านี้ทำให้ MachGen สามารถให้บริการ HiDream ได้ในหนึ่งวินาทีเทียบกับหกวินาทีและ Flux ใน 1.5 วินาทีเทียบกับ 6.2 วินาที สำหรับวิดีโอ Wan 2.2 ทำงานใน 16.5 วินาทีเทียบกับ 98 วินาที ในขณะที่ LTX 2.3 ทำงานใน 10.7 วินาทีเทียบกับ 67 วินาที ค่าใช้จ่ายการอนุมาน (inference) ก็ลดลง 2–4 เท่าสำหรับโมเดลภาพและ 2–3 เท่าสำหรับวิดีโอ

ผลลัพธ์เหล่านี้ใช้โมเดลดั้งเดิมที่ไม่ได้ผ่านการ distill. เรากำลังปรับปรุงการทำงานของโมเดลโดยไม่ลดทอนคุณภาพของผลลัพธ์ สำหรับการนำไปใช้ในผลิตภัณฑ์จริง ความเร็ว, ค่าใช้จ่าย, และคุณภาพต้องทำงานร่วมกัน

Trusted TV เป็นตัวอย่างที่น่าสนใจ เพราะการลดระยะเวลาการสร้างจากหลายนาทีเหลือเป็นวินาทีเปลี่ยนแปลงมากกว่าตัวเลขค่าใช้จ่ายโครงสร้างพื้นฐาน เมื่อการสร้างวิดีโอเร็วพอที่จะผลิตแคมเปญหลายพันรายการและรูปแบบครีเอทีฟที่ปรับให้เป็นส่วนบุคคลได้แล้ว โมเดลธุรกิจหรือประสบการณ์ผลิตภัณฑ์ใหม่ใดบ้างที่กลายเป็นไปได้ ซึ่งก่อนหน้านี้ไม่สามารถทำได้

TrustedTV ช่วยธุรกิจสร้างโฆษณาที่พร้อมออกอากาศด้วย AI และเผยแพร่บนแพลตฟอร์มทีวีเชื่อมต่อเช่น Prime Video, Roku, และ DirecTV ลูกค้าส่วนใหญ่เป็นธุรกิจขนาดเล็ก การทำโฆษณาทีวีแบบดั้งเดิมต้องใช้ทีมถ่ายทำและตัดต่อ โดยค่าใช้จ่ายเริ่มจากหลายพันดอลลาร์และมักสูงถึงหลายหมื่นดอลลาร์ Trusted TV ทำให้ค่าใช้จ่ายเหล่านี้เป็นศูนย์ เจ้าของธุรกิจขนาดเล็กสามารถสร้างโฆษณาครบถ้วนจากสมาร์ทโฟนได้ประมาณห้านาทีและดูผลลัพธ์ก่อนชำระเงินแล้ว มีแคมเปญมากกว่า 10,000 รายการถูกสร้างบนแพลตฟอร์มนี้

Ian, CEO ของ Trusted TV, เห็นผลการวัดความหน่วงของ MachGen บน Artificial Analysis แล้วไม่เชื่อ เขาจึงสมัครทดสอบด้วยตนเอง การเรนเดอร์ครั้งแรกของเขากลับมาประมาณ 25 วินาทีโดยไม่มีการสูญเสียคุณภาพ และเมื่อเขาทดสอบการทำงานพร้อมกัน ผลการปรับปรุงยังคงอยู่ในระดับขนาดใหญ่ พวกเขาย้ายกระบวนการผลิตทั้งหมดไปยัง MachGen ภายในเวลาไม่ถึง 48 ชั่วโมง และตอนนี้ MachGen เป็นแรงขับหลักสำหรับการสร้างวิดีโอใหม่ทั้งหมดของพวกเขา ในการปรับใช้ล่าสุด เราอยู่ใกล้ 10 หรือ 11 วินาทีสำหรับโมเดลนั้น และเราจะพัฒนาต่อไป

ผลของผลิตภัณฑ์คือผู้โฆษณาจะหยุดทำโฆษณาทั่วไปเพียงหนึ่งหรือสองชิ้น ผู้ใช้ของพวกเขาจะหมุนเวียนโฆษณาใหม่สองหรือสามชิ้นต่อสัปดาห์ ทดสอบครีเอทีฟในกลุ่มผู้ชมต่าง ๆ และทำการปรับปรุงต่อเนื่องแทนการตัดสินใจครั้งเดียว สิ่งต่อไปที่เกิดขึ้นคือการปรับแต่งตามภูมิศาสตร์และระดับผู้ชมในระดับใหญ่ ซึ่งก่อนหน้านี้สงวนไว้สำหรับบริษัทที่มีงบหลายล้านดอลลาร์

เวอร์ชันที่ฉันคิดถึงส่วนตัว: วันนี้ฉันเห็นโฆษณารองเท้าที่ถ่ายบนถนนในแมนฮัตตัน ฉันอาศัยอยู่ใน Bay Area ดังนั้นมันไม่มีความหมายสำหรับฉัน สิ่งที่ฉันต้องการคือโฆษณาเดียวกันที่มีภูเขา Mission Peak เป็นพื้นหลัง นั่นไม่ใช่โฆษณาที่ถูกลง; มันเป็นรูปแบบการโฆษณาที่ต่างออกไป และจะคุ้มค่าเชิงเศรษฐกิจได้เมื่อการสร้างเร็วและราคาถูกพอที่จะทำหลายพันรูปแบบ

สำหรับบริษัทที่ฝังการสร้างภาพหรือวิดีโอโดยตรงลงในผลิตภัณฑ์ พวกเขาควรพิจารณาเรื่องเศรษฐศาสตร์ของการอนุมานอย่างไร? ที่ระดับใด การเพิ่มประสิทธิภาพการใช้ GPU จะกลายเป็นสิ่งสำคัญเชิงกลยุทธ์ มากกว่าการจ่ายค่าใช้บริการ API ต่อการสร้างแต่ละครั้ง?

จุดเปลี่ยนเกิดขึ้นเมื่อการอนุมานเริ่มส่งผลต่อประสบการณ์ของลูกค้าหรือกำไรของบริษัท

API แบบอเนกประสงค์อาจเหมาะสมในช่วงที่ทีมกำลังตรวจสอบผลิตภัณฑ์ เมื่อการสร้างกลายเป็นส่วนสำคัญของผลิตภัณฑ์นั้น ทีมต้องมองไกลกว่าราคาต่อผลลัพธ์ที่ระบุไว้ ความหน่วง, ความพร้อมทำงานพร้อมกัน, คุณภาพ, ความน่าเชื่อถือ, และการใช้ GPU ทั้งหมดกลายเป็นส่วนหนึ่งของเศรษฐศาสตร์

การสร้างอาจดูเหมือนราคาถูก แต่หากผู้ใช้ต้องรอหลายนาทีและละทิ้งกระบวนการก็ยังเป็นปัญหาทางธุรกิจ สถาปัตยกรรมที่ต้องการความจุ GPU เพิ่มขึ้นตามอัตราการใช้ก็จะทำให้กำไรต้องเผชิญความกดดันที่เพิ่มขึ้น

ไม่มีเกณฑ์ปริมาณคำขอเดียวที่กำหนดได้ เนื่องจากการคำนวณที่ต้องใช้สำหรับคลิปสั้น 540p แตกต่างอย่างมากจากวิดีโอ 1080p ที่ยาวกว่า การปรับแต่งจะกลายเป็นเชิงกลยุทธ์เมื่อการใช้ที่เพิ่มขึ้นทำให้ค่าใช้จ่ายเพิ่มขึ้นในอัตราใกล้เคียง ความต้องการสูงสุดทำให้เกิดคิว หรือความหน่วงเริ่มจำกัดประสบการณ์ของผลิตภัณฑ์

MachGen ทำงานข้ามหลายชั้น รวมถึงเคอร์เนล GPU ที่กำหนดเอง, การแคช, การเพิ่มความแม่นยำ, การจัดตาราง, และการทำงานแบบขนาน เมื่อโมเดลพัฒนาอย่างรวดเร็ว คุณคิดว่าชั้นใดของสแตกการอนุมานยังมีโอกาสสูงสุดสำหรับการปรับปรุงความเร็วและต้นทุนอย่างมาก?

สำหรับการสร้างวิดีโอ, attention เป็นหนึ่งในโอกาสที่เหลืออยู่ใหญ่ที่สุด เนื่องจากมันครอบคลุมส่วนใหญ่ของงบประมาณการคำนวณในหลายโมเดล ยังมีพื้นที่สำคัญในการปรับปรุงสูตรความแม่นยำต่ำ, attention แบบกระจาย, และเคอร์เนล attention เฉพาะ diffusion

Attention เป็นเพียงส่วนหนึ่งของโอกาส การเพิ่มประสิทธิภาพโดยรวมที่ใหญ่ที่สุดจะมาจากการรวมการปรับปรุงทั่วสแตก ตัวอย่างคือการแคช เทคนิคการแคช KV ที่ใช้ใน LLMs ไม่สามารถถ่ายโอนโดยตรงได้ แต่โมเดล diffusion มีความซ้ำซ้อนเชิงพื้นที่และเชิงเวลาที่สามารถใช้ประโยชน์ได้ด้วยวิธีที่เหมาะสม

การทำงานแบบขนานเป็นโอกาสอีกประการหนึ่ง การเพิ่ม GPU ไม่ได้ทำให้ความเร็วเพิ่มขึ้นตามสัดส่วนโดยอัตโนมัติ เนื่องจากค่าโอเวอร์เฮดของการสื่อสารอาจชดเชยประโยชน์นั้น เราพัฒนาเคอร์เนลที่ปรับแต่งเฉพาะซึ่งทำให้การสื่อสารทับซ้อนกับการคำนวณที่ไม่ขึ้นกับข้อมูลและจัดลำดับการทำงานร่วมกับงานที่ขึ้นกับข้อมูล

การให้ความสนใจ, แคช, เคอร์เนล, การทำงานแบบขนาน, หน่วยความจำและการจัดตารางทั้งหมดส่งผลต่อกันและกัน การปรับแต่งเพียงชั้นเดียวในที่สุดจะทำให้เกิดคอขวดที่ส่วนอื่น การปรับปรุงที่ใหญ่ที่สุดจะมาจากการมองสแต็กเป็นระบบครบวงจรที่ออกแบบมาสำหรับโปรไฟล์การคำนวณของ diffusion

ด้วยโมเดลวิดีโอรุ่นใหม่ที่ทำให้เวลาการสร้างใกล้เคียงกับเวลาจริง เราอยู่ห่างแค่ไหนจากวิดีโอเชิงสร้างที่โต้ตอบได้จริง ๆ และอุปสรรคทางเทคนิคใดบ้างที่ยังต้องเอาชนะก่อนที่การสร้างวิดีโอแบบเรียลไทม์จะกลายเป็นเรื่องปกติ

เรากำลังบรรลุความเร็วเชิงโต้ตอบสำหรับบางแอปพลิเคชันแล้ว MachGen สร้างวิดีโอ Vidu Q3 Turbo ความยาวห้าวินาทีที่ความละเอียด 720p ได้ในประมาณหวินาทีและที่ 540p ในน้อยกว่าสามวินาที ความเร็วนี้เพียงพอสำหรับการทำซ้ำเชิงสร้างสรรค์อย่างรวดเร็วและทำให้อวาตาร์ตอบสนองและวิดีโอเชิงโต้ตอบอยู่ในมือ

ตัวอย่างของสิ่งที่ผมคิดว่าการโต้ตอบหมายถึงอย่างไร ลองจินตนาการว่าคุณกำลังดูเรื่องราวและคุณสามารถเห็นว่าจบลงอย่างไรและคุณไม่ชอบมัน แทนที่จะนั่งรับชมอย่างเฉย ๆ คุณเปลี่ยนทิศทาง: ตัวละครสองคนควรไปค้นหาว่าสิ่งที่ตัวละครที่สามซ่อนอยู่คืออะไรและเผชิญหน้ากับเขาแทนที่จะปล่อยให้เรื่องดำเนินต่อไป เนื้อหาที่คุณควบคุมแทนที่จะเป็นเนื้อหาที่คุณรับ นั่นคือสิ่งที่การสร้างที่เร็วและราคาถูกทำให้เป็นไปได้และมันเปลี่ยนแปลงเกือบทุกอย่างที่เราบริโภค

การไปถึงจุดนั้นมักต้องอาศัยเกณฑ์วัดความหน่วงหลายตัวที่แข็งแรง ประสบการณ์ทั้งหมดต้องคงความตอบสนองได้ภายใต้การจราจรการผลิตพร้อมคงคุณภาพภาพ ความสม่ำเสมอระหว่างเฟรม และต้นทุนที่คาดการณ์ได้ วิดีโอที่ยาวขึ้น ความละเอียดที่สูงขึ้นและคำขอพร้อมกันทั้งหมดเพิ่มภาระโครงสร้างพื้นฐาน และระบบยังต้องจัดสรรความจุ เส้นทางคำขอ และฟื้นฟูจากความล้มเหลวของฮาร์ดแวร์โดยผู้ใช้ไม่สังเกตเห็น

มันจะมาถึงตามกรณีการใช้งาน ทีละกรณี คลิปสั้น, อวาตาร์, เกมและเครื่องมือสร้างสรรค์น่าจะเป็นกลุ่มแรกที่ได้รับประโยชน์ เพราะการสร้างที่วัดเป็นวินาทีเพียงพอสำหรับพวกเขาแล้ว เมื่อคุณภาพโมเดลและประสิทธิภาพการสรุปผลพัฒนาขึ้นพร้อมกัน แอปพลิเคชันเพิ่มเติมจะข้ามเกณฑ์นั้น

เมื่อเอเจนต์ AI สร้างภาพและวิดีโอโดยอัตโนมัติมากขึ้นแทนการรอให้มนุษย์กดปุ่ม ความต้องการโครงสร้างพื้นฐานจะเปลี่ยนแปลงอย่างไร? งานที่ขับเคลื่อนโดยเอเจนต์สร้างความต้องการที่แตกต่างอย่างพื้นฐานในด้านความหน่วง, ความพร้อมทำงานพร้อมกัน, ต้นทุนและความน่าเชื่อถือหรือไม่

เอเจนต์หนึ่งจะเปลี่ยนคำขอของผู้ใช้เดียวให้กลายเป็นงานสร้างหลายสิบหรือหลายร้อยงาน มันสร้างตัวเลือกหลายแบบ ประเมินผล, ปรับคำสั่งใหม่และทำซ้ำกระบวนการโดยไม่มีการแทรกแซงของมนุษย์ระหว่างขั้นตอน

สิ่งนั้นทำให้ความหน่วง, ความพร้อมทำงานพร้อมกัน, ต้นทุนและความน่าเชื่อถือมีความสำคัญมากยิ่งขึ้น หากการสร้างแต่ละครั้งใช้เวลาหลายนาที กระบวนการทำงานของเอเจนต์จะช้าเกินกว่าจะเป็นประโยชน์ หากแต่ละครั้งมีค่าใช้จ่ายสูง การทำซ้ำอัตโนมัติจะไม่คุ้มค่าเชิงเศรษฐกิจ ระบบยังต้องรับมือกับคำขอพร้อมกันจำนวนมากอย่างเชื่อถือได้ เพราะความล้มเหลวเพียงครั้งเดียวอาจทำให้โซ่ของงานทั้งหมดหยุดชะงัก

นี่คือจุดที่ความสามารถเช่น การจัดสรร GPU, การปรับขนาดอัตโนมัติและการกำหนดเส้นทางมีความสำคัญเท่ากับการปรับแต่งระดับโมเดล ความต้องการของเอเจนต์มีความกระตุกมากกว่าความต้องการจากแอปพลิเคชันสร้างสรรค์ที่ผู้ใช้กดปุ่ม

หน่วยงานที่เกี่ยวข้องไม่ได้เป็นเพียงภาพหรือวิดีโอเดียวอีกต่อไป แต่เป็นวงจรเต็มของการสร้าง, การประเมินและการปรับปรุงเนื้อหา โครงสร้างพื้นฐานต้องทำให้วงจรทั้งหมดนั้นเร็ว, มีต้นทุนที่สมเหตุสมผลและเชื่อถือได้

มีการแข่งขันอย่างดุเดือดระหว่างผู้ให้บริการ GPU, คลาวด์สรุปผล, ผู้พัฒนาโมเดลและแพลตฟอร์มการปรับแต่ง เมื่อฮาร์ดแวร์เองเร็วขึ้น ทำไมบริษัทต่าง ๆ ยังต้องการชั้นสรุปผลเฉพาะเช่น MachGen แทนที่จะพึ่งพาการปรับปรุงจาก NVIDIA, AMD, ผู้ให้บริการคลาวด์ หรือผู้พัฒนาโมเดลเอง

ฮาร์ดแวร์ที่เร็วขึ้นยกเพดานขึ้น ซอฟต์แวร์กำหนดว่าจะถึงส่วนใดของเพดานนั้น

เราได้เห็นปรากฏการณ์นี้กับ LLMs ตัวเร่งใหม่ ๆ ปรับปรุงประสิทธิภาพดิบในทุกเจนเนอเรชัน และการทำ batch อย่างต่อเนื่อง, การจัดการ KV‑cache, การถอดรหัสเชิงสเปคคิวเลทีฟ, และเคอร์เนลเฉพาะยังคงเป็นสิ่งที่ทำให้อุตสาหกรรมบรรลุอัตราการผลิตระดับการผลิตและด้านเศรษฐกิจ ไม่มีส่วนใดจากฮาร์ดแวร์

การปรับแต่งเส้นทางการผลิตเต็มรูปแบบสำหรับการสร้างภาพและวิดีโออย่างต่อเนื่องเป็นงานที่แตกต่างจากสิ่งที่ผู้จำหน่ายฮาร์ดแวร์, ผู้ให้บริการคลาวด์และผู้พัฒนาโมเดลทำอยู่ และไม่ได้เป็นลำดับความสำคัญหลักของใครเลย

มีหลายแนวทางสำหรับงานนั้น หนึ่งคือโมเดลตลาดที่รวมโมเดลและกำหนดเส้นทางคำขอ เราไม่คิดว่าวิธีนี้จะยั่งยืนในระยะยาว เพราะไม่มีการควบคุมชั้นที่ประสิทธิภาพอยู่ เราเลือกสร้างสแต็กด้วยตนเองและโฮสต์แบบเนทีฟ ซึ่งเป็นวิธีเดียวที่จะทำให้ได้ตัวเลขความหน่วงและต้นทุนที่เราต้องการ

ซึ่งหมายถึงการปรับจูน attention, caching, kernels, precision, memory และ parallelism สำหรับแต่ละโมเดลและแต่ละ accelerator พร้อมสนับสนุน managed APIs, dedicated cloud และการปรับใช้แบบ self-hosted จำนวนโมเดลและตัวเลือกฮาร์ดแวร์ที่เพิ่มขึ้น ความซับซ้อนก็เพิ่มตามไปด้วย บทบาทของเราคือการดูดซับสิ่งเหล่านี้เพื่อให้ลูกค้าของเราสามารถใช้เวลาของพวกเขาไปกับสิ่งที่ทำให้ผลิตภัณฑ์ของพวกเขาแตกต่างออกไป

คุณได้อธิบาย world models ว่าเป็นส่วนหนึ่งของวิสัยทัศน์ระยะยาวของ MachGen ซึ่งคุณลักษณะเชิงคำนวณหลายอย่างของมันคล้ายกับ diffusion workloads สิ่งที่โครงสร้างพื้นฐานสำหรับ world models ขนาดการผลิตต้องเป็นอย่างไร และแอปพลิเคชันใดบ้างที่จะเป็นไปได้หากการสร้างและจำลองสภาพแวดล้อมภาพกลายเป็นราคาถูกและตอบสนองเร็วเท่ากับการสร้างข้อความในวันนี้

วิธีหนึ่งในการมองแพลตฟอร์มของเราคือคล้ายกับ LLM แบบทั่วไป โมเดลเดียวกันร่างสัญญากฎหมายและตอบคำถามเกี่ยวกับร้านอาหาร สำหรับเรา แสต็กเดียวกันให้บริการบริษัท video avatar, AI advertising, การสร้างเรื่องราวและ microdrama และในที่สุดก็ world models แนวอุตสาหกรรมต่าง ๆ มีปัญหาด้านประสิทธิภาพพื้นฐานเดียวกัน

World models ยังไม่ใช่ธุรกิจหลักของเราตอนนี้ แต่เป็นสิ่งที่เรากำลังมุ่งสร้างและกำลังทำงานอย่างแข็งขันกับมัน World models ขนาดการผลิตจะต้องมี throughput สูงมากและ latency ต่ำมาก เนื่องจากมันสร้างและอัปเดตสภาพแวดล้อมอย่างต่อเนื่องแทนที่จะผลิตผลลัพธ์เดียว พวกมันยังต้องการความสอดคล้องเชิงพื้นที่และเชิงเวลา ความสามารถในการตอบสนองต่อการกระทำ และบ่อยครั้งต้องสามารถจำลองผลลัพธ์หลาย ๆ แบบพร้อมกัน สิ่งนี้สร้างปัญหาที่ยากในด้านหน่วยความจำ การเคลื่อนย้ายข้อมูล parallelism และความน่าเชื่อถือ โมเดลโลกที่ขับเคลื่อน robot หรือเกมไม่สามารถใช้เวลาหลายนาทีในการสร้างสถานะถัดไปได้ ประสิทธิภาพเป็นตัวกำหนดว่าระบบเหล่านี้จะใช้งานได้หรือไม่

ในเชิงคอมพิวเตอร์ world models ในปัจจุบันดูคล้ายกับ diffusion models มาก ดังนั้นสแตกที่เรากำลังสร้างอยู่ตอนนี้จึงเป็นพื้นฐานที่เป็นธรรมชาติ ยังไม่มีชั้นการให้บริการระดับ production‑grade ที่สมบูรณ์สำหรับพวกมันเทียบได้กับสิ่งที่มีสำหรับ LLMs เราตั้งใจจะสร้างมันขึ้น

หากการจำลองมีความตอบสนองและต้นทุนที่ต่ำเท่ากับการสร้างข้อความในตอนนี้ หุ่นยนต์จะสามารถฝึกซ้อมสถานการณ์หายากก่อนเผชิญหน้า เกมจะสามารถสร้างสภาพแวดล้อมที่ตอบสนองต่อผู้เล่นแต่ละคน และนักออกแบบจะสามารถทดสอบหลายสิบทางเลือกก่อนที่จะสร้างในโลกจริง Diffusion คือสิ่งที่เรามีรายได้ในวันนี้ World models คือดวงดาวเหนือของเรา

ขอบคุณสำหรับการสัมภาษณ์ที่ยอดเยี่ยม ผู้อ่านที่ต้องการเรียนรู้เพิ่มเติมควรเยี่ยมชม MachGen AI.

อองตวนเป็นผู้นำที่มีวิสัยทัศน์และเป็นหุ้นส่วนผู้ก่อตั้งของ Unite.AI โดยมีความหลงใหลที่ไม่สั่นคลอนในการ塑造และ推廣อนาคตของ AI และหุ่นยนต์ เขาเป็นผู้ประกอบการซีรีย์ที่เชื่อว่า AI จะมีผลกระทบต่อสังคมมากเท่ากับไฟฟ้า และมักจะพูดถึงศักยภาพของเทคโนโลยีที่เป็นนวัตกรรมและ AGI

ในฐานะ นักอนาคต เขาได้ทำการสำรวจว่านวัตกรรมเหล่านี้จะเปลี่ยนแปลงโลกของเราอย่างไร นอกจากนี้เขายังเป็นผู้ก่อตั้ง Securities.io ซึ่งเป็นแพลตฟอร์มที่มุ่งเน้นในการลงทุนในเทคโนโลยีที่ทันสมัยที่สุดซึ่งกำลังเปลี่ยนแปลงอนาคตและเปลี่ยนแปลงอุตสาหกรรมทั้งหมด