หุ่นยนต์และ AI ทางกายภาพ
มิมิค โรบอติกส์ เปิดตัว FLUX-mimic สู่โรงงานออดี้ ด้วยโมเดลการเรียนรู้ของหุ่นยนต์จากวิดีโอ

มิมิค โรบอติกส์ ได้เปิดตัว FLUX-mimic โมเดลการเรียนรู้ของหุ่นยนต์ใหม่ที่ออกแบบมาเพื่อช่วยให้หุ่นยนต์ทางอุตสาหกรรมเรียนรู้การทำงานที่ซับซ้อนจากข้อมูลการแสดงตัวอย่างที่น้อยกว่ามาก
พัฒนาโดยความร่วมมือกับบริษัท Black Forest Labs ซึ่งเป็นบริษัท AI ที่มุ่งเน้นการทำงานด้านการเห็น FLUX-mimic ได้รับการทดสอบและใช้งานร่วมกับออดี้ในการผลิตที่มีความยากในการทำงานอัตโนมัติ รวมถึงการทำงานกับวัสดุอ่อน การเปลี่ยนแปลงรูปแบบส่วนประกอบ และการควบคุมที่แม่นยำ
การประกาศครั้งนี้ชี้ให้เห็นว่าอาจมีการเปลี่ยนแปลงในด้าน AI ทางกายภาพ โดยไม่พึ่งพาข้อมูลการแสดงตัวอย่างของหุ่นยนต์เป็นหลัก FLUX-mimic พยายามที่จะถ่ายทอดความรู้ที่ได้เรียนรู้จากโมเดลวิดีโอสร้างสรรค์ไปยังระบบที่สามารถควบคุมเครื่องจักรในโลกแห่งความเป็นจริง
แนวทางใหม่ในการเรียนรู้ของหุ่นยนต์
ระบบหุ่นยนต์ทั่วไปในปัจจุบันใช้โมเดล Vision-Language-Action หรือ VLA ซึ่งรวมถึงโมเดลที่ฝึกอบรมจากภาพและภาษาเข้าด้วยกัน และส่วนประกอบที่คาดการณ์การเคลื่อนไหวของหุ่นยนต์
แนวทางนี้ทำให้หุ่นยนต์มีความเข้าใจเชิงсемานติก เช่น การรู้จักวัตถุหรือการแปลคำสั่งเขียน แต่ภาพนิ่งไม่สามารถจับภาพการเคลื่อนไหวของวัตถุหรือการเปลี่ยนแปลงรูปทรงได้อย่างสมบูรณ์
ความรู้ที่หายไปจึงต้องเรียนรู้จากข้อมูลการแสดงตัวอย่างของหุ่นยนต์ ซึ่งอาจมีค่าใช้จ่ายสูงและใช้เวลานานในการรวบรวม ข้อมูลการแสดงตัวอย่างแต่ละครั้งต้องใช้หุ่นยนต์จริง ผู้ควบคุม พื้นที่ทำงานที่เหมาะสม และข้อมูลการเคลื่อนไหวที่บันทึกอย่างรอบคอบ
FLUX-mimic ใช้แนวทางที่แตกต่าง โดยใช้การแสดงภาพจากโมเดล FLUX 3 ของ Black Forest Labs เป็นพื้นฐานในการคาดการณ์ว่างานควรดำเนินไปอย่างไรในระยะเวลาหนึ่ง
ตัวถอดรหัสการกระทำจะแปลการคาดการณ์ภาพของโมเดลให้เป็นคำสั่งที่หุ่นยนต์สามารถดำเนินการได้ ในแง่ปฏิบัติ ระบบจะประเมินว่าการทำงานที่สำเร็จควรจะดูอย่างไร แล้วกำหนดการเคลื่อนไหวทางกายภาพที่จำเป็นในการผลิตผลลัพธ์นั้น
สร้างบนโครงสร้างมิมิค-วิดีโอ
FLUX-mimic สร้างบนโครงสร้างมิมิค-วิดีโอ ซึ่งเป็นงานวิจัยก่อนหน้าของบริษัทเกี่ยวกับการใช้โมเดลวิดีโอที่ฝึกอบรมไว้แล้วเป็นฐานสำหรับการควบคุมหุ่นยนต์
แทนที่จะขอให้โมเดลวิชั่น-ภาษาแบบเดิมๆ คาดการณ์การเคลื่อนไหวจากเฟรมเดียว มิมิค-วิดีโอสร้างแผนภาพเชิงเส้นการทำงานที่แสดงว่างานอาจดำเนินไปอย่างไร
ตัวถอดรหัสการกระทำจะใช้การแสดงภาพภายในนั้นเพื่อสร้างการเคลื่อนไหวของหุ่นยนต์
ในงานวิจัยของบริษัท มิมิค-วิดีโอสามารถบรรลุประสิทธิภาพในการใช้ข้อมูลที่ดีขึ้นประมาณสิบเท่า และความเร็วในการฝึกอบรมที่เร็วกว่าประมาณสองเท่า เมื่อเทียบกับโครงสร้าง VLA ที่เทียบเท่ากัน
FLUX-mimic ขยายแนวคิดนี้โดยใช้โครงสร้าง FLUX 3 และการออกแบบที่สร้างขึ้นโดยเฉพาะสำหรับ AI ทางกายภาพ
ตามที่มิมิค โรบอติกส์ ระบุ งานที่อาจต้องใช้เวลา 30 ชั่วโมงหรือมากกว่านั้นในการแสดงตัวอย่างหุ่นยนต์ สามารถบรรลุประสิทธิภาพการผลิตได้ด้วยข้อมูลเพียง 30 นาที
ออดี้ให้ทดสอบอุตสาหกรรมที่ท้าทาย
ออดี้ทำงานร่วมกับมิมิค โรบอติกส์ในการทดสอบ FLUX-mimic ในสภาพแวดล้อมการผลิตที่แท้จริง ซึ่งระบบอัตโนมัติต้องเผชิญกับการเปลี่ยนแปลงของผลิตภัณฑ์ ความต้องการการผลิตที่เข้มงวด และงานที่ไม่สามารถลดรูปให้เป็นการเคลื่อนไหวซ้ำๆ ได้
ออดี้ระบุว่าหุ่นยนต์สามารถทำงานที่ซับซ้อนเกี่ยวกับการจัดการวัสดุอ่อน ซึ่งเป็นงานที่ยากที่จะแก้ไขด้วยหุ่นยนต์แบบเดิมๆ
การวิจัยการอัตโนมัติของออดี้แสดงให้เห็นว่าความสามารถในการปรับตัวเป็นสิ่งสำคัญในกระบวนการผลิต
รวมโมเดล ฮาร์ดแวร์ และการแสดงตัวอย่างของมนุษย์
โมเดลนี้เป็นส่วนหนึ่งของแพลตฟอร์มหุ่นยนต์แบบเต็มที่มิมิค โรบอติกส์กำลังพัฒนา
บริษัทสร้างหุ่นยนต์มือที่มีความสามารถในการจัดการและอุปกรณ์เก็บข้อมูลที่สวมใส่ได้
ผลกระทบในวงกว้างต่อการอัตโนมัติในโรงงาน
ความสำคัญของ FLUX-mimic จะขึ้นอยู่กับว่าเทคโนโลยีนี้สามารถรักษาอัตราความสำเร็จสูงได้หรือไม่ในรอบการผลิตหลายพันครั้ง
โรงงานต้องการประสิทธิภาพที่สม่ำเสมอ เวลาในการผลิตที่คาดการณ์ได้ การทำงานที่ปลอดภัยรอบๆ พนักงาน และการฟื้นตัวที่รวดเร็วจากข้อผิดพลาด
หากโมเดลการเรียนรู้จากวิดีโอสามารถรักษาความสามารถในการใช้ข้อมูลได้ขณะตอบสนองความต้องการความน่าเชื่อถือทางอุตสาหกรรม พวกมันจะสามารถขยายหุ่นยนต์ไปยังงานที่ยากหรือมีค่าใช้จ่ายสูงในการเขียนโปรแกรม
การมีส่วนร่วมของออดี้ทำให้ FLUX-mimic มีโอกาสที่จะพิสูจน์ว่าแนวทางนี้สามารถขยายออกไปนอกสภาพแวดล้อมการวิจัยที่ควบคุมได้หรือไม่
ความสำเร็จในโรงงานออดี้จะแสดงให้เห็นว่าโมเดลการเรียนรู้จากวิดีโอสามารถเป็นส่วนหนึ่งของชั้นสมองกลที่ควบคุมเครื่องจักรในโลกแห่งความเป็นจริงได้












