โมเดลและแพลตฟอร์ม AI

โมเดล Muse Image แบบเอเจนติกของ Meta เปิดให้ใช้บน Fal สำหรับนักพัฒนา

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

fal เมื่อวันที่ 1 กันยายน 2026 เปิดให้เข้าถึงสำหรับนักพัฒนาและองค์กร โมเดล Muse Image ซึ่งเป็นโมเดลการสร้างและแก้ไขภาพแบบเอเจนติกจาก Meta Superintelligence Labs ส่งมอบผ่าน Meta Model API บนแพลตฟอร์มของ fal. fal กล่าวว่าโมเดลนี้วางแผนแต่ละคำขอ, เรียกใช้เครื่องมือ, และตรวจสอบผลลัพธ์ของตนเองก่อนส่งคืน, และหน้ารายละเอียดโมเดลของ fal ระบุค่าบริการที่ $0.01 ต่อภาพ.

Muse Image เป็นโมเดลการสร้างภาพแรกจาก Meta Superintelligence Labs. โมเดลภาพส่วนใหญ่จะแมปคำสั่งตรงไปยังพิกเซลในหนึ่งขั้นตอน; fal กล่าวว่าแนวทางนี้ทำงานได้กับคำสั่งง่ายแต่อาจล้มเหลวกับงานที่ซับซ้อน, ทำให้ทีมผลิตต้องรวมหลายโมเดลและทำการทำความสะอาดด้วยมือหลายรอบ. fal ยังกล่าวว่าราคาที่อยู่ในระดับแนวหน้าได้ทำให้งานที่มีปริมาณสูงที่สุด, รวมถึงการสร้างรูปแบบโฆษณา, ภาพแคตาล็อก, และการปรับแต่งตามผู้ใช้, กลายเป็นสิ่งที่ไม่คุ้มค่าในระดับที่สำคัญที่สุด.

การใช้เครื่องมือและการปรับปรุงตนเอง

ตามประกาศของ fal, Muse Image ใช้สถาปัตยกรรมแบบ planner-plus-diffuser ที่มีการเรียกใช้เครื่องมือและการปรับปรุงภายในโซ่ความคิดเดียว. โมเดลค้นหาเว็บเพื่อหาข้อมูลอ้างอิงที่เป็นจริง, ซึ่ง fal กล่าวว่าเพิ่มความแม่นยำของข้อเท็จจริงในคำสั่งที่ต้องการความรู้สูงอย่างชัดเจน: โลโก้ที่ถูกต้อง, สถานที่จริง, แผนภูมิที่ทำงานได้, และ QR code ที่สแกนได้. มันเขียนและรันโค้ดสำหรับองค์ประกอบภาพที่แม่นยำ, และตรวจสอบและแก้ไขผลลัพธ์ก่อนส่งคืน, ขั้นตอนการตรวจสอบนี้ fal กล่าวว่าเพิ่มความแม่นยำในงานที่มีหลายส่วน.

โพสต์เชิงเทคนิคของ Meta วันที่ 7 กรกฎาคม 2026 อธิบายการออกแบบเอเจนติกเดียวกันจากมุมมองของห้องทดลอง: โมเดลเรียกใช้เครื่องมือค้นหาและการเขียนโค้ดเพื่อปรับปรุงความแม่นยำ, ปรับปรุงตนเองของการสร้างผลลัพธ์, และพัฒนาโดยการเพิ่มการคำนวณในช่วงทดสอบ. ในระหว่างการเรียนรู้แบบเสริมแรง, Muse Image เรียนรู้การเขียนและรันโค้ดที่สร้างกราฟและ QR code ที่แม่นยำและปรับตามรูปภาพที่เรนเดอร์. การปรับปรุงตนเองของมันอาจเป็นการแก้ไขในพื้นที่เมื่อรายละเอียดเล็ก ๆ ผิดพลาด, การสร้างใหม่เมื่อส่วนใหญ่ผิด, หรือการเรียกใช้เครื่องมือเพื่อให้ข้อมูลที่เป็นข้อเท็จจริงมากขึ้น. Meta กล่าวว่า พฤติกรรมนี้เกิดขึ้นระหว่างการฝึกฝนเพราะการปรับปรุงตนเองทำให้ได้ภาพที่ดีกว่าและได้รับรางวัลสูงขึ้น, โดยไม่ได้ออกแบบโดยเจตนา.

Meta ยังรายงานว่า Muse Image จะดีขึ้นเมื่อใช้เวลาคิดมากขึ้นในช่วงการสรุปผล: ด้วยการคำนวณในช่วงทดสอบที่เพิ่มขึ้น, โมเดลจะคิดมากขึ้น, ใช้การเรียกเครื่องมือมากขึ้น, และทำขั้นตอนการปรับปรุงตนเองมากขึ้น, โดยคะแนน Elo ตามความชอบของมนุษย์เพิ่มขึ้นในความสัมพันธ์เชิงลอการิทึมโดยประมาณ. การคำนวณนั้นครอบคลุมโทเค็นข้อความสำหรับการคิดและโทเค็นภาพสำหรับการสร้าง, โดยคุณภาพเป็นฟังก์ชันของผลรวมทั้งหมด. Meta พบว่าการสุ่มแบบ best‑of‑N, ที่โมเดลสร้างหลายภาพและเก็บภาพที่ดีที่สุด, ช่วยปรับคุณภาพในช่วงแรกแต่เร็ว ๆ นี้จะอิ่มตัว, ในขณะที่การใช้การคำนวณเดียวกันในการคิดอย่างตั้งใจทำให้ขยายได้ดีขึ้นอย่างมาก.

การสร้าง, การแก้ไข, และการจัดองค์ประกอบ

fal กล่าวว่าโมเดล Muse Image หนึ่งรุ่นครอบคลุมกระบวนการทำงานสามแบบที่ทีมผลิตมักจะต้องหาแยกจากผู้จำหน่ายหลายราย. แบบแรกรวมการสร้างกับการแก้ไขที่แม่นยำ: ผู้ใช้สร้างการออกแบบ, จากนั้นเปลี่ยนองค์ประกอบหนึ่งขณะที่ส่วนที่เหลือของภาพคงเดิม, ในหนึ่งคำขอเดียว. แบบที่สองคือการปรับปรุงแบบสนทนาหลายรอบ, สร้างสินทรัพย์หนึ่งผ่านหลายรอบโดยไม่มีการเสื่อมคุณภาพ. แบบที่สามคือการจัดองค์ประกอบโดยอิงอ้างอิง, ที่ทีมใส่ชุดแบรนด์และตัวอย่างสินทรัพย์และสร้างงานใหม่ที่สอดคล้องกับแบรนด์โดยตรงตามสไตล์และหัวข้อในคน, ผลิตภัณฑ์, และสภาพแวดล้อมต่าง ๆ.

Muse Image ยังแบ่งปันเครื่องมือและแผนกับ Muse Spark โมเดลผู้ช่วยของ Meta, ดังนั้นคำขอเดียวสามารถส่งคืน GIF แบบเคลื่อนไหว, เว็บไซต์ที่ฝังภาพ, และผลลัพธ์ภาพเชิงโต้ตอบแทนไฟล์แบบแบน, ตามที่ fal ระบุ.

การจัดอันดับใน Arena และการพร้อมใช้งาน

fal กล่าวว่า Muse Image อยู่ในอันดับห้าบน Arena ทั้งในด้านข้อความ‑เป็น‑ภาพ, การแก้ไขภาพเดียว, และการแก้ไขหลายภาพ. เมื่อ Meta เปิดตัวโมเดลนี้, รายงานว่า Muse Image อยู่ในตำแหน่งที่ 2 บน Arena ในทั้งสามหมวดหมู่ตามการจัดอันดับ Elo ตามความชอบของมนุษย์ ณ วันที่ 5 กรกฎาคม 2026. Meta ยังกล่าวว่า Muse Video, โมเดลคู่หูที่สร้างบนฐานการฝึกเดียวกัน, อยู่ในอันดับที่ 3 ใน Elo ตามความชอบของมนุษย์สำหรับข้อความ‑เป็น‑วิดีโอ ณ วันที่นั้น.

โมเดลนี้พร้อมใช้งานบน fal.ai ผ่านสนามทดลองแบบโต้ตอบและ API. fal ระบุสอง endpoint, meta/muse-image/text-to-image และ meta/muse-image/edit, ทั้งสองระบุว่าใช้เชิงพาณิชย์และมีราคา $0.01 ต่อภาพ. หน้า text‑to‑image เน้นการปฏิบัติตามคำสั่งอย่างแม่นยำและการเรนเดอร์รายละเอียดละเอียดเช่นข้อความ, แผนภูมิ, และ QR code อย่างถูกต้อง; หน้า editing อธิบายการแก้ไขที่แม่นยำซึ่งเปลี่ยนเฉพาะสิ่งที่ผู้ใช้ร้องขอ, รักษาความต่อเนื่องระหว่างรอบ, และจัดองค์ประกอบจากหลายภาพอ้างอิง.

Muse Image เข้าถึงผู้บริโภคครั้งแรกเมื่อ 7 กรกฎาคม 2026 ผ่าน Meta AI app และ meta.ai, Instagram Stories ในสหรัฐอเมริกา, และ WhatsApp ในบางประเทศที่จำกัด. ภาพที่สร้างโดย Muse Image ใน Meta AI app และบน meta.ai มี Content Seal ระบบลายน้ำที่มองไม่เห็นของ Meta, ซึ่ง Meta กล่าวว่า ยังคงอยู่แม้ผ่านการตัดต่อ, การบีบอัด, การปรับขนาด, และการถ่ายภาพหน้าจอ; Meta กำลังทดลองเครื่องมือตรวจจับที่ตรวจสอบว่าภาพมีลายน้ำหรือไม่.

fal อธิบายตนเองว่าเป็นแพลตฟอร์มสื่อเชิงสร้างสรรค์ที่ให้บริการโมเดลภาพ, วิดีโอ, และเสียงผ่าน API แบบรวมศูนย์, พร้อม GPU แบบไม่มีเซิร์ฟเวอร์ตามความต้องการและคลัสเตอร์คอมพิวเตอร์เฉพาะ, และระบุว่ามีนักพัฒนากว่า 2.5 ล้านคนใช้บริการ.

จอนาส รีฟ เป็นนักวิเคราะห์ที่สร้างโดย AI ที่ Unite.AI โดยมุ่งเน้นไปที่ปัญญาประดิษฐ์แบบ认知 (Cognitive AI) ปัญญาประดิษฐ์ทั่วไป (Artificial General Intelligence - AGI) และรากฐานทางทฤษฎีของปัญญาประดิษฐ์ เขาได้สำรวจว่ากระบวนการเรียนรู้ การให้เหตุผล ความจำ และการสรุปผลเกิดขึ้นในระบบทางชีววิทยาและระบบประดิษฐ์ โดยเชื่อมโยงระหว่างโครงสร้าง AI สมัยใหม่และคำถามที่มีมานานในด้านวิทยาศาสตร์认知และปรัชญาของจิต

ด้วยแนวทางเชิงแนวคิดและสะท้อนกลับ จอนาสได้ตรวจสอบกรอบการทำงาน เช่น โมเดลการให้เหตุผล ระบบอージェนต์ การรับรู้ที่เกิดขึ้น และทฤษฎีการจัดตำแหน่ง โดยมีเป้าหมายเพื่อชี้แจงว่าการก้าวหน้าไปสู่ AGI หมายถึงอะไร และไม่หมายถึงอะไร โดยไม่ได้ตาม đuổiเส้นเวลาหรือการโฆษณา เขาเน้นย้ำถึงหลักการแรก การใช้เหตุผลเชิงแนวคิด และข้อจำกัดของโมเดลปัจจุบัน

บทความที่เขียนโดยจอนาส รีฟเป็นผลงานที่สร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อให้แน่ใจถึงความถูกต้อง ความชัดเจน และการอภิปรายที่มีความรับผิดชอบเกี่ยวกับแนวคิด AI ที่ทันสมัย