Mô hình và nền tảng AI

Mô hình Hình ảnh Muse Agentic của Meta ra mắt trên Fal cho các nhà phát triển

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

fal vào ngày 1 tháng 9 năm 2026 đã ra mắt quyền truy cập cho nhà phát triển và doanh nghiệp tới Muse Image, mô hình tạo và chỉnh sửa hình ảnh agentic của Meta Superintelligence Labs, được cung cấp qua Meta Model API trên nền tảng của fal. fal cho biết mô hình lập kế hoạch cho mỗi yêu cầu, gọi công cụ và tự kiểm tra đầu ra của mình trước khi trả về, và trang mô hình của fal liệt kê mức phí $0.01 cho mỗi hình ảnh.

Muse Image là mô hình tạo hình ảnh đầu tiên của Meta Superintelligence Labs. Hầu hết các mô hình hình ảnh chuyển lời nhắc trực tiếp thành pixel trong một lần xử lý; fal cho biết cách tiếp cận này hoạt động với các lời nhắc đơn giản nhưng có thể gặp khó khăn với các bản mô tả phức tạp, buộc các đội sản xuất phải kết hợp nhiều mô hình và thực hiện nhiều vòng làm sạch thủ công. fal cũng cho biết giá cả tiên tiến đã khiến các khối lượng công việc có khối lượng lớn nhất, bao gồm tạo biến thể quảng cáo, hình ảnh danh mục và cá nhân hoá cho từng người dùng, trở nên không kinh tế ở quy mô mà chúng quan trọng nhất.

Sử dụng công cụ và Tự tinh chỉnh

Theo thông báo của fal, Muse Image sử dụng kiến trúc planner-plus-diffuser với các cuộc gọi công cụ và việc tinh chỉnh trong một chuỗi suy nghĩ duy nhất. Mô hình tìm kiếm trên web các tham chiếu thực tế, điều mà fal cho biết cải thiện đáng kể độ chính xác thực tế trên các lời nhắc đòi hỏi kiến thức sâu: logo chính xác, địa điểm thực, biểu đồ hoạt động và mã QR có thể quét được. Nó viết và chạy mã cho các yếu tố hình ảnh chính xác, và kiểm tra, sửa chữa đầu ra trước khi trả về, một bước xác minh mà fal cho rằng nâng cao độ chính xác trên các bản mô tả đa phần.

Bài đăng kỹ thuật ngày 7 tháng 7 năm 2026 của Meta mô tả thiết kế agentic tương tự từ góc nhìn của phòng thí nghiệm: mô hình gọi công cụ tìm kiếm và mã hóa để cải thiện độ chính xác, tự tinh chỉnh các sản phẩm của mình, và cải thiện thông qua việc mở rộng tính toán thời gian thử nghiệm. Trong quá trình học tăng cường, Muse Image đã học cách viết và thực thi mã tạo ra các biểu đồ và mã QR chính xác và dựa trên các hình ảnh đã render. Việc tự tinh chỉnh của nó có thể xuất hiện dưới dạng chỉnh sửa cục bộ khi một chi tiết nhỏ sai, tạo lại toàn bộ khi các phần lớn sai, hoặc gọi công cụ để có nền tảng thực tế hơn. Meta cho biết hành vi này xuất hiện trong quá trình đào tạo vì tự tinh chỉnh tạo ra hình ảnh tốt hơn và do đó nhận phần thưởng cao hơn, mà không được thiết kế cố ý.

Meta cũng báo cáo rằng Muse Image cải thiện càng lâu khi nó suy luận trong thời gian suy diễn: với nhiều tính toán thời gian thử nghiệm hơn, mô hình suy luận nhiều hơn, sử dụng nhiều cuộc gọi công cụ hơn và áp dụng nhiều bước tự tinh chỉnh hơn, với điểm Elo dựa trên sở thích con người tăng lên theo một mối quan hệ log-tuyến tính xấp xỉ. Tính toán này bao gồm token văn bản để suy luận và token hình ảnh để tạo, với chất lượng là hàm của tổng hợp chúng. Meta nhận thấy rằng phương pháp lấy mẫu best-of-N, trong đó mô hình tạo ra một số hình ảnh và giữ lại hình ảnh tốt nhất, cải thiện chất lượng ban đầu nhưng nhanh chóng đạt mức bão hòa, trong khi việc dành cùng một lượng tính toán cho suy luận có chủ đích mở rộng tốt hơn đáng kể.

Tạo hình, Chỉnh sửa và Sắp xếp

fal cho biết một mô hình Muse Image bao gồm ba quy trình làm việc mà các đội sản xuất thường lấy từ các nhà cung cấp riêng biệt. Đầu tiên kết hợp tạo hình với chỉnh sửa chính xác: người dùng tạo một thiết kế, sau đó thay đổi một yếu tố trong khi phần còn lại của hình ảnh không thay đổi, trong một lần gọi duy nhất. Thứ hai là tinh chỉnh đa vòng hội thoại, xây dựng một tài sản qua nhiều vòng mà không gây suy giảm chất lượng. Thứ ba là sắp xếp dựa trên tham chiếu, trong đó đội ngũ cung cấp bộ nhận diện thương hiệu và các tài sản mẫu và tạo ra công việc mới phù hợp với thương hiệu, khớp phong cách và chủ đề trên người, sản phẩm và môi trường.

Muse Image cũng chia sẻ công cụ và kế hoạch với Muse Spark, mô hình trợ lý của Meta, vì vậy một yêu cầu duy nhất có thể trả về các GIF hoạt hình, các trang web có hình ảnh nhúng và đầu ra hình ảnh tương tác thay vì một tệp tĩnh, theo fal.

Xếp hạng trên Arena và Khả dụng

fal cho biết Muse Image nằm trong top năm trên Arena trong các hạng mục chuyển văn bản thành hình ảnh, chỉnh sửa hình ảnh đơn và chỉnh sửa đa hình ảnh. Khi Meta giới thiệu mô hình này, họ báo cáo rằng Muse Image chiếm vị trí số 2 trên Arena trong cả ba danh mục theo xếp hạng Elo dựa trên sở thích con người tính đến ngày 5 tháng 7 năm 2026. Meta cũng cho biết Muse Video, mô hình đồng hành được xây dựng trên cùng nền tảng tiền huấn luyện, đạt vị trí số 3 trong Elo dựa trên sở thích con người cho chuyển văn bản thành video vào thời điểm đó.

Mô hình có sẵn trên fal.ai thông qua một playground tương tác và API. fal liệt kê hai endpoint, meta/muse-image/text-to-imagemeta/muse-image/edit, cả hai đều được đánh dấu cho mục đích thương mại và có giá $0.01 cho mỗi hình ảnh. Trang text-to-image nhấn mạnh việc tuân thủ hướng dẫn một cách trung thực và việc render chính xác các chi tiết tinh vi như văn bản, biểu đồ và mã QR; trang chỉnh sửa mô tả các chỉnh sửa chính xác chỉ thay đổi những gì người dùng yêu cầu, duy trì tính nhất quán qua các vòng và sắp xếp từ nhiều hình ảnh tham chiếu.

Muse Image lần đầu tiếp cận người tiêu dùng vào ngày 7 tháng 7 năm 2026 thông qua ứng dụng Meta AI và meta.ai, Instagram Stories tại Mỹ, và WhatsApp ở một số quốc gia hạn chế. Các hình ảnh được tạo bởi Muse Image trong ứng dụng Meta AI và trên meta.ai mang dấu Content Seal, hệ thống dấu nước vô hình của Meta, mà Meta cho biết vẫn giữ nguyên qua việc cắt, nén, thay đổi kích thước và chụp màn hình; Meta đang thử nghiệm một công cụ phát hiện để kiểm tra xem hình ảnh có mang dấu nước hay không.

fal mô tả mình là một nền tảng truyền thông tạo sinh cung cấp các mô hình hình ảnh, video và âm thanh qua một API thống nhất, với GPU không máy chủ theo yêu cầu và các cụm tính toán chuyên dụng, và cho biết hơn 2,5 triệu nhà phát triển đang sử dụng nó.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.