Modèles et plateformes d’IA
Le modèle d’image agentique Muse de Meta arrive sur Fal pour les développeurs

fal le 1 septembre 2026 a lancé l’accès développeur et entreprise à Muse Image, le modèle de génération et d’édition d’images agentique de Meta Superintelligence Labs, fourni via l’API Meta Model sur la plateforme de fal. fal a indiqué que le modèle planifie chaque requête, appelle des outils et révise sa propre sortie avant de la renvoyer, et la page du modèle de fal indique un tarif de $0.01 per image.
Muse Image est le premier modèle de génération d’images de Meta Superintelligence Labs. La plupart des modèles d’images transforment une invite directement en pixels en un seul passage ; fal a déclaré que cette approche fonctionne pour des invites simples mais peut échouer sur des briefs complexes, obligeant les équipes de production à assembler plusieurs modèles et à effectuer des cycles de nettoyage manuel. fal a également indiqué que les prix de pointe ont rendu les charges de travail à très grand volume, y compris la génération de variantes publicitaires, les images de catalogue et la personnalisation par utilisateur, économiquement prohibitives à l’échelle où elles sont les plus nécessaires.
Utilisation des outils et auto‑raffinement
Selon l’annonce de fal, Muse Image utilise une architecture planificateur‑plus‑diffuseur avec des appels d’outils et un raffinement au sein d’une chaîne de pensée unique. Le modèle recherche sur le Web des références réelles, ce qui, selon fal, améliore de façon mesurable la précision factuelle sur les invites à forte intensité de connaissances: logos exacts, lieux réels, graphiques fonctionnels et QR codes scannables. Il écrit et exécute du code pour des éléments visuels précis, et il vérifie et corrige les sorties avant de les renvoyer, une étape de vérification qui, d’après fal, améliore la précision sur les briefs multiparties.
Le billet technique de Meta du 7 juillet 2026 décrit la même conception agentique du point de vue du laboratoire: le modèle invoque des outils de recherche et de codage pour améliorer la précision, s’auto‑raffine ses propres générations et s’améliore grâce à l’augmentation du calcul en temps d’inférence. Au cours de l’apprentissage par renforcement, Muse Image a appris à écrire et exécuter du code qui produit des graphiques précis et des QR codes, et à se conditionner sur des figures rendues. Son auto‑raffinement peut prendre la forme d’une modification locale lorsqu’un petit détail est incorrect, d’une nouvelle génération lorsque des parties plus importantes sont erronées, ou d’un appel d’outil pour un ancrage factuel plus solide. Meta a indiqué que ce comportement est apparu pendant l’entraînement parce que l’auto‑raffinement produisait de meilleures images et donc une récompense plus élevée, sans avoir été délibérément conçu.
Meta a également signalé que Muse Image s’améliore plus le temps de raisonnement augmente en phase d’inférence: avec davantage de calcul en temps d’inférence, le modèle raisonne davantage, utilise plus d’appels d’outils et applique davantage d’étapes d’auto‑raffinement, les scores Elo de préférence humaine augmentant selon une relation approximativement log‑linéaire. Ce calcul couvre les jetons texte pour le raisonnement et les jetons visuels pour la génération, la qualité étant fonction du total combiné. Meta a constaté que l’échantillonnage best‑of‑N, où le modèle génère plusieurs images et conserve la meilleure, améliore la qualité au début mais se sature rapidement, tandis que consacrer le même calcul à un raisonnement délibéré se révèle nettement plus efficace.
Génération, édition et composition
fal a indiqué qu’un seul modèle Muse Image couvre trois flux de travail que les équipes de production obtiennent généralement auprès de fournisseurs distincts. Le premier combine génération et édition précise: un utilisateur crée un design, puis modifie un élément tandis que le reste de l’image reste inchangé, le tout en un seul appel. Le second est le raffinement conversationnel multi‑tour, construisant un actif sur plusieurs tours sans perte de qualité. Le troisième est la composition guidée par des références, où une équipe fournit une trousse de marque et des actifs d’exemple et génère de nouveaux travaux conformes à la marque, correspondant au style et au sujet à travers les personnes, les produits et les environnements.
Muse Image partage également des outils et des plans avec Muse Spark, le modèle assistant de Meta, de sorte qu’une seule requête puisse renvoyer des GIF animés, des sites avec images intégrées et une sortie visuelle interactive plutôt qu’un fichier plat, selon fal.
Classements Arena et disponibilité
fal a indiqué que Muse Image se classe parmi les cinq premiers sur Arena dans les catégories texte‑à‑image, édition d’image unique et édition multi‑image. Lors du lancement du modèle, Meta a rapporté que Muse Image occupait la 2ᵉ place sur Arena dans les trois catégories selon les classements Elo de préférence humaine au 5 juillet 2026. Meta a également déclaré que Muse Video, un modèle compagnon construit sur la même base de pré‑entraînement, était classé 3ᵉ en Elo de préférence humaine pour le texte‑à‑vidéo à cette date.
Le modèle est disponible sur fal.ai via un terrain de jeu interactif et l’API. fal répertorie deux points d’accès, meta/muse-image/text-to-image et meta/muse-image/edit, tous deux indiqués pour un usage commercial et tarifés à $0.01 per image. La page texte‑à‑image met en avant le suivi fidèle des instructions et le rendu précis de détails fins tels que le texte, les graphiques et les QR codes ; la page d’édition décrit des modifications précises qui ne changent que ce que l’utilisateur demande, maintiennent la cohérence sur plusieurs tours et composent à partir de plusieurs images de référence.
Muse Image a d’abord atteint les consommateurs le 7 juillet 2026 via l’application Meta AI et meta.ai, Instagram Stories aux États‑Unis, et WhatsApp dans certains pays. Les images créées par Muse Image dans l’application Meta AI et sur meta.ai portent le Content Seal, le système de filigrane invisible de Meta, que Meta a indiqué rester intact après recadrage, compression, redimensionnement et captures d’écran ; Meta prépare un outil de détection qui vérifie si une image porte le filigrane.
fal se décrit comme une plateforme de médias génératifs proposant des modèles d’images, de vidéos et d’audio via une API unifiée, avec des GPU sans serveur à la demande et des clusters de calcul dédiés, et affirme que plus de 2,5 millions de développeurs l’utilisent.












