AI-modeller och plattformar
Metas agentiska Muse Image-modell lanseras på Fal för utvecklare

fal den 1 september 2026 lanserade utvecklar- och företagsåtkomst till Muse Image, den agentiska bildgenererings- och redigeringsmodellen från Meta Superintelligence Labs, levererad via Meta Model API på fal:s plattform. fal uppgav att modellen planerar varje begäran, anropar verktyg och granskar sitt eget resultat innan det returneras, och fal:s modellsida listar förfrågningar till $0.01 per bild.
Muse Image är den första bildgenereringsmodellen från Meta Superintelligence Labs. De flesta bildmodeller mappar en prompt direkt till pixlar i ett enda steg; fal uppgav att detta tillvägagångssätt fungerar för enkla prompts men kan misslyckas med komplexa uppdrag, vilket tvingar produktionsteam att kombinera flera modeller och genomföra flera omgångar av manuell rengöring. fal sade också att frontier‑prissättningen har gjort de mest volymintensiva arbetsbelastningarna, inklusive generering av annonsvarianter, katalogbilder och personalisering per användare, ekonomiskt oöverkomliga i den skala där de är mest relevanta.
Verktygsanvändning och självrefinering
Enligt fals meddelande använder Muse Image en planner‑plus‑diffuser‑arkitektur med verktygsanrop och raffinering inom en enda tankekedja. Modellen söker på webben efter verkliga referenser, vilket fal sade mätbart förbättrar faktuell noggrannhet på kunskapsintensiva prompts: korrekta logotyper, verkliga platser, fungerande diagram och skannbara QR‑koder. Den skriver och kör kod för precisa visuella element, och den kontrollerar och korrigerar resultat innan de returneras, ett verifieringssteg som fal sade förbättrar noggrannheten i flerdelade uppdrag.
Metas tekniska inlägg den 7 juli 2026 beskriver samma agentiska design ur laboratoriets perspektiv: modellen anropar sök‑ och kodningsverktyg för att förbättra noggrannheten, självrefinerar sina egna generationer och förbättras genom att skala beräkningstid vid test. Under förstärkningsinlärning lärde sig Muse Image att skriva och köra kod som producerar korrekta diagram och QR‑koder samt att förutsätta renderade figurer. Dess självrefinering kan ta formen av en lokal redigering när en liten detalj är fel, en ny generation när större delar är felaktiga, eller ett verktygsanrop för mer faktabaserad förankring. Meta sade att detta beteende uppstod under träning eftersom självrefinering gav bättre bilder och därmed högre belöning, utan att vara avsiktligt designat.
Meta rapporterade också att Muse Image förbättras ju längre den resonerar under inferens: med mer beräkningstid vid test resonerar modellen mer, använder fler verktygsanrop och tillämpar fler självrefineringssteg, med mänskliga preferens‑Elo‑poäng som stiger i ett ungefärligt log‑linjärt förhållande. Den beräkningen omfattar text‑tokens för resonemang och visuella tokens för generering, där kvaliteten är en funktion av den kombinerade summan. Meta fann att best‑of‑N‑sampling, där modellen genererar flera bilder och behåller den bästa, förbättrar kvaliteten tidigt men mättas snabbt, medan att lägga samma beräkningskraft på avsiktligt resonemang skalar avsevärt bättre.
Generering, redigering och komposition
fal uppgav att en Muse Image-modell täcker tre arbetsflöden som produktionsteam vanligtvis hämtar från separata leverantörer. Det första kombinerar generering med exakt redigering: en användare genererar en design och ändrar sedan ett element medan resten av bilden förblir oförändrad, i ett enda anrop. Det andra är konversativ flerstegsrefinering, där en tillgång byggs upp över många varv utan kvalitetsförlust. Det tredje är referensdriven komposition, där ett team matar in en varumärkespaket och exempel på tillgångar och genererar nytt varumärkesanpassat arbete som matchar stil och ämne över personer, produkter och miljöer.
Muse Image delar också verktyg och planer med Muse Spark, Metas assistentmodell, så att ett enda anrop kan returnera animerade GIF‑filer, webbplatser med inbäddade bilder och interaktivt visuellt resultat istället för en enkel fil, enligt fal.
Arena‑rankningar och tillgänglighet
fal uppgav att Muse Image placerar sig bland de fem bästa på Arena för text‑till‑bild, enskild bildredigering och flerdels‑bildredigering. När Meta introducerade modellen rapporterade de att Muse Image hade plats två på Arena i alla tre kategorier under mänskliga preferens‑Elo‑rankningar per den 5 juli 2026. Meta meddelade också att Muse Video, en följeslagarmodell byggd på samma förträningsbas, rankades som nummer tre i mänskliga preferens‑Elo för text‑till‑video på det datumet.
Modellen finns tillgänglig på fal.ai via en interaktiv lekplats och API:et. fal listar två slutpunkter, meta/muse-image/text-to-image och meta/muse-image/edit, båda markerade för kommersiell användning och prissatta till $0.01 per bild. Text‑till‑bild‑sidan framhäver trogen följsamhet av instruktioner och exakt återgivning av fina detaljer som text, diagram och QR‑koder; redigeringssidan beskriver precisa redigeringar som endast ändrar det användaren begär, behåller koherens över varv och komponeras från flera referensbilder.
Muse Image nådde först konsumenterna den 7 juli 2026 via Meta AI‑appen och meta.ai, Instagram Stories i USA och WhatsApp i begränsade länder. Bilder som skapats av Muse Image i Meta AI‑appen och på meta.ai bär Content Seal, Metas osynliga vattenmärkningssystem, vilket Meta sade förblir intakt genom beskärning, komprimering, storleksändring och skärmdumpar; Meta förhandsvisar ett detekteringsverktyg som kontrollerar om en bild bär vattenmärket.
fal beskriver sig själv som en generativ medieplattform som erbjuder bild-, video- och ljudmodeller via ett enhetligt API, med efterfråganstyrda serverlösa GPU:er och dedikerade beräkningskluster, och uppger att mer än 2,5 miljoner utvecklare använder den.












