Моделі та платформи ШІ

Модель Muse Image з агентним підходом від Meta з’явилася на Fal для розробників

mm
Додайте Unite.AI до бажаних джерел у Google

fal 1 вересня 2026 року запустив доступ для розробників та підприємств до Muse Image, агентної моделі генерації та редагування зображень від Meta Superintelligence Labs, що надається через Meta Model API на платформі fal. fal зазначив, що модель планує кожен запит, викликає інструменти та перевіряє власний результат перед його поверненням, а на сторінці моделі fal вказано ціну $0.01 за зображення.

Muse Image — це перша модель генерації зображень від Meta Superintelligence Labs. Більшість моделей перетворюють підказку безпосередньо в пікселі за один прохід; fal зазначив, що такий підхід працює для простих підказок, але може зазнати збою при складних завданнях, змушуючи команди продакшну поєднувати кілька моделей і виконувати кілька раундів ручного очищення. fal також зазначив, що передові ціни роблять найбільш об’ємні навантаження, включаючи генерацію варіантів реклами, каталогічні зображення та персоналізацію для кожного користувача, економічно недоступними на масштабі, де вони мають найбільше значення.

Використання інструментів та самовдосконалення

За даними оголошення fal, Muse Image використовує архітектуру планувальник‑плюс‑дифузор з викликами інструментів і вдосконаленням в межах єдиного ланцюжка мислення. Модель шукає в інтернеті реальні референси, що, за словами fal, вимірювано підвищує фактичну точність у знання‑інтенсивних підказках: точні логотипи, реальні місця, працюючі діаграми та скановані QR‑коди. Вона пише та виконує код для точних візуальних елементів і перевіряє та виправляє результати перед їх поверненням — крок верифікації, який, за словами fal, підвищує точність у багаточастинних завданнях.

Технічний пост Meta від 7 липня 2026 року описує той самий агентний дизайн з точки зору лабораторії: модель викликає інструменти пошуку та кодування для підвищення точності, самовдосконалює свої генерації та покращується за рахунок масштабування обчислень під час тестування. Під час навчання підкріпленням Muse Image навчилася писати та виконувати код, що створює точні графіки та QR‑коди, і умовно залежати від відрендерених фігур. Її самовдосконалення може проявлятися як локальне редагування, коли невелика деталь неправильна, як нова генерація, коли більші частини помилкові, або як виклик інструменту для більшої фактичної обґрунтованості. Meta зазначив, що така поведінка виникла під час навчання, оскільки самовдосконалення давало кращі зображення і, отже, вищу нагороду, без спеціального дизайну.

Meta також повідомив, що Muse Image покращується чим довше вона міркує під час інференції: при більшій обчислювальній потужності під час тестування модель більше міркує, частіше викликає інструменти та застосовує більше кроків самовдосконалення, а оцінки Elo за перевагу людей зростають приблизно за лог‑лінійною залежністю. Ці обчислення охоплюють текстові токени для міркувань і візуальні токени для генерації, причому якість залежить від їх сумарної кількості. Meta виявив, що вибірка best‑of‑N, коли модель генерує кілька зображень і залишає найкраще, підвищує якість на ранніх етапах, але швидко насичується, тоді як використання тієї ж обчислювальної потужності для свідомого міркування масштабується значно ефективніше.

Генерація, редагування та композиція

fal зазначив, що одна модель Muse Image охоплює три робочі процеси, які команди продакшну зазвичай отримують від різних постачальників. Перший поєднує генерацію з точним редагуванням: користувач створює дизайн, а потім змінює один елемент, залишаючи решту зображення незмінною, в одному виклику. Другий — це розмовне багатокрокове вдосконалення, коли один ресурс створюється протягом багатьох кроків без втрати якості. Третій — композиція на основі референсів, коли команда передає бренд‑кіт і зразкові активи і генерує нові матеріали у відповідності до стилю та тематики для людей, продуктів та середовищ.

Muse Image також спільно використовує інструменти та плани з Muse Spark, помічником‑моделлю Meta, тому один запит може повернути анімовані GIF‑файли, сайти з вбудованими зображеннями та інтерактивний візуальний вивід замість простого файлу, згідно з fal.

Рейтинги Arena та доступність

fal повідомив, що Muse Image входить до п’ятірки кращих у Arena за текст‑до‑зображення, редагування окремих зображень та редагування множинних зображень. Коли Meta представила модель, вона повідомила, що Muse Image зайняла 2‑е місце в Arena у всіх трьох категоріях за рейтингом Elo за перевагою людей станом на 5 липня 2026 року. Meta також зазначив, що Muse Video, супутня модель, побудована на тому ж базовому передтренуванні, зайняла 3‑є місце в рейтингу Elo за перевагою людей у категорії текст‑до‑відео на ту ж дату.

Модель доступна на fal.ai через інтерактивний майданчик і API. fal перераховує два кінцеві точки, meta/muse-image/text-to-image та meta/muse-image/edit, обидві позначені для комерційного використання і оцінені в $0.01 за зображення. Сторінка текст‑до‑зображення підкреслює точне слідування інструкціям і правильне відтворення дрібних деталей, таких як текст, графіки та QR‑коди; сторінка редагування описує точні правки, які змінюють лише те, що запитав користувач, зберігаючи узгодженість протягом кількох кроків і комбінуючи кілька референсних зображень.

Muse Image вперше дісталася до споживачів 7 липня 2026 року через застосунок Meta AI та meta.ai, Instagram Stories у США та WhatsApp у обмеженій кількості країн. Зображення, створені Muse Image у застосунку Meta AI та на meta.ai, несуть Content Seal — невидиму систему водяних знаків Meta, яка, за словами Meta, залишається цілісною після кадрування, стиснення, зміни розміру та скріншотів; Meta демонструє інструмент виявлення, який перевіряє, чи містить зображення водяний знак.

fal описує себе як генеративну медіа‑платформу, що пропонує моделі зображень, відео та аудіо через уніфікований API, з GPU‑ресурсами за запитом без серверів та спеціальними обчислювальними кластерами, і зазначає, що її використовують понад 2,5 мільйона розробників.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.