AIモデルとプラットフォーム

MetaのエージェンティックMuse Imageモデルが開発者向けにFalで利用可能に

mm
Unite.AI を Google の優先ソースに追加

falは2026年9月1日、開発者およびエンタープライズ向けアクセスを開始し、Meta Superintelligence Labsのエージェンティック画像生成・編集モデル「Muse Image」をfalのプラットフォーム上のMeta Model APIを通じて提供しました。falによると、同モデルは各リクエストを計画し、ツールを呼び出し、出力を自身で検証してから返却し、モデルページでは画像1枚あたり0.01ドルでリクエストできると掲載されています。

Muse ImageはMeta Superintelligence Labs初の画像生成モデルです。ほとんどの画像モデルはプロンプトを単一パスでピクセルに直接マッピングしますが、falはこの手法がシンプルなプロンプトには有効でも、複雑なブリーフでは失敗しやすく、制作チームは複数のモデルを組み合わせて手動でのクリーンアップを何度も行う必要があると指摘しています。また、falは先端の価格設定により、広告バリエーション生成、カタログ画像、ユーザーごとのパーソナライズといった高ボリュームのワークロードが、重要な規模での利用において経済的に実行不可能になっていると述べています。

ツール使用と自己改良

falの発表によれば、Muse Imageはプランナープラスディフューザーのアーキテクチャを採用し、ツール呼び出しとリファインメントを単一の思考チェーン内で行います。同モデルはウェブ上で実際の参照を検索し、falはこれにより知識集約的なプロンプトに対する事実精度が測定可能に向上すると述べています。具体例として正確なロゴ、実在する場所、機能するチャート、スキャン可能なQRコードなどがあります。また、精密なビジュアル要素のためにコードを書き実行し、出力を返す前に検査・修正する検証ステップを設けており、falはこれが複数部構成のブリーフに対する精度を向上させるとしています。

Metaの2026年7月7日技術投稿では、ラボ視点から同じエージェンティック設計が説明されています。モデルは検索とコーディングツールを呼び出して精度を向上させ、生成物を自己リファインし、テスト時の計算リソースを拡大することで性能が向上します。強化学習の過程で、Muse Imageは正確なプロットやQRコードを生成するコードを書き実行し、描画された図に条件付けすることを学習しました。自己リファインは、細部の誤りに対してはローカル編集、大きな部分の誤りに対しては新たな生成、事実的根拠が必要な場合はツール呼び出しという形を取ります。Metaは、この挙動はトレーニング中に自己リファインがより良い画像を生み出し、結果として報酬が高くなったため自然に現れたもので、意図的に設計されたものではないと述べています。

Metaはさらに、Muse Imageは推論時に考慮時間が長くなるほど性能が向上すると報告しています。テスト時の計算リソースを増やすと、モデルはより多く推論し、ツール呼び出し回数が増え、自己リファインのステップも増加し、人間好みのEloスコアは概ね対数線形の関係で上昇します。この計算は推論用のテキストトークンと生成用のビジュアルトークンの両方を含み、品質は合計トークン数の関数となります。Metaは、モデルが複数の画像を生成し最良のものを選択するbest-of-Nサンプリングは初期段階で品質を向上させるもののすぐに飽和し、同等の計算リソースを意図的な推論に割り当てる方がはるかにスケールすることを発見しました。

生成、編集、そして構成

falによれば、Muse Imageモデル1つで、制作チームが通常は別々のベンダーから調達する3つのワークフローをカバーしています。第一は生成と精密編集の組み合わせで、ユーザーがデザインを生成した後、画像の残りはそのままで特定の要素だけを変更でき、これが単一の呼び出しで行われます。第二は会話型のマルチターンリファインメントで、複数ターンにわたり資産を構築しても品質のドリフトが生じません。第三は参照駆動型の構成で、チームがブランドキットとサンプル資産を提供すると、人物・製品・環境にわたってスタイルとテーマが一致した新しいオンブランド作品を生成します。

Muse ImageはMetaのアシスタントモデルであるMuse Sparkとツールやプランを共有しており、falによれば、単一のリクエストでアニメーションGIFや埋め込み画像付きサイト、インタラクティブなビジュアル出力など、フラットファイルではなく多様な形式の結果を得ることができます。

Arenaランキングと利用可能性

falによれば、Muse ImageはArenaにおいてテキストから画像への変換、単一画像編集、マルチ画像編集のすべてでトップ5にランクインしています。Metaが同モデルを発表した際、2026年7月5日時点で人間好みのEloランキングにおいて3カテゴリすべてでArenaの第2位を保持していたと報告されました。また、同じ事前学習ベース上に構築された companionモデルのMuse Videoは、テキストから動画への変換で同日時点で第3位にランク付けされているとMetaは述べています。

このモデルはfal.ai上のインタラクティブなプレイグラウンドとAPIを通じて利用可能です。falは2つのエンドポイント、meta/muse-image/text-to-imagemeta/muse-image/edit を掲載しており、いずれも商用利用が可能で画像1枚あたり0.01ドルの価格設定です。テキストから画像へのページでは、指示に忠実に従うことと、テキスト、プロット、QRコードといった細部の正確な描画が強調されています。編集ページでは、ユーザーが指定した部分のみを変更し、ターン間の一貫性を保ち、複数の参照画像から構成する精密な編集が説明されています。

Muse Imageは2026年7月7日に、Meta AIアプリ と meta.ai、米国のInstagram Stories、そして限定的な国々のWhatsAppを通じて一般ユーザーに提供されました。Meta AIアプリや meta.ai 上で生成された画像には、Metaの不可視透かしシステム「Content Seal」が付与されており、Metaはこの透かしがトリミング、圧縮、リサイズ、スクリーンショットを経ても保持されると述べています。また、Metaは画像に透かしが付いているかを検出するツールのプレビューも行っています。

falは、統一APIを通じて画像、動画、音声モデルを提供するジェネレーティブメディアプラットフォームであり、オンデマンドのサーバーレスGPUと専用コンピュートクラスターを備えていると説明しています。また、2.5百万人以上の開発者が同プラットフォームを利用していると述べています。

ジョナス・リーブは、Unite.AIでのAI生成アナリストで、認知AI、人工一般知能(AGI)、および機械知能の理論的基礎に焦点を当てています。彼の仕事は、生物系と人工系の両方で、学習、推論、記憶、抽象化がどのようにして現れるかを探求し、現代のAIアーキテクチャと認知科学および心の哲学の長年の疑問との間でつながりを築いています。
概念的かつ反省的なアプローチで、ジョナスは、推論モデル、エージェントシステム、出現性認知、整列理論などのフレームワークを検討し、AGIへの進歩が実際に何を意味するか、そして何を意味しないのかを明確にしようとします。タイムラインやヒープを追うのではなく、第一原理、概念的厳密さ、現在のモデルにおける限界を強調しています。
ジョナス・リーブによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって検証されており、先進的なAI概念についての正確性、明確性、責任ある議論を保証しています。