Andersonの視点

AIは最終的にモアトの外で繁栄するか?

mm
Unite.AI を Google の優先ソースに追加
A cartoon image of a SIMs-style game where a Scottish Laird in his castle is regarding the thriving villagers beyond his moat with puzzlement. GPT-1.5.

Big AIのコストと制限、およびハードウェアコストへの影響により、ユーザーは独自のシステムを構築することを余儀なくされています。ただし、規制の増加により、「影のAI経済」のようなシステムを閉鎖する可能性もあります。

 

意見 科学研究論文でよく見られる「落とし穴」の1つは、論文で取り上げられている問題がすでに他の場所で解決されているというものです。新しい研究の貢献は、たかがしで、または漸進的なものであることが多いです。

これは、研究者が量子的飛躍を期待していたのに、ほとんど進歩がなかったこと、問題の以前の解決策が新しい提案よりもリソースを大量に消費していたこと、またはプロジェクトの目的が完全に失敗したが、アカデミック研究の「出版か死か」の文化により、チームがそれを発表することを余儀なくされたこと(しばしばポータルの最も忙しい出版日の雪崩の中に埋もれて)など、多くの理由で起こる可能性があります。

機械学習文学では、比較的新しく、非謝罪的な理由がより頻繁に登場しています。つまり、提案された機能または機能は、現在、クローズドソースのAPIバウンドポータルを介してのみ利用可能であるということです。

私は今朝、ある論文を検討していました。中国の大学とAmazonの共同研究であり、拡散ベースの画像編集システムにおけるオブジェクト除去の失敗という反復的な問題に取り組んでいました。これは、ターゲット空間を類似のオブジェクトで再び満たすのではなく、単にオブジェクトを除去するのではなく、頻繁に「再充填」します。

<img class="size-full wp-image-407380" src="https://www.unite.ai/wp-content/uploads/2026/04/you-only-erase-once.jpg" alt="左端は元の画像です。赤いセグメンテーションマスクは、AIにどの部分を除去するかを示しています。次に、「Ours」と表示されている画像は、オブジェクト除去アプローチに成功しています。残りの2つの画像は、オブジェクトを除去するのではなく、別のオブジェクトを挿入する類似のシステムを示しています。ソース – https://arxiv.org/pdf/2603.27599v1” width=”1200″ height=”272″ /> 左端は元の画像です。赤いセグメンテーションマスクは、AIにどの部分を除去するかを示しています。次に、「Ours」と表示されている画像は、オブジェクト除去アプローチに成功しています。残りの2つの画像は、オブジェクトを除去するのではなく、別のオブジェクトを挿入する類似のシステムを示しています。. ソース

上記の例では、中央の画像は、新しいアプローチでオブジェクトを除去し、妥当な背景を配置することを示しています。対照的に、2つの前の方法(2つの左側の画像)はオブジェクトを除去しますが、代わりに同じ画像に別のオブジェクトを挿入します。

落とし穴!

この課題の理由や背景を今回は省略します(興味深い テーマ です)。その代わりに、論文でクラシックな「落とし穴」に遭遇しました。著者たちは、高価な独自システムがすでにこのタスクをかなり信頼性高く実行できることを認めています。私は、Adobe Firefly を含む他のクローズドソースシステムを数年間使用しているので、これについてはよく存じています。

‘[拡散ベース]方法は、オブジェクトを除去した後に、意図しないオブジェクトを挿入することによって、しばしば「妄想」を引き起こします。これにより、[結果]は文脈的に一貫性がなくなる。

‘一方、最近のクローズドソースのマルチモーダルモデル、たとえばChatGPTやNano Bananaは、オブジェクト除去においてより強力ですが、大きなパラメータ数と高計算オーバーヘッドを伴うため、エッジデバイスでの実用的展開が妨げられます。

‘したがって、優れた除去性能を実現し、かつ推論遅延が低く、パラメータ数が大幅に少ない、専用のオブジェクト除去モデルを開発することは非常に必要です。

この説明は、技術的な障害に焦点を当てていますが、ChatGPTやNano Bananaのようなクローズドソースアーキテクチャが一切ローカルにインストールできないという明らかな事実を省略しています。たとえそのようなシステムが物議を醸すコンテンツを生成する能力により、門番の正当性が高まったとしても、ポータルは主に商業的要件により独自のものです。

並行開発

しかし、なぜ、依然として有料システムに依存している問題を解決しようとするのでしょうか?その理由は、必要なGPUコンピュートが、ローカルセットアップで実現可能なものを超えているからです。ほとんどの新しい「オープン」論文やコードリポジトリには、A100クラスタなどのリソース要件が非常に高い設定やトレーニング/推論設定が特徴です。

これは、予定されている、経済を破壊するAIデータセンターが最終的にオンラインになるために何を達成するかによって異なります。一般大衆の恐怖やエリートの希望は、モート化された、独自の「ChatGPTレベルの」独自システムが仕事を奪い、定期的にサブスクリプション料金を上げ、サービスレベルを下げ、最初のVC資本が3〜5年間運用するために待たなければならないことを想定しています。

しかし、文献では、代替の未来を支持する傾向が見られます。たとえば、r/stablediffusionのようなオンラインコミュニティの「独り歩き」、「周辺」の精神は、920,000人のユーザーを擁し、クローズドソース画像/ビデオ生成システムに関する投稿を長期にわたって禁止しています。

この代替的な未来では、新しい世界的なAIデータセンターの供給は、モノリシックな「ブラックボックス」フレームワークであるChatGPTやAdobe Fireflyの需要ではなく、ユーザーが構成し、定義するシステムのための生のコンピュートを促進します。

表面の摩擦

r/stablediffusionの複雑な、PatreonマイニングされたリモートGPUのウォークスルーを調べてみると、現在は不可能に思えます。モデルは目標を毎回更新し、最も簡単なフレームワークでさえローカルに展開するのが難しく、一般的には、地頭の良い趣味家や、AIに直接関与していないが、独自のローカルシステムを開発して維持したい企業にとって、追求は厳しいものです。

しかし、過去30年間で、オープンで民主的な簡素化とコモディティ化の需要が非常に高かったすべてのテクノロジーは、それを得る傾向があります。最も普及した解決策は、商業システムとオープンソースの代替案およびイニシアチブの間の緊張から生じることが多いです。

インターネット接続、コンテンツ管理システム、ブログフレームワーク、インターネットセキュリティ、写真、メディア管理などの追求は、混乱した複雑さから単純さと有用性への進化を遂げてきました。

したがって、後のAI風景は、現在の先端AI市場リーダーが望むよりも、より変化に富んで、小規模で真正に競合するプレーヤーが多くなる可能性があります。

必要性による自己実現

皮肉なことに、「ビッグAI」は、コンピュータコンポーネント(特にDRAM)をすべてデータセンターに吸い込んでいくことで、エンドユーザーに独立性の精神を与えています。そうでなければ、これらのコンポーネントは「普通」の消費者に渡ることになります。

結果として、多くの人々は、閉じられた「グローバルAI」リソースが薄いクライアント経由でアクセスされ、既存の機器を維持することに興味を持つようになっています。

AIのテクノロジー供給チェーンへの攻撃により、テクノロジーサービスプロバイダーは、ハードウェア不足により本物の圧力を受けているか、または単にAIのために、過去3〜6ヶ月で価格を上げています。

これにより、セルフホスティングとオンプレミスへの関心が高まりました。ここには、マシンラーニングネットワークのセルフホスティングも含まれます。

私は最近、これに取り組んでいました。ローカルLANストレージに写真やビデオ、ファイルバックアップを移行しました。前者については、iCloudやその他のクラウドストレージプロバイダーの価格上昇その他の懸念事項から離れるために、無料でオープンソースのImmichマルチプラットフォームメディアサーバーを使用しています。

無料のImmichプラットフォームは、メディアをあなたの機器に保持し、自分のチャンネルにプライベートに保管できます。この場合、写真やビデオが保存されている場所に、NVIDIA 3090 GPUをLAN越しに提供するために、Docker上でImmichを使用しています。つまり、より強力なGPUが重い画像/ビデオ処理を処理できるということです。

無料のImmichプラットフォームは、メディアをあなたの機器に保持し、自分のチャンネルにプライベートに保管できます。この場合、写真やビデオが保存されている場所に、NVIDIA 3090 GPUをLAN越しに提供するために、Docker上でImmichを使用しています。つまり、より強力なGPUが重い画像/ビデオ処理を処理できるということです。

私の経験が他の人のそれと同じであるならば、バイブコーディング(現在、多くのオンラインコミュニティで呪われている)は、この独立の波を推進しています(それでも、オープンソースリポジトリに頼ることによって脅威にさらされる可能性があります)。

たとえば、ネットワークは私の計算の弱点でしたので、セキュアなVPSを実行して、新しいセルフホストサービスの一部をサポートするために、AIの支援が必要でした。

このように、「ビッグAI」は、ユーザーが既存の機器を維持することに興味を持つようにすることで、間接的に「スモールAI」を強化しています。したがって、現在のハイパースケール、ハイパーバリューのAI企業の隆盛は、より民主的なユーザー主導のAI社会が現れるための必要だが一時的な状態であると考えられます。モートを求める、レンタルを求める企業は、使い終わったブースター・ロケットのように捨て去られ、2000年のドットコム・バブルが企業が崩壊した後も、長期にわたってウェブを加速させるインフラストラクチャを残したのと同様に。

コンプライアンスの時代

しかし、きっとそうはならないでしょう。

私たちが、そうであることを願うかどうかは別として、AIの規制と、現在の世界的な傾向である年齢検証の組み合わせにより、「影のAI経済」のような発展の道を塞ぐことになるでしょう。

「影のAI経済」を防ぐための錨は規制です。すでに、GitHubHugging Faceなどの中央リポジトリでは、ローカルにリポジトリをクローンする前に、オンラインログインを要求することがよくあります。

したがって、AIフレームワークの監視を現在の慣行よりも広く強化するメカニズムはすでに存在しています。規制の強化の意志は、個々の政府の取り組みから世界的な動きへと移行しています。

したがって、市場の力とFOSS運動の工夫が、カジュアルなAIの展開からの摩擦を取り除く場合、規制の要件として、障害が再び現れる可能性があります。企業にとっては負担ではあるが、個人の場合はそうではないかもしれません。同様の摩擦が、ガバナンス要件として、消費者向けのオンライン支払いシステムに加わったのと同様です。2000年代のPayPalの黄金時代です。

Metaが、OSレベルの年齢制御のロビー活動に20億ドルを費やしたのは、AIへの重要な投資のためか、データ収集の利益のためかはわかりません。しかし、大手テクノロジー企業が年齢制御を支持することの結果は、「ローカル」AIが、クラスA物質のように規制されることになるでしょう。同様に、DMCAは、特定の著作権回避メカニズムではなく、意図を犯罪化するように設計されています。国際的なAI規制は、非準拠使用のマシンラーニングを、ほとんどの積極的な監視なしに、違法行為として扱う可能性があります。

これは、1年前であれば、過度に暗い見方に思えたかもしれません。しかし、それは、カリフォルニアsystemdが、ハードウェアレベルの年齢検証のアイデアを支持する前にでした。現在、多くの人々によって、オンラインの匿名性を禁止するための代理人と見なされています。

結論

したがって、法的および立法的背景は、AIを高度に規制された空間へと導き込む準備が整っています。そこでは、ユーザーは、規制物質を栽培または発酵するのと同様に、「自分で醸造」することはできません。研究部門は、AIがより広い社会で民主化された有益な力になるという、より楽観的な立場を維持しています。

AIバブルが崩壊した後の瓦礫の処分方法に多くは依存します。提供者が統合されるか、市場が長期的なバルカニゼーションに落ち着くかによって、少なくとも、より穏やかな規制アプローチが必要になるでしょう。

 

2026年4月1日(水)に初めて公開されました

機械学習のライターであり、ヒューマンイメージ合成のドメインスペシャリスト。Metaphysic.aiでの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合に伴い退任。
ポートフォリオサイト:martinanderson.ai
コンタクト:[email protected]