Andersonの視点

AIモデルの「創造的」出力がプロバイダー間で類似化している

mm
Unite.AI を Google の優先ソースに追加
AI-Generated article illustration (GPT Image 2): three overlapping white envelopes carry Shakespeare stamps labeled 'CLAUDE', 'CHATGPT' and 'GEMINI' in pink, green and blue, resting on a wooden surface. A yellow-and-black warning-style border surrounds the scene, reading 'AI FANTASY INSIDE' and 'REALITY OUTSIDE', with black arrows and striped corner markings.

新しい研究によれば、競合企業のAIモデルが創造的な回答でますます似通ってきており、ユーザーが遭遇するアイデアの幅が狭まる可能性があることが示唆されています。

 

米国の新たな研究では、主要なAIモデルの幅広い範囲にわたる「創造的」出力が時間とともにますます類似していることが判明しました。

デューク大学の研究者らは、2023年から2026年にかけてリリースされた12のプロバイダー系統の69モデルをテストし、実世界の自由形式質問と標準的な創造性テストの両方において出力の多様性が統計的に有意に低下していることを発見しました。これは、主要なLLMプロバイダー全体で「創造的」な要求に対してますます類似したアイデアが提供される可能性を示唆しています。

テスト対象となったプロバイダー系統は、Anthropic、Cohere、DeepSeek、Google、Meta、MiniMax、Mistral AI、Moonshot AI、OpenAI、Qwen、xAI、そして Z.ai*:

From the new paper - model releases used in the study, from 2023年3月 to 2026年7月. The chart covers 68 mode versions across 12 AI providers, demonstrating how the models tested were distributed across the three-year period, and showing increasingly frequent release schedules for some providers, which has to be accounted for in the authors' reckonings. Source - https://arxiv.org/pdf/2608.19437

新しい論文から – 研究で使用されたモデルリリース(2023年3月から2026年7月まで)。このチャートは12社のAIプロバイダーにわたる68のモデルバージョンを示し、3年間にわたるテスト対象モデルの配分と、一部プロバイダーのリリーススケジュールがますます頻繁になっていることを示しています。これらは著者の計算に考慮される必要があります。Source – https://arxiv.org/pdf/2608.19437 ソース

新しい論文の新しい論文の著者らは次のように述べています**:

『我々は、オープンエンドのプロンプトへのLLMの応答が時間とともにますます類似してきていることを発見しました』

『これは、オープンエンドの応答を生成するタスクにおいてLLMの創造性が低下していることを示唆しており、創造的アシスタントとしての長期的有用性を慎重に検証する必要がある』

algorithmic monoculture』は確立された研究分野となっていますが、AI生成の創造的出力における均質化傾向の検証はこれまで行われていなかったと、著者らは主張しています。

しかし、孤立した事例がこの収束を示してきており、コーネル大学のMay 20026 studyで概説された奇妙なケースがその一例です。この研究では、さまざまなLLMプロバイダーが「灯台守」に関する奇妙で衝突する執着を示し、特に「Mara」や「Elias」などの時代錯誤的な名前が現れました:

In May, Cornell University's new paper found strange similarities across LLM providers when given 'open prompts' – though no clues as to why have yet become apparent in the diverse training data fueling these models.

5月に、コーネル大学の新しい論文は、’open prompts’ が与えられた際にLLMプロバイダー間で奇妙な類似性が見られることを発見しましたが、なぜそのようになるのかについての手がかりは、これらのモデルを支える多様なトレーニングデータからはまだ明らかになっていません。

新しい研究はより体系的です: 研究者は3年間にわたるモデルを、実世界の創造的プロンプトと、日常的な物体の異常な使用法を求める古典的な心理学テストの両方でテストしました。その後、モデルの回答の意味的な距離を測定し、世代が進むにつれてその距離が縮小しているかを追跡しました。

LLMは同様に創造的になっているのか?3年分のモデルからの証拠, :

『我々の発見は予備的なものではあるものの、LLMを創造的パートナーとして長期的に活用することへの懸念を提起します。たとえモデルが創造的タスクで優れた性能を示しても、出力が収束することでLLMユーザーが接する可能性の範囲が制限され、結果として彼ら自身の思考の幅も狭まる可能性があります。』

『エッセイ執筆などの創造的タスクにLLMを使用すると脳活動が低下するという研究がありますが、我々の研究が示すようにますます創造性が低下したLLMを使用することは、人間の創造性へのLLMの影響をさらに悪化させる可能性があるでしょうか?この研究と他の研究で観察されています。』

すでに、LLMテキスト出力の多様な特徴はミームの素材となっており、今年5月に報告したように、少なくとも1人の著者が前述の主要モデルに共通する「灯台」への執着を取り上げた本を自費出版しています。

したがって、出版社がますます本を撤回し、AIが執筆したまたはAI支援されたものと疑うような状況下で、新たな研究は、見た目は人間が書いた作品、学生が提出した学術論文を含む、’プロットの偶然一致’が増加することを示唆しているようです。

この収束がどこから来ているのかについて、著者らは重複するトレーニングデータとますます類似した最適化目標が、モデルを概念や意味関係の内部表現で類似させ、最終的により似通った回答を生み出すと仮説を立てています:

『[それ]は、この均質性がまだ発展途上の技術の一時的な副産物なのか、統計的言語モデルの不可避的で、潜在的に累積的な特徴なのかは不明です。』

『妥当な要因は両方向に指し示しています。重複データで訓練され、類似した目標に最適化された生成モデルは、概念や意味関係をますます類似した方法で整理し、結果として似通った出力を生むという学術的研究が増加しています。』

しかし、著者らは研究を引用し、モデルが進化するにつれて創造的出力に関して再び独自の特徴セットへと分岐する可能性があることも指摘しています。

方法

AIモデルがますます類似しているかどうかを追跡するために、研究者はオープンエンドの質問から始め、世代を超えたモデルの回答を収集しました。各回答は意味の数値表現に変換され、応答がどれだけ似ているか、あるいは異なるかを測定できるようにしました。

回帰分析を用いて、これらの差が新しいモデルがリリースされるにつれて縮小しているかどうかを確立しました:

The authors' schema for measuring whether AI outputs become more similar over time. Open-ended creative prompts are run across different model families, their answers mapped by meaning to measure the distance between them, with regression analysis tracking how those distances change across successive model generations.

AI出力が時間とともにより類似するかどうかを測定するための著者のスキーマ。異なるモデル系統に対してオープンエンドの創造的プロンプトを実行し、回答を意味でマッピングして距離を測定し、回帰分析で世代を超えるモデル間でその距離がどのように変化したかを追跡しました。

創造性を異なる視点からテストするために、2つのプロンプトセットが選択されました。まず、Alternate Uses Task(AUT)は、発散的思考の標準的な心理学テストで、普通の物体の非凡な使用法を求めます。本研究ではハンマーなどの物体が使用されました。その固定フォーマットは、異なるモデルが生成したアイデアを比較するための統制された方法を提供しました。

さらに100のプロンプトがInfinity-Chat100から抽出されました。これは言語モデルとの実世界の会話から得られたコレクションです。これらはコンテンツ生成、問題解決、ブレインストーミング、アイデア創出など、制約の少ない創造的タスクを含み、生成される回答やアプローチに対してより大きな自由度を許容します。

完全なAUTとInfinity-Chat100のプロンプトセットは、2023年3月から2026年7月までにリリースされたモデル(Anthropic、Google、Meta、OpenAI、DeepSeek、Mistral AIの12プロバイダー)に送信されました。すべての応答はOpenRouterのAPIを通じて同一のサンプリング設定で収集され、temperature(創造的に応答する自由度)とtop-pはともに1に設定されました。

モデルはリリース月順に並べられ、新しい世代がより類似した回答を生成しているかどうかが検証されました。

リリース日自体はトレーニングデータ、アーキテクチャ、ポストトレーニングの変化を必ずしも捉えないため、著者らはこの傾向をモデル開発との関連として扱い、時間の経過自体が収束を引き起こす証拠とは見なしていません。

その後、モデルの回答はall-MiniLM-L6-v2 sentence-transformerを用いて埋め込みに変換されました。各回答は数値ベクトルとして表現され、意味が似ている回答は類似した方向に配置され、その意味的距離を測定できるようになりました。

AUTでは、各オブジェクトに対して提案されたすべての使用法を単一の回答として扱い、モデルごとに10個の埋め込みを生成しました。Infinity-Chat100では、各回答を個別に埋め込み、モデルごとに100個の埋め込みを生成しました。

27か月のリリース期間は9つの時間帯に分けられ、異なるプロバイダーのモデルのみが比較されました。各期間内で回答間の意味的距離が測定され、距離が小さいほど類似度が高いことを示します。

モデル数が多いプロバイダーが結果を支配しないように、各プロバイダーから均等にサンプルを抽出し、分析を1,000回繰り返しました。

結果

その後、線形回帰を用いて時間経過に伴うこれらの距離を追跡し、一貫した負の傾きが異なるプロバイダーのモデルがますます類似していることを示しました:

Initial test results, showing whether creative responses from different AI providers became more similar over time. Semantic distances declined for both the Alternate Uses Task and Infinity-Chat100 prompts, while repeated balanced sampling produced consistently negative trends, indicating increasing similarity across model generations.

初期テスト結果は、異なるAIプロバイダーの創造的応答が時間とともにより類似しているかを示しています。Alternate Uses Task と Infinity-Chat100 の両方のプロンプトで意味的距離が減少し、繰り返し行われた均衡サンプリングは一貫して負の傾向を示し、モデル世代を超えて類似性が増加していることを示しています。

これらの結果で著者らが強調した点は:

『AUT と Infinity-Chat の両方の応答セットにおいて、観測期間中にプロバイダー間の出力距離が減少していることが観測されました。』

『これは、時間とともにLLMの創造的出力の多様性が低下し、均質性が増加していることを示唆しています。』

古いモデルと新しいモデルの差は、Alternate Uses Task で最も顕著でした。最初のモデルで約0.50だったプロバイダー間の平均距離は、最新モデルでは0.40未満に低下し、回答が大幅に類似したことを意味します。同様のパターンはInfinity-Chat100でも見られましたが、変化は小さく、平均距離は約0.34から0.32付近に低下しました。

Test results measuring how quickly answers from the different AI providers became more similar over time. The 'Alternate Uses' Task showed a much stronger decline in differences between models than Infinity-Chat, with both results remaining consistent across the researchers’ repeated sampling tests.

テスト結果は、異なるAIプロバイダーの回答が時間とともにどれだけ速く類似していくかを測定しています。’Alternate Uses’ タスクはInfinity-Chatに比べてモデル間の差の減少がはるかに顕著で、両方の結果は研究者が繰り返しサンプリングテストを行っても一貫しています。

この発見は、1,000回の均衡再サンプリングすべてで再現されました。すべての場合において、新しいモデルは古いモデルよりも回答がより近くなっていました。これらの減少幅と研究者の95%信頼区間は上図に示されています。

この点に関して、論文は次のように述べています:

『AUT の減少幅は、タスクの目的を考えると特に注目すべきです。AUT は、モデルにできるだけ独創的かつ予想外の使用法を生成させることで発散的思考を明示的にテストするため、出力が異なることが期待される正確な設定です。』

Infinity-Chat の結果は、同様の傾向がはるかに広範な創造的タスクでも現れたことを示しています。100のプロンプトはモデルに多様なオープンエンド回答を生成させ、これらの回答は時間とともにより類似していきました

この変化は Alternate Uses Task よりも小さかったものの、2025年以降にリリースされたモデルでより顕著になりました。著者らは、これは特定のテストだけでなく、一般的に異なるAIプロバイダーの創造的出力がますます類似していることを示す早期の兆候である可能性があると示唆しています。

結論

LLM と VLM の収束に関する問題は、研究コミュニティとそれらから派生する下流モデルの利用者の双方において、継続的かつ拡大する懸念の源です。我々は、研究シーンがアクセスできる唯一の「純粋」なデータ世代の最終段階に差し掛かっており、モデルプロバイダーが競合のデータを流出させようとする決意は、データが同一化し、モデル訓練の原則がプロバイダー間で似通っている(場合によっては完全に同一)ため、収束リスクを必然的に高めています。

したがって、モデルファミリー間で創造的出力の類似性が高まることに対抗するために、em ダッシュの置き換えのような単純な解決策は現れにくく、むしろ重複事例はより公的で恥ずかしい形で顕在化する可能性が高いです。

 

* 完全なモデルリストは Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; と GLM-5.2

** 著者の強調であり、私のものではありません。

著者のインライン引用をハイパーリンクに変換したものです。

初掲載 2026年8月21日金曜日

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai