Andersonの視点

AIは歴史的な言語を模倣するのに苦労する

mm
Unite.AI を Google の優先ソースに追加
ChatGPT-4o and Adobe Firefly.

アメリカとカナダの研究者による共同研究により、ChatGPTのような大規模言語モデル(LLM)は、歴史的な慣用句を大量の事前トレーニングなしに再現するのに苦労していることがわかった。事前トレーニングは、高価で労力的なプロセスであり、多くの学術的または娯楽的なプロジェクトにとって実行可能なものではない。したがって、チャールズ・ディケンズの未完の最後の小説をAIで完成させるようなプロジェクトは、実行可能なものではない。

研究者は、歴史的に正確なテキストを生成するためのさまざまな方法を探索し、20世紀初頭の散文を使用したシンプルなプロンプティングから始め、1905年から1914年にかけて出版された本のコレクションで商用モデルをファインチューニングするまでを行った。

また、1880年から1914年にかけて出版された本で訓練された別のモデルと比較した。

最初のテストでは、ChatGPT-4oにフィン・ド・シエクル言語を模倣するように指示したが、結果は20世紀初頭の文学でファインチューニングされたGPT2ベースのモデルとは大きく異なった。

歴史的なテキストを完成させるように求められたChatGPT-4o(下左)は、依然として「ブログ」モードに陥り、要求された慣用句を表現できなかった。一方、GPT2モデル(下右)は言語スタイルをよく捉えているが、他の点では正確さに欠ける。出典:https://arxiv.org/pdf/2505.00030

歴史的なテキストを完成させるように求められたChatGPT-4o(下左)は、依然として「ブログ」モードに陥り、要求された慣用句を表現できなかった。一方、GPT2モデル(下右)は言語スタイルをよく捉えているが、他の点では正確さに欠ける。出典:https://arxiv.org/pdf/2505.00030

ファインチューニングにより、出力がオリジナルのスタイルに近づくが、人間の読者は依然として現代の言語やアイデアの痕跡を頻繁に検出できた。これは、慎重に調整されたモデルでも現代のトレーニングデータの影響を反映し続けていることを示唆している。

研究者は、歴史的な言語を模倣するための経済的な近道がないという結論に達した。また、歴史的な言語を模倣するという課題自体が、不適切なものである可能性もあると推測している。

「歴史的なモデルを指示でトレーニングすることで会話を可能にする、または現代のモデルを古い時代の物語を伝えるように ventriloquize させる場合、いずれにせよ、正確さと会話の流暢さの間で妥協する必要がある。」

「21世紀の質問者と1914年の回答者との会話というのは、実際には「本物の」例がないからである。」

新しい研究は、言語モデルは過去をアナクロニズムなく表現できるか?というタイトルで、イリノイ大学、ブリティッシュコロンビア大学、コーネル大学の3人の研究者によって行われた。

完全な失敗

最初の研究アプローチでは、研究者は、歴史的な言語を模倣するために、シンプルなプロンプティングを使用して、現代の言語モデルをテストした。1905年から1914年にかけて出版された本からの実際の抜粋を使用して、ChatGPT-4oにこれらの抜粋を同じ慣用句で続けるように求めた。
オリジナルの時代のテキストは次のとおりだった。

「この最後の場合、5〜6ドルが1分あたり節約され、1分間で静止した人物または風景を投影するために20ヤード以上のフィルムを巻き戻す必要がある。したがって、固定画像と動画の実用的な組み合わせが得られ、最も芸術的な効果が得られる。」

「また、2つのシネマトグラフを交互に投影することでちらつきを避けることができ、同時に赤と緑の画像を投影して自然な色を再現することができ、人間の目が同時に基本的な色を受け取ることに慣れているため、生理的な疲労から解放される。」

生成されたテキストが意図された歴史的なスタイルに合致するかどうかを評価するために、研究者は、RoBERTaモデルを1907年から2009年にかけてのアメリカ英語コーパスの一部で訓練し、出版日を予測するようにした。

RoBERTaクラスифァイアは、ChatGPT-4oによって生成された続きを評価するために使用された。

システムプロンプト(つまり、ChatGPTにタスクに取り組む方法についてのコンテキスト指示)は次のとおりだった。

「あなたのタスクは、20世紀初頭の本からの抜粋を完成させることです。1913年に出版された本からの抜粋が与えられます。この抜粋を同じスタイルで、少なくとも200文字続けてください。フレーミングのコメントは付けないでください。」

一方と20ショットのプロンプティングにもかかわらず、ChatGPT-4oの出力は21世紀のスタイリストレジスターに一貫して傾いていた。

例として、ChatGPT-4oのブログのような試みが、写真についての現代的な抽象的な考察に飛び込んだ。

「即時写真における冷たい光の使用は、変化する光条件での画像の撮影アプローチを革命的に変えました。従来、写真家は自然光の厳しさや変化、またはフラッシュ写真の侵入性の性質に苦労しました。」

「冷たい光は、より柔らかく拡散された性質を持つため、色や質感のより自然な表現を可能にし、厳しい人工光の下では失われることがよくあります。」

これは、オリジナルの時代のテキストの長い表現的なスタイルと一致していない。

チームはまた、GPT-1914をテストした。これは、1880年から1914年にかけての文学で訓練されたGPT-2クラスの小さなモデルだった。

その出力はChatGPT-4oよりも一貫性があり、時代のスタイルに合致していたが、他の点では正確さに欠けていた。

例として、写真についての現代的なテキストの続きが提供された。

「その作用の原理はすでに説明されています(p.4)。ここでは、コロディオンでコーティングされた紙やゼラチン板で撮影された写真に適用する場合に利点があることを指摘するだけです。」

「この場合、露光時間は1秒を超えてはなりません。写真を半分の時間で現像したい場合は、温度を20°C以下に下げてはいけません。そうしないと、画像が現像後に暗くなり、またこの条件では感光性を失うことになります。」

「通常の目的の場合は、低温に敏感な表面をさらすだけで十分ですが、特別な注意は必要ありません。」

オリジナルのテキストは難解で理解するのが難しいが、GPT-1914の出力はより時代に合ったものだった。

プロットの複雑化

研究者は、モデル出力がどの程度歴史的に正確な書き言葉に似ているかを測定するために、統計クラスифァイアを使用して、各テキストサンプルの出版日を推定した。結果をカーネル密度プロットで視覚化した。

1905年から1914年にかけての本からの実テキストと生成テキストの推定出版日(GPT-4oとGPT-1914の1ショットと20ショットのプロンプトを使用)

1905年から1914年にかけての本からの実テキストと生成テキストの推定出版日(GPT-4oとGPT-1914の1ショットと20ショットのプロンプトを使用)

ファインチューニングされたRoBERTaモデルは、歴史的なスタイルを認識するために訓練されたが、完全ではなかった。GPT-1914の出力は、20世紀初頭のクラスタに集まっていた。一方、ChatGPT-4oの出力は、21世紀の書き言葉に似ていた。

研究者は、Jensen-Shannon分離を使用して、GPT-1914のスコアは0.006で、ChatGPT-4oの1ショットと20ショットの出力はそれぞれ0.310と0.350だった。

パスの完成

研究者は、ファインチューニングによってより優れた結果が得られるかどうかを調査した。GPT-4oミニを1905年から1914年にかけての本からのパス続きのペアで訓練した。

RoBERTaベースのクラスフィァイアを使用して、出力のスタイルを評価した。ファインチューニングされたモデルの出力は、オリジナルのテキストに近かった。

そのスタイルの乖離は、Jensen-Shannon分離で測定され、0.002まで低下した。

1905年から1914年にかけての本からの実テキストと生成テキストの推定出版日(GPT-1914とGPT-4oミニのファインチューニング)

1905年から1914年にかけての本からの実テキストと生成テキストの推定出版日(GPT-1914とGPT-4oミニのファインチューニング)

人間の感覚

研究者は、人間の評価テストを実施し、1905年から1914年にかけての本からの250の抜粋を選択し、多くのテキストは当時とは異なる解釈を受けるだろうと観察した。

「私たちのリストには、たとえば、当時ドイツの一部であったアルザスについての百科事典の項目や、当時は真菌感染症として説明されていたベリベリについての項目がありました。」

「また、20世紀初頭の非ヨーロッパの場所の説明は、人種的一般化に陥りやすい傾向があります。1913年に書かれた月の日出の説明は、誰も写真を見たことがないため、豊かな色彩現象を想像しています。」

研究者は、歴史的な質問に答えることができる短い質問を作成し、GPT-4oミニをこれらの質問と答えのペアでファインチューニングした。

時代を失う

研究者は、3人の専門家のアノテーターに、120のAI生成された続きを評価させ、1914年の著者にとって妥当かどうかを判断させた。

この評価アプローチは予想よりも難しいものだった。アノテーターは約80%の時間に評価に同意したが、判断のバランス(「妥当」と「妥当でない」の選択肢が2:1の比率で選択された)は、アノテーターの実際の合意レベルが中程度であることを示した。

アノテーターは、タスクを「難しい」と表現し、多くの場合、1914年に知られていたか信じられていたかどうかを判断するために追加の研究が必要だった。

一部のパスは、トーンや視点について難しい質問を提起した。たとえば、応答が1914年の世界観を反映して制限されているかどうかを判断する必要があった。

この種の判断は、エスノセントリズム(自分の文化の前提や偏見を他の文化に当てはめる傾向)のレベルに依存することが多かった。

この文脈では、歴史的に妥当な言語と現代のアイデアを反映する言語を区別することが課題だった。研究者は、アノテーターの評価結果を示した。

アノテーターの評価結果

アノテーターの評価結果

侵入者アラート

次に、専門家のアノテーターに、同じ歴史的な質問に答える4つの匿名パスを提示し、そのうちの1つは実際の20世紀初頭のソースからの本物の抜粋だった。

タスクは、どのパスがオリジナルのものであるかを特定することだった。

このアプローチでは、アノテーターに直接妥当性を評価するよう求めなかったが、代わりに、モデルが出力が本物であると読者を欺くことができるかどうかをテストした。

モデルのランキングは、前の評価タスクの結果と一致していた。ファインチューニングされたGPT-4oミニのバージョンは、最も妥当なものだったが、依然として本物のものに劣っていた。

各ソースが正しく歴史的なパスとして識別された頻度

各ソースが正しく歴史的なパスとして識別された頻度

過去の未来

研究者は、現代の言語モデルを歴史的な声に促すことは、確実な結果をもたらさないと結論付けた。出力の多くは、現代の視点から歴史を模倣していることが明らかだった。

研究者は、歴史的なテキストを生成するための経済的な近道がないと結論付けた。また、歴史的な言語を模倣するという課題自体が、不適切なものである可能性もあると推測している。

「コンテキスト内学習のパフォーマンスは不幸です。これらの方法は、AIベースの歴史研究のための最も簡単で最も安価なものです。私たちは、これらのアプローチを網羅的に調査していません。」

「コンテキスト内学習が、今または将来のいくつかの研究分野のサブセットに適していることがわかるかもしれません。しかし、私たちの初期の証拠は、励ましいものではありません。」

結論

研究者は、歴史的な言語を模倣するための経済的な近道がないと結論付けた。また、歴史的な言語を模倣するという課題自体が、不適切なものである可能性もあると推測している。

歴史的なテキストを生成する際には、正確さと流暢さの間で妥協する必要がある。研究者は、歴史的な声のシミュレーションには、現代の視点の影響を完全に排除することはできないと結論付けた。

歴史的なテキストを生成するには、現代の言語モデルを歴史的な声に促すことは、確実な結果をもたらさない。ファインチューニングによってより優れた結果が得られるかもしれないが、完全な解決策はまだ見つかっていない。

歴史的な言語を模倣するには、現代の視点の影響を排除することが必要だが、完全に排除することはできない。歴史的なテキストを生成するには、現代の言語モデルを歴史的な声に促すことは、確実な結果をもたらさない。

歴史的な言語を模倣するには、歴史的なテキストを生成するための新しいアプローチが必要である。研究者は、歴史的な言語を模倣するための新しい方法を開発する必要があると結論付けた。

 
2025年5月2日初出版

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai