Andersonの視点
人工知能に対する歴史的言語の挑戦
自然言語処理(NLP)システムの中心的な課題の1つは、さまざまな書面資料から重要な洞察を導き出すことです。新しいNLPアルゴリズムのトレーニングデータセットの寄与元は、Twitter、ブロードシート新聞、科学雑誌など、言語的に多様なものになり得ます。これら3つの情報源だけに固有の特徴的な特徴があります。
ほとんどの場合、これは英語のみであり、現在または最近のテキスト情報源のみです。NLPアルゴリズムが複数の時代からの資料を考慮する必要がある場合、通常、国や地域コミュニティ、特に歴史上の異なる時期における異なる言語や書き方を調和させることが困難です。
しかし、歴史上の時代を跨ぐテキストデータ(歴史的論文や古い科学作品など)を使用することは、トピックの歴史的概要を生成し、メトリックの採用と維持以前のドメインの統計的タイムラインを再構築するための有用な方法となり得ます。
例えば、気候変動予測AIモデルに寄与する気象情報は、世界中で1880年まで十分に記録されていませんでしたが、古典的なテキストのデータマイニングは、有用な事前の天候データを提供する古代の重大な気象イベントの古い記録を提供します。
時間的不一致
ワシントン大学とアレン人工知能研究所の新しい論文は、5年間という短い期間でも時間的不一致が発生し、事前トレーニング済みのNLPモデルの有用性を損なうことができることを発見しました。

全てのケースで、スコアが高いほど良いです。ここでは、5年間のテキスト資料の4つのコーパスにわたる時間的劣化のヒートマップを示しています。著者によれば、トレーニングデータと評価データの不一致は、著しいパフォーマンス低下を引き起こす可能性があります。 ソース:https://arxiv.org/pdf/2111.07408.pdf
論文には以下のように記載されています:
‘時間的不一致は、言語モデルの汎化とタスクのパフォーマンスの両方に影響します。テキストドメインとタスクの劣化に大きな変動を見つけました。5年間で、分類器のF1スコアは40ポイント(Twitterの政治的所属)または1ポイント(Yelpのレビュー評価)まで劣化する可能性があります。同じドメインで定義された2つの異なるタスクは、時間の経過とともに異なるレベルの劣化を示す可能性があります。’
不均衡な分割
根本的な問題は、トレーニングデータセットが一般的に2つのグループに分割されることです。時には、80/20の割合でかなり不均衡です。データのより大きなグループはニューラルネットワークでトレーニングされ、残りのデータはアルゴリズムの精度をテストするためのコントロールグループとして使用されます。
複数の年間にわたる資料を含む混合データセットでは、評価データは特定の時代からの資料で構成される可能性があります。
これにより、より多様な時代からの資料でトレーニングされたモデルに対するテストベッドとして不適切なものとなります。実際、評価データが新しい資料や古い資料を過度に表す場合、最新のK-POPアイドルを祖父に評価させるようなものです。
長い回避策は、より時間的に制限されたデータセットで複数のモデルをトレーニングし、各モデルの結果からの互換性のある機能をまとめることですが、ランダムなモデル初期化の実践だけが、クロスモデルのパリティと公平性を達成することにおける独自の問題に直面しています。さらに、データセットが互いに十分に似ているかどうかを考慮せずに、実験が有意義であるかどうかを判断することです。
データとトレーニング
時間的不一致を評価するために、著者は4つのテキストコーパスを4つのドメインでトレーニングしました。
Twitter
…ここでは、2015年から2020年までの12百万ツイートをランダムに抽出し、名前付きエンティティ(人や組織)や政治的所属を研究しました。
科学記事
…ここでは、Semantic Scholarコーパスからラベル付けされていないデータを取得し、30年間にわたる650,000のドキュメントを取得し、ここでは、メンションタイプの分類(SciERC)とAI会場の分類(AIC、AAAIまたはICMLで発表されたかどうかを判断する)を研究しました。
ニュース記事
…ここでは、Newsroom Datasetから2009年から2016年までの900万件の記事を使用し、ここでは3つのタスクを実行しました。ニュースルームの要約、発行元の分類、メディアフレームの分類(MFC、ニュース出力の優先順位付けられたトピックの認識)を行いました。
食品レビュー
…ここでは、Yelp Open Datasetを使用し、1つのタスク、レビュー評価の分類(YELPCLS、セクターでの典型的な感情分析の課題)を実行しました。
結果
モデルは、GPT-2で評価され、さまざまなF1スコアが得られました。著者は、時間的不一致によるパフォーマンス低下は双方向的であり、最近のデータでトレーニングされたモデルは古いデータの影響を受ける可能性があり、逆もまた同様であることを発見しました(記事の先頭の画像を参照)。著者は、これが社会科学への応用に特に重大な影響を与えることを指摘しています。
一般に、結果は、時間的不一致がパフォーマンス低下を「著しく」低下させ、ほとんどのタスクに広範囲にわたる影響を与えることを示しています。数十年間にわたるデータセットは、当然ながら問題を悪化させます。
著者はさらに、時間的不一致がラベル付けされたデータだけでなく、事前トレーニングデータにも影響を与えることも観察しました。さらに、ドメイン適応(以下参照)を通じて影響を軽減する彼らの試みは、状況を大幅に改善しなかったものの、データセット内の情報を微調整することはある程度役立つと主張しています。
結論
研究者は、以前の研究で示唆された、ドメイン適応(DAPT、データの不均衡に対する対策)や時間適応(時間別にデータを選択する)を含む既存の解決策が問題を軽減するのに役立たないことを確認しました。
論文は以下のように結論付けています:
‘実験により、以前の研究よりもタスク間で時間的劣化の変動が大きいことが明らかになりました。これらの結果は、NLPの応用における時間的不一致の継続的な研究、ベンチマーク評価におけるその考慮、実務者によるシステムのパフォーマンスを時間の経過とともに監視することの重要性を促しています。 ‘
‘特に、時間的に整列したデータでLMを継続的にトレーニングすることはあまり効果がないことがわかり、時間的適応方法を見つけるためのさらなる研究が必要であることを示しています。’
著者は、データが継続的に更新される継続的学習へのさらなる調査が役立つ可能性があること、また、概念のドリフトやタスクのシフトを検出する他の方法がデータセットを更新するための有用な手助けとなる可能性があることを示唆しています。
* インライン引用のハイパーリンクへの変換












