Andersonの視点

人工知能を用いた機械ターキングの作成

mm
Unite.AI を Google の優先ソースに追加

機械学習システムの開発の大部分は、データのラベル付けに依存しており、数百、場合によっては数千の質問(例:これは猫の写真ですか?およびこのテキストは攻撃的ですか?)が、AIシステムを訓練するための権威あるデータセットを作成するために解決される必要があります。

私たちが何らかの時点でこのプロセスに貢献していることとは対照的に、これらのラベル付けタスクの大部分は、金銭的な報酬を受け取る人間の労働者によって、Amazon Mechanical Turkなどのフレームワークで実行されています。ここで、注釈者はピースワーク経済で小規模な分類タスクを完了します。

事前訓練済み言語モデル(PLM)が、Amazon Mechanical Turk(AMT)および同様のプラットフォームでクラウドソーシングされている基本的な人間の知能タスク(HIT)の一部を自身で実行できる場合、モデル開発はより安価になるでしょう。

ドイツとHuaweiの最近の研究では、この論文LMTurk:Few-Shot Learners as Crowdsourcing Workers」でこれを提案しています。

少数샷学習を実行する言語モデル

著者は、Turkワーカー(人間)に通常対象となるタスクのよりシンプルな層は、少数샷学習に類似しており、自動化フレームワークが与えられた少数の例に基づいてミニタスクを決定する必要があると示唆しています。

したがって、著者は、人間によって訓練された既存のPLMからAIシステムが効果的に学習できることを提案しています。つまり、人間から機械への基本的な知識はすでに実現されており、知識が相対的に不変であるか、ある程度経験的である場合、自動化された言語モデルフレームワークはこれらのタスクを自身で実行できる可能性があると考えられます。

‘私たちの基本的な考えは、NLPタスクTに対して、少数샷学習者を非専門家のワーカーとして扱い、人間言語技術のためのリソースを注釈するクラウドソーシングワーカーに似せるということです。クラウドソーシングワーカーをある種の少数샷学習者と見なすことができるという事実にインスパイアされています。’

このことの意味は、将来のAIシステムが依存する多くの基準事実は、人間によって数年前に導き出されたものであり、以降は事前検証された情報として扱われ、機械のみの系統が進化するにつれて人間の介入を必要としないということです。

中程度のパフォーマンスを持つ言語モデルのための仕事

人間の介入を必要としないコストを削減する動機に加えて、研究者は「中程度の」PLMを「真正な」Mechanical Turkとして使用することで、これらの「中程度の」システムに役立つ仕事を提供できることを示唆しています。これらのシステムは、GPT-3などのヘッドラインを飾る、超大規模で高価な言語モデルによって日陰になっているため、こうしたタスクには高すぎて過剰なスペックを持っています。

‘私たちのこの論文での目標は、現在の少数샷学習者をより効果的に使用する方法を考案することです。これは非常に重要です。なぜなら、巨大な少数샷学習者が多数訓練されているからです。どうすればそれらを効果的に使用できるかが重要な問題です。特に、難しいことに、巨大なモデルを展開する代替手段が必要です。 ‘

‘同時に、PLMの長所を最大限に活用したいと思います。PLMの多様性は、タスクへの広範な適用可能性を保証し、言語と世界に関する膨大な知識(事前訓練で学習されたもの)は、少数샷学習者のデータ効率性に現れ、データ注釈における労力と時間の消費を削減します。’

これまで、著者は、NLPにおける少数샷学習者が、高レベルの自然言語システムへの道における使い捨ての間隔段階として扱われてきたと主張しています。これらのシステムは、より多くのリソースを消費するものであり、そのような作業は、潜在的な有用性を考慮せずに、抽象的に行われてきたとされています。

方法

著者は、LMTurk(Language Model as Mechanical Turk)を提供しています。これは、自動化されたHITからの入力が中レベルのNLPモデルにラベルを提供するワークフローです。

LMTurkの基本的な概念モデル。

LMTurkの基本的な概念モデル。

この最初のイテレーションは、人間がラベル付けした「ゴールド」データに依存しており、肉体的なTurkがタスクの限定された数のラベルを注釈付けしており、ラベルは人間の監督またはコンセンサス投票によってスコア付けされています。このスキーマの意味は、この人間ベースの開始点からのフォークまたは開発では、将来的に人間の入力を必要としない可能性があるということです。

著者は、人間の入力が存在するが大幅に削減された後のハイブリッドモデルでのさらなる実験を提案していますが、彼らは人間生成のHITワーカーからの同等の結果とLMTurkモデルを比較しなかったことを示しています。なぜなら、ゴールドラベル付けされたデータは「人間の入力」そのものだからです。

PLMは、P-Tuningによってタスクに適応されました。P-Tuningは、中国の研究者によって2021年に発表された方法であり、GPT-3スタイルのモデルを自然言語理解(NLU)タスクで改善するために、訓練可能な連続的なプロンプト埋め込みを提案しました。

P-Tuningは、GPTスタイルのモデルの予測力と言語の概念的な理解の外観を、埋め込まれた疑似プロンプトを組み込むことで深めることを試みます。この場合、開始クエリは「Britainの首都は[x]」です。

P-Tuningは、GPTスタイルのモデルの予測力と言語の概念的な理解の外観を、埋め込まれた疑似プロンプトを組み込むことで深めることを試みます。この場合、開始クエリは「Britainの首都は[x]」です。

データとアーキテクチャ

LMTurkは、5つのデータセットで評価されました:Stanford Sentiment Treebankの2つ、AGのNews Corpus、Recognizing Textual Entailment(RTE)、およびCorpus of Linguistic Acceptability(CoLA)。

大規模モデルとして、LMTurkは、223百万パラメータを特徴とする公開されているPLMであるALBERT-XXLarge-v2(AXLV2)を、自動化されたTurkへの変換のためのソースモデルとして使用します。(GPT-3の175億パラメータとは対照的に)AXLV2は、より大規模なモデルである334M BERT-Largeを上回る能力を発揮したことがあります。

より軽量でエッジ展開可能なモデルとして、プロジェクトはTinyBERT-General-4L-312D(TBG)を使用します。これは、14.5百万パラメータを特徴とし、110百万パラメータを持つBERT-baseと同等のパフォーマンスを発揮します。

P-Tuningを使用したプロンプト有効化トレーニングは、PyTorchとHuggingFaceでAXLV2に対して行われ、バッチサイズ13、学習率5e-4、線形減衰で100バッチステップで実行されました。各実験は3つの異なるランダムシードで開始されました。

結果

LMTurkプロジェクトは、NLPのさまざまなサブセクターに対して多様なモデルを実行するため、研究者の実験の結果は、LMTurkが再利用可能なアプローチを提供することを示唆しています。

評価のために、著者は、ドイツの研究者Timo SchickとHinrich SchutzeによるExploiting Cloze Questions for Few Shot Text Classification and Natural Language InferenceおよびPrincetonとMITのGao、Chen、FischによるPrompt-Based Autoの結果と比較しています。

LMTurk実験の結果。研究者は「同等の」パフォーマンスを報告しています。

LMTurk実験の結果。研究者は「同等の」パフォーマンスを報告しています。

簡単に言えば、LMTurkは、金ラベル付けされた人間起源のデータを、自動化システムが人間の入力を代替する中程度の複雑さを持つ言語モデルに組み込む、そして固めるときに、比較的有望な研究ラインを提供します。

この分野の先行研究と同様に、中心的な概念は、元の人間データの不変性に依存しており、時間的要因がNLP開発の重大な障害となる可能性があるため、機械のみの系統が進化するにつれて人間の介入を必要としないと想定しています。

 

2022年12月30日初出

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai