AIモデルとプラットフォーム
GPT-2、人工知能テキスト・ジェネレーターが完全に公開される
TheNextWeb(TNW)によると、人工知能プロジェクトを数多く手がける非営利組織であるOpenAIは、GPT-2というテキスト・ジェネレーターに関する最終モデルを公開した。GPT-2は、2019年2月の発表以来、大きな議論を巻き起こしてきた。
OpenAIの研究論文「Language Models are Unsupervised Multitask Learners」によると、「GPT-2は、機械学習を用いて、制限された入力に基づいて新しいテキストを生成する。」つまり、ユーザーが任意のテーマについて一文や二文を入力すると、AIジェネレーターは元の入力に関連したテキストを生成する。実質的には、TNWによると、ほとんどの「テキスト・ジェネレーター」と異なり、事前に書かれた文字列を出力しない。GPT-2は、以前存在しなかったテキストを生成する。
カーネギー・メロン大学図書館のプログラム・ディレクターであるScott B. Weingartは、ツイートで具体的な例を示している。
What is a Panther but a young lion?
An entire corridor filled entirely with people screaming.
How’s this for a happy ending? pic.twitter.com/qvPTrs790N
— Scott B. Weingart (@scott_bot) 2019年8月20日
If death, in some obscure and distant hour,
Strikes me still as I slept, if I yet dream:
Is that my peace with an eternity spent?
[…]
But I fear it will be no peace or rest
Until the stars give me the full glow of their light
To see all my cares and woes in an instant.Shit. pic.twitter.com/QRoi1C3rjj
— Scott B. Weingart (@scott_bot) 2019年8月20日
OpenAIは当初、システムの潜在的な悪用について懸念していたため、2019年2月にGPT-2を8か月間で4つのパートに分けて公開することを決定した。その理由について、ブログで説明している。「技術の悪用についての懸念から、トレーニング済みのモデルは公開しない。責任ある開示の実験として、研究者が実験するための小さいモデルと技術論文を公開する。」
説明によると、完全なモデルには15億のパラメータがある。「モデルがトレーニングされるパラメータは多いほど、賢いように見える – 人間と同様に、練習は完璧に近づく。」
TNWによると、OpenAIは当初、1億2400万のパラメータを持つモデルを公開し、その後3億5500万と7億7400万のパラメータを持つモデルを公開した。公開されたモデルをテストした結果、「各イテレーションは前のイテレーションよりも能力が大幅に改善された」としている。
悪用を防ぐために、OpenAIはGPT-2の検出モデルを公開した。これは、「悪用を予防的に阻止する」ために設計されている。ただし、ブログ投稿によると、これらの検出モデルはまだGPT-2自体で達成した品質レベルに到達するために追加の作業が必要である。
興味がある場合は、GPT-2モデルをここでGithubからダウンロードし、モデルカードをここで確認し、OpenAIのブログ投稿をここで読むことができる。












