ソートリーダー

GPT-4は真のAI革命をもたらすか?

mm
Unite.AI を Google の優先ソースに追加

GPT-3が導入されてからほぼ3年が経過しました。2020年5月にリリースされました。以来、AIテキスト生成モデルは、人間が書いたように見えます。人間が書いたように聞こえるテキストを作成する能力で、多くの関心を集めてきました。現在、次のバージョンのGPT-4が近くリリースされる予定です。2023年初頭にリリースされる予定です。

このAIニュースは非常に期待されていますが、GPT-4の詳細はあまり明らかではありません。GPT-4を開発しているOpenAIは、新しいモデルの機能や能力について公に多くを語っていません。ただし、最近のAI分野、特に自然言語処理(NLP)における進歩は、GPT-4について予想されることがらを示唆しています。

GPTとは何か

具体的な内容に入る前に、GPTの基礎を理解する必要があります。GPTは、ジェネレーティブ・プレトレーニング・トランスフォーマー(Generative Pre-trained Transformer)と呼ばれる深層学習ニューラルネットワークモデルで、インターネットから利用可能なデータを使用して大量の機械生成テキストを作成するものです。GPT-3は、このテクノロジーの3世代目であり、現在利用可能な最も高度なAIテキスト生成モデルの1つです。

GPT-3を、SiriやAlexaのようなボイスアシスタントと考えてみましょう。ただし、はるかに大規模なものです。Alexaに好きな曲を再生してもらう、またはSiriにテキストを入力してもらうのではなく、GPT-3に500語の記事を書いてもらったり、1分以内に100個のソーシャルメディア投稿アイデアを生成してもらったりすることができます。ユーザーがする必要があるのは、明確で具体的なプロンプトを提供することです。たとえば、「創造性の重要性について500語の記事を書いてください」というプロンプトを与えると、GPT-3はほぼ何でも書くことができます。

GPT-3は、テキスト要約、言語翻訳、コード生成、ほぼすべての書き込みタスクの自動化に使用されています。

しかし、GPT-3は、特に長い文章を書く場合や、洞察が必要な複雑なトピックの場合に問題が生じることがあります。たとえば、ウェブサイトのコンピューターコードを生成するように求められた場合、正しいが最適化されていないコードが返されることがあります。したがって、人間のコーダーが改善する必要があります。同様の問題が、長いテキスト文書にも生じます。テキストの量が増えると、人間のライターが修正する必要があるエラーが発生する可能性が高くなります。

つまり、GPT-3は、人間のライターまたはコーダーを完全に置き換えるものではありません。代わりに、GPT-3は、ブログ投稿アイデアや広告コピーの粗いアウトラインを生成する際に、時間を節約するためのライティングアシスタントとして考えるべきです。

パラメータが多ければよいのか

AIモデルについて理解する上で重要なのは、パラメータを使用して予測を行う方法です。AIモデルのパラメータは、学習プロセスを定義し、出力に構造を提供します。一般的に、AIモデルのパラメータの数は、パフォーマンスの尺度として使用されてきました。パラメータが多いほど、モデルはより強力で、滑らかで、予測可能になります。スケーリング仮説によれば、これが当てはまります。

たとえば、GPT-1が2018年にリリースされたとき、1.17億のパラメータを持っていました。1年後にリリースされたGPT-2は、12億のパラメータを持っていました。GPT-3はさらにその数を高め、175億のパラメータを持っています。2021年8月のAndrew Feldman(Cerebrasの創設者兼CEO)のインタビューによると、GPT-4は約100兆のパラメータを持つ予定です。これにより、GPT-4はGPT-3より100倍強力になるという、パラメータ数の量子的飛躍が実現することになります。

しかし、Feldmanの壮大な主張にもかかわらず、GPT-4が実際に100兆のパラメータを持つことはない理由もあります。パラメータの数が増えると、モデルをトレーニングして微調整するコストが高くなるためです。大量の計算能力が必要になるからです。

さらに、モデルの有効性を決定する要因は、パラメータの数だけではありません。たとえば、NvidiaとMicrosoftが開発したテキスト生成モデル、Megatron-Turing NLGは、500億を超えるパラメータを持っています。にもかかわらず、MT-NLGはGPT-3に匹敵するものではなく、パフォーマンスでは遠く及ばないことがわかっています。つまり、より多くのパラメータを持つことは、必ずしもよりよいものではありません。

おそらく、GPT-4はGPT-3よりも多くのパラメータを持つでしょう。しかし、その数が桁数で大きく増えるかどうかはわかりません。代わりに、OpenAIは、アルゴリズム設計と整合性の質的改善に重点を置いた、より薄型のモデルを追求している可能性があります。こうした改善の正確な影響は予測が難しいですが、わかっていることは、スパースモデルは、条件付き計算を通じて計算コストを削減できることです。つまり、AIモデルのすべてのパラメータが常に動作しているわけではありません。これは、人間の脳のニューロンの動作と似ています。

GPT-4は何ができるのか

OpenAIが新しい声明を発表するか、GPT-4をリリースするまで、GPT-4がGPT-3とどのように異なるかについては、推測するしかありません。

AIの深層学習開発の将来は、マルチモーダルですが、GPT-4はおそらくテキストのみのままです。人間は、さまざまな音響、視覚、テキスト入力で満たされた多感覚世界に住んでいます。したがって、AI開発は最終的に、さまざまな入力を組み込むことができるマルチモーダルモデルを生み出すことになります。

しかし、良いマルチモーダルモデルを設計することは、テキストのみのモデルを設計するよりもはるかに難しいです。まだその技術はありません。パラメータサイズの制限を考えると、OpenAIはテキストのみのモデルを拡大して改善することに焦点を当てている可能性が高いです。

また、GPT-4は、正確なプロンプトに依存しない可能性があります。GPT-3の欠点の1つは、テキストプロンプトを慎重に書く必要があることです。プロンプトが不十分な場合、出力は不正確、有害、または極端な見解を反映する可能性があります。これは、AIモデルがユーザーの意図を完全に理解していないことを示唆しており、これは「整合性の問題」と呼ばれます。AIモデルはインターネットのテキストデータセットでトレーニングされているため、人間の偏見、虚偽、偏見がテキスト出力に簡単に混入する可能性があります。

しかし、開発者が整合性の問題に進展を遂げている兆候もあります。これは、InstructGPTの開発によるものです。InstructGPTは、GPT-3のより高度なバージョンで、人間のフィードバックでトレーニングされており、指示とユーザーの意図に従うように設計されています。人間の評価者は、InstructGPTがGPT-3よりもプロンプトに依存しないことを発見しました。

ただし、これらのテストはOpenAIの従業員のみで行われたため、性別、宗教、政治的見解などで均一なグループである可能性があります。GPT-4は、より多様なトレーニングデータでトレーニングされる可能性が高く、さまざまなグループのユーザーにとっての整合性を向上させるでしょう。ただし、どの程度かはまだわかりません。

GPT-4は人間を置き換えるのか

GPT-4の約束にもかかわらず、人間のライターまたはコーダーを完全に置き換える可能性は低いです。パラメータの最適化、多様性、整合性など、まだ多くの作業が必要です。人間の経験の複雑さやニュアンスを真正に理解できるテキスト生成モデルが現れるまでには、まだ多くの年がかかる可能性があります。

しかし、GPT-4の到来を期待する理由もあります。パラメータの最適化、つまり単純なパラメータの増加ではなく、前世代モデルよりもはるかに強力なAIモデルにつながる可能性があります。また、整合性の改善により、GPT-4はよりユーザーフレンドリーになる可能性があります。

さらに、AIツールの開発と導入の初期段階にあります。技術の新しい用途が不断に発見されており、人々が職場でのAIの使用に信頼と快適さを感じるにつれて、AIツールの広範な採用がビジネスのほぼすべての分野で見られるようになる可能性は高いです。

Dr. Danny Rittmanは、GBT TechnologiesのCTOです。これは、IoT(Internet of Things)、グローバルメッシュネットワーク、人工知能、および集積回路設計に関連するアプリケーションに対して、展開を可能にするソリューションです。