AIモデルとプラットフォーム

ChatGPTの1周年:AIインタラクションの未来を形作る

mm
Unite.AI を Google の優先ソースに追加

ChatGPTの1年間を振り返ると、このツールがAIのシーンを大きく変えたことが明らかだ。2022年末にリリースされたChatGPTは、ユーザーに親しみやすい会話スタイルでAIと対話する感覚を与え、機械ではなく人と話しているような感覚を与えた。この新しいアプローチはすぐに一般の注目を集めた。リリース後わずか5日で、ChatGPTはすでに100万人のユーザーを獲得していた。2023年初頭には、この数字は約1億人に増加し、10月までにプラットフォームは世界中で約17億回の訪問を受けていた。これらの数字は、その人気と有用性を語っている。

過去1年間で、ユーザーはChatGPTを様々な創造的な方法で使用してきた。シンプルなタスク seperti メールの書き方や履歴書の更新から、成功したビジネスを立ち上げるまで。ただし、それはユーザーがどのように使用しているかだけではなく、技術自体が成長して改善されたことにもある。初期のChatGPTは無料サービスで詳細なテキスト応答を提供していた。現在では、ChatGPT Plusが利用可能で、ChatGPT-4を含む。これらの更新されたバージョンは、より多くのデータでトレーニングされており、誤った回答が少なく、複雑な指示をよりよく理解できる。

最も大きな更新の一つは、ChatGPTが現在複数の方法で対話できることだ。音声で聞くことができ、話すことができ、画像を処理することもできる。これは、モバイルアプリで会話をすることができ、写真を表示して応答を得ることもできることを意味する。これらの変更は、AIの新たな可能性を開き、人々がAIの役割について考える方法を変えた。

テクノロジーとしてのデモから始まり、現在はテクノロジー界の主要プレーヤーとなったChatGPTの旅は、かなり印象的だ。初期の段階では、テクノロジーを改善するために一般の人々からフィードバックを集める方法として見られていた。しかし、すぐにAIの重要な部分となった。この成功は、人間のフィードバックと教師あり学習を組み合わせて大規模言語モデル(LLM)を微調整することの有効性を示している。その結果、ChatGPTは幅広い質問やタスクに対応できるようになった。

LLMの最も優れたかつ多機能なシステムを開発する競争は、ChatGPTのようなオープンソースモデルとプロプライエタリモデル両方の普及につながった。彼らの一般的な能力を理解するには、幅広いタスクに対する包括的なベンチマークが必要だ。このセクションでは、これらのベンチマークを探り、ChatGPTを含むさまざまなモデルがどのように比較されるかを明らかにする。

LLMの評価:ベンチマーク

  1. MT-Bench:このベンチマークは、8つのドメイン(書き込み、ロールプレイ、情報抽出、推論、数学、コーディング、STEM知識、人文科学)におけるマルチターン会話と指示の実行能力をテストする。より強力なLLMであるGPT-4が評価者として使用される。
  2. AlpacaEval:AlpacaFarm評価セットに基づくこのLLMベースの自動評価者は、GPT-4やClaudeなどの高度なLLMからの応答と比較してモデルをベンチマークし、候補モデルの勝率を計算する。
  3. オープンLLMリーダーボード:Language Model Evaluation Harnessを使用して、LLMを7つの重要なベンチマーク(推論課題や一般知識テストなど)で評価する。ゼロショットとファーショットの両設定で評価される。
  4. BIG-bench:この共同ベンチマークでは、200以上の新しい言語タスクをカバーし、多様なトピックや言語を網羅する。LLMの将来の能力を予測することを目的としている。
  5. ChatEval:オープンエンドの質問や従来の自然言語生成タスクに対するさまざまなモデルの応答の品質を評価するためのマルチエージェント論争フレームワーク。チームは自律的に議論し、評価することができる。

比較パフォーマンス

一般的なベンチマークでは、オープンソースLLMは驚くべき進歩を遂げている。例えば、Llama-2-70Bは特に、指示データでファインチューンされた後、印象的な結果を達成した。AlpacaEvalでは92.66%の勝率を記録し、GPT-3.5-turboを上回った。しかし、GPT-4は依然として95.28%の勝率でトップである。

Zephyr-7Bは、より小さいモデルながら、AlpacaEvalやMT-Benchで70B LLMと同等の能力を示した。WizardLM-70Bは、多様な指示データでファインチューンされた後、MT-BenchでオープンソースLLMの中で最高スコアを記録した。しかし、依然としてGPT-3.5-turboとGPT-4に後れを取っている。

GodziLLa2-70Bは、実験的なモデルで、さまざまなデータセットを組み合わせたもので、オープンLLMリーダーボードで競争力のあるスコアを達成し、潜在能力を示した。同様に、Yi-34Bは、GPT-3.5-turboと同等のスコアを記録し、GPT-4にわずかに後れを取った。

UltraLlamaは、多様で高品質なデータでファインチューンされた結果、GPT-3.5-turboと同等のベンチマークで勝ち、世界と専門知識の分野でそれを上回った。

拡大:巨大LLMの台頭

LLMモデル

2020年以降のトップLLMモデル

LLM開発における注目すべきトレンドの一つは、モデルのパラメーターの拡大だ。Gopher、GLaM、LaMDA、MT-NLG、PaLMなどのモデルは、540億パラメーターまでの境界を押し広げてきた。これらのモデルは卓越した能力を示したが、そのクローズドソース性はより広範な応用を制限した。この制限は、オープンソースLLMの開発への関心を高め、勢いを増している。

モデルのサイズを拡大することに加えて、研究者は代替戦略を模索している。モデルを単純に大きくするのではなく、小さいモデルの事前トレーニングを改善することに焦点を当てている。ChinchillaやUL2のような例では、より賢い戦略が効率的な結果をもたらすことが示された。また、言語モデルの指示チューニングにも大きな注目が集まっており、FLAN、T0、Flan-T5などのプロジェクトがこの分野に大きな貢献をしている。

ChatGPTのカタリスト

OpenAIのChatGPTの導入は、NLP研究の転換点となった。OpenAIと競合するために、GoogleやAnthropicはそれぞれBardとClaudeを立ち上げた。これらのモデルは多くのタスクでChatGPTと同等のパフォーマンスを示したが、依然としてOpenAIの最新モデルGPT-4に後れを取っている。これらのモデルの成功は、主に人間のフィードバックからの強化学習(RLHF)に帰因され、さらなる改善のための研究の焦点となっている。

OpenAIのQ*(Q-Star)に関する噂と推測

最近の報告によると、OpenAIの研究者は、Q*(クー・スター)と呼ばれる新しいモデルの開発で重大な進歩を達成した可能性がある。Q*は、初等数学レベルの数学を実行する能力を持つとされる。これは、専門家の間で、人工一般知能(AGI)への重要なステップとして議論を呼んでいる。OpenAIはこれらの報告についてコメントしていないが、Q*の推測される能力は、ソーシャルメディアやAI愛好家の間で大きな興奮と推測を呼んでいる。

Q*の開発は注目に値するものである。既存の言語モデル、例えばChatGPTやGPT-4は、ある程度の数学タスクを実行できるが、信頼性が高くない。課題は、AIモデルが単にパターンを認識するのではなく、抽象的な概念を理解し、推論する能力を持つ必要があることにある。数学は推論のベンチマークであり、AIが複数のステップを計画し、実行する能力を示す必要がある。これは、AIの能力の重要な飛躍となり、数学を超えて他の複雑なタスクにも適用される可能性がある。

しかし、専門家はこの進歩を過大評価しないよう警告している。数学の問題を信頼性高く解決できるAIシステムは、重要な成果となるだろうが、必ずしも超知能AIまたはAGIの到来を意味するわけではない。現在のAI研究、OpenAIを含む、は基本的な問題に焦点を当てており、より複雑なタスクではさまざまな程度の成功を収めている。

Q*のような進歩の潜在的な応用は広範囲にわたる。個別化されたチュートリアルから科学研究やエンジニアリングの支援まで、可能性は多岐にわたる。ただし、期待を管理し、進歩の限界や安全性に関する懸念を認識することが重要だ。AIが存在リスクをもたらすという懸念、OpenAIの基本的な懸念は、AIシステムが現実世界とより多く関わるようになるにつれて、特に重要になる。

オープンソースLLM運動

オープンソースLLM研究を促進するために、MetaはLlamaシリーズモデルをリリースし、Llamaに基づく新しい開発の波を引き起こした。これには、Alpaca、Vicuna、Lima、WizardLMのような、指示データでファインチューンされたモデルが含まれる。研究は、Llamaベースのフレームワーク内でのエージェントの機能強化、論理的推論、長文脈モデリングにも拡大している。

さらに、MPT、Falcon、XGen、Phi、Baichuan、MistralGrok、Yiのような、ゼロから強力なLLMを開発する傾向が見られる。これらの努力は、クローズドソースLLMの能力を民主化し、先端のAIツールをよりアクセスしやすく効率的になることを反映している。

ChatGPTとオープンソースモデルがヘルスケアに与える影響

将来、LLMは臨床記録作成、請求書の作成、医師の診断と治療計画の支援に役立つことが予想される。これは、テクノロジー大手やヘルスケア機関の注目を集めている。

Microsoftは、主要な電子ヘルスレコードソフトウェアプロバイダであるEpicとの協議を通じて、ヘルスケアにおけるLLMの統合を進めている。UC San Diego HealthやStanford University Medical Centerでは、すでに取り組みが進行中だ。同様に、GoogleはMayo Clinicとのパートナーシップを発表し、Amazon (AMZN ) Web ServicesはHealthScribeというAIによる臨床記録サービスを立ち上げた。これらは、ヘルスケアにおけるAIの重要な一歩を示している。

しかし、これらの急速な展開は、医療を企業の利益に任せることへの懸念を引き起こしている。プロプライエタリなLLMの性質は、評価を難しくしている。利益のために変更または中止される可能性があるため、患者のケア、プライバシー、安全性が損なわれる可能性がある。

緊急に必要なのは、ヘルスケアにおけるLLM開発のためのオープンで包括的なアプローチだ。ヘルスケア機関、研究者、臨床医、患者は、ヘルスケア用のオープンソースLLMを共同で開発するために世界的に協力する必要がある。これは、Trillion Parameter Consortiumに似たアプローチであり、計算資源、財政資源、専門知識のプールを可能にする。

私は過去5年間、機械学習とディープラーニングの魅力的世界に没頭してきました。私の情熱と専門知識は、AI/MLに特に焦点を当てた50以上の多様なソフトウェアエンジニアリングプロジェクトに貢献することになりました。私の継続的な好奇心は、自然言語処理という分野にも私を引き付け、さらに探求したいと思っています。