AIモデルとプラットフォーム

マルチモーダルAIの進化:ChatGPTがGPT-4Vで視覚を獲得

mm
Unite.AI を Google の優先ソースに追加

AIを人間のようにするための継続的な努力の中で、OpenAIのGPTモデルは常に境界を拡大してきました。GPT-4は現在、テキストと画像の両方のプロンプトを受け付けることができます。

マルチモーダル生成AIとは、テキスト、画像、またはオーディオなどの異なる出力が入力に基づいて生成されるモデルを指します。これらのモデルは、特定のデータでトレーニングされ、パターンを学習して新しいデータを生成し、AIアプリケーションを豊富にします。

マルチモーダルAIの最近の進歩

この分野での最近の著しい進歩は、DALL-E 3がChatGPTに統合されたことです。これは、OpenAIのテキストから画像技術における重要なアップグレードです。この統合により、ChatGPTがDALL-E 3の精密なプロンプトを支援し、ユーザーのアイデアを鮮明なAI生成アートに変換できるようになりました。ユーザーは直接DALL-E 3と対話できるようになりましたが、ChatGPTを組み合わせることでAIアートの作成プロセスがよりユーザーフレンドリーになりました。

DALL-E 3とそのChatGPTとの統合については、こちらを参照してください。このコラボレーションは、マルチモーダルAIの進歩を示し、ユーザーにとってAIアートの作成を容易にします。

GoogleのHealthは今年6月にMed-PaLM Mを導入しました。これは、多様なバイオメディカルデータを符号化および解釈するマルチモーダル生成モデルです。これは、PaLM-Eという言語モデルを医療ドメイン向けにファインチューニングし、MultiMedBenchというオープンソースベンチマークを使用して実現されました。このベンチマークには、7つのバイオメディカルデータタイプと14のタスク(医療質問回答や放射線レポート生成など)が含まれています。

様々な業界は、ビジネス拡大、運用の合理化、顧客エンゲージメントの向上を推進するための革新的なマルチモーダルAIツールを採用しています。音声、ビデオ、テキストAIの機能の進歩が、マルチモーダルAIの成長を促しています。

企業は、ビジネスモデルやプロセスを刷新し、ジェネレーティブAIエコシステム全体に成長の機会を提供するマルチモーダルAIアプリケーションを求めています。

GPT-4の発売後、ユーザーの一部は、時間の経過とともにレスポンスの品質が低下したことを指摘しました。これは、著名な開発者やOpenAIのフォーラムでも共有された懸念です。初期的にはOpenAIによって却下されましたが、後の研究では、この問題が確認されました。GPT-4の精度は、3月から6月の間に97.6%から2.4%に低下し、モデル更新による回答の品質低下を示しています。

chatgpt-ai

ChatGPT(青)と人工知能(赤)Google検索トレンド

Open AIのChatGPTの周りの話題は今再び戻ってきました。GPT-4Vというビジョン機能が追加され、ユーザーがGPT-4で画像を分析できるようになりました。これは、AI研究および開発における大きなステップです。

大規模言語モデル(LLM)に画像分析を追加することは、新しいインターフェイスを提供し、新しいタスクを解決する可能性を示しています。

GPT-4Vのトレーニングは2022年に完了し、早期アクセスは2023年3月に開始されました。GPT-4Vの視覚機能はGPT-4テクノロジーによって推進されています。トレーニングプロセスは同じままです。最初に、モデルは大量のテキストと画像データセットから次の単語を予測するようにトレーニングされました。

その後、人間のフィードバックからの強化学習(RLHF)を使用して、人間が好む出力を生成するようにファインチューニングされました。

GPT-4ビジョンメカニクス

GPT-4の優れたビジョン言語能力は、表面的な方法で機能します。

この仮説を調査するために、MiniGPT-4という新しいビジョン言語モデルが導入されました。これは、Vicunaという高度なLLMを使用しています。このモデルは、事前トレーニングされたコンポーネントを使用した視覚認識のためのビジョンエンコーダーを使用し、Vicuna言語モデルと単一の投影レイヤーを介してエンコードされた視覚特徴を整列させます。MiniGPT-4のアーキテクチャは、視覚と言語の特徴を整列させることに重点を置いたシンプルで有効なものです。

MiniGPT-4

MiniGPT-4のアーキテクチャには、事前トレーニングされたViTとQ-Former、単一の線形投影レイヤー、および高度なVicuna大規模言語モデルが含まれます。

視覚言語タスクにおける自己回帰言語モデルのトレンドも成長しています。言語とマルチモーダルドメイン間で知識を共有するクロスモーダルトランスファーを利用しています。

MiniGPT-4は、事前トレーニングされたビジョンエンコーダーから視覚情報をVicunaという高度なLLMと整列させて、視覚と言語のドメインを橋渡しします。モデルは、Vicunaを言語デコーダーとして使用し、2段階のトレーニングアプローチに従います。最初に、画像テキストペアの大規模データセットでトレーニングして、視覚言語知識を理解します。次に、高品質の小規模データセットでファインチューニングして、生成の信頼性と使いやすさを高めます。

MiniGPT-4で生成される言語の自然さと使いやすさを向上させるために、2段階の整列プロセスが開発され、視覚言語整列データセットの不足に対処しました。専用のデータセットがこの目的のために作成されました。

最初に、モデルは入力画像の詳細な説明を生成し、Vicuna言語モデルの形式に整列した会話プロンプトを使用して詳細を高めました。この段階では、より包括的な画像説明を生成することを目的としていました。

初期画像説明プロンプト:

###Human:<Img><ImageFeature></Img>この画像を詳細に説明してください。できるだけ多くの詳細を提供してください。見えるものすべてを言います。###Assistant:

データの後処理では、生成された説明の不一致やエラーをChatGPTを使用して修正し、手動で検証して高品質を確保しました。

2段階目のファインチューニングプロンプト:

###Human:<Img><ImageFeature></Img><Instruction>###Assistant:

この探究は、マルチモーダル生成AIのようなGPT-4のメカニズムを理解するための窓を開き、視覚と言語モダリティをどのように効果的に統合して、連貫性とコンテキストに富んだ出力を生成できるかを明らかにします。

GPT-4ビジョンの探索

ChatGPTを使用した画像の起源の決定

GPT-4ビジョンは、ChatGPTの画像を分析し、その地理的起源を特定する能力を強化します。この機能により、ユーザーは単にテキストではなく、テキストと視覚の組み合わせで対話できるようになり、画像データを介してさまざまな場所について調べるための便利なツールとなります。

Chatgpt-vision-GPT-4

ランドマーク画像の撮影場所をChatGPTに尋ねる

複雑な数学概念

GPT-4ビジョンは、グラフィカルまたは手書きの式を分析することで、複雑な数学概念を理解することに優れています。この機能は、複雑な数学問題を解決しようとする個人にとって、特に教育および学術分野で有用なツールとなります。

Chatgpt-vision-GPT-4

複雑な数学概念をChatGPTに理解させる

手書き入力からLaTeXコードへの変換

GPT-4Vの注目すべき能力の1つは、手書き入力をLaTeXコードに変換する機能です。この機能は、手書きの数学式やその他の技術情報をデジタル形式に変換する必要がある研究者、学者、学生にとって大きな利点となります。手書きからLaTeXへの変換は、文書のデジタル化の可能性を拡大し、技術文書化プロセスを簡素化します。

GPT-4Vの手書き入力からLaTeXコードを生成する機能

GPT-4Vの手書き入力からLaTeXコードを生成する機能

テーブル詳細の抽出

GPT-4Vは、テーブルから詳細を抽出し、関連する質問に回答する能力を示しています。これは、データ分析において重要なツールとなり、ユーザーがテーブルを調査し、重要な洞察を抽出し、質問に回答することを可能にします。

GPT-4Vがテーブルの詳細を理解し、関連する質問に回答する

GPT-4Vがテーブルの詳細を理解し、関連する質問に回答する

視覚的指示の理解

GPT-4Vの視覚的指示を理解する独自の能力は、ユーザーとの対話に新しい次元を追加します。視覚的なヒントを理解することで、GPT-4Vはよりコンテキストに応じた回答を提供できます。

GPT-4Vが視覚的指示を直接理解する独自の能力を示す

GPT-4Vが視覚的指示を直接理解する独自の能力を示す

ドローイングを使用したシンプルなモックアップWebサイトの作成

このツイートに触発され、unite.ai Webサイトのモックアップを作成しようとしました。

結果は私の初期のビジョンと完全に一致しませんでしたが、達成した結果はこちらです。

ChatGPTビジョンを使用したHTMLフロントエンドの出力

ChatGPTビジョンを使用したHTMLフロントエンドの出力

GPT-4V(ision)の限界と欠点

GPT-4Vを分析するために、Open AIチームは定性的および定量的な評価を実施しました。定性的評価には内部テストと外部の専門家レビューが含まれ、定量的な評価にはモデル拒否とさまざまなシナリオでの精度が測定されました。

モデルは完璧ではありません。

論文では、GPT-4Vの限界、たとえば画像内のテキストまたは文字が欠けていることや、間違った推論がなされることがあり、事実を捏造する可能性があることも強調されています。特に、画像内の有害物質を特定するのに適していませんが、しばしばそれらを誤って特定します。

医療画像では、GPT-4Vは一貫性のない回答を提供し、標準的な慣行への認識が不足しており、潜在的な誤診につながる可能性があります。

医療目的での信頼性のないパフォーマンス

医療目的での信頼性のないパフォーマンス(ソース

また、特定のヘイトシンボルのニュアンスを理解できない場合があり、視覚入力に基づいて不適切なコンテンツを生成する可能性があります。OpenAIは、特に医療またはデリケートなコンテキストでは、GPT-4Vを重要な解釈に使用しないことを推奨しています。

まとめ

Fast Stable Diffusion XLを使用して作成

Fast Stable Diffusion XLを使用して作成 https://huggingface.co/spaces/google/sdxl

GPT-4ビジョン(GPT-4V)の到来は、新しい可能性と新しい課題をもたらします。ロールアウト前に、特に画像内の人物のリスクを含め、多くの努力がリスクを減らすために行われました。GPT-4Vは、特に医療や科学の分野で多大な潜在性を示しています。

大きな疑問が残っています。たとえば、これらのモデルは有名人の写真から有名人を特定できるべきでしょうか。写真から人物の性別、人種、または感情を推測できるべきでしょうか。視覚障害者の支援を促進するための特別な調整は必要でしょうか。这些疑問は、プライバシー、公平性、AIが私たちの生活にどのように適合するかについて、誰もが意見を述べるべきものです。

私は過去5年間、機械学習とディープラーニングの魅力的世界に没頭してきました。私の情熱と専門知識は、AI/MLに特に焦点を当てた50以上の多様なソフトウェアエンジニアリングプロジェクトに貢献することになりました。私の継続的な好奇心は、自然言語処理という分野にも私を引き付け、さらに探求したいと思っています。