Kunal Kejriwal は、Python、PostgreSQL、Redis、そして GCP と AWS のクラウドインフラストラクチャを専門とするバックエンドエンジニアです。3 年間にわたり本番システムの構築とスケーリングを経験しており、AI インフラストラクチャ、分散システム、機械学習ワークロードのデプロイに関するアーキテクチャについて執筆しています。
人工知能の急速に進化する環境において、テクノロジー企業が直面する最大の課題の1つは、実験的なものから企業向けのものへの移行です。消費者向けのチャットボットやインタラクティブなプラットフォームは、公共のイメージに役立ちますが、企業はチャットインターフェイスだけでは成功できないため、競争が以前より激化している時代に、企業は堅牢でスケーラブルでセキュアなエコシステムが必要です。これは、GoogleがVertex AI、Google Cl...
大規模言語モデル(LLM)の著しい進歩は、マルチモーダル大規模言語モデル(MLLM)の開発を刺激しました。LLaVA、MiniGPT-4、InstructBLIPなどの初期のMLLMの努力は、視覚質問回答(VQA)などの視覚言語タスクで著しいマルチモーダル理解能力を示しています。LLMをマルチモーダルドメインに統合するために、これらの研究は、事前トレーニングされたモダリティ固有のエンコーダー(CLIPなど)から特徴をLLMの入力空...
マルチモーダル大規模言語モデル(MLLMs)では、複雑な視覚情報を正確に解釈する能力が重要な焦点となっています。最近の研究では、視覚的認識の強化がホールユーションを大幅に減らし、光学文字認識や文書分析などの解像度感受性タスクのパフォーマンスを向上させることが示されています。いくつかの最近のMLLMsは、ビジョンエンコーダーの混合を使用してこれを実現しています。にもかかわらず、専門家の選択や複数のビジョンエクスパートの統合などの重要...
大規模な事前学習とタスク固有のファインチューニングのアプローチは、言語モデリングにおいて標準的な実践として確立されています。同様に、コンピュータビジョンの方法も、事前学習のための大量のデータを使用することを進めています。LAION5B、Instagram-3.5B、JFT-300M、LVD142M、Visual Genome、YFCC100Mなどの大規模なデータセットの出現により、従来のベンチマークの範囲を超えたデータコーパスの探...
現在の長文脈の大規模言語モデル(LLM)は、最大100,000トークンの入力処理が可能ですが、2,000語を超える長さの出力生成に苦労しています。制御された実験により、モデルが出力長に制限を設ける根本的な要因は、教師ありファインチューニング(SFT)中に見られる例の長さであることが明らかになりました。言い換えると、この出力制限は、既存のSFTデータセットに長出力例が不足していることから生じています。長文脈LLMの最近の進歩により、...
大規模言語モデル(LLM)は、複数の生成呼び出し、先進的なプロンプティング技術、制御フロー、構造化された入出力が必要な複雑なタスクにますます利用されています。しかし、これらのアプリケーションをプログラミングし、実行するための効率的なシステムは不足しています。SGLangは、この問題に対処するために、構造化言語モデルプログラムの効率的な実行を提供することを目的とした新しいシステムです。SGLangは、フロントエンド言語とランタイムで...
大規模なマルチモーダルモデル(LMM)のトレーニングには、画像とテキストのインターリーブされたシーケンスを含む大規模なデータセットが必要です。オープンソースのLMMは急速に進化していますが、まだオープンソースのマルチモーダルインターリーブされたデータセットが不足しています。これらのデータセットは、さまざまなモダリティのコンテンツを理解および生成できる高度なAIシステムを作成するための基盤を形成するため、その重要性は強調されるべきで...
2018年、ニューラルネットワークの世界モデルにおける強化学習の概念が初めて導入され、すぐにこの基本原理が世界モデルに適用された。強化学習を実装する著名なモデルには、潜在的な状態空間の再帰的な状態空間モデルからの強化学習を導入したDreamerフレームワークがありました。DreamerV2は、離散的な潜在変数を使用することで複合エラーを軽減できることを実証しました。DreamerV3フレームワークは、固定されたハイパーパラメータで...
ディープジェネレーティブAIモデルは、自然言語生成、3D生成、イメージ生成、音声合成など、驚くべき能力を示してきました。3Dジェネレーティブモデルは、さまざまな業界やアプリケーションを変革し、現在の3Dプロダクションの風景を変えています。しかし、多くの現在のディープジェネレーティブモデルは、複雑なワイヤリングやライトニングテクスチャーを持つメッシュが、従来のレンダリングパイプライン(Physically Based Renderi...
LLMのウォーターマーキングは、LLMによって生成されたテキストを識別するために、LLMの出力に検出可能な信号を組み込む技術です。この技術は、LLMの誤用を防ぐために重要です。ウォーターマーキング技術は、主に2つのカテゴリに分けられます。KGWファミリーとクリストファミリーです。KGWファミリーは、LLMによって生成されるログを変更してウォーターマークを付けた出力を生成します。クリストファミリーは、LLMのテキスト生成プロセス中に...
LoRA(Low-Rank Adaption)またはPEFT(Parameter Efficient Fine-Tuning)の一種であるLoRAは、他の方法と比較して堅牢なパフォーマンスと広範な適用性を持つため、LLM(Large Language Model)のファインチューニングに最も人気のあるPEFT方法の1つです。LoRAフレームワークは、2つの低ランク行列を使用して、FFT(Full Fine Tuning)での重み更...
オートMLは数年前に人気を博したが、オートMLの初期の研究は90年代初頭に科学者がハイパーパラメータ最適化に関する最初の論文を発表したときに始まった。2014年にICMLが最初のオートMLワークショップを開催したとき、オートMLはML開発者の注目を集めた。オートMLの主要な焦点の1つは、ハイパーパラメータ検索問題であり、モデルは特定の機械学習モデルに対して大きなハイパーパラメータ空間で最適なハイパーパラメータを決定するために、さま...
最近の進歩と大型言語モデルの発展により、ビジョン言語推論、理解、インタラクションの能力が大幅に向上しました。現代のフレームワークでは、ビジョン言語モデルの能力を視覚的に解釈できるように、視覚信号をLLM(Large Language Model)に投影します。これは、視覚エンコーディング戦略が重要な役割を果たすさまざまなシナリオです。ただし、現実世界の画像は、シナリオの範囲が広いだけでなく、解像度とアスペクト比も大きく異なります。...
最近のマルチモーダル大規模言語モデル(MLLM)のアーキテクチャとパフォーマンスの進歩は、パフォーマンスを向上させるためにスケーラブルなデータとモデルが重要であることを強調しています。ただし、このアプローチは実用的で使いやすいものではありません。モデルのサイズを増やすと、計算コストが高くなります。モデルのトレーニングと推論の両方のプロセスで計算コストが高くなります。モデルのサイズを増やすと、計算コストが高くなります。モデルのトレー...
モダンな機械学習および人工知能フレームワークでは、トランスフォーマーはGPTシリーズやBERTなどの自然言語処理、コンピュータービジョンタスクなどのさまざまなドメインで最も広く使用されているコンポーネントの1つです。ただし、トランスフォーマーのアテンションモジュールはシーケンスの長さに比例して計算コストが増加し、高い計算コストの課題をもたらします。さまざまなモデルは、カーネル化、履歴メモリ圧縮、トークン混合範囲の制限、低ランクアプ...