AIモデルとプラットフォーム

Google DeepMind、スマートフォンで手話翻訳を実現するSL2Tをリリース

mm
Unite.AI を Google の優先ソースに追加

Google DeepMindは、手話からテキストへのモデル、SL2Tを、2つのAndroid製品に搭載し、初めて手話AIがスマートフォンの機能としてリリースされました。このモデルは、GboardとLive Transcribeの手話からテキストへの入力機能を可能にし、Pixel 11でアメリカ手話から英語への翻訳を開始しました。

この機能は、ユーザーが通常入力する場所でどこでも機能します。聴覚障害者の手話者は、ウェブ検索、メッセージやドキュメントの作成、またはGeminiへの質問を行うために、カメラに向かって手話で入力できます。Live Transcribeでは、手話者はテキスト入力ではなく手話で会話に応答できます。Googleによると、テスターはASLで手話することが英語で入力するよりも速く、より自然であると感じました。

SL2Tは、Googleが手話翻訳の品質と汎用性のブレークスルーと表現する最初のモデルです。これは、50以上の手話を含む100,000時間以上の手話データで訓練され、そのうち約4分の1がASLでした。言語、方言、熟練度を跨いで共同で訓練することで、会社の実験では単一言語システムを上回るモデルが生成されました。発表によると。

モデルが見るものと翻訳の方法

システムは、手話者の生のビデオを処理しません。デバイス上のモデル、MediaPipe Holisticは、手話者の顔、体、手の130のポイントをフレームごとに追跡し、幾何学的な座標のみがデバイスから翻訳のために送信されます。元のカメラフィードはすぐに破棄されます。これは、Googleがプライバシー保護として説明する設計です。

その座標ストリームから、SL2Tは中間の注釈層であるglossesを省略して、直接英語テキストを生成します。glossesは、個々の手話に固定のラベルを割り当てるもので、ほとんどの以前の手話翻訳システムが依存していたものです。glossesを削除することで、翻訳の品質は訓練データの量に応じてスケールすることができます。

手話は、独自の文法を持つ独立した自然言語であり、英語の手話版ではありません。これは、機械翻訳と、手、腕、胴体、頭、顔の同時動きを高フレームレートで追跡するという難しいコンピュータービジョンの問題を同時に解決する必要があることを意味します。以前の手話技術の試み、たとえばセンサーグローブは、これらの要件のどちらにも対処できませんでした。

ベンチマーク結果と残りのエラー パターン

FLEURS-ASLベンチマークでは、SL2Tは70 BLEURTのスコアを達成し、以前の結果を上回りました。Googleによると、1つの手で手話するバージョンのベンチマークでは74 BLEURT、PRESTO-ASLでは85 BLEURTのスコアを達成しました。FSboardでは、64パーセントの完全一致精度を達成しました。これらの数字はベンダー報告値であり、独立した評価はまだ公開されていません。

Googleは、FLEURS-ASLからのサイドバイサイドの例を公開し、流暢な出力と明らかな失敗モードを示しました。モデルはまれに手話を置き換え、速い指文字を落とし、受動的な構文やクラス分類の描写を失い、コンテキストが不足している場合は時制を失います。1つの例では、「この完全に羽毛で覆われた、温血の鳥」が「この生物は温血で、灰色を食べる」と翻訳され、指文字のエラーで「prey」が「grey」に置き換えられました。

モデルはまた、誰も手話をしていないときにテキストを生成する、残りの幻覚的挙動を示します。たとえば、2人目がフレームに入ったとき、または手話者が一時停止したときに発生します。Googleによると、リリースバージョンは、2026年7月にDeaf評価者がテストした事前リリースビルドと比較して、これらのエラーを大幅に削減しましたが、完全には除去されていません。

Googleがツールを使用してはならない場所

リリースには、通常のレイヤーが追加されています。Google DeepMindは、Deaf組織、National Association of the Deaf、World Federation of the Deaf、Deaf Professional Arts Network、Rochester Institute of TechnologyのNational Technical Institute for the Deafを含む、手話AIアドバイザリーコミッティーを設立しました。委員会は、共同の影響レポートを作成し、テクノロジーが何であるか、どこで使用するべきではないかを定義しました。

レポートでは、SL2T 1.0を、低リスク、非公式の状況でのアシスタントドラフト生成ツールとして定義しています。メッセージング、検索、ナビゲーション、メモ作成、およびカジュアルな1対1会話に使用されます。医療相談、法的手続き、警察の対応、授業、面接、政府の利益決定に対しては明示的に除外されています。また、機関が認定された人間の通訳者に代わるために使用してはならないことも述べられています。

手話者は、プロセス全体でコントロールを維持します。両方のアプリでは、ユーザーが確認および編集できるテキストプレビューが表示され、Live Transcribeでは、Deafユーザーが会話相手に翻訳されたテキストを表示するタイミングを制御できます。レポートでは、このセーフガードは、エラーをキャッチするために機能的な英語のリテラシーを前提としていることが記載されています。

SL2Tがモデル独自の限界ドキュメントでどのように機能するか

影響レポートは、モデルの技術的境界を詳細にカタログ化しています。明るさが低い、背光が強い、または服が手や顔と対比してコントラストが低いと、精度が低下します。ポーズトラッカーはフレーム内の最大の被写体のみを追跡し、複数の手話者を処理できません。カメラの角度が極端であるか、手話者が横になっている場合、パフォーマンスが低下します。入力クリップは60秒に制限され、各クリップは独立して翻訳され、以前の会話の記憶はありません。モデルは18歳未満の手話者で訓練または評価されていません。カスタムの単語リスト、名前の手話、方言の設定はサポートされていません。

近い将来のアップデートには、句読点、改行、絵文字、基本的な編集コマンドの入力、およびLive Transcribeでの連続クリップ間の会話メモリが含まれます。長期的な研究目標には、非手話マーカーである顔の表情や眉の位置への感度の向上、複数の手話者のサポート、地域によるASL方言やBlack ASLへのデータ収集の拡大が含まれます。

プロジェクトは、DeafのGooglerであるSam Sepahから始まり、Deafの視点がデータ収集、ユーザー研究、評価に組み込まれました。Googleは、SL2Tのリリースを、長期的な取り組みの始まりと表現しています。追加の手話、手話生成、より広範なフロンティア機能がすべてアクティブな作業としてリストされています。この機能は、Pixel 11で追加コストなしで提供され、以降のデバイスにも搭載される予定です。データ収集、ユーザー研究、評価に。

ジョナス・リーブは、Unite.AIでのAI生成アナリストで、認知AI、人工一般知能(AGI)、および機械知能の理論的基礎に焦点を当てています。彼の仕事は、生物系と人工系の両方で、学習、推論、記憶、抽象化がどのようにして現れるかを探求し、現代のAIアーキテクチャと認知科学および心の哲学の長年の疑問との間でつながりを築いています。
概念的かつ反省的なアプローチで、ジョナスは、推論モデル、エージェントシステム、出現性認知、整列理論などのフレームワークを検討し、AGIへの進歩が実際に何を意味するか、そして何を意味しないのかを明確にしようとします。タイムラインやヒープを追うのではなく、第一原理、概念的厳密さ、現在のモデルにおける限界を強調しています。
ジョナス・リーブによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって検証されており、先進的なAI概念についての正確性、明確性、責任ある議論を保証しています。