AIモデルとプラットフォーム
脳インプラントとAIモデルを使用して思考をテキストに翻訳する
カリフォルニア大学サンフランシスコ校の研究者は最近、脳の活動を分析してテキストを生成するAIシステムを作成しました。つまり、思考をテキストに翻訳するのです。AIはユーザーの神経信号を取得して解読し、30〜50文のセットに基づいてリアルタイムで最大250語を解読できます。
インデペンデント紙の報道によると、AIモデルは4人の女性から収集された神経信号でトレーニングされました。実験の参加者には、てんかんの発作の発生を監視するために脳に電極が埋め込まれていました。参加者は文を大声で読み、神経信号はAIモデルに供給されました。モデルは、特定の単語と関連する神経活動を約97%の精度で判別でき、平均誤差率は約3%でした。
これは、神経信号が文と関連付けられる最初の試みではありません。神経科学者は10年以上前に同様のプロジェクトに取り組んでいます。しかし、研究者が作成したAIモデルは、印象的な精度を示し、ほぼリアルタイムで動作します。モデルは、再帰型ニューラルネットワークを使用して神経活動を単語に翻訳できる表現にエンコードします。著者は論文で述べているように、
「最近の機械翻訳の進歩に基づいて、各文の神経活動シーケンスを抽象的な表現にエンコードする再帰型ニューラルネットワークをトレーニングし、次にこの表現を単語ごとに英語の文にデコードしました。」
ArsTechnicaによると、神経信号と単語のリンクがどのように作成されたかをよりよく理解するために、研究者はシステムのさまざまな部分を無効化して実験しました。システムの精度は、神経表現に由来することが明らかになりました。また、オーディオ入力をシステムから無効化するとエラーが増加しましたが、全体的なパフォーマンスはまだ信頼性が高かったと考えられます。明らかに、このシステムは話すことができない人にとって有用なデバイスになる可能性があります。
電極入力のさまざまな部分を無効化すると、システムは特定の脳領域、特に言語処理と生成に関連する領域に最も注意を払っていることがわかりました。たとえば、システムのパフォーマンスの相当部分は、話すときに自分の声の音に注意を払う脳領域に基づいていました。
初期の結果は約束のあるものの、研究チームはモデルがより大きな語彙に拡張する方法がわかっていません。原理がより大きな語彙に一般化できることが重要です。平均的な英語話者は約20,000語の活用語彙を持っています。現在のデコーダー方法は、文の静的構造を解釈し、特定の神経活動パターンに一致する単語について教育された推測を行うことで動作します。語彙が増加すると、より多くの神経パターンが似ている可能性があるため、全体的な精度が低下する可能性があります。
論文の著者は、デコーダーが最終的に言語の規則的なパターンを判断する方法を学ぶことを希望していますが、日常の英語言語に一般化できるモデルをトレーニングするために必要なデータの量は不明です。この問題に対処するための1つの方法は、他の脳コンピュータインターフェースから収集されたデータを使用してトレーニングを補足することです。これらのインターフェースは、さまざまなアルゴリズムとインプラントを使用します。
カリフォルニア大学の研究者による研究は、神経インターフェースとコンピュータに関する研究と開発の波の中で最近の進展です。ロイヤルソサエティは、人とコンピュータを接続する神経インターフェースが最終的に人々が互いの考えを読むことを可能にするという報告書を昨年発表しました。報告書は、エルオン・マスクによって作成されたNeuralinkスタートアップとFacebookによって開発されたテクノロジーを、人間向けコンピューティングの進歩の証拠として引用しています。ロイヤルソサエティは、人間とコンピュータのインターフェースが、次の2つの10年間でアルツハイマー病などの神経変性疾患の治療において強力な選択肢になることを示しています。












