AIモデルとプラットフォーム
ディープマインド、AIトレーニング技術を開発し、人間の脳にも効果がある可能性が発見される
ディープマインドは最近、強化学習の一種である分布強化学習を開発し、そのメカニズムが人間の脳内の報酬経路の働きを説明する可能性があることを示唆する論文を発表しました。 NewScientistの報道によると、このマシンラーニングのトレーニング方法は、分布強化学習と呼ばれ、そのメカニズムは、脳内のドパミン放出のメカニズムを説明する可能性があります。
神経科学とコンピューターサイエンスは、長い歴史を持っています。1951年、マービン・ミンスキーは、報酬と罰を使用して、迷路を解決することができるコンピュータープログラムを作成しました。ミンスキーは、イワン・パブロフの研究に影響を受けており、パブロフは、犬が報酬と罰を使用して学習することを実証しました。ディープマインドの新しい論文は、神経科学とコンピューターサイエンスの歴史をさらに発展させ、強化学習の一種を使用して、ドパミン神経の機能を理解するための洞察を提供しています。
人間や動物が行動を起こす前に、脳内のドパミン放出を担当する神経集団は、行動の報酬を予測します。行動が実行され、その結果が明らかになると、脳はドパミンを放出します。しかし、このドパミン放出は、予測の誤差に比例して調整されます。報酬が予想よりも大きい場合、ドパミンの放出が強くなります。一方、報酬が予想よりも小さい場合、ドパミンの放出が弱くなります。ドパミンは、神経が予測を調整して、実際の報酬に収束するための修正機能として作用します。これは、強化学習アルゴリズムが動作する仕組みと非常に似ています。
2017年、ディープマインドの研究者は、一般的に使用されている強化学習アルゴリズムの強化版を発表し、この新しい学習方法は、多くの強化学習タスクの性能を向上させることができました。ディープマインドのチームは、新しいアルゴリズムのメカニズムが、人間の脳内のドパミン神経の機能を説明するために使用できる可能性があると考えました。
従来の強化学習アルゴリズムとは異なり、ディープマインドの新しいアルゴリズムは、報酬を分布として表現します。従来の強化学習アプローチでは、予想報酬を単一の数値として表現し、平均的な期待結果を表します。この変更により、モデルは可能な報酬をより正確に表現し、性能が向上しました。新しいトレーニング方法の優れた性能により、ディープマインドの研究者は、人間の脳内のドパミン神経が同様の方法で機能する可能性があるかどうかを調査することにしました。
ドパミン神経の機能を調査するために、ディープマインドはハーバード大学と協力して、マウスのドパミン神経の活動を研究しました。研究者は、マウスにさまざまなタスクを実行させ、サイコロの出目に基づいて報酬を与え、ドパミン神経の放電を記録しました。さまざまな神経は、さまざまな潜在的な結果を予測し、さまざまな量のドパミンを放出しました。いくつかの神経は、実際の報酬よりも低い予測を行い、他の神経は、実際の報酬よりも高い予測を行いました。報酬予測の分布をグラフ化した結果、予測の分布は、実際の報酬分布に近かったことがわかりました。これは、脳が予測を行うときに分布システムを使用していることを示唆しています。
この研究は、神経科学とコンピューターサイエンスの両方に影響を与える可能性があります。この研究は、分布強化学習を使用してより高度なAIモデルを作成することを支持しています。さらに、脳の報酬システムの機能に関する理論に影響を与える可能性があります。ドパミン神経が分布している場合、ある神経は他の神経よりも悲観的または楽観的である可能性があり、分布を理解することで、心理学における精神衛生と動機付けなどの側面にアプローチを変更する可能性があります。
MIT Technology Reviewの報道によると、ディープマインドの神経科学研究ディレクターであるマット・ボットビニックは、プレスブリーフィングで、この発見の重要性について説明しました。ボットビニックは次のように述べました。
「脳がそれを使用している場合、それは良いアイデアである可能性があります。これは、実際の状況で拡大することができる計算技術であることを示しています。他の計算プロセスとよく適合するでしょう。私たちの日常生活における脳の機能について、新しい視点を提供してくれるでしょう」












