倫理
研究者は神経科学者に頼ることでデータセットの偏りを克服しようとしている

MIT、ハーバード大学、富士通株式会社の研究者チームは、機械学習モデルがデータセットの偏りを克服できるかどうかを調査しました。彼らは、訓練データが人工ニューラルネットワークの学習にどのように影響するかを研究するために、神経科学的なアプローチを取りました。
この研究は、Nature Machine Intelligenceに掲載されました。
訓練データの多様性
研究の結果は、訓練データの多様性がニューラルネットワークが偏りを克服できるかどうかに影響することを示しました。ただし、データの多様性はネットワークのパフォーマンスに悪影響を与える可能性もあります。研究者は、ニューラルネットワークの訓練方法も偏ったデータセットを克服できるかどうかに影響することを示しました。
ザビエル・ボイクスは、脳と認知科学部門(BCS)と脳、心、機械のセンター(CBMM)の研究科学者です。また、彼は論文の共同著者です。
「ニューラルネットワークはデータセットの偏りを克服できることは励みになる。しかし、主な結論は、データの多様性を考慮する必要があるということです。大量の生データを収集するだけで何らかの成果が得られるという考え方を止める必要があります。データセットを設計する際に非常に注意深く考える必要があります」とボイクスは述べました。
チームは、新しいアプローチを開発するために神経科学者の考え方を取り入れた。ボイクスによると、実験では制御されたデータセットを使用することが一般的であるため、チームはさまざまなオブジェクトの画像を含むデータセットを構築し、組み合わせを制御して、一部のデータセットをより多様なものにしました。オブジェクトの画像が1つの視点からのみ表示されるデータセットは、より少ない多様性を持ち、オブジェクトの画像が複数の視点から表示されるデータセットは、より多くの多様性を持ちます。
研究者は、これらのデータセットを使用して、画像分類のためのニューラルネットワークを訓練しました。次に、ネットワークが訓練中に見なかった視点からのオブジェクトを識別する能力を調べました。
結果は、より多様なデータセットはネットワークが新しい画像や視点を一般化する能力を向上させ、偏りを克服する上で重要であることを示しました。
「しかし、常に多様性が高い方が良いというわけではありません。ここに緊張関係がある。ネットワークが新しいものを識別する能力が向上すると、既に識別しているものを識別する能力が低下する」とボイクスは述べました。
ニューラルネットワークの訓練方法
チームはまた、各タスクごとに個別に訓練されたモデルは、両方のタスクを同時に訓練されたモデルよりも偏りを克服する能力が高いことを発見しました。
「結果は非常に印象的でした。実際、最初にこの実験を行ったとき、私たちはバグだと思いました。結果が本当であることを確認するために、数週間かかりました。なぜなら、結果が予想外だったからです」とボイクスは続けました。
詳細な分析により、ニューロンの専門化がこのプロセスに関与していることがわかりました。ニューラルネットワークが画像内のオブジェクトを識別するように訓練されると、2種類のニューロンが現れます。1つのニューロンはオブジェクトのカテゴリを識別することに専門化し、もう1つのニューロンは視点を識別することに専門化します。
専門化されたニューロンは、ネットワークが個別のタスクに訓練されたときにより顕著になります。ただし、ネットワークが同時に両方のタスクを訓練されたとき、一部のニューロンは希薄化します。つまり、ニューロンは1つのタスクに専門化せず、混乱しやすくなります。
「しかし、次の質問は、これらのニューロンがどのようにして現れたのかです。ニューラルネットワークを訓練すると、これらのニューロンが学習プロセスから現れます。誰もネットワークにこれらのニューロンを含めるように指示しませんでした。そこが最も興味深いことです」とボイクスは述べました。
研究者は、これらの質問を将来の研究で調査し、新しいアプローチをより複雑なタスクに適用する予定です。












