AIモデルとプラットフォーム
AIシステムは人間の言語を好み、数値データよりも優れている可能性がある

新しい研究は、コロンビア工学大学から発表され、人工知能(AI)システムは数値データではなく人間の言語を好み、1と0の数字ではなく音声ファイルでプログラミングすることができることを示唆している。新しい研究は、機械工学教授のHod Lipsonと博士課程の学生Boyuan Chenによって行われた。この研究では、AIシステムは人間の言語の音声ファイルでプログラミングすることで、より高いパフォーマンスレベルに達することができることを実証した。
サイドバイサイドの比較では、音声ファイルでトレーニングされたニューラルネットワークは、シンプルなバイナリ入力でプログラミングされたネットワークよりも、オブジェクトを識別する際に高いパフォーマンスレベルに達した。
リプソンは、ジェームズとサリー・スカパ教授であり、コロンビア大学のデータサイエンス研究所のメンバーである。
「この発見の理由を理解するには、ニューラルネットワークが通常どのようにプログラミングされるか、そして人間の声の音を使用する理由を理解する必要がある」とリプソンは述べた。
バイナリ数字はコンパクトで正確であるが、人間の言語はより複雑で非バイナリである。プログラマーは通常、ニューラルネットワークを開発する際に数字から逸脱しないことが多い。
チームは、ニューラルネットワークが全ての可能性を発揮していないと考え、人間の声と特定の言葉でトレーニングすることで、より速くよりよいパフォーマンスが得られるのではないかと考えた。
ネットワークのトレーニング
新しい機械学習技術をテストする際、AI研究者は通常、ニューラルネットワークを特定のオブジェクトや動物を写真の中で識別するようにトレーニングする。
チームは、チェン、リプソン、ユー・リー、スーザン・ラグパティを含むメンバーで構成され、制御実験を設定し、2つの新しいニューラルネットワークを作成した。彼らはこれらのネットワークをトレーニングすることで、50,000枚の写真の中から10種類のオブジェクトを識別できるようにした。
1つのAIシステムは従来の方法で数値値でトレーニングされたが、実験的なニューラルネットワークは異なる方法でトレーニングされた。データテーブルに写真とオブジェクトの音声ファイルが含まれており、1や0は使用されなかった。
両方のAIシステムは15時間トレーニングされた。結果は、元のネットワークが1と0のシリーズで回答したのに対し、実験的なニューラルネットワークはオブジェクトの名前を「言っている」ように聞こえた。元の音声は理解不能だったが、最終的にほとんど正しい回答になった。
両方のネットワークは92%の精度でオブジェクトを正しく識別した。研究者は実験を2回目に実行し、写真の数を減らした。
従来のネットワークはデータが少ないため、35%の精度に低下したが、実験的なネットワークは70%の精度を維持した。
https://www.youtube.com/watch?v=Iq2YjHCAPRQ
驚くべき結果
次に、チームはより難しい画像を使用し、犬の画像を使用した。実験的なニューラルネットワークは50%の精度で回答したが、従来のネットワークは20%の精度しか出なかった。
ボユアン・チェンはこの研究のリード研究者である。
「私たちの発見は、多くの専門家がコンピュータと数字について考え方を変えるものである。バイナリ入力は機械に情報を伝えるより効率的な方法であるというのが一般的な仮定である」とチェンは述べた。
「人間の言語は数十千年間の最適化プロセスを経てきたので、人間の言葉がノイズとシグナルをバランスよく表現できることは当然である」とリプソンは述べた。
「私たちは、AIシステムをトレーニングするために新しい方法を考え、よりよい方法で教えることができる」とチェンは述べた。
「人間の言語の獲得と子供が話すことを学ぶのは、人間の進化の最大の謎の1つである」とリプソンは述べた。 「人間の幼児は繰り返し音声指示で最もよく学習するので、AIシステムも同様である可能性がある」とリプソンは述べた。












