AIモデルとプラットフォーム
アマゾンアレクサのヘッドリサーチャーがチューリングテストは古いと主張
アマゾンのアレクサの副社長兼チーフサイエンティストであるロヒット・プラサードは、最近、アレクサのブログで、AIモデルの洗練度を測るために長年使用されてきたチューリングテストは、AIのベンチマークとしては時代遅れであると主張した。
コンピューターサイエンティストおよび数学者であるアラン・チューリングは、70年以上前にチューリングテストの概念を初めて導入した。チューリングテストの目的は、機械が「人間の意味での思考」が可能かどうかを判断するためのものだった。チューリングは、機械が人間の会話行動を人間の会話と区別できないほど高度な会話行動を示せれば、機械は思考が可能であるとみなされるべきだと主張した。
チューリングテストの限界
プラサードは、チューリングテストには多くの限界があり、チューリング自身も初期の論文でこれらの限界について言及していたと主張した。チューリングの初期の論文によると、AIが私たちの生活のあらゆる側面に統合されるにつれて、人々はAIが人間と区別できないことを気にしなくなり、AIとのやり取りがスムーズであることを気にするようになった。プラサードは、この理由から、チューリングテストは時代遅れとみなされ、より有用なベンチマークに置き換えられるべきだと主張した。
プラサードは、多くの初期のチャットボットはチューリングテストに合格することを目的として設計され、近年ではいくつかのチャットボットが人間の判断者を3分の1以上欺くことに成功したと指摘した。しかし、人間の話し方をうまく真似ることができるということは、機械が「真に知能を持っている」ということではない。AIモデルはある分野では非常に優秀で、他の分野では非常に乏しい場合があり、汎用的な知能は持たない。それにもかかわらず、チューリングテストはまだチャットボットやデジタルアシスタントの一般的なベンチマークであり、プラサードはビジネスリーダーやジャーナリストが常にアレクサがチューリングテストに合格できるかどうかを尋ねていると指摘した。
プラサードによると、チューリングテストを使用して機械の知能を評価することの主な問題は、機械が情報を検索し、高速に計算する能力をほとんど考慮していないことである。AIプログラムは、複雑な数学や地理に関する質問に答えるために、人間を欺くために人工的な遅延を挿入するが、実際には瞬く間に答えを出すことができる。また、チューリングテストは、AIが外部センサーによって収集されたデータを使用して世界とやり取りする能力を考慮していない。AIはテキストコミュニケーションのみに頼り、ビジョンやモーションアルゴリズムを使用して世界とやり取りすることはできない。
新しいベンチマークの作成
プラサードは、新しい知能の測定方法が必要であり、これらの方法は汎用的な知能の評価に適しているべきだと主張した。これらのテストは、AIが現代社会で実際にどのように使用されているか、人々がAIを使用する目的を反映するべきである。テストは、AIが人間の知能をどれだけ高めるか、人間の日常生活をどれだけ改善するかを評価するべきである。また、テストは、AIが人間のような知能の特徴、たとえば言語能力、自己監督、そして「常識」をどれだけ示すかを理解するべきである。
現在のAI研究の重要な分野、たとえば推論、公平性、会話、感覚的理解は、チューリングテストでは評価されないが、さまざまな方法で評価することができる。プラサードは、これらの知能の特徴を評価する方法の1つは、課題を構成要素のタスクに分解することであると説明した。別の評価方法は、大規模な現実世界の課題を人間とコンピューターの間で作成することである。
アマゾンがアレクサ賞を創設したとき、ソーシャルボットが20分間人間と会話するためのルーブリックを作成した。ボットは、テクノロジー、スポーツ、政治、エンターテイメントなどの幅広いトピックについて論理的に会話する能力を評価された。開発段階では、顧客がボットに再び会話したいという欲求に基づいてスコアを付けた。最終ラウンドでは、独立した審判が5点満点の評価尺度を使用してボットを評価した。審判が使用したルーブリックは、適切な場合に共感などの重要な人間の特徴をAIが示すことを可能にする方法に基づいていた。
最終的に、プラサードは、アレクサのようなAI搭載デバイスの増加は、AIの進歩を測るための重要な機会を表しているが、新しい機会を利用するには、異なるメトリックが必要であると主張した。
「これらのAIは、タスク固有の知能ではなく、より汎用的な学習能力によって、ますます多くのタスクを専門家として行う必要がある」とプラサードは説明した。「したがって、次の10年間およびその先において、会話型および予測的な支援能力を備えたAIサービスは、アンビエントデバイス上で有用なテストとなる」。












