AIモデルとプラットフォーム
アナスタシア・ルーキナ、ETSのシニアリサーチサイエンティスト(NLP/スピーチ)- インタビューシリーズ

アナスタシア・ルーキナは、Educational Testing Services(ETS)での研究科学者であり、自動スピーチ評価に取り組んでいます。
彼女の研究関心は、モダン・ギリシャ語の方言、スピーチ・リズム、自動Prosody分析など、広範なトピックにわたります。
現在の彼女の仕事は、スピーチ技術と機械学習のツールや方法を、スピーチ認識/生成に関する研究の洞察と組み合わせて、非ネイティブスピーチの評価用の自動評価モデルを構築することに焦点を当てています。
あなたは明らかに言語に対する愛情を持っています。どのような経験があなたをこの分野に導いたのですか?
私はロシアのサンクトペテルブルクでロシア語を話し始め、英語に初めて触れたときに、あるパターンが見つかれば、ロシア語の単語を英語の単語に「変換」できることに魅了されました。ただし、そのパターンは必ずしも当てはまるとは限らず、新しいルールを見つける必要がありました。当時、言語学の分類や借用語の違いについては何も知らなかったですが、この経験が言語学への関心を高め、さらに多くの言語を学ぶ動機になりました。この言語学への関心が、私を音声学、機械学習、そして現在の仕事につながらせました。
あなたは以前、英語とロシア語、モダン・ギリシャ語とロシア語の間の翻訳者でした。翻訳者としてのあなたの経験は、NLPのニュアンスや問題に対する洞察を深めたと感じていますか?
私は常に研究者であると自認しています。私はモダン・ギリシャ語、特にモダン・ギリシャ語の音声学を研究する学者としてキャリアを始めました。博士論文では、モダン・ギリシャ語の方言間の音声学的違いと、これらの違いが地域の歴史と関連している可能性について研究しました。モダン・ギリシャ語の方言間の違いは、各方言が他の言語と接触した結果として生じた可能性があると主張しました。現在はモダン・ギリシャ語以外の分野で研究を続けていますが、言語接触の影響は私の研究の核心であり続けています。ただし、現在は新しい言語を学ぶ個人における言語接触に焦点を当て、技術が最も効率的に学習を支援できる方法を探究しています。
英語には多数のアクセントがあります。NLPをどのように設計すれば、これらのアクセントをすべて理解できるでしょうか? これは、深層学習アルゴリズムに各アクセントからの大量のデータを追加することで解決できる問題でしょうか?
これに対処するために、過去にいくつかのアプローチが使用されてきました。1つの大きなモデルを構築するのではなく、アクセントを識別してからカスタムモデルを使用する、または複数のモデルを同時に使用して最も適切なものを選択する、などの方法があります。最終的には、幅広いアクセントに対応するには、システムが遭遇するアクセントを代表するトレーニングと評価データが必要です。
ETSでは、自動システムによって生成されるスコアが、評価対象の実際のスキルに基づいており、学習者の人種、性別、出身国などの人口統計学的特性によって影響を受けないことを確認するための包括的な評価を実施しています。
子供や言語学習者は、完璧な発音を難しく感じることが多いです。発音の問題をどのように解決しますか?
「完璧な発音」というものは存在しません。私たちが話す言葉は、自分のアイデンティティと密接に結びついており、開発者や研究者としての私たちの目標は、システムがすべてのユーザーにとって公平であることを保証することです。
子供や言語学習者は、スピーチベースのシステムにとって特有の課題を提起します。たとえば、子供の声は大人と比べて音質が大きく異なり、子供たちは大人と異なった方法で話します。さらに、子供間の変異は大きいため、子供用の自動スピーチ認識システムの開発は、通常、多量の子供のスピーチデータを必要とする別のタスクとなります。
同様に、同じ背景を持つ言語学習者でも、音声学的、文法的、語彙的なパターンの使用において大きな変異があり、スピーチ認識は特に困難なタスクとなります。英語語学力の評価用にシステムを構築する際には、さまざまなレベルの言語学習者と母語話者のデータを使用しています。
2018年1月に、あなたは「自動スピーチ評価システムのトレーニングと評価にエクスペリヤンス応答を使用する」という論文を発表しました。この論文の主なブレークスルーと基本的な概念は何ですか?
この論文では、トレーニングデータとテストデータの品質が自動評価システムのパフォーマンスに与える影響を調査しました。
自動評価システムは、人間によってラベル付けされたデータでトレーニングされます。この場合、人間の評価者によって割り当てられたスコアです。人間の評価者は常にスコアについて一致を見せるわけではありません。評価において、人間の評価者の合意レベルを確保するために、いくつかの戦略が使用されています。しかし、自動評価エンジンは通常、レスポンスレベルのスコアでトレーニングされるため、これらのスコアの不一致はシステムのパフォーマンスに悪影響を及ぼす可能性があります。
多量のデータと人間の評価者の合意レベルが異なるデータにアクセスできたため、システムのパフォーマンスをさまざまな条件下で比較検討することができました。結果として、完全なデータでトレーニングしたシステムと、ノイジーなラベルを持つデータでトレーニングしたシステムのパフォーマンスに大きな差は見られませんでした。完全なラベルは、トレーニングセットのサイズが非常に小さい場合にのみ有利です。一方、人間のラベルの品質はシステムの評価に大きな影響を与えました。クリーンなラベルで評価した場合、パフォーマンスの推定値は最大30%高くなることがありました。
重要な結論は、多量のデータとリソースがあれば、トレーニングセットではなく評価セットのラベルをクリーンにする方が賢明であるということです。この発見は自動評価に限らず、他の多くの分野にも適用できます。
あなたのETSでの仕事について説明してください。
私は教育的な文脈で話された言語を処理するスピーチ評価エンジンシステムに取り組んでいます。1つのシステムとして、SpeechRater®があり、先進的なスピーチ認識と分析技術を使用して英語のスピーチ能力を評価し、詳細なフィードバックを提供します。SpeechRaterは10年以上前に導入された成熟したアプリケーションです。私はさまざまなアプリケーション用のスコアリングモデルを構築し、ETSの他の同僚と協力して、スコアがすべての受験者にとって信頼性が高く、公平で、有効であることを確認しています。また、システムのパフォーマンスを継続的に監視するために他のETSグループと協力しています。
運用システムのメンテナンスと改善に加えて、新しいシステムのプロトタイピングも行っています。私が特に興奮しているプロジェクトの1つは、RelayReader™です。これは、読み手が本を朗読し、読み手をサポートするために設計されたアプリケーションです。RelayReaderで本を読むと、ユーザーの読みはサーバーに送信され、フィードバックが提供されます。スピーチ処理の面では、このアプリケーションの主な課題は、読み手の関与を妨げることなく、学習を測定し、信頼性の高いフィードバックを提供する方法を見つけることです。
あなたがETSで働くことの最も好きな点は何ですか?
ETSに最初に惹かれたのは、全世界のすべての人々の教育の質を向上させるという非営利目的の組織であるという点でした。研究が製品につながることは素晴らしいことですが、将来の製品開発に役立つ基礎的なプロジェクトに取り組む機会があることも感謝しています。また、ETSはデータのプライバシーと公平性を非常に真剣に考慮しており、すべてのシステムは運用前に厳格な評価を受けることも評価しています。
しかし、ETSが素晴らしい職場である理由は、科学者、エンジニア、開発者が多様な背景から集まっているコミュニティです。これにより、多くの面白いコラボレーションが可能になります。
あなたは、AIが将来チューリング・テストに合格する可能性があると考えていますか?
1950年代以来、チューリング・テストの実践的な解釈は多数ありました。哲学的な意味で、人間のように考えられるAIシステムが存在しないという点では一般的な合意があると思います。しかし、これは非常にニッチなテーマとなりました。多くの人は、システムをチューリング・テストに合格させることを目的として構築しません。私たちは、特定の目標を達成するシステムを構築したいのです。
スピーチ認識や自然言語理解などのタスクについては、人間のパフォーマンスが金標準と見なされることがあります。しかし、AIシステムが人間よりも優れたパフォーマンスを見せるタスクもあり、またはAIシステムと人間の専門家が協力して最良の結果を達成するタスクもあります。たとえば、教育の文脈では、AIシステムが教師を置き換えるのではなく、教師を支援するために使用したいと考えています。学生の学習トラジェクトリーのパターンを特定したり、採点を支援したり、最適な教材を見つけたりするためです。
あなたがETSやNLPについて共有したいことがあれば、こちらに記載してください。
多くの人は、ETSを評価や自動評価システムで知っています。しかし、ETSはそれ以外にも多くのことができます。ボイス・バイオメトリクス、スピーチ・ダイアログ・アプリケーションなど、技術を学習に統合する新しい方法を常に探究しています。現在、多くの学生が自宅で学習しているため、ETSは一般の人々にいくつかの研究能力を開放しています。
インタビューに参加いただき、NLPとスピーチ認識の最新の進歩についての洞察を提供いただき、ありがとうございます。詳しく知りたい方は、Educational Testing Servicesを訪問してください。












