インタビュー

スピーチマティクスの製品担当責任者Thuy Le – インタビューシリーズ

mm
Unite.AI を Google の優先ソースに追加

Thuy Leは、Speechmaticsの製品担当責任者です。Thuyには、テクノロジーと革新的なアイデアの開発における20年以上の経験があります。また、MITでは機械工学の学士号、スタンフォードでは製品デザインの修士号を取得しています。Thuyには、製品管理、デザイン、開発、研究開発、エンジニアリング、メディア開発、ビジネス戦略など、幅広い分野での経験があります。Speechmaticsでは、革新的な製品とサービスを立ち上げ、ビジネスがすべての分野で市場をリードすることを支援する役割を担っています。

2019年11月に、Speechmaticsに参加する前に、自動運転車やB2Bアナリティクスソフトウェアなどのさまざまな業界で働いていました。スピーチ認識技術に取り組むきっかけとなったのは何ですか?

新しいテクノロジーの応用や、有意義な影響を与えることに興味があります。Speechmaticsのスピーチ認識技術は、その基準を満たしています。確かに、Speechmaticsの顧客がスピーチ認識技術の価値を自分の製品に活かすのを支援することは、素晴らしい経験でした。

Speechmaticsの製品担当責任者として、1日の業務はどうなりますか?

Speechmaticsは成長している会社で、製品チームは小さく(そして成長しています!)、ので、2日の業務は似ておりません。誰でも必要に応じて協力しています。製品担当責任者として、会社や製品の戦略的な立案から、ロードマップの優先順位付けや顧客とのやり取り、詳細な問題解決まで、幅広い業務を担当しています。組織内のさまざまな部門との関係構築や採用も、重要な役割です。

さまざまな方言やアクセントのデータセットへのアクセスに関する課題についてお話しください。

スピーチ技術では、通常、エンジンは1つの言語の1つの方言でトレーニングされており、その方言が最も正確に認識され、文字起こされます。英語の場合、アメリカ英語がそれであり、オーストラリア英語、イギリス英語、ジャマイカ英語などのアクセントでは、エラー率が高くなります。したがって、グローバルな顧客ベースと接触する企業にとって、これは大きな課題となります。3年前、2018年に、我们はGlobal Englishを立ち上げました。これは、すべての英語のアクセントと方言を理解する業界をリードする言語パックです。昨年、Global Spanishを立ち上げ、使命を続けています。私たちは、スピーチ技術が最大の潜在能力を発揮するには、誰と接触するかに関係なく、すべてを理解する必要があると考えています。今年後半にさらに革新的な技術を発表することを楽しみにしています。

これらのデータセットをトレーニングするために使用される機械学習手法についてお話しください。

私たちは、よく知られた教師ありのディープラーニング手法やニューラルネットワークをエンジンで使用しています。また、新しいアプローチを継続的に研究しています。特に、ASRモデルで必要なラベル付きデータの量を減らす方法についてです。スピーチ認識技術を構築する上で、データは非常に重要です。したがって、データのリーチを拡大する研究を進めることは不可欠です。エンジンでニューラルネットワークを使用することで、さまざまなコンテキストや言語でよりよく一般化することができます。

Speechmaticsは現在、業界をリードする企業で、テスト結果によると、Global SpanishはGoogleの製品よりも3-20%、Microsoft (MSFT ) の製品よりも4-13%高精度です。この成功の要因は何ですか?

(GOOGL )

前述したように、スピーチ技術がビジネスに真正に役立つためには、顧客ベース全体を理解する必要があります。言語や方言に関係なく、Speechmaticsの革新はこれを解決することを目指しています。また、情熱的で、動機付けされた、投資されたチームがいます。彼らは、最新のディープラーニング技術を使用して、顧客に最高の技術を提供することに尽力しています。

現在提供されている言語と、追加予定の言語についてお話しください。

現在、30以上の商用言語を提供しています。アラビア語から中国語、ポーランド語からポルトガル語まで、多数の言語をサポートしています。ただし、英語とスペイン語の言語パックはグローバルです。将来的には、新しい技術を使用して、新しい言語をより迅速に追加し、既存の言語をより定期的に改善することを目指しています。

音声によるコミュニケーションが主なコミュニケーション手段となる将来についてのご意見を聞かせてください。

企業は、スピーチ認識技術の価値を認識し始めています。2020年には、企業の68%が音声技術戦略を持っていることが報告されており、前年比で18%増加しました。ただし、この技術が最大の価値を発揮するためには、向上が必要です。会話は単なる言葉だけではなく、感情、リズム、句読点、背景ノイズ、トーン、話者変更など、コンテキストのヒントで構成されています。テキストからスピーチ認識技術だけでは多くの価値を提供できますが、音声ファイルやビデオファイルの場合、録音されたスピーチは単なる言葉を超えて、価値を提供することができます。スピーチ認識技術の将来は、これらの他の要素を考慮に入れ、単にスピーチをテキストに変換するのではなく、スピーチを価値に変換し、真正にすべての声を理解するものになります。

Speechmaticsについてさらに共有したいことがありますか?

今年後半に発表される、非常に興奮するべき進歩について共有することができると思います。ぜひ、注目してください!

素晴らしいインタビュー、詳しく知りたい読者はSpeechmaticsを訪れてください。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。