インタビュー
カードームのCEO兼共同創設者ダニ・チェルカスキー – インタビュー・シリーズ

ダニ・チェルカスキー、カードームのCEO兼共同創設者は、音響、信号処理、アルゴリズム開発における20年以上の経験を、ボイステクノロジー革新の最前線に持ち込みました。カードームを創設する前に、サイレンティウム株式会社のCTOとして、Tier 1企業や研究機関との共同研究を牽引しました。バル=イラン大学でのマイクロフォンアレイ処理の博士号を取得したチェルカスキーは、深い技術的専門知識と、現代のボイスインタラクションの苛立ちを排除するという明確な使命感を組み合わせています。彼の使命は、技術が周囲のノイズではなく、人々に真正に耳を傾けるものを作ることです。
カードームは、車、会議室、スマートホーム、公共の空間など、どのような環境でも、明確でパーソナライズされたボイスインタラクションを提供するAIドライブの空間音響ソリューションの先駆者です。独自のスピーチクラスタリング技術により、音声は位置に基づいて分離され、デバイスは各スピーカーを、唯一の話者であるかのように理解できます。ハードウェアに依存しないエッジコンピューティング対応設計により、カードームのプラットフォームは、音声認識の精度、セキュリティ、ユーザーエクスペリエンスを強化し、人間と機械の次世代のコミュニケーションを推進します。
あなたとDr. Alon Slapakがカードームを共同創設するきっかけとなったものは何ですか?
カードームの創設は、魅力と苛立ちの組み合わせから生まれました。音声とオーディオの分野で、学術と産業の両方で経験を積んだ私たちにとって、特にディープニューラルネットワークが登場したとき、音声認識の進歩はとても興奮するものでした。
静かなラボでは、技術は現象的でした。しかし、現実の世界に足を踏み入れると、その魔法は消えました。私たちは、騒々しい車の中、忙しいオフィス、または混沌とした家庭で、最先端の高度なシステムが1990年代の技術とほとんど変わらないことを観察しました。これが進歩の大きな障壁でした。
音声は、デバイスとインタラクションするための最も自然な方法です。ただし、それが実現するには、技術が現実生活の混沌を克服する必要があります。私たちは、それを私たちの使命とすることにしました。私たちは、1年間をガレージで過ごし、音波伝播方程式と新しいアイデアを試験し、カードームの空間音響技術の最初のデモンストレーションを達成するまで、苦闘しました。
その瞬間、私たちは鍵を見つけました。私たちは、製品を作るだけでなく、人間と機械のコミュニケーションの革命を始めるために、カードームを創設しました。
多くのボイスアシスタントは、声が重なったり、背景ノイズが優勢になったりすると、苦労し、ユーザーを苛立たせることがあります。従来の方法は、現実の状況でなぜあまりにも貧弱に機能するのでしょうか?
従来のボイスUIは、現実の世界で貧弱に機能するのは、そのソフトウェアが音を理解するために、過度に単純化された方法に頼っているからです。ほとんどのシステムは、音の到来方向を決定するために複数のマイクロフォンを使用するアプローチを採用していますが、これは音の角度だけに焦点を当て、他の重要な3D空間情報を無視します。このアプローチは、車、オフィス、またはリビングルームのような現実の環境ではすぐに失敗します。なぜなら、これらの環境は、音波がすべての反射面で反射する再verbで満たされているからです。方向だけを理解するシステムにとって、これらの反射はすべて新しい音源から来ているように見えます。
これにより、デバイスが「音響の鏡」のようなホールの中にいるような、混乱する効果が生じます。ここで、1つの声が同時に何百もの方向から来ているように聞こえます。システムは、音景を適切に解釈できないため、個々のスピーカーの明確な声を、反射の嵐から区別できません。この根本的な制限が、現代のボイステクノロジーが現実の、混沌としたシナリオで音を認識するのに苦労している理由です。
カードームの技術は、部屋の中で話している人が1人だけであるかのように扱います。どのような技術的ブレークスルーがこれを可能にし、従来の遠距離ボイス認識とはどのように異なりますか?
私たちの技術的ブレークスルーは、従来の方法が音の到来方向だけを検出するのではなく、3D空間内の音の正確な位置を特定する、空間音響AIと呼ばれる独自の技術です。これは、音が部屋の中で反射するパターンを分析することで機能し、各音源の「音響フィンガープリント」として扱います。私たちのAIは、各音源のこのフィンガープリントを瞬時に受動的に推測し、環境をマッピングします。この位置ベースのアプローチは、方向に基づく従来のシステムとは根本的に異なります。従来のシステムは、反射によって混乱しますが、私たちの技術は、反射パターンを使用して実際の音源を特定します。実用的には、カードーム対応デバイスは、騒々しい環境で1人の話者に焦点を当て、静かな部屋で話しているかのように聞こえます。さらに、認知AIにより、システムは単に言葉を聞くだけでなく、誰が話したのか、どのような文脈で話したのかを理解します。
ボイスAIは、「アイフォーンの瞬間」を迎えていると言われています。ボイスAIの観点から見ると、これは何を意味しますか? ボイスAIが真の主流採用に達するまで、どのくらいの距離がありますか?
私にとって、「アイフォーンの瞬間」は、ボイスがデバイスとインタラクションするためのデフォルトの方法になることを意味します。
私は、メーカーがボイスAIテクノロジーを全製品ラインに統合する競争を目撃しています。安全上の理由から、車はボイスファーストインターフェイスになりつつあります。スマートホームでは、タッチスクリーンをどこにでも置くことは実現不可能なので、ボイスユーザーインターフェイスが必要です。伝統的な家電製品も、ボイス機能を追加しています。なぜなら、メニューをナビゲートするよりも速いからです。ボイスの採用を促すテクノロジーは多数ありますが、真の革命はロボティクスによって決まります。ロボットが私たちの生活や職場に統合されると、ボイスはロボットとの自然なインターフェイスとして浮上します。
この共存が無駄なく機能するには、ロボットが人間のレベルで私たちを理解する必要があります。ロボットは、自然なスピーチのニュアンスや会話の流れを理解する必要があります。ロボットは、魔法のように感じられるほど正確な空間認識が必要です。ロボットは、誰が話しているのかを直感的に理解できる必要があります。さらに重要的是、ロボットはエッジで動作し、瞬時に、プライベートに、信頼性高くコミュニケーションをとる必要があります。
これは、人間と機械がインタラクションする方法における根本的な変化です。私たちは、その再定義を導くテクノロジーを構築しています。ボイスが期待されるインターフェイスではなく、望ましい機能になるまで、約24ヶ月かかるでしょう。
実用的には、空間音響と認知AIは、車、スマートホーム、ウェアラブル、公共の空間などの日常のデバイスをどのように変革するでしょうか?
変革は、どこにいても自然なインタラクションを可能にすることです。テクノロジーに合わせて自分の行動を変更する必要はありません。車では、高速道路で音楽を聴きながら運転中や、乗客と話している最中でも、真正にハンズフリーのコントロールが可能になります。スマートホームは、誰が話しているのか、どこから話しているのかを理解できるため、真正に賢くなります。同時に複数のリクエストを処理できます。
重要な洞察は、空間音響AIがボイス認識を改善するだけでなく、まったく新しいインタラクションパラダイムを可能にすることです。デバイスが音響シーンを完全に理解できるようになると、人間のコミュニケーションの自然な流れに参加できるようになります。人工的な制約に頼る必要はありません。ウェアラブルは、周囲の会話からユーザーの声を分離できるため、より便利になります。公共の空間では、パーソナライズされたがプライベートなボイスアシスタンスを提供できます。ロボティクスについても、ロボットが私たちの生活に統合されると、同じことが言えます。
常に傍受するデバイスのプライバシーは、増大する懸念事項です。カードームは、デバイス上での処理の需要とパフォーマンスおよび精度の必要性とのバランスをどのようにとっていますか?
現在のボイスAIソリューションのほとんどは、エッジコンポーネントとクラウドベースコンポーネントの両方で構成されています。エッジ処理はプライバシーの問題を引き起こしませんが、クラウド処理は大きな課題を提起します。カードームは、エッジコンポーネントの能力を大幅に拡大することで、この課題に対処しています。ローカルでより多くのデータを処理し、クラウドへの依存を減らすことで、カードームは、他のシステムよりも優れたプライバシ保護を提供します。
「常に傍受」デバイスの最大の懸念事項は、マイクがオーディオをキャプチャすることではなく、オーディオが分析のためにクラウドにアップロードされるリスクです。実践的には、クラウド処理の継続的なコストが高すぎるため、ほとんどの商用システムはそれを避けていますが、これには大きな代償があります。品質とレスポンスの低下です。カードームは、このトレードオフを解決することで、強力な常時オンの言語モデルをエッジデバイス自体に持ち込みます。カードームのテクノロジーでは、音響シーン、自然なスピーチ、コンテキストがすべて、デバイス上でリアルタイムに分析されます。音声データは、決してアップロードまたは保存されません。この革新的なアプローチにより、カードームは、強力なデータプライバシーと、高度に効率的なボイスUIの両方を提供できます。現在、ユーザーが直面している妥協を排除します。
業界全体を見ると、ボイスAIが消費者エレクトロニクス全体で主流のインターフェイスになる前に、まだ克服しなければならない最大の課題は何ですか?
最大の課題は、ボイスAIがまだ人間のようにコミュニケーションをとれないことです。ボイスAIが人間のレベルでコミュニケーションをとるには、会話の流れと文脈を理解する能力が必要です。さらに、ロボットが私たちの生活や職場に統合されると、ボイスはロボットとの自然なインターフェイスとして浮上します。ボイスAIの多くはクラウドベースであるため、継続的な傍受と会話の流れの理解が阻害されます。
ブレークスルーは、ボイスシステムが人間のようにコミュニケーションをとることができるようになったときに起こります。会話の文脈と流れを同じレベルで理解し、直感的に応答できるようになったとき、ボイスは主流のインターフェイスになるでしょう。
ボイスアシスタントの精度と信頼性が騒々しい環境で解決されたら、消費者とボイスアシスタントの関係はどのように進化するでしょうか?
ボイスアシスタントが正確で信頼性が高く、自然な会話が可能になると、ユーザーはそれらを必要な機能ではなく、日常生活で本能的に使用するようになります。ボイスAIが最初の試みで正しく理解することが分かれば、ユーザーはテクノロジーに合わせて自分の行動を変更するのをやめ、自然な言語とコンテキストでの会話を始めます。ボイスインタラクションの未来は、予測的でプロアクティブなものになるでしょう。デバイスが言葉だけでなく、トーン、感情的信号、会話の潜在的意味を理解することを想像してみてください。現在のシステムは、会話の自然な流れに苦労し、割り込み、ターン取り、コンテキストの理解に苦戦しています。人間は割り込みに適応しますが、ボイスAIは混乱します。OEMにとっての課題は、今日のソリューションの複雑さやハードウェア要件なく、将来のインターフェイスを提供するボイスAIを統合することです。
最後に、5年後のカードームとボイスAIエコシステムを見てみると、どうなっていると思いますか? ボイスファーストコンピューティングの時代に真正に入ったということを判断するための重要なマイルストーンは何ですか?
5年後、ボイスAIは今日のタッチスクリーンやキーボードと同じくらい普遍的になり、ほとんどすべてのコンピューティングデバイスで期待されるものになります。カードームは、ユーザーがどのデバイスでも、どこからでもボイスで操作できるようにする、運用システムになります。ロボット、スマートグラス、車など、どのようなデバイスでも、どのような環境でも、自然なインタラクションを可能にします。
重要なマイルストーンは、技術的なものではなく、行動的なものです。ボイスファーストコンピューティングに達したことを知るのは、人々がボイスコマンドについて考えるのをやめ、環境と自然な会話を始めたときです。マルチユーザー環境がシームレスに機能し、子供たちが自然にデバイスと会話することを期待するようになったときです。最終的な尺度は、私たちのテクノロジーがどれほど洗練されるかではなく、人間がデジタル世界とどれほど自然にインタラクションするかです。
素晴らしいインタビュー、詳細はカードームを訪れてください。












