インタビュー

アイザイア・N・グラネット、Blandの共同創設者兼CEO – インタビュー・シリーズ

mm
Unite.AI を Google の優先ソースに追加

アイザイア・N・グラネット、Blandの共同創設者兼CEOは、スタートアップの創設者であり、エンジニアであり、その背景は技術的な実行と初期の起業家経験および長期的な社会的影響の仕事と混合しています。彼は現在のベンチャーを立ち上げる前に、Z FellowsとY Combinatorに参加し、Lanternでエンジニアリングの経験を積み、サンディエゴ・チルという非営利組織を設立し、発達障害を持つ子供たちがスポーツにアクセスするのを助けるために250万ドル以上を集め、全国的な認知を得て、現在も取締役として関与しています。

Blandは、AIを活用した電話のインフラストラクチャを構築し、企業が顧客サポート、セールス、運用ワークフローを大規模に処理できるボイスエージェントを展開できるようにしています。このプラットフォームは、プログラム可能なボイスのやり取り、リアルタイムのレスポンス、ビジネスシステムとの深い統合を提供することで、従来のコールセンターを置き換えるか補完することを目的として設計されています。

あなたはサンディエゴ・チルを設立しました。これは、発達障害を持つ子供たちがスポーツにアクセスするのを助けるために行ったものでした。Y Combinatorに参加する前、Blandを立ち上げる前から、このような組織を構築する経験を積んでいました。このような経験は、あなたがボイス・ファーストのAI企業を設立する際にどのように影響しましたか。

私の生活と仕事は、常に何かを構築することに焦点を当ててきました。アイデアや信念が頭に浮かぶと、それを無視することはできません。サンディエゴ・チルを構築することで、私は組織を構築し、運営する方法を学びました。また、私たちの行動が他人に与える影響についても学びました。組織を構築することで、他人に与える影響は非常に大きいことを実感しました。サンディエゴ・チルでの経験は、私に多くの教訓と価値観を与えました。

2023年にY Combinatorを終了した後、企業向けのボイス・インフラストラクチャがまだ根本的に壊れていると感じ、LLMを従来のIVRツールの上に重ねるのではなく、エンドツーエンドのシステムを構築することを決断しました。どうしてそう感じたのですか。

銀行のチャットボットを使ったことがありますか。待ち時間が長すぎて、質問に対する回答が得られず、結局電話をかけなければなりませんでした。ロボットの声がメニューを案内し、0を押しても何も起こりませんでした。

銀行はそのような体験を可能にするために数十億ドルを費やしていますが、チャットボットはまだ顧客満足度で最も低いものの1つです。メールやコールセンターよりも低いです。

これが20年間続いてきたダイナミクスです。企業は顧客をスタッフから遠ざけようとしています。顧客はスタッフに会おうとしています。どちらも勝ちません。

問題は、企業が解決したいと考えているのではなく、解決できないことです。顧客に良い体験を提供するために、スタッフを増やすことはできません。月に100万件の電話を処理するコールセンターは、高価で、運営が難しく、質も一貫して低いです。

何が変わったのでしょうか。AIがようやく電話を解決できるようになりました。電話をルーティングしたり、遮断したりするのではなく、解決するのです。

しかし、これはシステムがリアルタイムのボイスから構築されている場合のみ機能します。LLMを従来のIVRツールの上に重ねたり、サードパーティのサービスを組み合わせたりすると、待ち時間が増え、信頼性が低下します。会話が崩壊します。

そのため、インフラストラクチャをエンドツーエンドで構築することにしました。ボイスは、即時的で自然な感じでなければなりません。そうでなければ、顧客は電話を切るでしょう。

Blandは、TTS、推論、トランスクリプションのスタックを内部で構築およびホストしています。サードパーティのAPIに頼ることのトレードオフは何でしたか。

毎にアウトソーシングするたびに、待ち時間とリスクが増えます。

ほとんどのボイスAIプラットフォームは、サードパーティのトランスクリプション、サードパーティのモデル、サードパーティのTTSを組み合わせたものです。デモでは機能しますが、電話の量が急増したり、チェーンの中で何かが間違ったりすると、機能しなくなります。

データの問題もあります。Foundationモデルプロバイダー、たとえばOpenAIは、顧客データを使用してモデルをトレーニングしています。エンタープライズライセンスは異なるということですが、不確実性は多くのセキュリティとコンプライアンスのチームを不安にさせます。

スタック全体をセルフホストすることで、ミリ秒単位の制御とモデル更新の制御が可能になります。顧客データは顧客のエコシステム内に留まり、サードパーティのトレーニングパイプラインに触れず、インフラストラクチャを監査できず、顧客が決定しない限り移動しません。

各エンタープライズ顧客に専用のインフラストラクチャを提供できるため、他の会社からのスパイクが顧客のパフォーマンスに影響を与えることはありません。何かが壊れたときに、ベンダーのベンダーを待つのではなく、実際に修正できます。

規制された業界では、一部の顧客はフルスタックを独自のVPCまたはオンプレミスで必要とする場合があります。那は、ベンダーが実際にデプロイしているものを所有している場合のみ可能です。

伝統的なコンタクトセンターの自動化は、シンプルなサポート電話を遮断することに重点を置いてきました。なぜ、ボリュームベースの自動化ではなく、長尾の複雑な顧客とのやり取りを優先しましたか。

伝統的なコンタクトセンターの自動化は、シンプルなサポート電話を遮断することに重点を置いてきました。なぜ、複雑な長尾のやり取りを優先しましたか。

私たちは逆のアプローチを取りました。私たちが最も複雑で敏感な電話を信頼性高く処理できる場合、他のすべては簡単になります。目標はデモを構築することではなく、フルアジェンティックな電話の解決を大規模に提供することです。そのためには、低待ち時間、高信頼性のシステムが必要です。実際の顧客会話で定義されるエッジケースを処理できるシステムが必要です。

あなたのエージェントは、CRMや運用データベースと統合して、電話をエンドツーエンドで解決するために使用されています。ボイスネイティブの自動化は、チャットベースのコパイロットと比較して、エンタープライズのワークフローのアーキテクチャをどのように変更しますか。

レガシーシステムは、互いに通信しません。CRM、スケジューリングツール、請求プラットフォームはシロです。システムにアクセスできない場合、ボイスエージェントは一般的な質問に答えることしかできません。

アカウントを参照したり、レコードを更新したり、予約を設定したりすることはできません。情報を収集し、手渡しします。人間のレップは、人が触れるべきではない作業に時間を費やします。コールノートのログ、手動での予約の設定、レポートのプルしてフォローアップが必要な人を調べます。

ディープな統合が、エンドツーエンドの解決を可能にします。統合がない場合、電話だけが自動化されます。

最近のSoulja Boyのボイスクローンデモは、会話エージェントが内部運用を超えてブランド向けの体験に拡大する可能性を示しています。エンタープライズのボイスエージェントは、セールス、サポート、マーケティングのチャネルを通じて連続して運用する、顧客向けのデジタルレプレゼンタンティブに進化する可能性がありますか。

絶対にそうです。私たちは、毎顧客が好きなビジネスや必須のビジネスとの個人的な関係を持つ世界を想像しています。重要なのは、AIが「楽しい」だけでなく、実際に複雑な問題を解決できることです。

リアルタイムのボイスは、テキストベースのAIデプロイメントでは存在しない待ち時間、ホールシネーション、アイデンティティの課題を導入します。ボイスエージェントを構築する際に、400ミリ秒未満で応答し、会話の正確性を維持するために直面した最も難しい技術的制約は何でしたか。

待ち時間です。それがほとんどのデモが死ぬところです。

チャットボットが3秒間応答しない場合、ユーザーは待ちます。ボイスエージェントがあなたが話し終わった後に不自然に間を置く場合、会話はすでに壊れています。応答は400ミリ秒以内に返ってくる必要があります。ほとんどのプラットフォームは、複数のサードパーティサービスを組み合わせているため、そこに到達することができません。

しかし、待ち時間は一部だけです。実際の顧客電話は、デモでは捉えられないほど雑です。人々は途中で話を遮ります。背景ノイズが入ってきます。呼び出しは言語を切り替えます。リクエストは漠然とします。ボイスAIがプロダクションで機能するためには、割り込みに対してコンテキストを失わずに、会話がスクリプトから外れたときに適応し、バッファリングしているように聞こえないようにする必要があります。

顧客はボイスAIと他のボットを比較しません。人間と話すことと比較します。那が基準です。

人間のようなAIシステムが会話中に自分自身を表現する方法について、企業はどのように考えるべきですか。

私たちは、エンドユーザーに対する誠実さと透明性を信じています。規制の一部は煩わしいものですが、欺瞞は受け入れられません。企業と協力して、顧客との信頼を基盤としたシームレスな体験を開発しています。

AIエージェントが同時に数百万の顧客とのやり取りを処理し始めたとき、企業は最初にどのような運用上の課題に直面することが多いですか。

いくつかのことが実践で重要になります。モジュラーなプロンプトアーキテクチャが最初に重要です。モノリシックなプロンプトはデバッグするのがほぼ不可能です。電話が間違った場合、どこで何が間違ったのかを特定する必要があります。指示の壁を見て、どの行が問題を引き起こしたのかを判断することはできません。

完全な可視性も同等に重要です。電話後の要約だけでは十分ではありません。毎回のやり取りの毎時点でエージェントが何をしているのかのリアルタイムの可視性が必要です。

ガードレールも不可欠です。特に規制された業界では、エージェントはポリシーの範囲内に留まる必要があります。那は任意ではありません。そうでない場合、優雅なフォールバックが必要です。

最後に、ナレッジマネジメントが重要です。エージェントは、製品、ポリシー、手順などの独自データにアクセスする必要があります。プラットフォームは、実際の電話で顧客が質問したときに、ナレッジギャップを自動的に表面化する必要があります。顧客が苦情を言う数週間後ではありません。

将来を見て、企業向けのボイスエージェントはタスク固有のツールのままであると思いますか。または、会話を通じて開始されたビジネスプロセスを自律的に管理できる、より包括的なAIエージェントに進化すると思いますか。

答えを知っているだけなら!私は、ボイスエージェントがビジネススタック全体にわたって進化すると思いますが、ビジネス全体をボイスエージェントで運用することは見られないと思います。那は、AIエージェントから人間が得られるサービスが、今日得られるサービスよりも即時的で正確で包括的になるだろうと信じています。実際、ボイスエージェントが発達するにつれて、電話の数が増えるのではなく、減るのではなく増えるのではないかと思います。

素晴らしいインタビュー、詳細を知りたい読者は、Blandを訪問してください。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。