インタビュー
ConvosのCTO兼共同創設者Andrew Missey – インタビューシリーズ

Andrew Missey、ConvosのCTO兼共同創設者は、AI製品開発、ソフトウェアアーキテクチャ、ネットワーク、フルスタックエンジニアリングを含む幅広い経験を持つソフトウェアエンジニア兼製品リーダーです。Convosを共同創設する前に、彼はForum3で2つのAI駆動型クリエイティブおよびマーケティングプラットフォームの開発と立ち上げを支援しました。そこでは、ハンズオンエンジニアリングとテクニカル製品管理を組み合わせました。彼の以前の役職では、N-able (NABL )、Autoshop Solutions、Brand IQで、Svelte、NestJS、Angular、JavaScriptを含むテクノロジーを使用して、フロントエンドアプリケーション、バックエンドシステム、クライアントダッシュボード、内部ソフトウェアツールを構築しました。この多様なバックグラウンドにより、ConvosのAI駆動型コミュニケーションプラットフォームの開発をリードするために、テクニカルな実行と製品戦略を橋渡しすることができます。
Convosは、政治キャンペーンやコミュニケーション会社が、一方向の大量メッセージングを、スケールでのパーソナライズされた双方向の有権者会話に置き換えることを支援するために設計された制御されたAI駆動型テキストプラットフォームです。このプラットフォームは、リアルタイムのセンチメント分析、トピック分類、コールツーアクション結果、エンゲージメントメトリック、構造化された有権者インサイトを、キャンペーンがアプローチを洗練するために使用できるように、レスポンスを変換します。キャンペーンが承認した資料やメッセージングガイドライン内で動作するクローズドシステムのAIは、コンタクトセグメンテーション、会話履歴、リンク追跡、データエクスポート、コンプライアンスに焦点を当てた監査証跡などの機能を提供します。Convosは、組織の既存のテキストインフラストラクチャを置き換えるのではなく、それを補完することもできます。
あなたは、政治的および組織的なテキストが主に一方向のコミュニケーションになっているのを見て、Convosを共同創設しました。大量メッセージングをAI駆動型会話に変える機会があるという元々の洞察は何でしたか? Convosを構築する際に直面した最大のテクニカルな課題は何でしたか?
その洞察は、受け手側に立ったことから来ました。
2024年の選挙の頃、私は多くの人と同様に、政治的なテキストで爆撃されていました。ある時点で、私はそれらに返信し始めました。質問をしたり、反応したりしましたが、決して何も返事は来ませんでした。メッセージは数百万件送信されていましたが、実際の交換を試みると、誰もいませんでした。
それは大きな失われた機会に思えました。相手側の人はすでに関与していました。彼らは本物の質問をしていました。しかし、返信は決して送信されませんでした。
Convosの背後にある考えはシンプルでした。放送を実際の会話に変え、スケールで、部屋いっぱいのスタッフを必要とせずに。
最大のテクニカルな課題は3つに減りました。スケール、遅延、コンプライアンスです。
スケールは明らかです。同時に数千の会話を管理し、それぞれが独自の状態と履歴を持っています。遅延は人々が期待するよりも重要です。誰かがテキストを返信し、返信が遅すぎると、その瞬間は失われます。テキストはほぼ即時的な感じがしますが、体験はそれに合う必要があります。
コンプライアンスは最も難しい部分でした。それは私たちが最初から優先したものでした。政治的なテキストは厳しく規制されており、それを間違えることは選択肢ではありません。私たちの初期のエンジニアリングの多くは、システムがメッセージに留まり、同意とオプトアウトを尊重する方法で、単に「STOP」という言葉をキャッチすることだけではなく、機能するようにすることに費やされました。
Convosは、会話型AI、ラージスケールメッセージング、リアルタイムセンチメント分析の交差点で動作します。同時に何千人もの人と関わる必要があるAIシステムを展開することで、どのような教訓を学びましたか? それらはまだ個人的で本物的なように感じますか?
最大の教訓は、「スケールでのパーソナライズ」は、デフォルトでは起こらないものであるということです。
同時に数千の会話を実行しているとき、すべてを一つの大きなバッチとして扱いたくなるのですが、テキストを受け取る人はあなたのバッチには気にしていません。彼らにとってそれは一対一の交換であり、それが感じられる必要があります。つまり、各会話は独自のコンテキストと履歴を持ち、返信は特定の人物が言ったことに対して反応し、誰でもいいというわけではありません。
私たちはまた、人々が本当に私たちに何を伝えているかに注意を払う必要があることを学びました。返信は単なる返信ではありません。センチメントを持ちます。誰かは質問、熱意、苛立ち、または単に放置されたいという明確な信号で応答できます。そうしたニュアンスを正しく読むことが、相互作用を成り立たせるものです。
最終的には、真正性は、聡明そうに聞こえるのではなく、聴いていることから来ます。最も人間らしい感じる交換は、実際の質問に答え、相手の時間を尊重するものです。
あなたは、多くの組織がモデルベンチマークに過度に重点を置き、個性やコミュニケーションスタイルを見落としていることを主張しています。なぜ個性がエンタープライズAI展開において重要な要素になっているのか、そして組織はそれをどのように評価するべきか?
ベンチマークは能力を測定します。フィットネスを測定しません。
モデルは推論またはコーディングで非常に高いスコアを獲得できますが、会話のために適切な選択ではない可能性があります。会話のやり取りは、モデルが話しかける方法、どれほど暖かく、どれほど正式であるか、いつ短くなるか、すべてが非常に重要です。
私たちの世界では、モデルは数学の問題を解決するのではなく、キャンペーンをテキストメッセージで表現しています。各キャンペーンには独自の声があり、モデルはそれに合う必要があります。トーンが間違っていると、基礎となるモデルの賢さに関係なく、相互作用は失敗します。
また、ベンチマークが見落としている能力の側面もあります。キャンペーンは、エージェントに何を言うか、避けるべきこと、特定のトピックをどのように扱うかについて、詳細な指示を提供できます。モデルはそれらすべてを一貫して、長い会話の中で従う必要があります。いくつかのモデルは、他のモデルよりも複雑な指示をドリフトせずに保持することがはるかに優れています。那も個性の一部です。モデルは素晴らしいように聞こえるが、会話の中で指示から外れるものは、実際の人々の前に置くことができません。
それが、個性がエンタープライズ展開において重要な要素になっている理由です。モデルが全体的に賢くなると、生まれつきの能力のギャップは狭まります。残っているのは性格です。彼らがどのようにコミュニケーションを取り、線を越えないか。ベンチマークではそれを見つけることはできません。モデルを実際のユースケースでテストし、実際のコンテンツで、エンドユーザーが読むように出力を読む必要があります。私たちはモデルを、実稼働で処理するのと同じ会話を通じてテストし、会話が感じるのは正しいかどうかを判断します。那は、ベンチマークスコア以上に多くのことを教えてくれます。
あなたのチームは、主要なLLMのパフォーマンスに重大な違いがあることを確認するために、複数の主要モデルをテストしました。どのような教訓を学びましたか? なぜいくつかのモデルは会話の仕事に他のモデルよりも適しているのですか?
私たちが学んだことは、最も適切なモデルは存在しないということです。特定の仕事に最も適したモデルだけが存在します。
いくつかのモデルは、指示を正確に従うことに優れています。これは、システムが厳格な境界内に留まる必要がある場合に重要です。いくつかのモデルは、自然な会話のトーンが強いです。いくつかのモデルは、より速いです。これは、レイテンシが体験の一部である場合に、独自の強みです。他のモデルは、複雑なリクエストを推論するのに優れていますが、カジュアルな会話では硬い、または反応に時間がかかります。
会話の仕事に特に、見出されることが多いものとは異なる特性が重要です。速度が重要です。一貫性が重要です。短くなるべき時を知ることが重要です。美しい3つの段落の答えを書くモデルは、正しい答えが1つの文の場合、誤った選択です。
これらは、リーダーボードに表示されません。モデルを実際の仕事の前に置き、実際にそれを処理する方法でそれに気付くだけです。
多くの企業は、単一のAIプロバイダーに依存するのではなく、マルチモデルの戦略を採用しています。モデルの間を切り替えることができるシステムを構築することの利点は何ですか? それを可能にするために、どのようなアーキテクチャ上の考慮が必要ですか?
主な利点は、ロックインされないことです。
プロバイダーにすべてを構築すると、彼らの制約をすべて継承します。彼らの価格設定、レート制限、レイテンシ、ダウンタイム、リリーススケジュールはすべてあなたのものになります。マルチモデルのアプローチでは、各タスクを最も適切なモデルにルーティングでき、プロバイダーが悪い1日を過ごしている場合にどこかに行くことができます。
また、コストを仕事に合わせることができます。すべてのやり取りに最も強力で最も高価なモデルが必要ではありません。シンプルな仕事を軽量モデルに送り、重いモデルを難しい場合に予約することで、実際の違いを生み出します。
アーキテクチャがそれを可能にします。プロバイダーのAPI全体で直接コードベースと話すのではなく、独自の内部インターフェイスと話す必要があるということです。そのインターフェイスが、実際にリクエストを処理するモデルを決定します。
一度それを持つと、ルーティングロジック、プロバイダーが失敗したときのフォールバック、モデルを交換することなくアプリケーションを書き直す能力、そして各モデルが少し異なるように振舞うため、モデル間で一貫したプロンプトと出力の処理が可能になります。
最初はより多くの作業が必要です。しかし、後で追加するのが非常に難しい柔軟性を購入します。
あなたは最近、AIモデルの進化の速さを強調しました。新しいリリースは、予期せずパフォーマンス特性を変更することがあります。企業は、最新のモデルを採用したいという欲求と、安定性、信頼性、予測可能なパフォーマンスの必要性のバランスをとるべきですか?
正直な答えは、新しいモデルは、それがアップグレードであることを証明するまで、アップグレードではないということです。
新しいリリースは興奮するものであり、すぐに最新のものを採用するというプレッシャーがあります。しかし、私たちは新しいモデルが予期せず振る舞いを変えるのを見ました。以前は信頼性が高かったものが、少し異なる方法で反応し始め、生産システムではそれらの小さな変更が累積します。
私たちがそれに対処する方法はシンプルです。モデルは、自分たちで手動でテストするまで、パイプラインに入れません。新しいリリースが出たとき、ベンチマークや発表をそのまま受け取るのではなく、実際の会話を処理するのと同じ会話を通じてそれを実行し、出力を自分で読みます。
そのハンズオンのステップは私たちにとって必須です。モデルは紙上ではより優れているように見えますが、実際の交換を扱う方法が、私たちが有権者に提示することに気付かないものです。唯一の方法は、システムが毎日扱うのと同じ状況にそれを置き、実際にどう反応するかを見てみることです。
これは、アブストラクションレイヤーがその価値を証明する別の場所です。私たちのアプリケーションは特定のモデルに依存しないため、新しいリリースを持ち込み、実際の会話を処理するのと同じ会話を通じてテストし、実際の会話を処理するのと同じ会話を通じてそれを既存のものと比較することができます。もしクリアなら切り替えます。そうでない場合は待ちます。
幻覚は、特に大規模なデータセットや複雑な情報と共に作業するモデルで、エンタープライズAIの採用の最大の障壁の1つです。幻覚を減らすために実用的で証明された最も効果的なテクニックは何ですか?
私たちが見つけた最も効果的なテクニックは、モデルが知ることを許可されるものを制限することです。
多くの幻覚は、モデルが一般的な知識から回答することを求めていることから来ます。そこでは、ギャップを埋めるために何かが適切に聞こえるもので埋めます。私たちはその逆をします。私たちのAIは、キャンペーンが提供した情報のみから厳密に動作します。インターネットにはアクセスできず、世界についての漠然とした記憶から情報を引き出しません。
もし答えが提供された資料の中にない場合、正しい応答は、その情報がないことを示すことです。その単一の境界は、多大なリスクを除去します。
しかし、そこで止まりません。キャンペーンの情報と一致することを確認するための複数のチェックを実装しています。モデルが応答を生成した後でも、応答はキャンペーンの情報と比較検証され、どこかに送信される前にそれが一致する必要があります。何かが一致しない場合、送信されません。
その先の実用的テクニックは、グラウンド化とガイドレールについてです。モデルに、前にあるタスクに必要な特定の関連コンテキストを与え、巨大な未分化のデータの山を与えるのではなく。情報が焦点を当てられているほど、漂う余地は少なくなります。
また、システムが行うことと言うことができることを明確に制限し、実際の会話を監視し、モデルが信頼できるものであると仮定しません。問題はモデルを信頼することで捕捉されるのではなく、出力を監視することで捕捉されます。
政治的なテキストのような規制された空間では、作られた答えは責任があります。したがって、私たちはシステムを透明性よりも推測を優先するように設計しました。
あなたは、AIエージェントがカスタマーサポート、コミュニケーション、Marketing、運用に展開されるにつれて、チームが繰り返し犯す間違いについて何を見ましたか? それらの間違いを避けるために、どのようなアドバイスをしますか?
私が最も見るミスは、チームがエージェントが機能するかどうかをテストするのですが、それを壊すかどうかをテストしないことです。
私は数えられないほどの回数、企業がAIチャットボットをリリースし、1日以内に誰かがオンラインでそれをジャイルブレイクして、思ってもいなかったことを言わせてしまうのを見ました。エージェントは指示から外れ、スクリプトから外れ、ブランドを表現する方法でスクリーンショットを共有されます。
それは、パイロットではすべてがうまくいっているからです。エージェントをテストするとき、すべてがきちんと行われ、質問がきちんと行われ、そしてそれは素晴らしいように見えます。生産性はその逆です。何かが公開されると、話しかける人の一部はそれをトリップさせようとしています。
あなたがそれに対してテストしない限り、あなたはそれをテストしていません。自分でシステムを壊すことを試みる必要があります。プッシュし、奇妙で敵対的な入力を与え、誰かが故意にそれに反対するときにそれが境界を維持するかどうかを見てみましょう。
繰り返される別のミスは、デモが機能するということです。パイロットは、幸せなパスのいくつかの監視された会話です。生産性は、予想していない方法で振る舞う数千人の人々、毎時、エッジケースが毎日のイベントになるスケールです。
私のアドバイスは、デモを完璧にする時間を費やすのではなく、自分でそれを壊す時間を費やすことです。もしもそれがあなたに耐えられないのなら、それは公開に耐えられません。
AIエージェントは、従来は人間のスタッフが必要だった会話を扱うことができるようになってきています。人間の監視と自動化のバランスは、次の5年でどうなるでしょうか? どのワークフローは人間の関与を必要とするでしょうか?
これは難しいもので、誰もが正確にどこに線が引かれるかを知っているわけではありません。私が考えるのは、AIの本当の価値は、フォースマルチプライヤーとして機能することです。小さなグループが、1人でできることよりもはるかに多くのことを行うことを可能にします。
このツールを最もよく活用しているチームは、まさにその方法でそれらを使用しています。AIはボリュームと繰り返しを処理し、人々は判断、戦略、本当に人間が必要な状況に時間を費やします。那は、人々を絵から消すことを目指すこととは非常に異なる目標です。
置き換えを目指すと、テクノロジーをそれが本当に良いものである以上に押し付ける傾向があり、そしてそれは、見えていてコストのかかる方法で失敗します。目標が人々を増やすことである場合、AIはそれがうまく行うことを行い、人々は最も価値のある場所に残ります。那は、テクノロジーが今日どこにあるかについて、より正直です。
次の5年間で、エージェントは会話の負担をより多く負うでしょう。そうするべきです。そうした作業は、人に必要ありません。
人間が関与する必要があるワークフローは、賭けが高い、または状況が真正に新しいものです。同意、コンプライアンス、または人に後で取り消しにくい決定が触れるもの。人々は方向を所有し、AIは彼らがカバーできる距離を助けるべきです。
会話型AIの将来について、どのような開発が最も楽しみですか? モデルがより賢くなったり、多モーダルになったり、自律性が高まったりするにつれて、Convosのようなプラットフォームはどのように進化するでしょうか?
私が最も楽しみにしていることは、会話がさらに改善されることです。
モデルが改善されるにつれて、私たちのプラットフォームが扱う交換は、再構築する必要なく、より自然でより役立つものになります。私たちがシステムをモデル間で移動できるように設計したため、改善をモデルごとに取り込みます。
私が最も注目しているのは、多モーダルです。現在、会話はテキストです。モデルが画像や他の形式をよりうまく処理できるようになると、会話をより豊かにしながら、テキストが機能する即時性を維持する機会があります。
自律性については、楽観的ですが、慎重です。より賢いエージェントが毎月リリースされています。彼らは多くのことを独自に処理できるようになります。しかし、規制された空間では、より多くの自律性は、より多くの規律を伴う必要があります。境界が重要です。
私は、誰もが返事を返さないテキストを送信しているのを見て、そこに参加しました。まだ、私が最も気にかける問題です。モデルがどれほど賢くなっても、戻ってくるのは、シンプルなものです。相手側の人は聞こえていると感じていますか?
素晴らしいインタビュー、ありがとうございます。詳しく知りたい読者は、Convosを訪問してください。












