インタビュー

Neal Lathia、Gradient Labs の共同創業者兼 CTO – インタビューシリーズ

mm
Unite.AI を Google の優先ソースに追加

Neal Lathia、Gradient Labs の共同創業者兼 CTO であり、金融テクノロジー、消費者プラットフォーム、学術研究にまたがるほぼ20年の経験を持つ機械学習およびデータサイエンスのリーダーです。2023 年に Gradient Labs を共同設立する前は、Monzo で5 年以上勤務し、シニア データサイエンティストから機械学習ディレクター、シニア機械学習エンジニアへと昇進し、機械学習インフラを構築し、運用、金融犯罪、プロダクトにわたるアプリケーションを支えるために分野をスケールさせました。以前は Skyscanner のシニア データサイエンティストとして勤務し、University of Cambridge と University College London で研究職に就き、レコメンダーシステム、行動データ、スマートフォンセンシング、パーソナライズド デジタルサービスを研究しました。Gradient Labs では、現在、複雑で規制された金融サービスワークフロー向けに設計された AI エージェントの技術をリードしています。

Gradient Labsはロンドン拠点の AI 企業で、金融サービス向けの専門的な自律エージェントを構築しています。従来は大量の人的関与が必要だった顧客業務の自動化に注力しています。元 Monzo のリーダーである Dimitri Masin、Neal Lathia、Danai Antoniou が創業し、融資・回収、紛争、Know Your Business(KYB)、オンボーディング、保険請求、カスタマーサービスなどの領域向けエージェントを開発し、音声、チャット、メールで動作させ、規制環境向けに設計されたコンプライアンスガードレールを組み込んでいます。Gradient Labs は、同社の技術が現在、Wise、Zego、Current、Stash、Rho などの顧客を通じて 32 million エンドユーザーに提供されていると述べています。2026 年 6 月に、シリーズ A の資金調達を $26 million に拡大したことを発表し、相互接続された専門 AI エージェントで複雑な銀行業務やフィンテック業務の自動化というより広いビジョンに向けて取り組んでいます。

2023 年に Gradient Labs を共同設立する前、Monzo で5 年以上機械学習の構築とリーダーシップを担っていました。Monzo で直接目にした何が、新たに自律 AI エージェントを中心とした会社を立ち上げる機会があると確信させ、また大規模言語モデルの登場がその機会を可能にしたのでしょうか?

Monzo では、規制された環境で動作しなければならない機械学習システムを何年も構築してきました。ミスは実際に重大な結果を招き、すべてに監査証跡が求められます。最も影響を受けたのは、既製品ではその厳しい制約下で安全に動作できないため、カスタムインフラを開発する必要があったことです。この経験から二つの確信が生まれました。第一に、テクノロジーがようやく銀行を何十年も業界を縛り続けてきた運用負担から解放できるということ。第二に、汎用的で横断的な AI では効果が期待できないということです—規制された業務のニュアンスはあまりにも特化されているからです。LLM が多段階で時に曖昧な顧客対応を推論できるほど能力を備えたとき、エージェントが人間を補助するだけでなく、規制されたワークフロー全体をエンドツーエンドで管理できるようになることが実現可能になりました。規制対象企業が実際に必要としているものと既存のソリューションとのギャップが、Gradient Labs を立ち上げ、金融向けに特化した垂直 AI に賭けた理由です。

消費者が経験している「体験のギザギザな境界」について述べられましたが、ある AI エージェントは極めて複雑なタスクを実行できる一方で、別のシステムは電話番号と名前を区別するような単純な作業で失敗します。基礎となるモデルが同程度に有能であるにもかかわらず、AI 体験にこのような劇的なギャップが生じる原因は何でしょうか?

このギャップは、モデルそのものの能力というよりも、どれだけエンジニアリングが施されているかに起因すると言えるでしょう。電話番号を名前と取り違えるといった単純なタスクでシステムが失敗する場合、検証やフォールバックロジック、構造化データ処理など、周囲のフレームワークに投資していないことを意味します。より優れたエージェントは、そのタスク専用にエンジニアリングされている可能性が高いです。根本的には同じモデルファミリーでも、周囲の厳格さが全く異なるため、まさにそれがギザギザな境界を生み出しています。

最先端モデルが継続的に改善される中で、なぜ基本的な AI の失敗は依然として残るのでしょうか?それは主にモデル自体の限界によるものですか、それとも周囲のシステムアーキテクチャ、データ、ワークフロー、評価、製品設計の失敗によるものですか?

主な原因はモデルではなくシステムです。最先端モデルは推論能力を向上させ続けていますが、企業はそれらを確率的な振る舞いに対応していないシステムに組み込むことが多いです。システム内には脆弱な統合や不完全なデータがあり、変更をリリースする前に実質的な評価ループがありません。そのため、プロダクションでの基本的な AI の失敗は実際には AI の失敗ではなく、評価、モニタリング、ワークフロー設計への投資不足が原因です。

多くの企業は AI カスタマーサービスを速度、コンテインメント、またはチケットの回避に最適化しているように見受けられます。AI エージェントが実際に顧客体験を向上させているかを測定したい場合、代わりにどの指標を使用すべきでしょうか?

このためには、解決精度を考慮しなければなりません。スピードやコンテインメントは、顧客を電話から切り離せたかどうかを評価する指標であり、問題を解決できたかどうかを測る指標ではありません。AIエージェントの能力を測るべき指標である解決精度は、単に素早く応答したかどうかではなく、エージェントが正しい対応をしたかどうかを判断します。これに加えて、再接触率や苦情件数、そしてその後人間が介入しなければならない頻度といった他のシグナルも併せて評価されます。回避率が上がっても再接触や苦情が増えている場合、目的とする成果を誤って最適化していることが分かります。

Gradient Labsは規制のある金融サービスに特化しており、誤った回答は一般的なカスタマーサービスのミスよりはるかに大きな影響を及ぼす可能性があります。貸付、紛争、オンボーディング、あるいはKnow Your Customer(KYC)チェックといった領域に関わるプロセスを、AIエージェントが自律的に処理できるほど信頼できるかどうかは、どのように判断すべきでしょうか?

多くのチームが選びがちなのは、コ・パイロットとしてすべてのアクションを誰かが承認するルートです。安全だと感じるため、そして多くの人がそれが安全だと想定します。しかし実際には、AIがほとんど正しく動作しているにもかかわらず、レビュー担当者が本当に確認せずに承認してしまい、安全性が失われています。これは既存の作業負荷を軽減するどころか、単に作業を速くし、得られる価値を減少させるだけです。

このため、Gradient Labsでは「AIエージェントが十分に信頼できる」かどうかはプロセスごとに異なる概念となります。私たちにとっては、段階的な自律性を経て開発されるべきであり、単一のチェック項目として捉えるべきではありません。KYCや紛争処理などの領域でエージェントにより大きな独立性を与えるのは、実際のケースを多数含む生きたデータセットでベンチマークし、稼働後もサンプル決定に対して人間がレビューを行った場合に限ります。興味深いことに、ここで可逆性が重要であることが確認されます。取り消し可能なものは、不可逆なものに比べて自律性がより速く付与されるのです。

ガードレールはAIエージェントの安全性を高める解決策として注目されていますが、ルールを増やしすぎるとシステムが硬直したり、正当なタスクの実行を妨げることがあります。エージェントを過度に制約されたチャットボットに陥らせずに、自律性とガードレールのバランスをどう取りますか?

誤りは、ガードレールをエージェントが単に跳ね返る壁とみなすことです。私たちのシステムでは、ガードレールは同時に二つの役割を果たします。会話の各ターンごとにガードレールを適用し、顧客の発言を検査して脆弱性や財務困難、苦情などを検出するものと、エージェントが発言しようとしている内容を検査しコンプライアンスを保つものがあります。ガードレールが作動したときは単にブロックするのではなく、エージェントを適切な手順へリルートし、その判断はエージェントの推論内で透明に示されます。オペレーターはなぜそのように行動したかを確認できるのです。さらに深いガードレールは、エージェントがタスクを考える方法、アクセスできるデータ、使用できるツールにも組み込まれています。この組み合わせにより、エージェントはガードレールの存在意義と理由を理解し、許可されていないものに見えるだけのタスクを拒否せず、正当なタスクを完了できるようになるため、硬直せずに安全性が保たれます。

ここで問題になるのは、ガードレールをエージェントが跳ね返るだけのレンガの壁と捉えてしまうことです。具体的には、会話の各ターンで二種類のガードレールを実行しています。まず、顧客側のガードレールは顧客の発言を検査し、脆弱性や財務的困難、苦情などを検出することを目的としています。次に、エージェント側のガードレールはエージェントが送信しようとするメッセージを事前にチェックし、コンプライアンスを保つ役割を果たします。

つまり、ガードレールが作動した際に単にアクションを遮断するのではなく、適切な経路へリルートする仕組みです。これによりエージェントの意思決定プロセスの透明性が保たれ、人間のオペレーターはその行動理由を把握できるようになります。

また、エージェントの推論プロセス全てが大規模言語モデル(LLM)を通過しなければならないわけではないため、これが可能になります。この種のガードレールは決定論的で、会話の最後だけでなくエージェントのライフタイム全体でトリガーされます。これにより、機密性の高いコミュニケーションをエージェントに任せつつ、特定のユースケース向けにエージェントをカスタマイズし、予測可能かつスケーラブルに運用できるのです。

最も重要なのは、エージェントがタスクを考える方法を最初にどのように教えるかです。関連データへのアクセスや必要なツールの認識を確実にさせることで、エージェントは許可されていないと見なすだけのタスクを拒否せず、正当なタスクを遂行できるようになります。これが安全性を向上させ、硬直化を防ぐ鍵となります。

AIエージェントがますます自律的になる中で、人間がループに残すべき領域はどこでしょうか? 基盤となるモデルがどれほど高度になっても、引き続き人間の判断が必要だと考える決定や顧客対応はありますか?

判断が誠実な裁量を要する場合、顧客に重大な影響を及ぼす場合、またはエージェントがまだ評価されていない結果に関わる場合は、人間が関与する必要があります。人間が全てを行う必要は必ずしもありませんが、必要に応じてレビューや承認を行うべきです。モデルがより高度になるにつきましても、これはおそらく同様で、能力の問題ではなく、説明責任や、クレジット結果や紛争などが関わる際に顧客が人間の意思決定者を求める権利に関わるからです。

判断が誠実な裁量を要する場合、顧客に重大な影響を及ぼす場合、またはエージェントがまだ評価されていない結果に関わる場合は、人間が関与する必要があります。私はこれを、従来のフォールバックモデルよりも一歩進めて、エージェントが組織図上で人間と共に位置付けられるようになっていると主張したいです。その結果、人間の労力はエスカレーションや判断が必要なケースに重点的に投入され、エージェントは調整やルーティング作業を担当するようシフトしています。

しかし、これを真に成功させるためには、エージェントも人間と同様の組織的文脈を持つ必要があります。つまり、どの問題を誰に回すべきか、そしてそのタイミングを把握できることです。そこで私たちはCollaborateを開発しました。オペレーター、エンジニア、エージェントがピアとして協働できるようにし、バージョン管理、評価、継続的学習を中心に据えています。これにより人間は完全にループに留まり、ループの形状はエージェントと人間の協調度に応じて変化します。

Gradient Labsは、単一の汎用エージェントではなく、特定の金融サービスワークフロー向けに設計された専門エージェントに注力しています。企業向けAIの将来は、専門エージェントのネットワークが主流になると考えますか?それとも、ますます高性能な基盤モデルが専門性の重要性を低減させるでしょうか?

たとえ基礎モデルが向上したとしても、専門性は依然として重要だと考えます。顧客は単に賢いモデルに対して支払うのではなく、ワークフロー固有の評価やガードレール、データ統合に対して支払います。そして、その作業は基盤モデルが優れたものになったからといって消えるわけではありません。私は、共通で強力な基礎モデルの上に構築された、専門エージェントのネットワークが主流になると見ています。

AIエージェントは導入後も学習・改善が求められますが、規制された環境では小さな行動変化でも新たなリスクを招く可能性があります。企業は、更新がリグレッションやコンプライアンス問題、予期せぬ挙動を引き起こさないことを保証しつつ、エージェントを継続的に改善できるでしょうか?

私たちが掲げている原則は、すべての更新をインクリメンタルな設定変更ではなく新しいモデルリリースとして扱うことであり、各変更は出荷前に完全な評価スイートを通過させます。これには、過去にミスが実際に重大な影響を与えた事例に対するリグレッションテストが含まれ、すべての顧客に一斉に展開することはありません。段階的にロールアウトし監視することで、ドリフトが発生し始めた場合でも、全規模ではなく限定されたトラフィックで捕捉できます。これは、最近リリースしたCollaborateが構築された正確な考え方です。Collaborateは、オペレーター、エンジニア、AIエージェントがピアとして同じ「エージェントがどのように考えるべきか」という生きた定義上で協働できるようにし、バージョン管理、評価、継続的学習をワークフローに直接組み込んでいます。そのため、誰かがエージェントのケース処理方法を改善すると、その変更はバージョン管理され、過去の対話でテストされ、他のリリースと同様のコントロール下でロールアウトされます。つまり、エージェントは導入後も改善を続けられますが、改善自体がリグレッションやコンプライアンス問題を引き起こすことはありません。

今後、強力な基盤モデルへのアクセスがますますコモディティ化する中で、AIアプリケーションにおける真の競争優位はどこから生まれるでしょうか?勝者は最良のモデルを持つ者でしょうか、それとも信頼性の高いシステムを構築し、一貫した優れた体験を提供できる者でしょうか?

ますます多くの基盤モデルが収束しつつある現在、優位性はこれらのモデルを取り巻く、評価、ガードレール、データ、ワークフロー設計といった信頼性の高いシステムを最も得意とする者にほぼ完全に移ります。モデル自体はコモディティ的な入力となりますが、実際の製品は本番環境での一貫性と信頼性です。

それ以上に、エージェントが企業の業務にどれだけ深く組み込まれているかが優位性の源になると考えています。さまざまな部門に組み込めるエージェントは、特定の課題だけを扱うツールやフロントラインに限定されたものに比べて優位です。エージェントがフロントラインとバックオフィスのシステムを横断して働くことで、やり取りにより多くのコンテキストを提供し、エンドツーエンドで複雑な問題を処理でき、人間と同様の働き方を実現します。エージェントが企業の実際の業務フローに適合できることが、長期的な勝利の鍵になると期待しています。

素晴らしいインタビューに感謝します。詳しく知りたい読者はGradient Labsをご覧ください。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。