인터뷰

Neal Lathia, Gradient Labs 공동 설립자 겸 CTO – 인터뷰 시리즈

mm
Unite.AI를 Google의 선호 소스에 추가

Neal Lathia, Gradient Labs 공동 설립자 겸 CTO는 머신러닝 및 데이터 사이언스 리더로, 금융 기술, 소비자 플랫폼, 학술 연구에 걸친 거의 20년의 경력을 가지고 있습니다. 2023년에 Gradient Labs를 공동 설립하기 전, 그는 Monzo에서 5년 이상 근무하며 Senior Data Scientist에서 Machine Learning Director 및 Staff Machine Learning Engineer로 승진했으며, 머신러닝 인프라를 구축하고 운영, 금융 범죄, 제품 등 전반에 걸친 애플리케이션을 지원하도록 분야를 확장하는 데 기여했습니다. 이전에는 Skyscanner에서 Senior Data Scientist로 일했으며, University of Cambridge와 University College London에서 연구직을 맡아 추천 시스템, 행동 데이터, 스마트폰 센싱, 개인화 디지털 서비스 등을 연구했습니다. 현재 Gradient Labs에서 그는 복잡하고 규제된 금융 서비스 워크플로우를 위한 AI 에이전트의 기술을 이끌고 있습니다.

Gradient Labs는 런던에 기반을 둔 AI 기업으로, 전통적으로 많은 인간 개입이 필요한 고객 운영을 자동화하는 전문 자율 에이전트를 구축합니다. 전 Monzo 리더였던 Dimitri Masin, Neal Lathia, Danai Antoniou가 설립했으며, 대출 및 채권 회수, 분쟁, Know Your Business (KYB), 온보딩, 보험 청구, 고객 서비스 등 분야의 에이전트를 개발하고 음성, 채팅, 이메일을 통해 운영하면서 규제 환경에 맞춘 컴플라이언스 가드레일을 통합합니다. Gradient Labs에 따르면, 이 기술은 현재 Wise, Zego, Current, Stash, Rho 등 고객을 포함해 3,200만 명 이상의 최종 사용자를 지원하고 있습니다. 2026년 6월, 회사는 시리즈 A 투자를 $26 million으로 확대했으며, 상호 연결된 전문 AI 에이전트를 통해 복잡한 은행 및 핀테크 운영을 자동화한다는 더 큰 비전을 향해 나아가고 있습니다.

당신은 2023년에 Gradient Labs를 공동 설립하기 전 Monzo에서 5년 이상 머신러닝을 구축하고 이끌었습니다. Monlon에서 직접 목격한 어떤 점이 자율 AI 에이전트를 중심으로 새로운 회사를 만들 기회가 있다고 확신하게 만들었으며, 대형 언어 모델의 등장이 그 기회를 가능하게 만든 이유는 무엇인가요?

Monzo에서 저는 규제 환경에서 작동해야 하는 ML 시스템을 구축하는 데 수년을 보냈습니다. 실수는 실제로 큰 영향을 미치고 모든 작업에 감사 추적이 필요합니다. 가장 큰 영향을 준 것은 맞춤형 인프라를 개발해야 했다는 점이었습니다. 기존에 준비된 솔루션으로는 이러한 엄격한 제약 하에서 안전하게 작동할 수 없었기 때문입니다. 이 경험을 통해 두 가지 확신을 갖게 되었습니다. 첫째, 기술이 은행이 수십 년 동안 산업을 얽매어 온 운영 부담을 마침내 해소할 수 있다는 점입니다. 둘째, 범용 수평형 AI는 큰 변화를 만들지 못한다는 점—규제된 작업의 미묘함은 너무 구체적이기 때문입니다. 대형 언어 모델이 다단계, 때로는 모호한 고객 상호작용을 추론할 수 있을 만큼 충분히 능숙해지자, 전체 규제 워크플로우를 엔드투엔드로 관리할 수 있는 에이전트를 구축하는 것이 가능해졌습니다. 기존에 존재하던 것과 실제 규제 기업이 필요로 하는 사이의 격차가 Gradient Labs를 시작하게 만든 이유이며, 금융 분야에 특화된 수직형 AI에 베팅한 이유이기도 합니다.

당신은 소비자들이 겪는 현상을 “경험의 들쭉날쭉함”이라고 표현했습니다. 한 AI 에이전트는 매우 복잡한 작업을 수행할 수 있지만, 다른 시스템은 전화번호와 이름을 구분하는 것처럼 단순한 작업에서도 실패합니다. 기본 모델이 비슷한 수준일 때, 이러한 극적인 격차를 실제로 초래하는 원인은 무엇인가요?

그 격차는 모델 자체의 순수한 성능보다는 모델에 투입된 엔지니어링 양에 더 기인한다고 말하고 싶습니다. 시스템이 전화번호를 이름으로 착각하는 등 단순 작업에서 실패한다면, 검증, 폴백 로직, 구조화된 데이터 처리 등 주변 프레임워크에 투자하지 않았다는 의미입니다. 보다 인상적인 에이전트는 해당 작업을 위해 정밀하게 엔지니어링되었을 가능성이 높습니다. 동일한 기본 모델군이지만 적용된 엄격성 수준이 완전히 달라서 바로 이러한 차이가 들쭉날쭉함을 초래합니다.

최첨단 모델이 지속적으로 개선됨에도 불구하고, 겉보기에 기본적인 AI 실패가 왜 계속 발생할까요? 이는 모델 자체의 한계 때문인가요, 아니면 주변 시스템 아키텍처, 데이터, 워크플로우, 평가, 제품 설계 등의 실패 때문인가요?

주된 원인은 모델이 아니라 시스템입니다. 최첨단 모델은 추론 능력이 계속 향상되고 있습니다. 그러나 기업들은 종종 확률 기반 행동에 맞게 개발되지 않은 시스템에 이를 연결합니다. 시스템에는 취약한 통합과 불완전한 데이터가 존재하며, 변경이 배포되기 전에 실질적인 평가 루프가 없습니다. 따라서 프로덕션에서 발생하는 기본적인 AI 실패는 실제 AI 실패라기보다 평가, 모니터링, 워크플로우 설계에 대한 투자가 부족한 결과입니다.

많은 기업이 AI 고객 서비스를 속도, 해결율, 티켓 회피 등으로 최적화하는 것으로 보입니다. AI 에이전트가 실제로 고객 경험을 개선하고 있는지를 측정하려면 기업은 어떤 지표를 사용해야 할까요?

이를 위해서는 해결 정확도를 고려해야 합니다. 속도와 억제는 고객을 전화를 끊게 했는지 여부를 평가하는 데 사용되며, 문제를 해결했는지는 평가하지 않습니다. AI 에이전트의 역량을 측정하기 위해 사용되어야 하는 해결 정확도는 에이전트가 올바른 행동을 했는지를 고려하며, 단순히 빠르게 응답하는 것과는 다릅니다. 이는 재접촉 비율, 불만 건수, 그리고 이후 인간이 개입해야 하는 빈도와 같은 다른 신호와 함께 작동합니다. 전환율이 상승하면서도 재접촉 및 불만이 증가한다면 잘못된 결과를 최적화하고 있다는 것을 알 수 있습니다.

Gradient Labs는 규제된 금융 서비스에 집중하고 있으며, 여기서는 잘못된 응답이 일반적인 고객 서비스 실수보다 훨씬 큰 영향을 미칠 수 있습니다. 대출, 분쟁, 온보딩 또는 고객 알기(KYC) 검증과 같은 영역을 포함하는 프로세스를 AI 에이전트가 자율적으로 처리할 수 있을 만큼 신뢰할 수 있는지를 어떻게 판단합니까?

대부분의 팀이 선호하는 기본 경로는 공동 파일럿 방식입니다: 누군가가 모든 행동을 승인해 더 안전하다고 느끼기 때문입니다. 그리고 대부분은 이것이 더 안전하다고 가정합니다. 그러나 실제로 AI가 대부분의 작업을 정확히 수행함에 따라 검토자들이 실제로 확인하지 않고 승인하게 되고, 안전성은 결국 사라집니다. 이는 기존 작업량을 최소화하는 데 전혀 도움이 되지 않으며, 단지 속도를 높이고 얻는 가치를 감소시킬 뿐입니다.

이것이 Gradient Labs에서 AI 에이전트가 충분히 신뢰할 수 있다는 개념이 매우 프로세스별로 구체적인 이유입니다. 우리에게는 단계적 자율성을 통해 개발되어야 하며 단순히 하나의 목표로만 여겨서는 안 됩니다. KYC나 분쟁과 같은 분야에서 더 큰 독립성을 부여받기 위해서는, 에이전트가 대규모의 실제 사례 집합에 대해 벤치마크를 거치고, 운영에 투입된 후에도 그 결정의 샘플에 대해 인간 검토가 이루어져야 합니다. 흥미롭게도, 이는 되돌릴 수 있음이 여기서 정말 중요함을 확인시켜 줍니다. 되돌릴 수 있는 경우는 그렇지 않은 경우보다 더 빠르게 자율성을 얻을 것입니다.

가드레일은 AI 에이전트를 더 안전하게 만들기 위한 해결책으로 점점 더 많이 제시되고 있지만, 규칙을 추가하면 시스템이 경직되거나 정당한 작업을 수행하지 못하게 할 수도 있습니다. 에이전트를 또 다른 고도로 제한된 챗봇으로 전락시키지 않으면서 자율성과 가드레일을 어떻게 균형 잡을 수 있습니까?

실수는 가드레일을 에이전트가 단순히 튕겨 나가는 벽으로 여기는 것입니다. 우리 시스템에서는 가드레일이 두 가지 역할을 동시에 수행합니다. 대화의 매 턴마다 가드레일을 적용합니다 — 일부는 고객이 말하는 내용을 검사해 취약성, 재정적 어려움, 불만 등을 포착하고, 다른 일부는 에이전트가 말하려는 내용을 검사해 규정을 준수하도록 합니다. 그러나 가드레일이 작동하면 단순히 차단하지 않고 에이전트를 올바른 절차로 재지정하며, 그 결정은 에이전트의 추론 과정에 투명하게 표시되어 운영자가 왜 그렇게 행동했는지 알 수 있습니다. 더 깊은 가드레일은 에이전트가 작업을 어떻게 생각하도록 교육받는지, 접근할 수 있는 데이터, 사용할 수 있는 도구 등에 내재되어 있습니다. 이러한 조합이 에이전트를 경직되지 않게 안전하게 유지하는 핵심이며, 에이전트는 가드레일이 무엇이며 왜 존재하는지 이해하고, 허용되지 않는 것으로 보이는 것을 거부하는 대신 정당한 작업을 수행합니다.

여기서 문제는 가드레일을 에이전트가 튕겨 나가는 벽돌벽으로 보는 데 있다고 생각합니다. 보다 구체적으로, 우리는 대화의 매 턴마다 두 가지 유형의 가드레일을 실행합니다. 첫 번째는 고객이 말하는 내용을 검사하여 취약성, 재정적 어려움, 불만을 제기하는 고객 등을 포착하도록 설계된 고객 가드레일입니다. 두 번째는 에이전트가 메시지를 보내기 전에 말하려는 내용을 확인하여 규정을 준수하도록 하는 에이전트 가드레일입니다.

이는 가드레일 중 하나가 작동했을 때 행동을 완전히 차단하는 대신 올바른 경로로 재지정한다는 의미입니다. 이렇게 하면 에이전트의 의사결정 과정에 대한 투명성을 유지하고, 인간 운영자에게 해당 행동을 취한 이유를 제공할 수 있습니다.

우리가 이를 가능하게 하는 이유는 에이전트의 추론 과정 모든 측면이 LLM을 통과하도록 강제되지 않기 때문입니다. 이러한 가드레일은 대화 종료 시에만 작동하는 것이 아니라 에이전트의 전체 수명 동안 트리거되므로 결정론적입니다. 이를 통해 우리는 민감한 커뮤니케이션을 에이전트에게 신뢰하고, 대규모 및 예측 가능한 방식으로 특정 사용 사례에 맞는 에이전트 맞춤화를 허용할 수 있습니다.

가장 중요한 것은 에이전트가 처음부터 작업을 어떻게 사고하도록 교육받는가이며, 이를 통해 관련 데이터를 접근하고 필요한 도구를 사용할 수 있게 하는 것입니다. 에이전트가 허용되지 않을 것처럼 보이는 모든 일을 거부하지 않고 정당한 작업을 수행할 수 있는 능력이 안전성을 향상하고 경직성을 방지하는 데 도움이 됩니다.

AI 에이전트가 점점 더 자율화됨에 따라 인간은 어디에서 루프에 남아 있어야 할까요? 기본 모델이 얼마나 능력 있어도 계속해서 인간의 판단이 필요하다고 생각하는 특정 결정이나 고객 상호작용이 있습니까?

결정이 정직한 재량을 필요로 하거나 고객에게 중대한 영향을 미치거나 에이전트가 아직 평가되지 않은 결과와 관련될 경우 인간이 관여해야 합니다. 인간이 전체를 수행해야 하는 것은 아니지만 필요에 따라 검토하거나 승인해야 합니다. 모델이 더욱 능력 있어도 이는 여전히 사실일 가능성이 높으며, 이는 능력의 문제가 아니라 책임과 신용 결과나 분쟁과 같은 상황에서 고객이 인간 의사결정자를 가질 권리 때문입니다.

결정이 정직한 재량을 필요로 하거나 고객에게 중대한 영향을 미치거나 에이전트가 아직 평가되지 않은 결과와 관련될 경우 인간이 관여해야 합니다. 저는 이를 전통적인 백업 모델보다 한 단계 더 나아가, 에이전트가 인간과 함께 조직도에서 점점 그 위치를 확보하고 있다고 주장하고 싶습니다. 그 결과 인간의 노력이 주로 에스컬레이션 및 판단 호출에 집중되는 반면, 에이전트는 조정 및 라우팅 작업을 담당하게 됩니다.

하지만 이를 진정으로 성공시키려면 에이전트도 인간과 동일한 제도적 맥락을 필요로 하여, 어떤 문제에 누구를 언제 끌어들여야 하는지 알 수 있어야 합니다. 그래서 우리는 Collaborate를 만들었습니다. 운영자, 엔지니어, 에이전트가 버전 관리, 평가, 지속적인 학습을 핵심으로 삼아 동료처럼 함께 작업할 수 있게 하기 위함입니다. 이를 통해 인간은 완전히 루프에 머무르고, 루프는 에이전트와 인간이 얼마나 잘 협업하는가에 따라 형태만 바뀌게 됩니다.

Gradient Labs는 단일 범용 에이전트보다 특정 금융 서비스 워크플로우에 맞춘 전문 에이전트에 집중해 왔습니다. 기업 AI의 미래가 주로 전문 에이전트 네트워크로 구성될 것이라고 보십니까, 아니면 점점 더 강력해지는 기반 모델이 결국 이러한 전문성을 덜 중요하게 만들 것이라고 보십니까?

기본 모델이 개선되더라도 전문화는 여전히 중요하다고 생각합니다. 사람들은 단순히 똑똑한 모델에만 비용을 지불하는 것이 아니라, 해당 워크플로우에 특화된 평가, 가드레일, 데이터 통합을 위해 비용을 지불합니다. 그리고 이러한 작업은 기본 모델이 좋아진다고 사라지지 않습니다. 저는 모든 작업을 수행하는 하나의 범용 에이전트보다는 공통적이고 강력한 기본 모델 위에 구축된 전문 에이전트 네트워크가 될 것이라고 봅니다.

AI 에이전트는 배포 후 지속적으로 학습하고 개선해야 하지만, 규제된 환경에서는 작은 행동 변화조차 새로운 위험을 초래할 수 있습니다. 기업이 에이전트를 지속적으로 개선하면서 업데이트가 회귀, 컴플라이언스 문제 또는 예기치 않은 동작을 일으키지 않도록 하려면 어떻게 해야 할까요?

우리가 따르는 원칙은 모든 업데이트를 점진적인 설정 변경이 아니라 새로운 모델 릴리스로 간주하여, 배포 전에 모든 변경이 전체 평가 스위트를 통과하도록 하는 것입니다. 여기에는 실수가 실제 차이를 만들었을 선례에 대한 회귀 테스트가 포함되며, 모든 고객에게 한 번에 적용되지 않고 점진적으로 롤아웃하고 모니터링합니다. 따라서 드리프트가 발생하기 시작하면 전체 규모가 아니라 제한된 트래픽에만 영향을 미치게 됩니다. 이것이 바로 최근 출시된 Collaborate가 기반으로 하는 핵심입니다. Collaborate는 운영자, 엔지니어, AI 에이전트가 에이전트가 어떻게 생각해야 하는지에 대한 살아있는 정의를 공유하며 버전 관리, 평가, 지속 학습을 워크플로우에 직접 통합해 동료처럼 함께 작업할 수 있게 합니다. 따라서 누군가 에이전트가 사례를 처리하는 방식을 개선하면, 그 변경은 버전 관리되고 과거 대화에 대해 테스트된 뒤 다른 릴리스와 동일한 제어 하에 롤아웃됩니다. 이는 에이전트가 배포 후에도 계속 개선될 수 있지만, 개선 자체가 회귀나 컴플라이언스 문제를 일으키는 원인이 되지 않음을 의미합니다.

앞으로 강력한 기반 모델에 대한 접근성이 점점 보편화됨에 따라 AI 애플리케이션에서 실제 경쟁 우위는 어디에서 나올까요? 최고의 모델을 보유한 기업이 승자가 될까요, 아니면 신뢰할 수 있는 시스템을 설계하고 일관된 좋은 경험을 제공하는 기업이 승자가 될까요?

점점 더 많은 기반 모델이 수렴하기 시작하면서, 우위는 거의 전적으로 이러한 모델을 중심으로 보다 신뢰할 수 있는 시스템을 설계하는 능력, 즉 평가, 가드레일, 데이터, 워크플로우 설계에 뛰어난 사람에게 넘어갈 것입니다. 모델 자체는 상품화된 입력이 되고 있지만, 실제 제품은 생산 환경에서의 일관성과 신뢰성입니다.

그보다 더 나아가, 저는 이점이 에이전트가 기업 운영에 얼마나 깊이 내재되었는가에 달려 있다고 봅니다. 기업 운영의 다양한 부문에 삽입될 수 있는 에이전트는 특정 문제만 다루거나 프런트라인에만 도달할 수 있는 도구보다 우위를 점할 것입니다. 에이전트가 프런트라인과 백오피스 시스템을 모두 아우를 수 있을 때, 더 많은 맥락을 제공하고 인간처럼 복잡한 문제를 끝‑끝까지 처리할 수 있습니다. 에이전트가 기업의 실제 업무 방식에 맞게 적응하는 것이 지속적인 승리의 핵심이라고 기대합니다.

멋진 인터뷰에 감사드립니다. 더 알고 싶은 독자는 Gradient Labs를 방문하세요.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.