인터뷰

Sushil Kumar, Cyara CEO – 인터뷰 시리즈

mm
Unite.AI를 Google의 선호 소스에 추가

Sushil Kumar, Cyara CEO는 인공지능, DevOps, 클라우드 인프라, 제품 전략 및 소프트웨어 테스트 분야에서 25년 이상 리더십을 가진 경험 풍부한 엔터프라이즈 소프트웨어 임원 및 기업가입니다. 그는 2025년 12월에 Cyara의 CEO로 합류했으며, 이전에 RelicX.ai의 공동 설립자 겸 CEO로서 생성형 AI 기반, 의도 기반 테스트 자동화 플랫폼을 구축했으며 이 플랫폼은 Harness에 인수되었습니다. 그 후 그는 RelicX의 기술을 Harness에 통합하는 작업을 이끌었고, 해당 기업의 AI 테스트 자동화 전략 수립에 기여했습니다. 경력 초기에 Kumar는 Broadcom에서 DevOps 총괄 매니저, CA Technologies에서 제품 담당 수석 부사장으로 재직했으며, Oracle에서 16년 이상 근무하면서 고위 제품 리더십 역할을 맡아 주요 엔터프라이즈 소프트웨어 사업을 확장하는 데 기여했습니다. 이러한 역할들을 통해 그는 대기업을 위한 AI, 클라우드, DevOps 및 자동화 플랫폼 구축과 확장에 집중해 왔습니다. Cyara에서의 그의 임명은 회사의 AI 기반 고객 경험 보증 역량 및 글로벌 범위를 확대하는 데 중점을 두고 있습니다.

Cyara는 음성, 디지털, 메신저 및 대화형 AI 채널 전반에 걸쳐 고객 상호작용을 테스트, 모니터링 및 검증하도록 기업을 지원하는 고객 경험 보증 회사입니다. Cyara Agentic Platform은 AI 기반 고객 경험이 야기하는 증가하는 과제, 즉 비결정적 AI 에이전트 테스트, 환각 및 행동 변이 감지, 규정 준수 검증, 운영 시스템 모니터링, 그리고 엔드‑투‑엔드 고객 여정 평가 등을 해결하도록 설계되었습니다. 이 플랫폼은 AI 에이전트 테스트, 운영 모니터링, 음성 및 통신 보증, 디지털 채널 테스트, CX 가시성을 결합하여 연간 3억 5천만 건 이상의 고객 여정을 지원하며, 140개국 이상에 걸친 글로벌 네트워크를 보유하고 있습니다. 기업이 점점 더 자율적인 AI 에이전트를 고객 대면 워크플로에 배치함에 따라, Cyara는 이러한 시스템이 배포 전후에 신뢰성·안전성·일관성을 유지하는지 평가하는 보증 레이어로 자사의 기술을 포지셔닝하고 있습니다.

Oracle와 CA/Broadcom에서 기업 소프트웨어를 구축·확장해 온 경험을 바탕으로 Relicx를 설립하고 현재 Cyara를 이끌고 계십니다. 이러한 경험이 AI 에이전트를 전통적인 소프트웨어보다 인력 구성원처럼 관리해야 한다는 관점을 어떻게 형성했는지 말씀해 주세요.

저는 경력 대부분을 기업 소프트웨어를 구축하고 확장하는 데 투자했으며, 그곳에서 만든 규율은 결정론적 시스템에 대한 규율이었습니다. 소프트웨어가 해야 할 일을 알고 있습니다. 그 기대에 맞춰 검증합니다. 소프트웨어가 오류가 발생하면 오류, 실패한 트랜잭션, 알림 등으로 알려줍니다.

AI 에이전트는 그렇게 작동하지 않습니다. 비결정적이기 때문에 동일한 입력이 다른 경로를 택할 수 있습니다. 더 중요한 것은, 이들이 회사를 대신해 행동한다는 점입니다. 환불, 정책, 약속 등과 같은 약속을 수행합니다. 그리고 그 중 하나가 잘못되더라도 시스템이 고장 나지는 않습니다. 잘못된 답변이 정확한 답변처럼 들릴 수 있습니다. 트랜잭션은 성공하고, 대시보드는 여전히 녹색이며, 고객은 회사가 동의하지 않은 무언가를 받게 됩니다.

소프트웨어가 결정과 약속을 수행하고, 오류를 알려주지 않을 수 있게 되면, 다른 운영 모델이 필요합니다.

이때 인력과의 비교가 의미를 갖게 됩니다. 직원의 모든 결정을 스크립트로 관리하지 않습니다. 역할을 부여하고, 그에 따른 권한을 설정하며, 직원이 권한을 획득함에 따라 권한을 확대합니다. 에이전트도 동일한 구조 아래에서 같은 방식으로 행동합니다.

제 생각에는 자율성은 배포 결정이 아니라 일련의 승진 과정입니다. 에이전트는 작업을 수행하고 권한 범위 내에 머무르며 도움이 필요할 때 이를 인식함으로써 각 단계의 승인을 얻습니다.

AI 에이전트를 위한 “HR‑유사” 운영 모델은 기업 내부에서 실제로 어떻게 구현되며, 기업이 먼저 도입해야 할 요소는 무엇인가요?

먼저 역할부터 정의하세요. 모든 에이전트는 실제 운영에 투입되기 전에 직무 기술서와 유사한 문서를 가져야 합니다. 수행해야 할 목표, 권한 있는 정보, 활용 가능한 고객 데이터, 스스로 내릴 수 있는 결정, 그리고 책임이 어디까지인지를 명확히 해야 합니다. 기업이 이를 한 문단으로 작성하지 못한다면, 해당 에이전트는 역할을 수행할 준비가 된 것이 아니라 데모 단계에 머물러 있습니다.

그 역할에서 파생되는 네 가지 요소가 있으며 순서가 중요합니다. 출시 전 증거 확보는 에이전트가 통제된 테스트가 아닌 실제 환경과 유사한 조건에서 작업을 수행할 수 있음을 입증하는 것을 의미합니다. 운영 중 감독을 통해 에이전트가 실제로 수행한 작업을 파악하고 시스템 응답 여부만 확인하지 않도록 합니다. 승격 게이트를 두어 증거가 확보된 경우에만 추가 권한을 부여하고, 그 이전에는 부여하지 않습니다. 마지막으로, 엔지니어링이 아닌 비즈니스 부문에 소유자를 지정하여 해당 에이전트가 수행할 수 있는 업무에 대한 책임을 지게 합니다.

순서를 잘못 잡으면 나머지는 의미를 잃습니다. 책임이 모호하면 좋은 성과를 입증할 수 없으며, 실패 역시 증명할 수 없습니다. 역할이 먼저이고, 그 다음에 증거가 따라옵니다.

AI 에이전트에 특정 역할을 부여할 경우, 조직은 고객이나 핵심 시스템과 상호작용하기 전에 그 책임, 권한 및 경계를 어떻게 정의해야 할까요?

역할은 에이전트가 무엇을 위한 것인지 설명합니다. 권한은 에이전트가 접근할 수 있는 범위를 나타냅니다. 이는 서로 다른 두 대화이며, 기업들은 보통 첫 번째만 가지고 있습니다.

세 가지 사항을 명확히 하세요. 에이전트가 접근할 수 있는 시스템과 데이터, 그리고 그 방향을 명시해야 합니다. 고객 기록을 읽는 것과 변경하는 것은 동일한 권한이 아니기 때문입니다. 에이전트가 스스로 약속할 수 있는 내용, 즉 금전과 책임이 발생하는 환불, 크레딧, 정책 예외와 같은 사항을 정의합니다. 그리고 전환을 강제하는 조건을 명시합니다. 사전에 지정할 수 있는 경우와 에이전트가 자신의 역량을 벗어났다는 신호가 포함됩니다.

이러한 결정은 기술팀에만 맡겨서는 안 됩니다. 이는 기업이 감수하는 위험을 결정합니다. 고객 경험과 컴플라이언스 노출을 담당하는 사람들이 그 경계가 어디에 설정되는지에 대해 발언권을 가져야 하며, 보통 마지막에 의견을 묻는 대상이 됩니다.

그렇다면 에이전트가 그 경계 안에 머무른다는 것을 증명해야 합니다. 목표는 모든 가능한 실수를 없애는 것이 아니라, 실수가 발생할 수 있다는 점을 인정하는 것입니다. 실수는 발생합니다. 중요한 질문은 에이전트가 자신의 한계를 이해하고, 언제 멈춰야 하는지를 알고, 고객 여정의 다른 부분에 부정적인 영향을 미치지 않으며 주어진 업무를 수행할 수 있는가 입니다.

당신은 더 큰 자율성이 처음부터 부여되는 것이 아니라 획득되어야 한다고 주장합니다. 기업이 AI 에이전트가 독립적으로 취할 수 있는 행동 범위를 확대하기 전에 에이전트가 입증해야 할 것은 무엇입니까?

이제 AI 에이전트를 만드는 것은 쉽습니다. 어려운 부분은 그 에이전트가 자율성을 가질 자격이 있음을 증명하는 것입니다.

에이전트가 스스로 할 수 있는 범위를 확대하기 전에, 기업은 에이전트가 할당된 업무를 일관되게 수행하고 경계 내에 머무른다는 증거가 필요합니다. 이는 기대했던 상황뿐만 아니라 예상하지 못한 상황에서도 어떻게 대응하는지를 의미합니다. 에이전트는 통제된 조건에서는 강력해 보일 수 있지만, 상황이나 주변 시스템이 변하면 다르게 행동할 수 있습니다.

고객이 간단한 청구 문의로 시작했지만 결제 실패 후 좌절하게 될 수 있습니다. 에이전트는 이러한 변화를 실시간으로 인식하고 경로를 바꿔야 하며, 검증된 경로를 계속 따라서는 안 됩니다.

권한이 확대되기 전에 세 가지가 충족되어야 합니다. 에이전트는 깨끗한 환경이 아닌 실제 조건에서 업무를 수행해야 합니다. 자신의 역량 한계를 알고 그 지점에서 멈춰야 합니다. 그리고 누군가가 필요할 때마다 두 가지에 대한 증거를 제시할 수 있어야 합니다.

증명의 수준은 자율성 수준에 맞아야 합니다. 작은 결정에는 가벼운 증거가 충분합니다. 결제 시스템 접근이나 정책 예외를 약속하는 능력과 같은 경우에는 기준이 훨씬 높아야 합니다.

기업은 AI 에이전트를 배포한 후, 특히 그들의 의사결정 품질이 전통적인 소프트웨어 테스트 지표만으로는 포착되지 않을 때, 어떻게 지속적으로 성능을 평가해야 할까요?

이것이 전통적인 소프트웨어 사고방식이 무너지는 지점입니다. 결정론적 소프트웨어에서는 무조건 통과 여부만 테스트합니다. AI 에이전트의 경우 시스템으로부터 성공적인 응답을 받더라도 고객 상호작용이 실패할 수 있습니다.

따라서 결과를 평가해야 합니다, 응답 자체가 아니라. 에이전트가 고객이 달성하려는 목표를 이해했는가? 올바른 정보를 사용했는가? 여정을 완수했는가? 경계 내에 머물며 필요할 때 에스컬레이션했는가?

기본 평가, 즉 정답 집합에 대한 답변 점수 매기는 것이 최소 기준입니다. 모든 기업이 이를 보유하고 있습니다. 고객이 계속 신뢰하게 만드는 차원은 그 아래에 있습니다: 컴플라이언스, 편향, 오용, 그리고 에이전트가 실제 발신자, 그들의 억양, 배경 소음, 저가 핸드셋, 문장 중간에 끊기는 상황에서도 어떻게 버티는가. 음성 분야에서는 사람들이 예상하는 것보다 더 중요합니다. 왜냐하면 모든 점수가 전사본에 기반하기 때문입니다. 음성 인식 레이어가 질문을 오해하면, 에이전트는 아무도 묻지 않은 질문에 답하게 됩니다.

연산을 직접 살펴볼 가치가 있습니다. 평가에서 99% 점수는 훌륭해 보입니다. 연간 100만 건의 대화 중에는 1만 건이 실패한 것입니다.

두 가지 원칙이 적용됩니다. 검증은 에이전트와 모델 플랫폼과 독립적이어야 합니다. 우리는 에이전트를 직접 구축하지 않으며, 이는 어떤 공급업체도 자신의 AI를 스스로 판단해서는 안 된다고 명확히 말할 수 있는 이유입니다. 기준은 기업 자체의 정책, 고객 약속 및 규제 의무이며, 공급업체의 점수표가 아닙니다.

그리고 모든 운영 실패는 게이트가 되어야 합니다. 티켓이나 백로그 항목이 아니라, 다음 릴리즈가 배포되기 전에 에이전트가 통과해야 하는 테스트입니다. 운영 중 문제가 발생했을 때 그것이 에이전트가 통과해야 할 항목으로 전환되지 않으면, 같은 문제를 두 번 발견하게 되는 비용을 지불하게 되는 것입니다.

신뢰와 거버넌스가 에이전트형 AI 확장의 주요 장벽으로 점점 더 많이 언급되고 있습니다. 기술이 기업의 감독 능력보다 빠르게 발전하고 있다고 보시나요? 그리고 그것이 어떤 위험을 초래합니까?

저는 바로 그런 현상이 일어나고 있다고 생각합니다. 격차는 노력의 부족이라기보다 구조적인 문제입니다. 아이디어가 몇 주 만에 고객 대면 에이전트가 될 수 있습니다. 그 에이전트에 대한 운영 규율, 소유권, 증거, 감독은 훨씬 더 오래 걸리는데, 이는 사람과 책임이 개입하기 때문이며 단순히 소프트웨어만으로는 해결되지 않습니다.

위험은 격차가 확대되는 동안 눈에 보이지 않게 유지된다는 점이다. 에이전트는 오류도, 거래 실패도, 경고도 없이 고객에게 확신에 찬 잘못된 답변을 제공할 수 있다. 모든 대시보드는 정상으로 보인다. 전통적인 운영은 시스템이 문제가 발생했을 때 알려주기를 기대하지만, 에이전트는 이를 신뢰할 수 있게 알려주지 않는다.

답이 속도를 늦추는 것이 아니라고 생각한다. 여기서 승리하는 기업들은 빠르게 움직일 것이다. 답은 빠르게 움직일 수 있는 자신감을 주는 증거와 감독 체계를 구축하는 것이다. 에이전트에게 자율성이 높아질수록, 그 책임을 감당할 수 있다는 증거도 더 많이 필요하다.

자율 에이전트가 잘못된 결정을 내렸을 때 최종적으로 책임을 져야 하는 주체는 누구인가: 개발자, 이를 배포하는 사업부, 모델을 제공하는 공급업체, 혹은 사용을 승인한 경영진 중 누구인가?

궁극적으로 에이전트를 배포하는 회사가 결과에 대한 책임을 진다. 시스템을 구축하고 운영하는 데는 여러 이해관계자가 관여하지만, 고객은 모델 제공자와는 관계가 없다. 고객은 상호작용에 표시된 회사와 관계를 맺고 있다.

이는 책임이 한 사람에게만 귀속된다는 의미는 아니다. 책임은 의사결정 체인을 따라 흐른다. 개발자는 시스템이 어떻게 구축되었는지에 대해 책임이 있다. 사업부는 에이전트가 수행할 수 있는 범위를 결정한다. 공급업체는 제공하는 기술에 대해 책임을 진다. 리더십은 회사가 위험을 관리할 수 있는 통제와 감독 체계를 갖추도록 보장할 책임이 있다.

모델이 결정을 내렸다고 모델이 그 책임을 가진다고 생각하는 것이 실수이다. 그렇지 않다. 에이전트가 귀사를 대신해 고객에게 약속을 하면, 그 약속은 브랜드에 속한다. 고객은 이를 직감적으로 이해하고, 규제기관도 마찬가지이다.

AI 에이전트는 테스트 중에 예상되지 않은 상황을 마주하면 예측할 수 없게 행동할 수 있다. 에이전트가 고객, 금융 시스템 또는 민감한 데이터에 접근하기 전에 기업은 이러한 엣지 케이스를 어떻게 테스트해야 할까?

에이전트가 결국 설계되지 않은 상황을 마주하게 될 것이라고 가정해야 한다. 문제는 그런 상황이 발생했을 때 어떻게 대응하느냐이다.

따라서 예상 경로를 넘어 검증해야 한다. 에이전트에게 모호한 요청을 주고, 상충되는 정보를 제공하며, 불완전한 컨텍스트를 제공한다. 올바른 답이 진행을 멈추고 에스컬레이션하는 상황에 놓이게 한다. 실제 환경 조건을 추가하는데, 음성의 경우 억양, 잡음, 불량 연결 및 통화 중간에 주제가 바뀌는 발신자를 포함한다. 목표는 에이전트가 작동한다는 것을 확인하는 것이 아니라, 조건이 깨끗하지 않을 때 어떻게 행동하는지를 파악하는 것이다.

보다 중요한 점은 에이전트를 개별적으로 검증하는 것이 아니라 전체 여정을 검증해야 한다는 것이다. 모델 자체가 문제인 경우는 드물다. 문제가 발생했을 때 내가 가장 먼저 묻는 것은 모델이 어떤 컨텍스트를 받았는가이다. 오래된 지식 기사이거나, 두 시스템이 상충되는 정책을 가지고 있거나, 고객이 이미 설명한 내용을 놓친 핸드오프일 수 있다. 각 구성 요소가 자체 테스트를 통과하더라도 구성 요소 사이의 연결 지점에서 고객 여정이 실패할 수 있다.

시스템 간의 그 층은 우리가 수년간 계측해 온 부분으로, 450개 기업과 연간 3억 5천만 건 이상의 고객 여정을 다루었다. 에이전트 여부와 관계없이 동일한 방식으로 실패한다. 또한 55개 이상의 다양한 공급업체 기술과 모든 주요 컨택센터 플랫폼 위에 구축된 에이전트를 확인했으며, 이는 기반 모델에 관계없이 이 패턴이 유지된다는 증거이다.

에이전트가 중요한 영역에 접근하기 전에, 기업은 에이전트가 상황이 정상일 때와 비정상일 때 어떻게 행동하는지에 대한 증거를 확보해야 한다.

기업이 결정론적 소프트웨어에서 추론·계획·소통·다중 애플리케이션에 걸친 행동을 수행하는 시스템으로 전환함에 따라 AI 테스트는 어떻게 진화할 것으로 보시는가?

테스트는 시스템이 기대한 답을 도출했는지를 묻는 것에서 올바른 결과를 달성했는지를 묻는 방향으로 전환해야 한다.

이는 상당한 변화이다. 에이전트는 동일한 고객 문제를 해결하기 위해 여러 경로를 취할 수 있으며, 모델과 그 기반 지식이 변함에 따라 이러한 경로도 시간이 지나면서 바뀔 수 있다. 모든 가능한 상호작용에 대한 스크립트를 작성할 수는 없다. 에이전트가 의도를 이해했는지, 과정에서 합리적인 결정을 내렸는지, 부여된 한계 내에서 행동했는지를 평가해야 한다.

한 가지에 대해 조심하고 싶다. 업계가 비용이 많이 드는 방식으로 잘못 이해하고 있기 때문이다. 사전 출시 테스트는 이제 더 중요해졌으며, 에이전트가 준비됐는지를 판단하는 기준이다. 이를 생략하고 바로 운영을 보겠다는 주장은 고객 앞에서 문제를 발견하게 된다는 논리와 같다.

변화된 점은 사전 출시 테스트가 이제 프로세스의 끝이 아니라는 것이다. 실제 운영에서는 제어된 환경에서 완전히 재현할 수 없는 조건을 드러내며, 이러한 운영 결과가 다음 릴리즈 전에 에이전트가 통과해야 할 테스트가 된다. 출시 전 검증, 운영 중 경계, 그리고 서로가 서로를 보완한다. 6개월 차에 운영되는 에이전트는 최초 출시된 에이전트보다 측정 가능한 수준으로 개선되어야 한다.

앞으로 신뢰할 수 있는 AI 인력을 성공적으로 구축하는 조직과 소규모 에이전시 AI 파일럿에 머무르는 조직을 구분 짓는 요소는 무엇인가?

에이전트로부터 실제 수익을 얻는 조직은 증거 기반 운영 모델을 구축한 조직이다. 정체되는 조직은 보통 기술 때문에 차단되는 것이 아니다. 다음 단계 승인을 위해 필요한 것을 아무도 만들 수 없기 때문에 차단된다. 법무팀이나 위험 관리 위원회가 합리적인 질문을 제기하지만 답이 없으므로 파일럿은 파일럿으로 남는다. 기술은 준비돼 있을지라도 조직이 더 큰 권한을 부여하는 것을 정당화하지 못한다.

이것이 파일럿과 운영 인력의 차이점이다. 파일럿에서는 항상 누군가가 감시하고 있다. 운영 모델에서는 각 에이전트가 한 문장으로 설명할 수 있는 업무를 가진다. 그 권한은 제한적이며 문서화되어 있다. 성과는 이를 만든 팀이 아닌 다른 기준으로 평가된다. 생산 실패는 출시 게이트가 된다. 증거가 확보되면 더 큰 자율성이 따라온다.

두 번째 차이점은 소유권이다. 규모를 확장하는 기업에서는 에이전트가 담당하는 비즈니스 기능에 속하며, 그 역할에 대해 책임을 지는 지정된 소유자가 있다. 반면 AI 팀이 소유한 AI 프로젝트로 남아 있으면 규모가 작게 유지된다. 이는 비즈니스 리더가 통제할 수 없는 위험을 감수하지 않기 때문이다.

이것은 전혀 이색적인 것이 아니다. 실제 책임을 맡은 사람들을 관리하는 기존 기업 방식과 크게 다르지 않다.

파일럿은 조직의 확신만으로도 진행될 수 있다. 규모를 확장하려면 증거가 필요하다.

멋진 인터뷰에 감사드립니다, 더 알고 싶은 독자들은 Cyara를 방문하십시오. 

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.