인터뷰

PolyAI의 공동 창립자 및 CEO인 Nikola Mrksic – 인터뷰 시리즈

mm
Unite.AI를 Google의 선호 소스에 추가

Nikola Mrksic는 PolyAI의 공동 창립자 및 CEO입니다. PolyAI는 자동 고객 서비스를 위한 기업용 음성 조종사 공급업체입니다.

초기에는 AI에 대해 어떤 점이 관심을 끌었나요?

저는 rất 어린 나이부터 수학과 컴퓨터 과학에 관심이 있었습니다. 케임브리지에서 공부하는 동안 저는 스티브 영과 주빈 가하라مانی와 같은 몇몇 유명한 기계 학습 연구자와 함께 일할 기회를 얻었습니다. 스티브는 저에게 그의 스타트업인 VocalIQ에서 음성 대화 시스템을 구축하는 일을 제안했습니다. 이후 저는 스티브와 함께 박사 학위를 취득했습니다. 그 때 저는 다양한 사용 사례와 언어에서 작동하는 데이터 주도 언어 이해 모델을 구축하는 일을 했었습니다. 대화형 AI는 매우 어려운 분야로, 여전히 많은 과학적 및 기술적 돌파구가 필요합니다. 그 분야에서 저는 지금까지忙しく 지내왔습니다.

2017년에 PolyAI를 설립했습니다. PolyAI의 기원에 대해 이야기해 주시겠습니까?

제 공동 창립자 Shawn Wen, Eddy Su와 저는 케임브리지에서 박사 학위를 함께 취득했습니다. 우리는 대화 시스템을 몇 년간 연구했지만, 우리가 연구한 시스템이 상업적으로 이용할 수 있는 분야가 거의 없다는 것을 깨달았습니다. 그래서 우리는 현실 세계에서 유용한 대화형 AI 솔루션을 만들기 위해 함께 모였습니다. 우리는 고객 서비스 분야에서 기회를 찾았습니다. 기술적 능력과 고객의 요구가 잘 맞았기 때문입니다.

우리는 고객 서비스에 중점을 두었습니다. 왜냐하면 기술적 능력과 고객의 요구가 잘 맞았기 때문입니다.

사용하는 기계 학습 및 자연어 처리 기술에 대해 이야기해 주시겠습니까?

우리의 주요 비법은 우리의 독점적인 인코더 모델입니다. 우리는 수십억 개의 자연어 대화로 사전 훈련을 시켰습니다. 그래서 입력 음성이 속어나 관용구를 사용하더라도 의도를 추출할 수 있습니다. 이것은 전화로 통화할 때 매우 중요합니다. 고객들은 키워드로 말하지 않습니다. 그들은 이야기를 합니다. 끊깁니다. 질문을 합니다. 그리고 대화를 제어하려고 합니다.

最近에 우리는 ConVEx 모델을 발표했습니다. 이것은 매우 데이터 효율적인 엔티티 추출기입니다. 우리는 대화에서 값을 정확하게 추출할 수 있습니다.

우리의 음성 인식 조정 과정은 음성 인식 플랫폼을 미세 조정하여 다른 억양으로 인한 노이즈를 중화하는 것입니다. 또한 우리는 대화 정책 라이브러리를 개발했습니다. 이것은 사전 설계된 사용 사례를 포함합니다. 그래서 우리는 고객에게 매우 빠르게 음성 조종사를 구축할 수 있습니다.

대화형 AI 제품이 좋은지 나쁜지 어떻게 구별할 수 있나요?

좋은 제품은 사용자의 의도를 일관되게 이해하고 사용자가 반복해서 말하지 않도록 합니다. 통화는 종종 시끄러운 환경에서 일어납니다. 그래서 제품은 잡음에 강해야 합니다. 브랜드가 큰 시장에 도달하면 제품은 다양한 억양과 의도 표현 방식을 이해해야 합니다. 둘 다 강력한 음성 인식 능력과 엔티티 추출이 필요합니다.

훌륭한 제품은 사용자와 적극적으로 상호 작용합니다. 사용자의 생각을 따라가고 복잡한 경우에 대처할 수 있습니다. 사용자가 여러 의도와 정보를同時적으로 공유할 때도 대처할 수 있습니다. 이것은 강력한 다중 레이블 분류와 컨텍스트 관리가 필요합니다.

훌륭한 제품은 인간적인 특성을 가지고 있지만 불쑤거나 로봇 같은 것은 아닙니다. 이것은 빠른 상호 작용, 진정한 목소리, 지속적인 피드백 큐와 무작위성 및 불완전성을 의미합니다.

最後에, 훌륭한 대화형 AI 제품은 사용자와 어디서나 상호 작용하고 플랫폼별 경험을 제공합니다. 이것은 음성, SMS, 채팅 또는 소셜 메시징 플랫폼을 포함합니다. 상호 작용 패러다임은 각 커뮤니케이션 플랫폼의 특징을 반영해야 합니다.

기업이 대화형 AI를 사용하는 것의 장점은 무엇인가요?

고객 경험은 매우 중요합니다. 고객이 원하는 것을 쉽게 할 수 있도록 하는 것이 최우선입니다.

전화는 여전히 고객이 회사에 연락하는 데 가장 선호하는 채널입니다. 모든 고객 상호 작용의 65%가 전화로 이루어집니다. COVID-19 팬데믹期间, 고객 지원 센터는 이전보다 더 많은 고객의 지원을 받았습니다.

물론, 훌륭한 경험은 고객이 원하는 대로 통신할 수 있도록 합니다. 비동기식 통신을 선호하는 고객에게도 브랜드가 같은 수준의 경험을 제공할 수 있도록 합니다.

고객이 무엇을 말하려고 하는지 감지하는 것이 얼마나 어려운가요?

음성 채널을 통해 고객을 이해하는 데에는 여러 가지 어려움이 있습니다. 사용자의 의미를 정확하게 이해하려면 여러 가지 구성 요소가 잘 작동해야 합니다.

첫째, 음성 인식은 어려울 수 있습니다. 특히 사람들이 시끄러운 환경에서 전화할 때 또는 운전하거나 터널을 지나갈 때 음성 인식이 어려울 수 있습니다. 또한 지역에 따라 억양이 다를 수 있습니다. 우리는 음성 인식을 최적화하기 위해 음성 인식 모델을 미세 조정하는 방법을 개발했습니다.

우리의 ConveRT 모델은 수십억 개의 대화로 사전 훈련을 시켰습니다. 그래서 약한 신호로 의도를 감지할 수 있습니다. 인간도 약간의 단어를 놓치더라도 대화를 이해할 수 있습니다.

또 다른 고려 사항은 사용자가 여러 동작을同時적으로 수행하려고 할 때입니다. 예를 들어, 누군가가 “저는 카드를 잃어버렸습니다. 사용 내역과 카드를 차단해 주시겠습니까?”라고 말할 수 있습니다. 이 경우 모델은 두 가지 의도를 인식하고 순서대로 처리해야 합니다.

모델은 또한 고객이 제공하는 엔티티를 추출하고 이해해야 합니다. 예를 들어, “토요일 점심에 저와 제妻, 그리고 우리 2명의 아이를 위해 테이블이 있습니까?”라는 질문에서 모델은 날짜(토요일)와 사람 수(4명)를 추출해야 합니다.

마지막으로, 대화는 항상 선형적이지 않습니다. 고객이 음성 조종사의 프롬프트와 관련이 없는 질문으로 끊을 수 있습니다. 그래서 조종사는 다른 입력을 ‘들어야’ 하며 이전에 사용자가 제공한 정보에 대한 변경 사항에 대응할 수 있어야 합니다.

企業이 PolyAI와 함께 대화형 AI ボット를 출시하려면 어떤 과정과 시간이 필요합니까?

우리는 고객에게 실질적인 비즈니스 영향을 미치는 음성 조종사를 제공하기 위해 여기 있습니다. 그래서 우리는 고객과 함께 시작하여 고객의 CX 목표, 주요 메트릭 및 지원 프로세스를 식별하고 명확히 합니다. 이것은 음성 조종사가 고객을 안내해야 하는 여정을 정의하는 곳입니다. 이것은 우리의 사전 훈련된 ConveRT 모델로 인해 고객으로부터 대화 데이터가 필요하지 않습니다.

그 다음 우리는 고객으로부터 거의 입력이 필요하지 않은 음성 조종사를 개발할 수 있습니다. 그래서 고객의 내부 IT 팀에 부담이 없습니다.

복잡성에 따라 우리는 2주 만에 가치 증명을 제공하고 2개월 만에 완전한 배포를 할 수 있습니다.

이번 인터뷰에 감사드립니다. 더 많은 정보를 원하시는 독자는 PolyAI를 방문하십시오.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.