사상 리더
AI 기반 음성 대화 에이전트 для 기업: 두 가지 주요 도전

지금은 이전보다 AI 기반 음성 시스템을 사용하는 것이 적절한 때입니다. 고객 서비스에 대한 전화를 생각해 보십시오. 곧 모든剛性과 유연성이 사라질 것입니다 – 뻣뻣한 로봇 음성, “판매를 위해 1번을 누르십시오”와 같은 제한적인 메뉴, 우리 모두가 인간 에이전트와 대화하기 위해 열심히 0번을 누르거나 전화를 모두 끊는 불편한 경험입니다.
더 이상 없습니다. 대형 언어 모델(LLM), 자동 음성 인식(ASR), 텍스트 음성 변환(TTS) 시스템의 발전으로 인해 “다음 세대” 음성 에이전트가 도착했습니다 – 만약 어떻게 구축할지 알면 말입니다.
오늘 우리는 이러한 최첨단 음성 대화 에이전트를 구축하려고 하는 사람들에게 도전하는 도전을 살펴보겠습니다.
음성을 왜 사용하는가?
들어가기 전에, 음성 에이전트와 텍스트 기반 상호작용의 일반적인 매력과 관련성을 살펴보겠습니다. 음성 상호작용이 텍스트 기반 상호작용보다 더 적절한 이유는 여러 가지가 있습니다 – 이것들은 모두 증가하는 순서입니다:
-
선호도 또는 습관 – 말하기는 역사적으로 텍스트 입력보다 먼저 발생합니다
-
느린 텍스트 입력 – 많은 사람들이 텍스트 입력보다 말하기가 더 빠를 수 있습니다
-
손이 자유로울 수 있는 상황 – 운전, 운동, 설거지 등
-
문해력 – 에이전트가 이해하는 언어에서 최소한의 문해력
-
장애 – 시각 장애 또는 비음성 운동 제어의 부족
웹사이트를 통한 거래가 지배하는 시대에도 음성은 상거래가 강력한 수단입니다. 예를 들어,最近의 JD Power 호텔 산업 고객 만족도 조사에 따르면 객실을 전화로 예약한 고객은 온라인 여행사(OTA) 또는 호텔 웹사이트를 통해 예약한 고객보다 더 만족도 높은 숙박 경험을 했습니다.
하지만 인터랙티브 음성 응답(IVR)은 충분하지 않습니다. 2023년 Zippia의 조사에 따르면 88%의 고객이 자동 전화 메뉴를 탐색하는 대신 라이브 에이전트와 음성 통화를 선호한다고 합니다. 또한 조사에 따르면 전화 메뉴에서 사람들이 가장 많이 불편해하는 것들에는 관련 없는 옵션을 듣는 것(69%), 문제를 완전히 설명할 수 없는 것(67%), 비효율적인 서비스(33%), 그리고 혼란스러운 옵션(15%)이 포함됩니다.
또한 비즈니스와 상호작용하기 위해 음성 조작기를 사용하는 데 열린 마음이 있습니다. Accenture의 조사에 따르면 약 47%의 소비자가 이미 비즈니스와 상호작용하기 위해 음성 조작기를 사용하는 데 편안함을 느끼고 있으며, 약 31%의 소비자가 이미 비즈니스와 상호작용하기 위해 음성 조작기를 사용했습니다.
어떤 이유에서든, 많은 사람들에게는 자연스럽고 편안한 음성 상호작용이 있습니다.
음성 에이전트가 좋은 것의 기준
대략적으로, 좋은 음성 에이전트는 사용자에게 다음과 같은 방식으로 응답해야 합니다:
-
관련성: 사용자가 말한 것/원하는 것에 대한 올바른 이해에 기반합니다. 참고로, 에이전트의 응답은 단순히 말한 답변만이 아니라 백엔드와의 통합을 통해 어떤 형태의 동작일 수 있습니다(예: 호출자가 “예약하십시오”라고 말했을 때 실제로 호텔 객실을 예약하는 것).
-
정확성: 사실에 기반합니다(예: 1월 19일에 호텔에 객실이 उपलब줄 때만 “객실이 उपलब줄 때”라고 말합니다)
-
명확성: 응답은 이해할 수 있어야 합니다
-
적시성: 인간과 같은 대기 시간을 갖습니다
-
안전성: 공격적이거나 부적절한 언어, 보호된 정보의 노출 등이 없습니다
문제
현재 음성 기반 자동 시스템은 위의 기준을 충족하기 위해 매우 제한적이고 사용하기에 불편한 시스템을 사용합니다. 이는 높은 기대와 함께 음성 기반 대화 контек스트가 설정되면서, 이러한 기대는 TTS 시스템의 음질이 인간의 음성과 구별할 수 없을 때 더욱 높아집니다. 그러나 이러한 기대는 현재 널리 배포된 시스템에서 깨지게 됩니다. 왜일까요?
한 마디로 – 유연성이 없습니다:
-
제한된 언어 – 사용자는 일반적으로 비자연스럽게 말해야 합니다: 짧은 문장, 특정 순서, 불필요한 정보 없이 등. 이는 옛날 번호 기반 메뉴 시스템보다 발전된 것이 아닙니다
-
좁고 포괄적이지 않은 “수용 가능” 언어 개념 – 비속어, 음음, 등에 대한 낮은 허용도
-
뒤로 가기 없음:何か가 잘못되면, 문제가 있는 정보를 “수리”하거나 수정할 기회가 거의 없을 수 있으며, 다시 시작하거나 인간 에이전트에게 전환을 기다려야 할 수 있습니다
-
엄격한 턴 테이킹 – 에이전트를 중단하거나 말할 수 있는 능력이 없습니다
이러한 제약이 사람들에게 불편하거나 짜증나게 할 수 있다는 것은 당연합니다.
해결책:
좋은 소식은 현대의 AI 시스템이 이러한 종류의 경험을 크게 개선할 수 있을 만큼 강력하고 빠르다는 것입니다. 이는 여러 가지 요인으로 인해 가능합니다:
-
더 빠르고 강력한 하드웨어
-
ASR의 개선(더 높은 정확도, 노이즈, 악센트 등)
-
TTS의 개선(자연스러운 음성 또는 클론 음성)
-
생성적 LLM의 도착(자연스러운 대화)
그 마지막 점은 게임 체인저입니다. 핵심 아이디어는 좋은 예측 모델이 좋은 생성 모델이 될 수 있다는 것입니다. 인공 에이전트는 충분히 좋은 LLM이 예측하는 가장 가능성 있는 것을 말하는 인간 고객 서비스 에이전트와 같은 대화 성능에 근접할 수 있습니다.
수십 개의 AI 스타트업이 음성 기반 대화 에이전트 문제를 단순히 오프-더-쉘프 ASR과 TTS 모듈을 LLM 코어에 연결하여 해결하려고 합니다. 이러한 관점에서 해결책은 단지 지연과 비용을 최소화하는 조합을 선택하는 것입니다. 물론, 이것은 중요합니다. 그러나 이것이 충분한가요?
아니, 아직은 아니요
그런 간단한 접근 방식이 작동하지 않는 몇 가지 특정한 이유가 있습니다. 그러나 두 가지 일반적인 지점에서 파생됩니다:
-
LLM은 단독으로 좋은 사실 기반 텍스트 대화를 제공할 수 없습니다. 따라서 음성 기반 대화를 위해서도 할 수 없습니다.何か 다른 것이 필요합니다.
-
即使 LLM을 좋은 텍스트 기반 대화 에이전트를 만드는 데 필요한 것으로 보충하더라도, 이를 좋은 음성 기반 대화 에이전트로 전환하는 것은 단순히 최고의 ASR과 TTS 모듈에 연결하는 것보다 더 많은 것이 필요합니다.
각각의 도전을 위한 구체적인 예를 살펴보겠습니다.
도전 1: 현실을 유지하기
현재 널리 알려진 바와 같이, LLM은 때때로 부정확하거나 ‘환상’ 정보를 생성합니다. 이는 많은 상업적 애플리케이션의 контек스트에서 재앙적입니다. 즉, 정확성이 중요하지 않은 엔터테인먼트 애플리케이션에서는 문제가 되지 않을 수 있지만, 사실 정확성이 중요한 곳에서는 문제가 됩니다.
LLM이 환상 정보를 생성한다는 것은 반성해 보면 당연합니다. 이는 데이터 세트(그러나巨대하다 하더라도)가 1년 이상 된 데이터에서 훈련된 모델을 사용하여 데이터 세트의 일부가 되거나 데이터 세트에서 유도된 사실이 아닌 질문에 대한 답변을 생성할 때 직접적인 결과입니다. 호출자가 “내 멤버십 번호는 무엇인가요?”라고 묻으면, 단순히 사전 훈련된 LLM은 정확한 답변을 생성할 수 없고, 오직 그럴듯한 답변만을 생성할 수 있습니다.
이 문제를 다루는 가장 일반적인 방법은:
-
세부 튜닝: 사전 훈련된 LLM을 추가로 훈련시킵니다. 이번에는 원하는 정확한 답변을 할 수 있는 도메인 특정 데이터로 훈련시킵니다.
-
프롬프트 엔지니어링: 추가 데이터/지침을 LLM에 입력으로 추가합니다. 대화 기록 외에
-
검색 보강 생성(RAG): 프롬프트 엔지니어링과 비슷하지만, 추가된 데이터는 대화 컨텍스트(예: 고객이 “호텔에 수영장이 있나요?”라고 묻는 경우)에 따라 도메인 특정 데이터의 임베딩 인코딩 인덱스와 일치하는 것으로 결정됩니다.
-
규칙 기반 제어: RAG와 비슷하지만, 프롬프트에 추가할 항목은 신경망 메모리와 일치하는 것으로 결정되지 않고, 하드 코딩된(및 수동으로 코딩된) 규칙에 따라 결정됩니다.
한 가지 크기가 모든 것을 만족하지는 않습니다. 어떤 방법이 적절할지는 예를 들어, 에이전트의 답변을 알려주는 도메인 특정 데이터에 따라 달라집니다. 특히, 이러한 데이터가 자주 변경되는지(예: 고객 이름) 또는 거의 변경되지 않는지(예: 초기 인사: “호텔 부다페스트에 오신 것을 환영합니다. 오늘 어떻게 도와드릴까요?”)에 따라 달라집니다. 세부 튜닝은 전자의 경우에 적합하지 않으며, RAG는 후자의 경우에 서투른 해결책이 될 것입니다. 따라서 작동하는 시스템은 이러한 방법을 모두 사용해야 합니다.
さらに, 이러한 방법을 LLM과 서로의 통합하여 지연과 비용을 최소화하는 방식으로 엔지니어링하는 것은 주의 깊은 엔지니어링을 필요로 합니다. 예를 들어, 모델의 RAG 성능은 이를 위한 방법을 위한 미세 조정을 통해 개선될 수 있습니다.
그것은 각 방법이 다시 자신의 도전을 소개한다는 것을 놀라운 일은 아닙니다. 예를 들어, 세부 튜닝을 생각해 보십시오. 도메인 특정 데이터에 대한 사전 훈련된 LLM을 세부 튜닝하면 그 데이터에 대한 성능이 개선됩니다. 그러나 이러한 세부 튜닝은 사전 훈련된 모델의 일반적인 성능의 기초가 되는 매개변수(가중치)를 수정합니다. 따라서 이러한 수정은 모델의 이전 지식의 일부를 잊어버리게(또는 “참사적 잊어버림”을 일으킵니다) 만들 수 있습니다. 이는 모델이 부정확하거나 부적절한(또는 안전하지 않은) 답변을 줄 수 있습니다. 에이전트가 계속해서 정확하고 안전하게 응답하려면, 참사적 잊어버림을 완화하는 세부 튜닝 방법이 필요합니다.
도전 2: 엔드포인트
고객이 말하는 것을 끝냈는지 여부를 결정하는 것은 자연스러운 대화 흐름을 위해 중요합니다. 또한, 시스템은 중단을 우아하게 처리하여 대화가 고객의 필요에 응답하고 일관성을 유지하는 것을 보장해야 합니다. 이것은 인간과 같은 수준의 기준에 도달하는 것입니다. 그러나 이것은 필수적인 작업입니다.
작동하는 해결책은 다음과 같은 질문을 고려해야 합니다:
-
고객이 말하는 것을 멈췄을 때 에이전트가 고객이 말하는 것을 멈췄다고 결정하기 전에 기다려야 하는 시간은 얼마인가?
-
위의 사항은 고객이 완전한 문장을 완료했는지 여부에 따라 달라지는가?
-
고객이 에이전트를 중단하면 어떻게 해야 하는가?
-
특히, 에이전트는 고객이 에이전트가 말하는 것을 들지 못했다고 가정해야 하는가?
이러한 문제는 주로 타이밍과 관련이 있으며, LLM이 올바른 답변을 주는 것에涉及된 엔지니어링 이상의 주의 깊은 엔지니어링을 필요로 합니다.
결론
AI 기반 음성 시스템의 발전은 고객 서비스 역학의 혁신적인 변화를 약속합니다. 구식 전화 시스템을 대체하여 LLM, ASR, TTS 기술을 사용합니다. 그러나, 환상 정보와 무결점한 엔드포인트를 극복하는 것이 자연스럽고 효율적인 음성 상호작용을 제공하는 데 중요합니다.
고객 서비스의 자동화는 기업에真正한 게임 체인저가 될 수 있습니다. 그러나, 이것은 올바르게 수행되어야 합니다. 2024년, 특히 이러한 새로운 기술과 함께, 우리는 자연스럽고 유연하며 우리를 강력하게 이해할 수 있는 시스템을 구축할 수 있습니다. 그 결과는 대기 시간을 줄이고, 현재의 음성 봇 경험을 개선하여 고객 참여와 서비스 품질의 변혁적인 시대를 표시합니다.













