인터뷰
글라디아의 창립자 및 CEO인 Jean-Louis Quéguiner – 인터뷰 시리즈

Jean-Louis Quéguiner는 글라디아의 창립자이자 CEO입니다. 그는 이전에 유럽의 주요 클라우드 제공업체 중 하나인 OVHcloud에서 데이터, AI, 양자 컴퓨팅 그룹 부사장을 역임했습니다. 그는 캐나다의 퀘벡 대학교와 파리의 아르츠 에 메티에르 파리테크에서 상징적 인공지능 분야에서 석사 학위를 가지고 있습니다. 그의 경력 동안 그는 금융 데이터 분석, 실시간 디지털 광고를 위한 기계 학습 응용, 음성 AI API 개발 등 다양한 산업에서 중요한 직책을 맡았습니다.
글라디아는 제품 전반에 걸쳐 고급 오디오 전사와 실시간 AI 솔루션을 제공하여 산업, 언어, 기술 스택에 대한 무제한 통합을 가능하게 합니다. 최신 음성 인식 및 생성 인공지능 모델을 최적화함으로써 정확하고 지연 없는 음성 및 언어 처리를 보장합니다. 글라디아의 플랫폼은 또한 통화 및 회의에서 통찰력과 메타데이터를 실시간으로 추출할 수 있으므로 판매 지원, 자동 고객 지원 등 주요 기업 사용 사례를 지원합니다.
음성-텍스트(STT) 기술의 도전을 해결하기 위해 무엇이 영감을 주었으며, 시장에서 어떤 격차를 보았나요?
글라디아를 설립했을 때 초기 목표는 광범위했습니다. 복잡한 기술을 접근하기 쉽게 만드는 인공지능 회사였습니다. 그러나 더 깊이 nghiên cứu함에 따라 음성 기술이 가장 깨진 영역이며 가장 집중해야 할 영역임을 알게 되었습니다.
음성은 우리 일상 생활의 중심이며 대부분의 의사소통은 말로 이루어집니다. 그러나 개발자가 음성 데이터와 함께 작업하기 위한 도구는 속도, 정확도, 가격 측면에서 불충분했습니다. 특히 언어 간에는 더욱如此이었습니다.
저는 그것을 고치고 싶었습니다. 음성 기술의 복잡성을 풀어내고 단순하고 효율적이고 강력하고 접근하기 쉬운 것으로 다시 패키지화하고 싶었습니다. 개발자는 음성 인식의 복잡성이나 음성 인식의 문맥 길이에 대한 세부 사항에 대해 걱정할 필요가 없습니다. 저의 목표는 모델이나 기술에 관계없이 원활하게 작동하는 엔터프라이즈급 음성-텍스트 API를 만드는 것이었습니다.
엔터프라이즈 사용을 위한 전사 솔루션을 구축하는 동안 어떤 고유한 도전을 직면했나요?
음성 인식에서 속도와 정확도는 두 가지 주요 성능 지표입니다. 이것은 디자인에 의해 반대되는 관계이므로 하나를 개선하면 다른 하나가妥協됩니다. 비용 요인은 제공업체가 속도와 품질 사이에서 선택하는 것에 의해 큰 영향을 받습니다.
글라디아를 구축하는 동안 우리의 목표는 이러한 두 요소 사이에서 완벽한 균형을 찾는 것이었습니다. 또한 기술이 시작업과 중소기업에게도 이용 가능하도록 하는 것이었습니다. 이 과정에서 우리는 또한 기초 음성 인식 모델이 영어에 편향되어 있으며, 훈련 데이터로 인해 많은 언어가 대표되지 않는다는 것을 깨달았습니다.
속도-정확도 트레이드오프를 해결하는 것 외에도 우리는 유럽의 다언어 팀으로서 핵심 모델을 최적화하여真正 글로벌 API를 구축하여 기업이 언어 간에 운영할 수 있도록 하는 것이 중요했습니다.
글라디아는拥挤한 AI 전사 시장에서 어떻게 차별화되고 있나요? Whisper-Zero ASR이 특별한 점은 무엇인가요?
우리의 새로운 실시간 엔진(Gladia Real Time)은 업계 최고 수준의 300ms 지연을 달성했습니다. 또한 “오디오 인텔리전스” 추가 기능을 통해 통화 또는 회의에서 통찰력을 추출할 수 있습니다.
저희가 아는 바에 따르면, 거의 없는 경쟁자가 이러한 낮은 지연 시간(1초 미만)으로 전사와 통찰력을 모두 제공할 수 있습니다. 또한 영어 이외의 언어에서 정확하게 수행합니다. 현재 언어 지원은 100개 이상의 언어로 확장됩니다.
또한 기술 스택과 전송 프로토콜에 대한 완전한 중립성을 제공하는 제품을 만드는 데 특별한 강조를 두었습니다. 우리의 API는 모든 기존 기술 스택 및 전송 프로토콜과 호환됩니다.
실시간 전사에서 특히 중요한 문제인 AI 모델의 환상(hallucinations)에 대해 설명하고, 글라디아는 이 문제를 어떻게 해결하는지 설명하세요.
환상은 모델이 지식이 부족하거나 주제에 대한 컨텍스트가 없을 때 발생합니다. 모델은 요청에 맞게 출력을 생성할 수 있지만, 훈련 당시 존재하는 정보만 참조할 수 있으며, 이는 최신 정보가 아닐 수 있습니다. 모델은 정보를 채우기 위해 들리는 것과 같은 정보를 생성하여 일관된 응답을 생성할 수 있습니다.
환상은 처음에 대규모 언어 모델(LLM)에서 알려졌지만, 음성 인식 모델에서도 발생합니다. Whisper ASR과 같은 모델은 유사한 아키텍처로 인해 LLM과 같은 환상을 가질 수 있습니다.
이 접근 방식은 음성 인식의 전통적인 음향 기반 아키텍처와 대조됩니다. 음향 기반 아키텍처는 입력 소리를 출력과 일치시키는 더 기계적인 방식입니다.
따라서 실제로 말하지 않은 단어가 전사본에 나타날 수 있으며, 특히 의료 분야와 같은 경우에 심각한 결과를 초래할 수 있습니다.
환상을 관리하고 감지하는 방법에는 여러 가지가 있습니다. 하나의 일반적인 접근 방식은 생성-검색 시스템(RAG 시스템)을 사용하는 것입니다. 이 시스템은 모델의 생성 능력과 事実을 확인하는 메커니즘을 결합합니다.
또 다른 방법은 “사고의 연쇄” 접근 방식을 사용하는 것입니다. 여기서 모델은 일련의 사전 정의된 단계나 체크포인트를 통해 안내되어 논리적인 경로를 따라갑니다.
환상을 감지하는 또 다른 전략은 모델의 출력의 진실성을 평가하는 시스템을 사용하는 것입니다. 후보 응답을 비교하여 가장 정확한 것을 결정하는 벤치마크가 있습니다.
글라디아에서는 Whisper-Zero를 구축하는 동안 여러 기술의 조합을 실험했습니다. 이는 비동기 전사에서 이미 탁월한 결과를 보여주었으며, 현재 실시간에서도 동일한 99.9% 정보 충실도를 달성하기 위해 최적화 중입니다.
STT 기술은 강세, 소음, 다언어 대화와 같은 다양한 복잡성을 처리해야 합니다. 글라디아는 이러한 도전을 어떻게 해결하여 높은 정확도를 보장합니까?
음성 인식에서 언어 감지는 매우 복잡한 작업입니다. 각 스피커에는 고유한 음성 서명이 있으며, 이를 특징이라고 합니다. 기계 학습 알고리즘은 음성 스펙트럼을 분석하여 분류를 수행할 수 있으며, Mel Frequency Cepstral Coefficients(MFCC)를 사용하여 주된 주파수 특성을 추출할 수 있습니다.
MFCC는 인간의 청각 인식에서 영감을 받은 방법입니다. 이는 “psychoacoustic” 분야에 속하며, 어떻게 소리를 인식하는지에 중점을 둡니다. 이는 낮은 주파수를 강조하며, 오디오를 주파수 스펙트럼으로 변환하기 위한 정규화된 푸리에 분해와 같은 기술을 사용합니다.
그러나 이 접근 방식에는 한계가 있습니다. 이는 순수하게 음향학적입니다. 강한 악센트로 영어를 말하면, 시스템은 내용을 이해하는 대신 프로소디(리듬, 스트레스, 억양)에 따라 판단할 수 있습니다.
이것이 글라디아의 혁신적인 솔루션이 등장하는 곳입니다. 우리는 동적 언어 감지를 위한 심리 음향학적 특징과 내용 이해를 결합한 하이브리드 접근 방식을 개발했습니다.
우리 시스템은 음성의 내용을 이해하는 것뿐만 아니라 어떻게 말하는지에도 관심을 가지고 있습니다. 이 쌍방향 접근 방식은 효율적인 코드 스위칭을 가능하게 하며, 강한 악센트로 인해 오해나 잘못 표현되는 것을 방지합니다.
코드 스위칭은 다언어 대화 처리에서 특히 중요한 기능입니다. 스피커는 대화 중이나 문장 중에 언어를 전환할 수 있으며, 모델이 전환에도 불구하고 정확하게 전사할 수 있는 능력은 중요합니다.
글라디아 API는 높은 정확도로 많은 언어 쌍을 처리하는 능력으로 독특하며, 특히 노이즈 환경에서 품질이 저하되는 전사의 경우에도 잘 수행됩니다.
실시간 전사는 초저지연을 요구합니다. 어떻게하면 300밀리초 미만의 지연을 유지하면서 정확도를 유지할 수 있나요?
300밀리초 미만의 지연을 유지하면서 높은 정확도를 유지하는 것은 하드웨어 전문 지식, 알고리즘 최적화, 아키텍처 설계의 다각적인 접근 방식이 필요합니다.
실시간 AI는 전통적인 컴퓨팅과 다르게, GPGPU의 성능과 효율성에 밀접하게 연결되어 있습니다. 저는 거의 10년 동안 이 분야에서 일했으며, OVHCloud의 AI 부문을 이끌면서, 항상 하드웨어 파워와 비용, 알고리즘을 하드웨어와 원활하게 작동하도록 맞추는 균형을 찾는 것이 중요하다는 것을 배웠습니다.
실시간 AI의 성능은 알고리즘이 하드웨어의 능력과 효과적으로 일치하도록 하는데에서 나옵니다. 이는 모든 작업이 처리량을 최대화하고 지연을 최소화하도록 합니다.
하지만 그것은 단지 AI와 하드웨어에 관한 것이 아닙니다. 시스템의 아키텍처, 특히 네트워크는 지연에 큰 영향을 미칠 수 있습니다. 저희의 CTO는 Sigfox에서 저지연 네트워크 설계에 대한 깊은 전문 지식을 가지고 있으며, 네트워크 설정을 최적화하여 귀중한 밀리초를 절약했습니다.
따라서 이는 하드웨어 선택, 알고리즘 최적화, 네트워크 설계의 조합입니다. 이것이 저희가 300ms 미만의 지연을 일관되게 달성할 수 있도록 합니다.
글라디아의 도구를 사용하여 클라이언트가 개발한 혁신적인 응용 프로그램은 무엇인가요?
ASR은 다양한 응용 프로그램을 플랫폼 전반에 걸쳐 잠금 해제합니다. 그리고 지난 2년 동안 정말 선구적인 회사들이 나타나, LLM과 저희의 API를 사용하여 최첨단의 경쟁력 있는 제품을 구축하는 것을 보는 것은 놀라운 일입니다. 다음은 몇 가지 예입니다:
- 스마트 노트: 많은 클라이언트가 직장 회의, 학생 강의, 의료 상담에서 정보를 빠르게 캡처하고 조직하기 위한 도구를 구축하고 있습니다. 스피커 다이아라이제이션을 사용하면 대화에서 누가 무엇을 말했는지 식별할 수 있으며, 시간 표시된 전사본을 사용하면 사용자가 녹음의 특정 부분으로 바로 이동하여 시간을 절약하고 아무 것도 번역에 잃어버리지 않도록 할 수 있습니다.
- 판매 지원: 판매 세계에서 고객의 감정을 이해하는 것이 모든 것입니다. 팀은 판매 호출 또는 데모 중에 프로스펙트가 어떻게 반응하는지에 대한 실시간 통찰력을 얻기 위해 저희의 감정 분석 기능을 사용하고 있습니다. 또한 시간 표시된 전사본은 팀이 대화의 주요 부분을 다시 방문하여 제안을 정제하거나 고객의 우려를 더 효과적으로 해결하도록 도와줍니다. 이 사용 사례의 경우, 특히 CRM에 자동으로 피드될 수 있는 이름, 회사 세부 정보 및 기타 정보를 식별하는 데 중요한 NER도 중요합니다.
- 콜 센터 지원: 콜 센터 공간의 회사들은 저희의 API를 사용하여 에이전트에게 실시간 지원을 제공하고 고객의 감정을 호출 중에 플래그합니다. 스피커 다이아라이제이션은 말한 내용이 올바른 사람에게 할당되도록 보장하며, 시간 표시된 전사본은 관리자가 중요하거나 준수 문제를 빠르게 검토할 수 있도록 합니다. 이것은 고객 경험을 개선하는 것뿐만 아니라(호출 해결률 및 품질 모니터링 개선) 에이전트의 생산성과 만족도를 높여줍니다.
엔터프라이즈 사용자를 위한 전사 신뢰성을 향상시키는 데 사용자 정의 어휘와 개체 인식의 역할에 대해 논의해 주세요.
많은 산업은 전문 용어, 브랜드 이름, 고유한 언어 뉴앙스를 사용합니다. 사용자 정의 어휘 통합을 통해 전사 솔루션이 이러한 특정 요구 사항에 적응할 수 있습니다. 이는 문맥적 뉴앙스를 캡처하고 비즈니스 요구 사항을 반영하는 출력을 제공하는 데 중요합니다.
예를 들어, 도메인 특정 단어 목록을 특정 언어로 만들 수 있습니다.
이 기능은 사용자 경험을 개선하고 전사본에서 오류를 최소화하는 데 도움이 됩니다. 특히 의료 또는 금융과 같은 분야에서 이는 매우 중요합니다.
명명된 개체 인식(NER)은 비정형 오디오 데이터에서 주요 정보를 추출하고 식별합니다. 비정형 데이터의 일반적인 도전은 이러한 중요한 정보가 전사본 내에서 쉽게 접근할 수 없다는 것입니다.
이를 해결하기 위해 글라디아는 구조화된 키 데이터 추출(KDE) 접근 방식을 개발했습니다. Whisper 기반 아키텍처의 생성 능력을 활용하여 컨텍스트를 캡처하고 관련 정보를 식별 및 추출합니다.
이 프로세스는 사용자 정의 어휘 및 NER와 같은 기능으로 더욱 강화될 수 있습니다. 이는 비즈니스에서 CRMs를 빠르고 효율적으로 채우는 데 도움이 됩니다.
고객 지원, 판매, 콘텐츠 생성과 같은 산업에서 실시간 전사가 어떻게 변화를 일으키고 있나요?
실시간 전사는 이러한 산업을 깊이 있게 변화시키고 있으며, 생산성의 엄청난 이점과 구체적인 비즈니스 이점을 제공하고 있습니다.
첫째, 실시간 전사는 지원 팀을 위한 게임 체인저입니다. 실시간 지원은 더 빠른 응답, 더智能한 에이전트, 더 나은 결과(예: NSF, 처리 시간 등)로 해결률을 개선하는 데 도움이 됩니다. 음성 인식 시스템이 영어 이외의 언어와 실시간 번역을 더 잘 처리할수록, 연락 센터는 글로벌 고객 경험을 낮은 마진으로 달성할 수 있습니다.
판매에서 속도와 정확한 통찰력이 모든 것입니다. 실시간 전사는 에이전트에게 정확한 시점에 올바른 통찰력을 제공하여 거래를 마무리하는 데 도움이 됩니다.
생산자에게 실시간 전사는 현재에는 덜 관련이 있지만, 특히 라이브 캡션 및 미디어 이벤트 중 번역과 관련하여 여전히 잠재력이 있습니다. 대부분의 현재 미디어 고객은 아직 비동기 전사를 선호하며, 속도는 중요하지 않지만 정확도는 비디오 편집 및 자막 생성과 같은 응용 프로그램에서 중요합니다.
실시간 AI 전사는 성장하는 추세입니다. 이 기술이 향후 5-10년 동안 어디로 갈 것이라고 생각하나요?
저는 이 현상, 즉 실시간 AI가 모든 곳에 있을 것이라고 생각합니다. 본质的に, 우리는 기계가 사람들과 같은 방식으로 사람들과 상호 작용하는 능력을 말하고 있습니다.
만약 당신이 미래를 설정한 어떤 할리우드 영화(예: Her)를 본다면, 키보드를 통해 지능형 시스템과 상호 작용하는 사람은 볼 수 없습니다. 그것은 인간의 집단 상상력에서 음성이 세계와 상호 작용하는 주요 방식임을 증명합니다.
음성은 글쓰기보다 훨씬 더 오래된 인간 문화와 역사的一部입니다. 글쓰기는 우리의 지식을 더 효과적으로 보존할 수 있도록 해주었습니다. 그러나 GenAI 시스템은 음성을 이해하고 응답을 생성하며 상호 작용을 저장할 수 있으므로, 그것은 인간의 최고의 점과 인간의 최고를 결합한 것입니다. 그것은 음성 커뮤니케이션의 에너지와 기존에만 글쓰기 미디어가 보장할 수 있던 메모리의 이점을 제공합니다. 이것이 왜 그것이 모든 곳에 있을 것이라고 믿는 이유입니다. 그것은 우리의 궁극적인 집단 꿈입니다.
감사합니다. 더 많은 정보를 원하는 독자는 글라디아를 방문할 수 있습니다.












