AI 모델 및 플랫폼
Google, API 및 AI Studio에서 Gemini 3.8 음성 모델 출시

Google는 2026년 9월 23일에 Gemini 3.8 Flash TTS 및 Gemini 3.8 Flash-Lite TTS를 소개했으며, 이는 지금까지 가장 표현력이 풍부한 오디오 생성 모델이라고 설명했습니다. 두 모델은 같은 날 Gemini API와 Google AI Studio에서 출시되었습니다.
Gemini Audio 팀을 대표하여 그룹 제품 관리자 Leland Rechis와 연구 과학 이사 Alan Cowen이 작성한 이번 발표는 Gemini 3.8 Flash TTS를 게임, 몰입형 오디오북, 팟캐스트 및 인터랙티브 미디어 전반에 걸친 깊은 창의적 연출 및 캐릭터 디자인에 적합하도록 위치시킵니다. Gemini 3.8 Flash-Lite TTS는 대량 생산 및 비용 효율적인 사용을 위해 설계되었으며, 더빙, 오디오 콘텐츠 제작 및 음성 에이전트를 위한 톤, 속도 및 표현 뉘앙스에 대한 세밀한 제어를 최적화했습니다. 발표에서는 이 두 모델이 이전 Gemini Audio 출시인 3.5 Live Translate, 3.5 Transcribe, 그리고 Gemini 3.8 Live 및 3.8 Live Extended Thinking 모델에 이어진 것이라고 소개했습니다. Gemini 3.8 Audio 모델 카드에 따르면, 이 모델들은 Gemini 3 Pro를 기반으로 하며, TTS 변형은 최대 8K 토큰의 텍스트 입력을 받아 최대 64K 토큰의 오디오 출력을 반환합니다.
음성 디자인 및 복제
Google는 Gemini 3.8 Flash TTS가 자연어 프롬프트를 통해 처음부터 맞춤형 음성을 생성할 수 있으며, 역할, 억양 및 음성 특성을 100개 이상의 언어와 방언에 걸쳐 맞춤 설정할 수 있다고 밝혔습니다. 이 회사는 이번 출시를 통해 기존 30개의 음성 세트를 2,000개가 넘는 프로덕션 준비된 음성 라이브러리로 확장했으며, 멕시코 스페인어, 퀘벡 프랑스어, 스코츠 영어와 같은 지역 변형도 포함한다고 전했습니다. 사용자는 맞춤 음성을 저장 및 관리하여 진행 중인 프로젝트 전반에 걸쳐 성능을 일관되게 유지할 수 있으며, 라이브러리 음성의 음색, 피치, 속도 및 억양을 조정하는 음성 리믹싱 기능이 곧 제공될 예정이라고 나와 있습니다.
음성 복제는 사용자의 자체 음성 또는 사용 권한이 있는 음성의 30초 오디오 샘플로부터 일관된 음성 프로필을 재생성합니다. Google는 이 기능이 내장된 동의 검증, SynthID 워터마크 및 C2PA 자격 증명을 포함하고 있다고 밝혔습니다.
성능 지시 및 보고된 벤치마크
두 모델 모두 각 퍼포먼스를 줄 단위로 지시할 수 있게 합니다: 사용자는 직접 무대 지시를 작성하거나 Gemini가 자연스러운 스크립트 신호를 통해 전달을 조정하도록 할 수 있습니다. Google는 장시간 생성이 음성 품질, 속도 및 캐릭터 음색을 수시간에 걸친 연속 오디오에서도 최소한의 화자 변동으로 유지한다고 밝혔으며, 이는 팟캐스트와 오디오북을 목표로 합니다. 기본적인 두 화자 장면 연출은 단일 스크립트에서 다중 턴 대화를 지시하면서 두 음성을 자연스러운 턴 테이킹으로 구분합니다. 스크립트된 보컬 버스트와 백채널링은 <laughs>, <sigh>, <gasp>와 같은 비언어적 신호와 “mhm”, “yeah”와 같은 삽입어를 추가합니다.
평가 결과, Google은 Gemini 3.8 Flash TTS가 Hume AI의 Voice Design Benchmark에서 71.4점으로 전체 1위를 차지했으며, 억양 모델링에서도 60.8점으로 선두를 달렸다고 보고했습니다. 또한 Flash TTS와 Flash-Lite TTS가 Hume AI의 Overall Quality Index에서 각각 1위와 2위를 차지했으며, 새로운 모델들이 장시간 콘텐츠 및 듀얼 스피커 스크린플레이 제어와 같은 사용 사례에서 Gemini 3.1 Flash TTS에 비해 크게 개선되었다고 밝혔습니다. Voice Arena에서 진행된 블라인드 인간 선호도 평가에서 두 모델은 일본어, 브라질 포르투갈어, 베트남어, 현대 표준 아랍어, 멕시코 스페인어 및 힌디어를 포함한 언어에서 경쟁 모델들 중 상위 위치를 차지했다고 Google은 전했습니다.
안전, 제한 사항 및 제공 여부
동의 검증 시스템 하에서는 복제된 음성을 만들기 전에 사용자가 음성 소유자의 구두 동의 녹음을 제공해야 하며, 이는 기준 화자와 일치해야 합니다. Gemini Audio 모델이 생성하는 모든 오디오 클립에는 SynthID 워터마크가 포함되며, Google은 이를 감지할 수 없을 정도로 미세하고 오디오 출력에 직접 삽입되어 AI 생성 음성이 탐지 가능하도록 만든다고 설명합니다.
모델 카드에는 환각 현상 및 가끔 발생하는 지연이나 시간 초과 문제와 같은 알려진 제한 사항이 나열되어 있으며, 지식 컷오프는 2025년 1월로 지정되어 있습니다. 최전선 안전성을 위해 Google DeepMind는 Gemini 3.8 Audio 모델이 Gemini 3.7 Flash와 비교해 의미 있는 새로운 기능이나 실질적인 성능 향상이 없다고 평가했으며, 해당 평가에서는 Frontier Safety Framework 하에서 추적된 또는 핵심 역량 수준에 도달하지 못했다고 밝혔습니다. 이를 근거로 Gemini 3.8 Audio 모델은 이러한 수준에 도달할 가능성이 낮다고 말했습니다.
Gemini 3.8 Flash TTS는 Gemini Notebook에서도, Flash‑Lite TTS는 Google Vids에서도 제공되며, Gemini Enterprise를 통한 API 기업 접근은 곧 제공될 예정이라고 명시되었습니다. Google AI Studio는 음성 디자인 작업공간처럼 구축된 오디오 놀이터를 추가했으며, 개발자는 처음부터 새로운 음성 정체성을 프롬프트하거나 음성을 복제한 뒤 듀얼 스피커 스크린플레이 편집기에서 줄 단위 전달을 지시할 수 있습니다. 발표의 각주에서는 AI Studio를 통한 음성 복제가 일리노이, 텍사스, 유럽 경제 지역, 영국, 스위스 및 인도에서는 제공되지 않는다고 밝혔습니다. 개발자 플랫폼 Agora, LiveKit, Pipecat, Vercel이 Gemini API를 통해 모델을 지원하며, Google은 Figma, HeyGen, Linguana, Wondercraft, 99.co, Ollang을 파트너로 지정해 새로운 TTS 모델을 전 세계 더빙, 미디어 현지화 및 대화형 음성 에이전트에 통합한다고 발표했습니다.












