AI 모델 및 플랫폼
Google, Gemini 3.8 Live에 실시간 아바타 시각 존재감을 도입

Google는 2026년 9월 24일 Gemini 3.8 Live with Live Avatar를 소개했으며, 이 기능은 기본 실시간 대화 모델의 음성에 거의 실시간으로 생성된 비디오를 추가하고, 미국 및 유럽 연합에 위치한 엔드포인트를 통해 Gemini Enterprise에 일반적으로 제공되었습니다.
Gemini Audio 팀을 대표하여 연구 과학자 Shuo-yiin Chang와 소프트웨어 엔지니어 CJ Zheng이 작성한 발표에서는 이 기능을 Gemini 대화형 AI를 위한 시각적 존재 레이어로 소개합니다. Google은 정밀한 립싱크, 자연스러운 표정, 부드러운 턴테이킹을 통해 기업이 고객 서비스 및 인터랙티브 워크스루와 같은 가상 서비스를 확장할 수 있다고 말합니다.
이 릴리스는 Google의 2026년 9월 15일 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking 출시에 이어 진행되며, 각각 확장 가능하고 비용 효율적인 대화와 고복잡도 추론 작업을 위해 포지셔닝된 실시간 대화 모델이며, Gemini API, Google AI Studio, Gemini 앱, Google Workspace 및 Search Live를 통해 배포가 시작되었습니다.
Gemini Enterprise에서 일반 제공
Gemini 3.8 Live with Live Avatar는 2026년 9월 24일 현재 Gemini Enterprise에서 일반 제공되며, Google Cloud는 이 기술이 Google Cloud Next 2026에서 처음 미리 보기로 소개되었다고 밝혔습니다. 이 릴리스는 미국 및 EU 엔드포인트를 통해 제공되며, 할당된 처리량, 기업 컴플라이언스 및 엄격한 데이터 거버넌스를 포함합니다(Google Cloud의 Gemini Live 그룹 제품 관리자 Fabien Blanc‑paques의 게시물에 따르면). Gemini 3.8 Live Extended Thinking은 여전히 비공개 프리뷰 상태입니다.
기업 고객은 Gemini Enterprise 콘솔에서 모델을 체험하고, Gemini Live API 문서를 통해 통합하며, Google Cloud 가격 페이지에서 요금을 확인할 수 있습니다. Google Cloud는 고객에게 할당된 처리량, 맞춤형 배포 아키텍처 및 맞춤형 아바타 허용 목록을 위해 영업 담당자와 협의할 것을 권장합니다.
Live Avatar 작동 방식
Google에 따르면 Live Avatar는 시각 및 음성 입력을 동시에 처리하고, 거의 실시간으로 표현력 있는 음성 및 비디오로 응답합니다. 이 기능은 비동기 도구 호출도 지원하여 대화를 중단하지 않고 백그라운드에서 도구 호출을 시작하고 데이터를 가져올 수 있습니다. 한 Google 시연에서는 대화가 중단되지 않은 채 아바타가 호텔 투숙객을 확인하는 모습을 보여줍니다.
Google은 아바타가 97개 언어에 걸쳐 대화가 진행될 때 립싱크와 표정을 조정하여 비디오 품질을 유지하고 시각적 드리프트를 방지한다고 말합니다. Google Cloud 게시물은 오디오와 함께 카메라 피드 및 화면 공유에 대한 실시간 시각적 이해, 대화 맥락 및 백엔드 트랜잭션을 보존하는 중단 복구, 수동 전환 없이 자동 언어 감지 및 전환, 웹, 모바일 및 인터랙티브 키오스크 전반에 걸친 배포를 추가합니다. 별도의 Google Cloud 시연에서는 고객이 카메라로 손상을 보여주는 동안 보험 청구 접수 에이전트가 청구 노트북을 작성하고, Google의 Agent Development Kit으로 구축된 에이전트 팀이 정책을 검증하고, 접수 규칙을 적용하며, 배경에서 손해 사정사 패킷을 조립하는 모습을 보여줍니다.
아바타, 워터마킹 및 모델 카드 제한
조직은 사전 설정된 아바타 라이브러리에서 배포하거나 고품질 참조 이미지로 맞춤형 아바타를 생성할 수 있으며, Google은 결과가 참조 이미지의 유사성, 브랜드 스타일링 또는 캐릭터 정체성을 유지한다고 말합니다. 맞춤형 아바타 생성 접근은 기업 허용 목록이 필요합니다; Google Cloud는 허용 목록 및 검증 절차를 신원 보호와 오용 방지를 위한 안전장치로 설명합니다. 생성된 모든 음성 및 비디오 스트림에는 눈에 띄지 않는 SynthID 워터마크가 삽입되어 AI 생성 콘텐츠를 감지 가능하게 합니다.
Gemini 3.8 Audio 모델 카드에 따르면, 해당 모델은 Gemini 3 Pro를 기반으로 합니다. Gemini 3.8 Live는 오디오, 이미지, 비디오, 텍스트를 최대 128K 토큰의 컨텍스트 윈도우로 받아들이며, Live Avatar를 사용할 경우 오디오, 비디오, 텍스트를 출력하되 24K 토큰 출력 제한을 적용합니다. 모델 카드에 따르면 Live Avatar 변형은 설정된 이미지와 오디오 입력에 의해 구동되어, 말에 맞춰 자연스러운 머리 움직임을 동기화한 표현력 있는 비디오를 생성하며, 몇 분 정도의 연속 상호작용은 유지하지만 장시간(수시간)까지는 지속되지 않습니다.
모델 카드에는 가능한 환각, 간헐적인 지연 또는 타임아웃 등 알려진 제한 사항이 나열되어 있으며, 지식 컷오프를 2025년 1월로 설정했습니다. 최전선 안전 평가에서는 Gemini 3.7 Flash에 비해 의미 있는 새로운 기능이나 실질적인 성능 향상이 없다고 판단했으며, 이를 근거로 Google은 Gemini 3.8 Audio 모델이 Frontier Safety Framework 하에서 추적된 또는 핵심 역량 수준에 도달할 가능성이 낮다고 판단합니다.
고객 배포 사례
Google Cloud는 이 기능을 활용하는 여러 기업을 소개했습니다. Cox Automotive는 Autotrader를 위한 AI 기반 쇼핑 어시스턴트를 구축했으며, 실시간 화면 강조 및 도구 호출을 사용해 자동차 구매자가 차량 검색, 비교 및 금융을 실시간으로 안내합니다.
“쇼핑객들은 필터와 메뉴를 탐색하기보다 자신의 말로 필요를 설명하기를 점점 더 기대합니다. Autotrader의 새로운 대화형 AI 아바타는 자연스러운 대화를 적절한 재고와 매칭시켜 차량 탐색 경험을 제공합니다,”라고 Cox Automotive의 부사장 겸 최고 제품 책임자인 Marianne Johnson이 Google Cloud 발표에서 말했습니다.
Equal AI 최고경영자 Akhilesh Damaraju는 회사의 개인 AI가 9개 인도어를 대상으로 매일 백만 건 이상의 실시간 전화를 처리한다고 말했으며, Gemini 3.8 Live가 방해 처리, 다국어 대화 및 도구 호출 신뢰성을 개선했다고 덧붙였습니다. Salesforce의 Agentforce 제품 부사장 Bob Van Osten은 Agentforce와 Gemini 3.8 Live가 Salesforce AI Research와 Google 간의 협업을 통해 실시간 다중모달 기능과 에이전트형 AI를 결합하고 있다고 밝혔습니다. Specs의 소프트웨어 엔지니어 Eric Walsh는 모델의 음성 활동 감지 업데이트와 지연 시간 개선이 SPECS 플랫폼의 AI 어시스턴트에 대한 진전이라고 말했습니다.












