AI 모델 및 플랫폼

OpenAI의 GPT‑Live‑1, API에 도입되어 분당 $0.05 요금

mm
Unite.AI를 Google의 선호 소스에 추가

OpenAI는 2026년 9월 10일 API에서 GPT‑Live‑1을 출시했습니다, 전체 이중화 음성 모델을 프런트엔드 음성 레이어에 대해 분당 $0.05의 가격으로 개발자에게 제공했습니다. 이번 출시로 ChatGPT Voice 뒤에 있는 대화 시스템이 타사 앱 및 비즈니스 워크플로우로 확장됩니다.

GPT‑Live‑1은 동시에 듣고 말할 수 있으며, OpenAI는 Codex와 ChatGPT Work를 통해 시연된 바와 같이 더 깊은 추론과 행동을 결합된 모델 및 도구에 위임한다고 밝혔습니다. API 출시를 위해 회사는 개발자가 사용자, 워크플로우 및 목표에 맞춰 음성 경험을 조정하고 맞춤화할 수 있는 기능에 집중했다고 말했습니다.

듣기와 말하기를 위한 단일 모델

전통적인 음성 에이전트는 음성‑텍스트 변환, 추론 모델, 텍스트‑음성 변환을 순차적으로 연결하는데, 각 단계마다 지연이 발생하고 타이밍, 컨텍스트 또는 대화의 자연스러운 흐름을 잃을 가능성이 높아집니다. GPT‑Live‑1은 들어오는 오디오와 나가는 오디오를 동시에 처리하는 단일 모델로, 중단 및 확인 신호에 실시간으로 대응하면서 더 깊은 추론은 백엔드에 위임합니다. 따라서 대화는 백그라운드에서 작업이 진행되는 동안에도 지속될 수 있습니다.

개발자는 대화 뒤에 사용할 모델, 도구 및 에이전트 하네스를 선택합니다. OpenAI는 대량 일정 관리나 주문 업데이트와 같은 고빈도 작업에 Luna와 같은 모델을, 복잡한 고객 문제에 추론이 필요한 경우 Astra와 같은 모델을 결합하는 예시를 들었으며, 백엔드에 타사 모델을 사용할 수도 있다고 설명했습니다. 시스템 프롬프트를 통해 에이전트의 톤, 속도 및 대화 스타일을 조정할 수 있습니다.

OpenAI는 API 출시를 위한 추가 강점으로: 모든 단계를 음성으로 설명하지 않아도 되는 무음 컨텍스트 관리와 배경 소음 처리, 장시간 세션 간 컨텍스트 유지, 레스토랑 예약부터 고객 지원까지 전화를 통한 전체 이중화 에이전트를 지원하는 전화 시스템 연동을 제시했습니다. GPT‑Live‑1은 기본적으로 ASR 전사와 응답 텍스트를 제공하고, 키워드 바이어싱 및 영문자·숫자 이해를 지원합니다. 비록 턴 기반 모델은 아니지만, 기본적으로 턴 감지를 지원해 개발자가 명시적인 턴 경계에 맞춰 구축을 지속할 수 있습니다. 발표와 함께 공개된 코드 예시에서는 애플리케이션이 대화 컨텍스트를 Codex에 전달하고, Codex의 답변을 세션 중 GPT‑Live‑1에 반환하는 과정을 보여줍니다.

보고된 평가 결과

OpenAI는 GPT‑Live‑1이 GPT‑Realtime‑2.1에 비해 Full Duplex Bench 성능을 30 퍼센트 포인트 향상시켰으며, 턴‑테이킹 지연 및 인터랙티브 행동에서 큰 개선을 보였고, GPT‑6 Astra와 중간 수준의 추론 노력을 결합했을 때 최첨단 음성‑에이전트 지능을 측정하는 Tau3 벤치마크에서 1위를 차지했다고 보고했습니다.

Tau3(Voice) Intelligence는 항공, 소매, 통신 분야의 음성 고객 서비스 작업을 평가합니다. OpenAI가 보고한 Pass@1 작업 성공률은 GPT‑Live‑1이 86.2%이며, GPT‑Realtime‑2.1은 45.7%, GPT‑Realtime‑2는 42.4%에 불과합니다. Tau Banking(Voice) Knowledge는 97개의 은행 지식 작업 중 성공적으로 완료된 비율을 측정했으며, 각각 32.0% 대 12.4%와 10.3%를 기록했습니다.

또한 회사는 인공 분석 대화 역학 평균 점수가 GPT‑Live‑1은 97.3%로, GPT‑Realtime‑2.1은 95.7%, GPT‑Realtime‑2는 95.3%에 불과하다고 보고했습니다. 이 평가는 일시 정지 처리, 대화 턴 테이킹, 방해, 백채널을 포함합니다. Full Duplex Bench v1.5 Interactivity에서는 배경 음성, 타인에게 말하기, 청취자 백채널, 방해에 대한 반응을 테스트했으며, 점수는 각각 80.10% 대 45.4%와 47.8%였습니다. Full Duplex Bench v1 턴‑테이킹 지연은 사용자가 턴을 마친 후 에이전트가 응답을 시작하는 속도를 측정했으며, GPT‑Live‑1은 0.798초, GPT‑Realtime‑2.1은 1.41초, GPT‑Realtime‑2는 1.63초였습니다. Full Duplex Bench v3에서는 낮은 추론 노력을 가진 Terra 백엔드로 실행했으며, 툴‑콜 Pass@1은 GPT‑Live‑1이 87.0%로, GPT‑Realtime‑2.1은 60.0%, GPT‑Realtime‑2는 58.0%였고, 응답 품질은 각각 90.0%, 88.0%, 81.0%를 기록했습니다.

ChatGPT Voice에서 API로

OpenAI는 2026년 7월 8일 GPT‑Live를 소개했으며, 이는 ChatGPT Voice를 구동하는 새로운 세대의 전체 이중화 음성 모델입니다. 같은 날 전 세계 ChatGPT 사용자에게 GPT‑Live‑1 및 GPT‑Live‑1 mini를 출시하고, 이 모델들을 API에 제공할 계획이라고 밝혔습니다. OpenAI는 GPT‑Live‑1이 Go, Plus, Pro 사용자를 위한 ChatGPT Voice의 기본 모델이 되고, GPT‑Live‑1 mini는 무료 사용자를 위한 기본 모델이 될 것이라고 말했습니다. 2026년 7월 31일 업데이트에서는 SynthID 워터마크를 GPT‑Live를 통해 생성된 지원 오디오에 적용하고, OpenAI API와 함께 공개 검증 도구에 대한 API 접근성을 추가했습니다.

이 발표는 또한 기업에게 OpenAI Presence를 소개했습니다. OpenAI는 이 서비스가 GPT‑Live‑1을 활용해 질문에 답하고, 문제를 해결하며, 회사 시스템을 사용하고, 승인된 작업을 수행하고, 필요 시 사람에게 에스컬레이션하는 실시간 음성 인터랙션을 제공한다고 설명했습니다. OpenAI는 2026년 7월 22일에 Presence를 출시했으며, 이는 음성 및 채팅 워크플로우를 위한 기업용 제품으로, OpenAI Forward Deployed Engineers와 선택된 글로벌 시스템 통합 파트너가 주도하는 제한된 일반 가용성 프로그램을 통해 자격이 있는 고객에게 제공됩니다.

초기 고객과 새로운 음성

Yelp 최고 기술 책임자 Alex Levy는 GPT‑Live‑1을 Yelp Host와 Hatch에 도입함으로써 기존 음성 아키텍처에 비해 턴‑테이킹과 정확도가 향상되었으며, Yelp Host가 예약 및 음식 주문과 같은 전화를 받을 때 통화 처리율이 크게 개선되고 있다고 전했습니다. “전화 상대방이 더 풍부하고 자연스러운 문장을 말하게 되어, 전화기 반대쪽 경험이 실제로 다르게 느껴집니다.”라고 Levy는 말했습니다. 발표와 함께 공개된 데모에서는 Yelp Host가 예약을 확정하는 동안 GPT‑Live‑1이 배경 소음, 부수 대화 및 방해를 처리하는 모습을 보여줍니다.

Speak 공동 설립자이자 최고 기술 책임자 Andrew Hsu는 초기 평가에서 GPT‑Live‑1이 학습자의 사고 중단 시 발생하는 방해를 이전의 턴 기반 시스템에 비해 거의 80% 감소시켰다고 밝혔습니다. Fin 최고 운영 책임자 Jordan Neil은 이 모델이 AI 음성 지원을 정지‑시작 리듬에서 전화 통화의 자연스러운 흐름으로 전환시켜, 고객이 일시 정지하고, 방해하고, 방향을 바꾸는 동안 Fin이 자체 지원 시스템과 연계해 문제를 해결할 수 있게 한다고 설명했습니다. Cognition 공동 설립자이자 최고 제품 책임자 Walden Yan은 GPT‑Live‑1을 Devin(코그니션 AI 엔지니어)과 함께 사용해 아이디어를 논의하고, 접근 방식을 압박 테스트하거나, 키보드에서 떨어진 상태에서도 작업을 인계할 수 있었다고 전했습니다.

OpenAI는 소수의 실시간 음성에서 억양, 방언, 언어를 아우르는 더 넓은 선택지로 확대하고 있으며, 개발자에게 어시스턴트의 음성을 맞춤 설정할 수 있는 선택권을 제공한다고 밝혔습니다. 맞춤형 음성 접근을 원하는 개발자는 OpenAI 영업팀에 연락해 자격 요건 및 요청 절차를 확인해야 합니다. 회사는 향후 몇 달 동안 음성 옵션과 언어 지원을 지속적으로 확대할 것이라고 전했습니다.

Jonas Reeve는 Unite.AI의 AI 생성 분석가로, 인지 AI, 인공 일반 지능(AGI), 기계 지능의 이론적 기초에 중점을 둡니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 및 인공 시스템에서 어떻게 나타나는지 탐구하며, 현대적인 AI 아키텍처와 인지 과학 및 마음의 철학의 오래된 질문 사이의 연결을 그립니다.
개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 출현적 인지, 정렬 이론과 같은 프레임워크를 조사하여 AGI로의 진보가 실제로 무엇을 의미하는지 및 무엇을 의미하지 않는지 명확히 합니다. 그는 타임라인이나 호재를 추구하는 대신 첫 번째 원칙, 개념적 엄격성, 현재 모델의 한계를 강조합니다.
Jonas Reeve가 작성한 기사들은 AI로 생성되어 Unite.AI의 편집 팀에 의해 검토되어 고급 AI 개념에 대한 정확성, 명확성, 책임있는 논의를 보장합니다.