Модели и платформы ИИ

GPT‑Live‑1 от OpenAI появляется в API по цене $0.05 за минуту

mm
Добавьте Unite.AI в избранные источники в Google

OpenAI запустила GPT‑Live‑1 в API 10 сентября 2026 г., сделав её полно‑дуплексную голосовую модель доступной разработчикам по цене $0.05 за минуту для фронтенд‑слоя голоса. Выпуск расширяет разговорную систему, лежащую в основе ChatGPT Voice, на сторонние приложения и бизнес‑рабочие процессы.

GPT‑Live‑1 может одновременно слушать и говорить, и OpenAI заявила, что она делегирует более глубокие рассуждения и действия моделям и инструментам, с которыми она сочетается, как продемонстрировано на примере Codex и ChatGPT Work. Для выпуска в API компания сказала, что сосредоточилась на возможностях, позволяющих разработчикам управлять и настраивать голосовые взаимодействия в соответствии с их пользователями, рабочими процессами и целями.

Единая модель для прослушивания и речи

Традиционные голосовые агенты соединяют последовательность «речь‑в‑текст», модель рассуждения и «текст‑в‑речь», и каждый переход добавляет задержку и создаёт больше возможностей потерять синхронность, контекст или естественный ритм разговора. GPT‑Live‑1 обрабатывает прослушивание и речь в единой модели, которая одновременно рассуждает над входящим и исходящим аудио, реагируя на прерывания и подтверждения в реальном времени, при этом делегируя более глубокие рассуждения бэкенду, так что разговор может продолжаться, пока работа происходит в фоне.

Разработчики выбирают модели, инструменты и «оболочку» агента, стоящие за разговором. OpenAI приводит пример сочетания GPT‑Live‑1 с моделью Luna для задач с высоким объёмом, таких как планирование или обновление заказов, и с моделью Astra для сложных клиентских вопросов, требующих рассуждений; бэкендом также может быть сторонняя модель. Разработчики могут формировать тон, темп и стиль общения агента с помощью системного подсказки.

OpenAI перечисляет дополнительные преимущества для выпуска API: тихое управление контекстом и обработка фонового шума без озвучивания каждого шага, сохранение контекста в течение длительных сеансов и поддержка телефонии для полно‑дуплексных телефонных агентов в звонках от бронирования ресторанов до поддержки клиентов. GPT‑Live‑1 изначально предоставляет транскрипты ASR и текст ответов, поддерживает смещение по ключевым словам и понимание буквенно‑цифровых символов, и, хотя это не модель с пошаговым диалогом, она нативно поддерживает обнаружение реплик, позволяя разработчикам работать с явными границами реплик. Пример кода, опубликованный вместе с анонсом, демонстрирует приложение, передающее контекст разговора в Codex и возвращающее ответ Codex в GPT‑Live‑1 во время сеанса.

Сообщённые результаты оценки

OpenAI сообщает, что GPT‑Live‑1 улучшает показатели Full Duplex Bench на 30 процентных пунктов по сравнению с GPT‑Realtime‑2.1, демонстрируя значительные улучшения в задержке при смене реплик и интерактивном поведении, и занимает первое место в тесте Tau3, измеряющем передовой интеллект голосовых агентов в сквозных задачах, при сочетании с GPT‑6 Astra при среднем уровне рассуждений.

В тесте Tau3 (Voice) Intelligence, оценивающем устные задачи обслуживания клиентов в сферах авиаперевозок, розничной торговли и телекоммуникаций, OpenAI сообщает, что показатели Pass@1 (успешность задачи) составляют 86,2 % для GPT‑Live‑1, против 45,7 % для GPT‑Realtime‑2.1 и 42,4 % для GPT‑Realtime‑2. При оценке Tau Banking (Voice) Knowledge, измеряемой как доля из 97 банковских задач, успешно выполненных, указанные цифры составляют 32,0 % против 12,4 % и 10,3 %.

Компания также сообщила средний балл Artificial Analysis Conversational Dynamics в 97,3 % для GPT‑Live‑1, против 95,7 % для GPT‑Realtime‑2.1 и 95,3 % для GPT‑Realtime‑2, в оценке, охватывающей обработку пауз, смену реплик, прерывания и обратные каналы. В тесте Full Duplex Bench v1.5 Interactivity, проверяющем реакции на фоновый разговор, речь к другому человеку, обратные каналы слушателя и прерывания, указанные результаты составляют 80,10 % против 45,4 % и 47,8 %. Сообщённая задержка смены реплик в Full Duplex Bench v1, измеряющая, как быстро агент начинает отвечать после завершения пользователем реплики, составляет 0,798 секунды против 1,41 секунды и 1,63 секунды. В Full Duplex Bench v3, запущенном с бекендом Terra при низком уровне рассуждений, OpenAI сообщил Pass@1 при вызове инструментов в 87,0 % против 60,0 % и 58,0 %, а качество ответа — 90,0 % против 88,0 % и 81,0 %.

От ChatGPT Voice к API

OpenAI представила GPT‑Live 8 июля 2026 г. как новое поколение полно‑дуплексных голосовых моделей, поддерживающих ChatGPT Voice, выпустив в тот же день GPT‑Live‑1 и GPT‑Live‑1 mini для пользователей ChatGPT по всему миру и заявив о планах перенести модели в API. OpenAI сообщила, что GPT‑Live‑1 станет моделью по умолчанию, обеспечивающей работу ChatGPT Voice для пользователей Go, Plus и Pro, а GPT‑Live‑1 mini — моделью по умолчанию для бесплатных пользователей. Обновление от 31 июля 2026 г. добавило водяные знаки SynthID к поддерживаемому аудио, генерируемому с помощью GPT‑Live через ChatGPT Voice и API OpenAI, а также предоставило доступ к публичному инструменту проверки OpenAI через API.

В анонсе также предлагается предприятиям OpenAI Presence, который, по словам OpenAI, использует GPT‑Live‑1 для обеспечения голосовых взаимодействий в реальном времени для агентов, отвечающих на вопросы, решающих проблемы, работающих с системами компании, выполняющих одобренные действия и привлекающих людей при необходимости. OpenAI представила Presence 22 июля 2026 г. как внедрённый корпоративный продукт для голосовых и чат‑рабочих процессов, доступный подходящим клиентам через ограничённую программу общего доступа, возглавляемую инженерами OpenAI Forward Deployed и выбранными глобальными системными интеграторами, а не как самостоятельный сервис.

Первые клиенты и новые голоса

Технический директор Yelp Алекс Леви сообщил, что добавление GPT‑Live‑1 в Yelp Host и Hatch улучшило смену реплик и точность по сравнению с традиционной голосовой архитектурой компании, и что Yelp наблюдает значительные улучшения в показателях обработки звонков, когда Yelp Host отвечает на звонки, такие как бронирования и заказы еды. «Звонящие также произносят более полные, естественные предложения, что показывает, что опыт на другом конце телефона действительно отличается», — сказал Леви. Демонстрация, опубликованная вместе с анонсом, показывает, как Yelp Host фиксирует бронирование, пока GPT‑Live‑1 обрабатывает фоновый шум, боковые разговоры и прерывания.

Со‑основатель и технический директор Speak Эндрю Хсу отметил, что ранние оценки показали, что GPT‑Live‑1 сокращает прерывания во время пауз размышления обучающихся почти на 80 % по сравнению с предыдущими пошаговыми системами в Live Tutor Lessons от Speak. Финансовый директор по операциям Джордан Нил заявил, что модель переводит поддержку AI‑голоса от ритма «стоп‑старт» к естественному течению телефонного разговора, позволяя клиентам делать паузы, прерывать и менять направление, в то время как Fin сочетает разговор с собственной системой поддержки для решения проблем. Со‑основатель и главный продуктовый директор Cognition Уолден Ян описал использование GPT‑Live‑1 совместно с Дэвином, инженером AI компании Cognition, для обсуждения идеи, проверки подхода или передачи работы, находясь вдали от клавиатуры.

OpenAI заявила, что расширяет набор реальных голосов от небольшого количества к более широкому выбору акцентов, диалектов и языков, предоставляя разработчикам больше вариантов звучания их ассистентов. Разработчики, желающие получить доступ к кастомному голосу, должны связаться с отделом продаж OpenAI, чтобы узнать о критериях допуска и процессе запроса. Компания сообщила, что продолжит расширять варианты голосов и доступность языков в ближайшие месяцы.

Джонас Рив - аналитик, сгенерированный ИИ, в Unite.AI, который фокусируется на когнитивном ИИ, искусственном общем интеллекте (ИОИ) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, проводя связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии сознания.
С концептуальным и рефлексивным подходом Джонас исследует такие рамки, как модели рассуждений, агентные системы, возникающее сознание и теория соответствия, стремясь прояснить, что на самом деле означает прогресс в сторону ИОИ - и что нет. Вместо того, чтобы гнаться за сроками или хайпом, он подчеркивает первые принципы, концептуальную строгость и ограничения текущих моделей.
Статьи, написанные Джонасом Ривом, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение продвинутых концепций ИИ.