Моделі та платформи ШІ

GPT‑Live‑1 від OpenAI з’явився в API за $0,05 за хвилину

mm
Додайте Unite.AI до бажаних джерел у Google

OpenAI запустила GPT‑Live‑1 в API 10 вересня 2026 року, зробивши свою повнодуплексну голосову модель доступною розробникам за $0,05 за хвилину для фронтенд‑шару голосу. Це випуск розширює розмовну систему, що стоїть за ChatGPT Voice, на сторонні додатки та бізнес‑процеси.

GPT‑Live‑1 може одночасно слухати і говорити, і OpenAI заявила, що делегує глибше міркування та дії моделям і інструментам, з якими вона поєднана, як продемонстровано з Codex та ChatGPT Work. Для випуску API компанія зазначила, що зосередилась на можливостях, які дозволяють розробникам керувати та налаштовувати голосові взаємодії навколо їхніх користувачів, робочих процесів та цілей.

Єдина модель для прослуховування та говоріння

Традиційні голосові агенти послідовно об’єднують розпізнавання мови (speech-to-text), модель міркування та синтез мови (text-to-speech), і кожна передача додає затримку та створює більше можливостей втратити таймінг, контекст або природний ритм розмови. GPT‑Live‑1 обробляє прослуховування та говоріння в одній моделі, яка одночасно аналізує вхідний та вихідний аудіо, реагуючи на переривання та підтвердження в режимі реального часу, делегуючи глибше міркування бекенду, тож розмова може продовжуватись, поки робота виконується у фоні.

Розробники обирають моделі, інструменти та оболонку агента, що стоять за розмовою. OpenAI наводить приклад поєднання GPT‑Live‑1 з моделлю типу Luna для високонавантажених завдань, таких як планування чи оновлення замовлень, та з моделлю типу Astra для складних клієнтських питань, що вимагають міркування; бекенд також може бути сторонньою моделлю. Розробники можуть формувати тон, темп та стиль розмови агента за допомогою системного підказки.

OpenAI перераховує додаткові переваги випуску API: безшумне управління контекстом та обробка фонового шуму без озвучування кожного кроку, збереження контексту протягом тривалих сеансів та підтримка телефонії для повнодуплексних телефонних агентів у викликах від резервування столиків у ресторанах до підтримки клієнтів. GPT‑Live‑1 вбудовано надає транскрипти ASR та текст відповіді, підтримує зміщення за ключовими словами та розуміння алфавітно‑цифрових даних, і, хоча це не модель з покроковою взаємодією, вона вбудовано підтримує виявлення ходів, щоб розробники могли будувати навколо явних меж ходів. У кодовому фрагменті, опублікованому разом з оголошенням, показано застосунок, який передає контекст розмови Codex і повертає відповідь Codex до GPT‑Live‑1 під час сеансу.

Звітні результати оцінювання

OpenAI повідомляє, що GPT‑Live‑1 підвищує продуктивність Full Duplex Bench на 30 процентних пунктів порівняно з GPT‑Realtime‑2.1, забезпечуючи значні покращення затримки чергування та інтерактивної поведінки, і що вона займає перше місце в тесті Tau3, бенчмарку, що вимірює передовий інтелект голосових агентів у сквозних завданнях, коли поєднана з GPT‑6 Astra при середньому рівні міркувань.

У тесті Tau3 (Voice) Intelligence, який оцінює усні завдання обслуговування клієнтів у авіації, роздрібній торгівлі та телекомунікаціях, OpenAI повідомляє, що показники успішності завдань Pass@1 становлять 86,2 % для GPT‑Live‑1, порівняно з 45,7 % для GPT‑Realtime‑2.1 та 42,4 % для GPT‑Realtime‑2. У тесті Tau Banking (Voice) Knowledge, що вимірює частку успішно виконаних 97 банківських завдань, повідомлені показники становлять 32,0 % проти 12,4 % і 10,3 %.

Компанія також повідомила середній бал Artificial Analysis Conversational Dynamics у 97,3 % для GPT‑Live‑1, проти 95,7 % для GPT‑Realtime‑2.1 та 95,3 % для GPT‑Realtime‑2, у оцінці, що охоплює обробку пауз, чергування в розмові, переривання та зворотні сигнали. У тесті Full Duplex Bench v1.5 Interactivity, який перевіряє реакції на фоновий звук, мову до іншої особи, зворотні сигнали слухача та переривання, повідомлені результати становлять 80,10 % проти 45,4 % і 47,8 %. Звітна затримка чергування у Full Duplex Bench v1, що вимірює, як швидко агент починає відповідь після завершення користувачем свого ходу, складає 0,798 секунди проти 1,41 секунди і 1,63 секунди. У Full Duplex Bench v3, запущеному з бекендом Terra при низькому рівні міркувань, OpenAI повідомила про Pass@1 при виклику інструментів у 87,0 % проти 60,0 % і 58,0 %, а якість відповіді — 90,0 % проти 88,0 % і 81,0 %.

Від ChatGPT Voice до API

OpenAI представила GPT‑Live 8 липня 2026 року як нове покоління повнодуплексних голосових моделей, що живлять ChatGPT Voice, випустивши того ж дня GPT‑Live‑1 та GPT‑Live‑1 mini для користувачів ChatGPT по всьому світу та заявивши про плани перенести моделі до API. OpenAI повідомила, що GPT‑Live‑1 стане моделлю за замовчуванням, що живить ChatGPT Voice для користувачів Go, Plus та Pro, а GPT‑Live‑1 mini — за замовчуванням для безкоштовних користувачів. Оновлення від 31 липня 2026 року додало водяний знак SynthID до підтримуваного аудіо, згенерованого за допомогою GPT‑Live через ChatGPT Voice та OpenAI API, а також доступ до публічного інструменту верифікації OpenAI через API.

Оголошення також спрямовує підприємства до OpenAI Presence, яку OpenAI зазначила, що використовує GPT‑Live‑1 для забезпечення голосових взаємодій у реальному часі агентів, що відповідають на запитання, вирішують проблеми, користуються системами компанії, виконують схвалені дії та при необхідності передають їх людям. OpenAI представила Presence 22 липня 2026 року як розгорнутий корпоративний продукт для голосових та чат‑процесів, доступний для відповідних клієнтів через обмежену програму загальної доступності, яку очолюють інженери OpenAI Forward Deployed та обрані глобальні системні інтегратори, а не як продукт самообслуговування.

Перші клієнти та нові голоси

Технічний директор Yelp Алекс Леві заявив, що додавання GPT‑Live‑1 до Yelp Host та Hatch покращило чергування та точність порівняно з традиційною голосовою архітектурою компанії, і що Yelp спостерігає значні покращення у показниках обробки дзвінків, коли Yelp Host відповідає на дзвінки, такі як резервування столиків та замовлення їжі. «Абоненти також говорять повнішими, більш природними реченнями, що свідчить про те, що досвід на іншому кінці телефону дійсно інший», — сказав Леві. Демонстрація, опублікована разом з оголошенням, показує, як Yelp Host забезпечує резервування, тоді як GPT‑Live‑1 обробляє фоновий шум, бокові розмови та переривання.

Співзасновник та технічний директор Speak Ендрю Хсу зазначив, що ранні оцінки показали, що GPT‑Live‑1 скоротив переривання під час пауз розмірковування учнів майже на 80 % порівняно з попередніми системами на основі черг у Live Tutor Lessons від Speak. Операційний директор Fin Джордан Ніл заявив, що модель переносить підтримку AI‑голосу від ритму «стоп‑старт» до природного потоку телефонного дзвінка, дозволяючи клієнтам робити паузи, переривати та змінювати напрямок, тоді як Fin поєднує розмову зі своєю власною системою підтримки для вирішення проблем. Співзасновник та головний продуктовий директор Cognition Уолден Ян описав використання GPT‑Live‑1 разом з Девіном, інженером AI Cognition, для обговорення ідеї, тестування підходу або передачі роботи, коли ви далеко від клавіатури.

OpenAI повідомила, що розширює набір реальних голосів від невеликого до ширшого вибору акцентів, діалектів та мов, надаючи розробникам більше варіантів щодо звучання їхніх асистентів. Розробники, які шукають доступ до кастомних голосів, повинні зв’язатися з відділом продажів OpenAI, щоб дізнатися про умови та процес подання запиту. Компанія заявила, що продовжуватиме розширювати варіанти голосів та доступність мов у наступні місяці.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.