AI-modeller og platforme

OpenAI’s GPT-Live-1 ankommer i API’en til $0.05 per minut

mm
Føj Unite.AI til dine foretrukne kilder på Google

OpenAI lancerede GPT-Live-1 i API’en den 10. september 2026, hvilket gør deres fuld-duplex stemmemodel tilgængelig for udviklere til $0.05 per minut for front‑end stemmelaget. Udgivelsen udvider det samtalesystem, der ligger bag ChatGPT Voice, til tredjeparts‑apps og forretnings‑arbejdsprocesser.

GPT-Live-1 kan lytte og tale samtidigt, og OpenAI oplyser, at den overlader dybere ræsonnement og handlinger til de modeller og værktøjer, den er parret med, som demonstreret med Codex og ChatGPT Work. For API‑udgivelsen sagde virksomheden, at den fokuserede på funktioner, der gør det muligt for udviklere at styre og tilpasse stemmeoplevelser omkring deres brugere, arbejdsprocesser og mål.

En enkelt model til lytning og tale

Traditionelle stemmeagenter kæder tale‑til‑tekst, en ræsonneringsmodel og tekst‑til‑tale sammen, og hver overlevering tilføjer latenstid og skaber flere muligheder for at miste timing, kontekst eller den naturlige rytme i en samtale. GPT-Live-1 håndterer lytning og tale i én enkelt model, der ræsonnerer over indgående og udgående lyd samtidigt, svarer på afbrydelser og anerkendelser i realtid, mens dybere ræsonnement overlades til backend, så samtalen kan fortsætte, mens arbejdet foregår i baggrunden.

Udviklere vælger de modeller, værktøjer og agent‑rammer, der ligger bag samtalen. OpenAI giver eksemplet med at parre GPT-Live-1 med en model som Luna til høj‑volumen‑opgaver såsom planlægning eller ordreopdateringer, og en model som Astra til komplekse kundespørgsmål, der kræver ræsonnement; backend kan også være en tredjepartsmodel. Udviklere kan forme en agents tone, tempo og samtalestil gennem systemprompten.

OpenAI angiver yderligere styrker for API‑udgivelsen: tavs kontekststyring og håndtering af baggrundsstøj uden at fortælle hvert trin højt, kontekstbevarelse på tværs af udvidede sessioner samt telefoni‑understøttelse for fuld‑duplex telefonagenter i opkald fra restaurantreservationer til kundesupport. GPT-Live-1 leverer indbygget ASR‑transskriptioner og svartekst, understøtter nøgleords‑bias og alfanumerisk forståelse, og selvom den ikke er en tur‑baseret model, understøtter den indbygget tur‑detektion, så udviklere kan fortsætte med at bygge omkring eksplicitte tur‑grænser. Et kodeeksempel offentliggjort sammen med meddelelsen viser en applikation, der sender samtalekontekst til Codex og returnerer Codex’ svar til GPT-Live-1 under en session.

Rapporterede evalueringsresultater

OpenAI rapporterer, at GPT-Live-1 forbedrer Full Duplex Bench‑præstationen med 30 procentpoint i forhold til GPT-Realtime-2.1, med store gevinster i tur‑latens og interaktiv adfærd, og at den rangerer som nummer ét på Tau3, en benchmark der måler frontlinje‑stemmegents intelligens på ende‑til‑ende‑opgaver, når den er parret med GPT-6 Astra med middel‑ræsonneringsindsats.

På Tau3 (Voice) Intelligence, som evaluerer talte kundeservicetasks inden for luftfart, detailhandel og telekommunikation, er OpenAIs rapporterede Pass@1‑opgaveløsningsscore 86,2 % for GPT-Live-1, sammenlignet med 45,7 % for GPT-Realtime-2.1 og 42,4 % for GPT-Realtime-2. På Tau Banking (Voice) Knowledge, målt som andelen af 97 bank‑viden‑opgaver, der fuldføres succesfuldt, er de rapporterede tal 32,0 % versus 12,4 % og 10,3 %.

Virksomheden rapporterede også en gennemsnitlig score på 97,3 % for Artificial Analysis Conversational Dynamics for GPT-Live-1, sammenlignet med 95,7 % for GPT-Realtime-2.1 og 95,3 % for GPT-Realtime-2, i en evaluering der dækker pausehåndtering, samtaletur‑tagning, afbrydelser og backchannels. På Full Duplex Bench v1.5 Interactivity, som tester reaktioner på baggrundsstøj, tale til en anden person, lytter‑backchannels og afbrydelser, er de rapporterede scores 80,10 % versus 45,4 % og 47,8 %. Den rapporterede Full Duplex Bench v1 tur‑latens, som måler hvor hurtigt agenten begynder sit svar efter brugeren afslutter en tur, er 0,798 sekunder versus 1,41 sekunder og 1,63 sekunder. På Full Duplex Bench v3, kørt med en Terra‑backend ved lav ræsonneringsindsats, rapporterede OpenAI værktøjs‑kald Pass@1 på 87,0 % versus 60,0 % og 58,0 %, samt svarkvalitet på 90,0 % versus 88,0 % og 81,0 %.

Fra ChatGPT Voice til API’en

OpenAI introducerede GPT-Live den 8. juli 2026 som en ny generation af fuld‑duplex stemmemodeller, der driver ChatGPT Voice, og lancerede GPT-Live-1 og GPT-Live-1 mini til ChatGPT‑brugere globalt samme dag med udmelding om, at modellerne skulle bringes til API’en. OpenAI sagde, at GPT-Live-1 ville blive standardmodellen, der driver ChatGPT Voice for Go-, Plus‑ og Pro‑brugere, mens GPT-Live-1 mini blev standard for gratisbrugere. En opdatering den 31. juli 2026 tilføjede SynthID‑vandmærkning til understøttet lyd genereret med GPT-Live gennem ChatGPT Voice og OpenAI‑API’en, samt API‑adgang til OpenAIs offentlige verifikationsværktøj.

Meddelelserne peger også virksomheder mod OpenAI Presence, som OpenAI oplyser bruger GPT-Live-1 til at drive real‑time stemmeinteraktioner for agenter, der besvarer spørgsmål, løser problemer, bruger virksomhedens systemer, udfører godkendte handlinger og eskalerer til personer efter behov. OpenAI introducerede Presence den 22. juli 2026 som et implementeret enterprise‑produkt til stemme‑ og chat‑arbejdsprocesser, tilgængeligt for berettigede kunder gennem et begrænset generelt tilgængelighedsprogram ledet af OpenAI Forward Deployed Engineers og udvalgte globale systemintegratorer i stedet for som et selvbetjent produkt.

Tidlige kunder og nye stemmer

Yelps teknologichef Alex Levy sagde, at tilføjelsen af GPT-Live-1 til Yelp Host og Hatch forbedrede tur‑tagning og nøjagtighed i forhold til virksomhedens traditionelle stemmearkitektur, og at Yelp ser betydelige forbedringer i håndteringsrater for opkald, når Yelp Host besvarer opkald som reservationer og madbestillinger. “Opkaldene taler også i mere komplette, naturlige sætninger, hvilket viser os, at oplevelsen i den anden ende af telefonen føles ægte anderledes,” sagde Levy. En demo offentliggjort sammen med meddelelsen viser Yelp Host, der sikrer en reservation, mens GPT-Live-1 håndterer baggrundsstøj, sidesamtaler og afbrydelser.

Speak medstifter og teknologichef Andrew Hsu sagde, at tidlige evalueringer viste, at GPT-Live-1 reducerede afbrydelser under elevernes tænke‑pauser med næsten 80 % sammenlignet med tidligere tur‑baserede systemer i Speaks Live Tutor‑lektioner. Fin’s driftschef Jordan Neil sagde, at modellen flytter AI‑stemme‑support fra en stop‑start‑rytme mod den naturlige strøm i et telefonopkald, så kunder kan pause, afbryde og skifte retning, mens Fin kombinerer samtalen med sit proprietære supportsystem for at løse problemer. Cognition medstifter og produktchef Walden Yan beskrev brugen af GPT-Live-1 sammen med Devin, Cognitions AI‑ingeniør, til at drøfte en idé, teste en tilgang under pres eller overlevere arbejde, mens de er væk fra tastaturet.

OpenAI sagde, at de udvider fra et lille udvalg af real‑time stemmer til et bredere sortiment på tværs af accenter, dialekter og sprog, så udviklere får flere valgmuligheder for, hvordan deres assistenter lyder. Udviklere, der ønsker adgang til tilpassede stemmer, skal kontakte OpenAI‑salg for at få information om berettigelse og anmodningsprocessen. Virksomheden oplyser, at de vil fortsætte med at udvide stemmemuligheder og sprogtilgængelighed i de kommende måneder.

Jonas Reeve er en AI-genereret analytiker hos Unite.AI, der fokuserer på kognitiv AI, kunstig generel intelligens (AGI) og de teoretiske grundlag for maskinintelligens. Hans arbejde udforsker, hvordan læring, resonnering, hukommelse og abstraktion opstår i både biologiske og kunstige systemer, og hvordan der kan trækkes forbindelser mellem moderne AI-arkitekturer og langvarige spørgsmål i kognitiv videnskab og filosofi om sindet.
Med en konceptuel og reflekterende tilgang undersøger Jonas rammer som resonneringsmodeller, agente systemer, emergent kognition og alignment-teori, med det formål at klargøre, hvad fremgang mod AGI faktisk betyder - og hvad det ikke gør. I stedet for at jagte tidsfrister eller hype lægger han vægt på første principper, konceptuel rigor og grænserne for nuværende modeller.
Artikler skrevet af Jonas Reeve er AI-genererede og gennemgået af Unite.AIs redaktionelle team for at sikre nøjagtighed, klarhed og ansvarlig diskussion af avancerede AI-koncepter.