AI-modeller og plattformer

OpenAI kutter API-priser på sine to billigste GPT-5.6-nivåer

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

OpenAI senket API-prisen på sine to lavere kostnads GPT-5.6-modeller den 30. juli 2026, og kutta den billigste nivået med 80 % og midtnivået med 20 %, mens den forblev uendret. Endringen er logget i selskapets eget API-endringslogg og er allerede aktiv på den publiserte prislisten.

Per million inndata- og utdatatoken, er de nye standardratene:

  • GPT-5.6 Luna: 20 cent og $1,20, ned fra $1 og $6
  • GPT-5.6 Terra: $2 og $12, ned fra $2,50 og $15
  • GPT-5.6 Sol: $5 og $30, uendret, og matcher prisen dens forgjenger GPT-5.5 fortsatt har

Alle tre nivåer nådde generell tilgjengelighet den 9. juli 2026 til de høyere prisene, noe som gjør omprisingen tre uker inn i familiens kommersielle liv.

Kuttene gjelder for alle servicenivåer på arkene, ikke bare den annonserte prisen. Batch- og Flex-behandling, som begge er halvparten av standardprisen, setter nå Luna på 10 cent inndata og 60 cent utdata. Cached inndatalesninger, som er rabattert 90 %, faller til to cent per million token på Luna og 20 cent på Terra. Lange kontekstforespørsler, som beregnes til dobbel inndata og 1,5 ganger utdata, lander på 40 cent og $1,80 for Luna. Kjøpere som går gjennom Amazon Bedrock, blir belastet av AWS, og OpenAI påpeker at disse prisene kan være forskjellige fra deres egne.

De billigere nivåene er der høyvolumsproduksjonstrafikken bor: klassifisering, uttrekk, forespørselsruting, førsteutkast og de lange agentløkkene hvor en enkelt brukerinstruksjon kan utløse dusinvis av modellkall før den returnerer et svar. En femdobbelt kutt på nivået som absorberer denne volumet endrer aritmetikken for hvilke arbeidsbelastninger som er verdt å automatisere overhodet.

Hvor de billigere nivåene sitter i forhold til Claude

Ved 20 cent inndata og $1,20 utdata, underkutter Luna Anthropics billigste publiserte modell, Haiku 4.5, med en faktor på fem på inndata og omtrent fire på utdata, ifølge Anthropics pris-side. Terras nye pris ligger under $3 og $15 som Claude Sonnet 5 er planlagt å koste når den introduserende prisen på $2 og $10 utløper den 31. august 2026. Øverst i begge linjene, koste Sol fortsatt mer på utdata enn Opus 5, som Anthropic priser til $5 og $25.

Prioritert behandling blir Hurtig-modus

Den samme endringsloggposten pensjonerer Prioritert behandling og erstatter den med Hurtig-modus. For Sol, sier OpenAI at Hurtig-modus kjører opptil 2,5 ganger standardhastighet til dobbel pris, og skiftet er bakoverkompatibelt: forespørsler som allerede er merket for prioritet, ruter til Hurtig-modus uten en kodeendring. Hurtig-modus priser er $10 og $60 for Sol, $4 og $24 for Terra, og 40 cent og $2,40 for Luna.

Anthropic selger samme produkt under samme navn og samme vilkår — Hurtig-modus for Opus 5, opptil 2,5 ganger raskere til dobbel standardpris. De to prislistene konvergerer nå også på region-festet inferens. OpenAI beregner en prisøkning på 10 % på modeller utgitt på eller etter 5. mars 2026 når en kunde krever data-bosetting; Anthropic beregner US-only-inferens til 1,1 ganger sin standardpris.

Hva gjorde de billigere nivåene billigere

OpenAI publiserte sin regnskapsføring en dag før kuttet. I en teknisk post den 29. juli 2026, beskrev fem medlemmer av deres tekniske stab optimaliseringer over inferens og agent-harness bak Codex og ChatGPT Work. Sol, som kjører inne i Codex, skrev om selskapets produksjons-GPU-kjerner; kombinert med bredere kjernel-arbeid, sier OpenAI at dette kutta sluttkonsektivt serving-kostnader med 20 %. Sol redesignet også sin egen spekulativ-dekoding draft-modell over hundrevis av eksperimenter, som selskapet krediterer med å øke token-genererings-effektivitet med over 15 %.

Dette er OpenAIs egne tall for sin egen stak. Posten ble avsluttet med en forpliktelse til å videreformidle “under-the-hood-forbedringer tilbake til våre brukere og kunder i form av mer tilgjengelig, kostnadseffektiv intelligens.” Prislisten fulgte en dag senere.

Arbeidet med harness peker på samme kostnadssenter som prisnedgangen gjør. OpenAI begrenser verktøy-utdata til 10 000 token som standard og holder modell-synlig historikk append-only, så en agent-løkke som sender sine instruksjoner og verktøydefinisjoner på hver trinn, treffer prompt-cachen i stedet for å betale full inndata-rate. På en oppgave som tar 30 modellforespørsler, er det 30 sjanser til å unngå å regne ut samme prefikset.

Kuttene inntrer mens kjøpere gjennomgår inferens-utgifter og utvider hvilke team berører modellene: OpenAIs egen forskning fant at ansatte bruker ChatGPT langt utenfor deres jobbtitler. Amazons ingeniørorganisasjon gikk til å begrense AI-utgifter etter kostnadsoverskridelser samme dag, og OpenAI levert harde utgifts-begrensninger for API-organisasjoner og prosjekter den 22. juli 2026, og lar administratorer sette en månedlig tak som begynner å returnere feil når sporet utgift når den.

For et team som allerede ruter bulk-arbeid til Luna, koster samme oppkall nå en femdel av hva de gjorde, med en tak de kan sette i dashbordet. Med Sols pris uendret, forblir den live-beslutningen der OpenAI har satt den siden familien ble levert: hvilket nivå hver forespørsel krever.

Aiden Cross er en AI-generert strateg hos Unite.AI, som dekker AI-produktstrategi, gjennomføring og de praktiske utfordringene ved å omdanne eksperimentelle modeller til skalerbare, markedsklare produkter. Hans arbeid fokuserer på hvordan startups og bedrifter går fra prototyper og demonstrasjoner til pålitelige systemer som brukes av ekte kunder.
Med en pragmatisk og detaljorientert perspektiv, analyserer Aiden produktveikart, markedsstrategier, plattformbeslutninger og organisatoriske kompromisser som avgjør om AI-initiativer lykkes eller stopper. Han legger særlig vekt på deployeringsrealiteter, brukeradopsjon, infrastrukturbegrensninger og sammenligningen mellom teknisk evne og forretningsverdi.
Artikler skrevet av Aiden Cross er AI-generert og gjennomgått av Unite.AIs redaksjonsteam for å sikre klarhet, nøyaktighet og ansvarlig dekning av hvordan AI-produkter bygges, sendes og skaleres i den virkelige verden.