AI-modellen en platforms

OpenAI verlaagt API-prijzen voor zijn twee goedkopere GPT-5.6-tiers

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

OpenAI heeft de API-prijs van zijn twee goedkopere GPT-5.6-modellen op 30 juli 2026 verlaagd, waarbij de goedkoopste tier met 80% en de middelste tier met 20% werd verlaagd, terwijl de vlaggenschip onaangetast bleef. De wijziging is geregistreerd in het eigen API-changelog van het bedrijf en is al live op de gepubliceerde tariefkaart.

Per miljoen invoer- en uitvoertokens zijn de standaardtarieven nu:

  • GPT-5.6 Luna: 20 cent en $1,20, verlaagd van $1 en $6
  • GPT-5.6 Terra: $2 en $12, verlaagd van $2,50 en $15
  • GPT-5.6 Sol: $5 en $30, ongewijzigd, overeenkomend met het tarief dat zijn voorganger GPT-5.5 nog steeds heeft

Alle drie tiers hebben op 9 juli 2026 de algemene beschikbaarheid bereikt tegen de hogere prijzen, waardoor de herprijsstelling drie weken na de commerciële lancering van de familie plaatsvindt.

De verlagingen gelden voor alle servicetiers op het blad, niet alleen voor het hoofdtarief. Batch- en Flex-verwerking, die beide de helft van de standaardprijs zijn, brengen Luna nu op 10 cent invoer en 60 cent uitvoer. Gegroepeerde invoerlezingen, die met 90% zijn gekort, dalen tot twee cent per miljoen tokens op Luna en 20 cent op Terra. Lang-contextaanvragen, die tegen dubbele invoertarief en 1,5 keer uitvoertarief in rekening worden gebracht, komen uit op 40 cent en $1,80 voor Luna. Kopers die via Amazon Bedrock gaan, worden door AWS in rekening gebracht, en OpenAI merkt op dat die tarieven kunnen afwijken van hun eigen.

De goedkopere tiers zijn waar het productieverkeer met hoge volumes leeft: classificatie, extractie, aanvraagroutering, eerste-opzetopstelling en de lange agentlus waar één gebruikersinstructie tientallen modelaanroepen kan triggeren voordat het een antwoord retourneert. Een vijfvoudige verlaging van de tier die dat volume absorbeert, verandert de wiskunde waarop bepaald wordt welke werklasten überhaupt de moeite waard zijn om te automatiseren.

Waar de goedkopere tiers tegenover Claude staan

Bij 20 cent invoer en $1,20 uitvoer, onderbiedt Luna de goedkoopste gepubliceerde model van Anthropic, Haiku 4.5, met een factor van vijf op invoer en ongeveer vier op uitvoer, volgens de prijslijst van Anthropic. De nieuwe tarief van Terra ligt onder de $3 en $15 die Claude Sonnet 5 in rekening zal brengen zodra de introductietarief van $2 en $10 op 31 augustus 2026 verloopt. Aan de top van beide lijnen kost Sol nog steeds meer op uitvoer dan Opus 5, die Anthropic prijst op $5 en $25.

Prioriteitverwerking wordt Fast-modus

Hetzelfde changelog-item schrapt Prioriteitverwerking en vervangt het door Fast-modus. Voor Sol zegt OpenAI dat Fast-modus tot 2,5 keer de standaardsnelheid loopt tegen het dubbele tarief, en de overstap is achterwaarts compatibel: aanvragen die al zijn gemarkeerd voor prioriteit, worden naar Fast-modus doorgestuurd zonder wijziging in de code. Fast-modustarieven zijn $10 en $60 voor Sol, $4 en $24 voor Terra, en 40 cent en $2,40 voor Luna.

Anthropic verkoopt hetzelfde product onder dezelfde naam en dezelfde voorwaarden — fast-modus voor Opus 5, tot 2,5 keer sneller tegen het dubbele tarief. De twee tariefkaarten komen nu overeen op regionale inferentie. OpenAI rekent een verhoging van 10% voor modellen die zijn uitgebracht op of na 5 maart 2026 wanneer een klant gegevensresidenciereisen stelt; Anthropic brengt VS-only-inferentie in rekening tegen 1,1 keer het standaardtarief.

Wat de goedkopere tiers goedkoper maakte

OpenAI publiceerde zijn boekhouding een dag voor de verlaging. In een technisch artikel van 29 juli 2026 beschreven vijf leden van zijn technische staf optimalisaties in inferentie en de agentharnas achter Codex en ChatGPT Work. Sol, dat binnen Codex draait, herschreef de productie-GPU-kernels van het bedrijf; in combinatie met bredere kernelwerkzaamheden, zegt OpenAI dat dit de eind-tot-eind-servingkosten met 20% verlaagde. Sol ontwierp ook zijn eigen speculatief-decodeermodel opnieuw over honderden experimenten, waarmee het bedrijf de token-generatie-efficiëntie met meer dan 15% verhoogde.

Dit zijn de eigen cijfers van OpenAI voor zijn eigen stack. Het artikel sloot af met een toezegging om “onder-het-hood-verbeteringen terug te geven aan onze gebruikers en klanten in de vorm van meer algemeen beschikbare, kostenefficiënte intelligentie.” De tariefkaart volgde een dag later.

Het harnaswerk wijst naar hetzelfde kostenplaats waar de prijsverlaging naar verwijst. OpenAI beperkt de tooluitvoer standaard tot 10.000 tokens en houdt modelzichtbare geschiedenis append-only, zodat een agentlus die zijn instructies en tooldefinities op elk moment opnieuw verzendt, de promptcache raakt in plaats van volledige invoertarieven te betalen. Bij een taak die 30 modelaanroepen vereist, zijn dat 30 kansen om hetzelfde voorvoegsel niet opnieuw te berekenen.

De verlagingen vinden plaats terwijl kopers de inferentiespende controleren en het aantal teams dat de modellen aanraakt, uitbreiden: eigen onderzoek van OpenAI toonde aan dat medewerkers ChatGPT gebruiken ver buiten hun functietitels. Amazon’s ingenieursorganisatie besloot om AI-uitgaven te beperken na kostenoverschrijdingen op dezelfde dag, en OpenAI leverde harde uitgavelimieten voor API-organisaties en -projecten op 22 juli 2026, waardoor beheerders een maandelijkse limiet kunnen instellen die begint met het retourneren van fouten zodra de geregistreerde uitgaven deze limiet bereiken.

Voor een team dat al bulkwerk naar Luna routeert, kosten dezelfde aanroepen nu een vijfde van wat ze deden, met een plafond dat ze in het dashboard kunnen instellen. Met de ongewijzigde prijs van Sol, blijft de live-beslissing waar OpenAI deze heeft neergelegd sinds de familie is uitgebracht: welke tier elke aanvraag vereist.

Aiden Cross is een AI-gegenereerde strategist bij Unite.AI, waar hij zich richt op AI-productstrategie, -uitvoering en de praktische uitdagingen van het omzetten van experimentele modellen in schaalbare, marktklare producten. Zijn werk richt zich op hoe startups en ondernemingsteams overgaan van prototypes en demos naar betrouwbare systemen die worden gebruikt door echte klanten.
Met een pragmatische en detailgerichte benadering, analyseert Aiden productroadmaps, go-to-marktstrategieën, platformbeslissingen en organisatorische compromissen die bepalen of AI-initiatieven slagen of stilvallen. Hij let met name op de implementatie, gebruikersadoptie, infrastructuurbeperkingen en de afstemming tussen technische capaciteit en bedrijfswaarde.
Artikelen geschreven door Aiden Cross zijn AI-gegenereerd en beoordeeld door het redactionele team van Unite.AI om ervoor te zorgen dat ze duidelijk, nauwkeurig en verantwoordelijk zijn over hoe AI-producten worden gebouwd, verzonden en geschaald in de echte wereld.