Modele i platformy AI
OpenAI obniża ceny API dla dwóch tańszych modeli GPT-5.6

OpenAI obniżył ceny API dla dwóch tańszych modeli GPT-5.6, obniżając najtańszy model o 80%, a model średni o 20%, przy czym cena modelu flagowego pozostała bez zmian. Zmiana ta została zapisana w changelogu API firmy i jest już dostępna na stronie z cennikiem.
Stawki za milion tokenów wejściowych i wyjściowych wynoszą obecnie:
- GPT-5.6 Luna: 20 centów i 1,20 dolara, w porównaniu z 1 dolarem i 6 dolarów
- GPT-5.6 Terra: 2 dolary i 12 dolarów, w porównaniu z 2,50 dolarem i 15 dolarów
- GPT-5.6 Sol: 5 dolarów i 30 dolarów, bez zmian, co odpowiada cenie poprzedniego modelu GPT-5.5
Wszystkie trzy modele zostały udostępnione 9 lipca 2026 r. po wyższych cenach, co oznacza, że obniżka cen nastąpiła trzy tygodnie po rozpoczęciu ich komercyjnego życia.
Obniżka cen dotyczy wszystkich poziomów usług, a nie tylko stawek podstawowych. Przetwarzanie partii i Flex, które wynoszą połowę ceny standardowej, wynoszą teraz 10 centów za token wejściowy i 60 centów za token wyjściowy dla modelu Luna. Odczyty z pamięci podręcznej, które są zniżkowane o 90%, spadają do 2 centów za milion tokenów dla modelu Luna i 20 centów dla modelu Terra. Żądania długiego kontekstu, które są rozliczane według podwójnej stawki wejściowej i 1,5-krotności stawki wyjściowej, wynoszą 40 centów i 1,80 dolara dla modelu Luna. Nabywcy, którzy korzystają z usług Amazon Bedrock, są rozliczani przez AWS, a OpenAI zauważa, że te stawki mogą się różnić od ich własnych.
Tańsze modele to miejsce, gdzie znajduje się ruch produkcyjny o dużej objętości: klasyfikacja, ekstrakcja, routing żądań, pierwsze szkice i długie pętle agentów, gdzie jeden rozkaz użytkownika może spowodować wiele wywołań modelu przed udzieleniem odpowiedzi. Pięciokrotna obniżka ceny modelu, który pochłania ten ruch, zmienia arytmetykę dotyczącą tego, które zadania są warte zautomatyzowania.
Gdzie tańsze modele stoją wobec Claude
Przy cenie 20 centów za token wejściowy i 1,20 dolara za token wyjściowy model Luna jest tańszy od najtańszego opublikowanego modelu Anthropic, Haiku 4.5, o czynnik pięć dla tokenów wejściowych i około cztery dla tokenów wyjściowych, zgodnie z cennikiem Anthropic. Nowa stawka modelu Terra jest niższa niż 3 dolary i 15 dolarów, które model Claude Sonnet 5 ma być rozliczany po zakończeniu okresu wprowadzającego 2 dolarów i 10 dolarów, który upływa 31 sierpnia 2026 r. Na szczycie obu linii model Sol nadal jest droższy od modelu Opus 5, który Anthropic wycenia na 5 dolarów i 25 dolarów.
Przetwarzanie priorytetowe staje się trybem Fast
Ten sam wpis w changlogu wycofuje Przetwarzanie priorytetowe i zastępuje je trybem Fast. Dla modelu Sol OpenAI mówi, że tryb Fast działa do 2,5-krotnie szybciej niż standardowa szybkość przy podwójnej cenie, a przełączenie jest wstecznie kompatybilne: żądania już oznaczone jako priorytetowe są kierowane do trybu Fast bez zmiany kodu. Stawki trybu Fast wynoszą 10 dolarów i 60 dolarów dla modelu Sol, 4 dolary i 24 dolary dla modelu Terra oraz 40 centów i 2,40 dolara dla modelu Luna.
Anthropic sprzedaje ten sam produkt pod tą samą nazwą i tymi samymi warunkami — tryb Fast dla modelu Opus 5, do 2,5-krotnie szybszy przy podwójnej cenie standardowej. Dwa cenniki są teraz zbieżne w odniesieniu do inferencji przypiętej do regionu. OpenAI pobiera 10% podwyżki za modele wydane 5 marca 2026 r. lub później, gdy klient wymaga rezydencji danych; Anthropic rozlicza inferencję tylko w USA przy 1,1-krotności standardowej stawki.
Co sprawiło, że tańsze modele są tańsze
OpenAI opublikował swoje rozliczenie dzień przed obniżką cen. W poście inżynierskim z 29 lipca 2026 r. pięciu członków personelu technicznego opisało optymalizacje w inferencji i harnessie agenta za modelem Codex i ChatGPT Work. Model Sol, działający wewnątrz modelu Codex, przepisał jądro GPU produkcji firmy; w połączeniu z szerszymi pracami nad jądrem OpenAI mówi, że obniżyło to koszty serwisowania o 20%. Model Sol również przeprojektował swój model draftu dekodowania spekulatywnego w setkach eksperymentów, co firma przypisuje zwiększeniu wydajności generowania tokenów o ponad 15%.
To są własne dane OpenAI dla własnej struktury. Post zakończył się zobowiązaniem do przekazywania “poprawek pod maską naszym użytkownikom i klientom w postaci bardziej dostępnej, efektywnej kosztowo inteligencji”. Karta cenowa nastąpiła dzień później.
Prace nad harnessami wskazują na ten sam punkt kosztowy, co obniżka cen. OpenAI ogranicza dane wyjściowe narzędzi do 10 000 tokenów domyślnie i utrzymuje historię modelu tylko do odczytu, więc pętla agenta, która wysyła swoje instrukcje i definicje narzędzi na każdym kroku, trafia do pamięci podręcznej zamiast płacić pełne stawki wejściowe. W przypadku zadania, które wymaga 30 wywołań modelu, jest to 30 szans, aby uniknąć ponownego obliczania tego samego prefiksu.
Obniżka cen następuje, gdy nabywcy audytują wydatki na inferencję i rozszerzają zespoły, które korzystają z modeli: własne badania OpenAI wykazały, że pracownicy korzystają z ChatGPT znacznie poza swoimi stanowiskami. Organizacja inżynierska Amazon przeszła na ograniczenie wydatków na AI po przekroczeniu budżetu tego samego dnia, a OpenAI wprowadził twarde limity wydatków dla organizacji API i projektów 22 lipca 2026 r., pozwalając administratorom ustalić miesięczny limit, który zaczyna zwracać błędy, gdy śledzone wydatki sięgną go.
Dla zespołu, który już kieruje pracę do modelu Luna, te same wywołania teraz kosztują jedną piątą tego, co kosztowały wcześniej, z limitem, który można ustalić w panelu. Przy niezmienionej cenie modelu Sol decyzja o wyborze modelu pozostaje tam, gdzie OpenAI ją umieścił od momentu premiery: jaki model jest wymagany dla każdego żądania.












