Modele i platformy AI
Anthropic powiązuje ceny Claude Opus 5.5 z dłuższymi sesjami kodowania

Anthropic poinformowało 24 września 2026 r., że sesje Claude Code stały się dłuższe i bardziej obciążone kontekstem w ciągu ostatnich sześciu miesięcy, opisując w poście na blogu Claude, jak mechanika cen i buforowania Claude Opus 5.5 odpowiada na tę zmianę. Firma szacuje, że koszt eksploatacji Opus 5.5 jest około 40 % niższy niż Opus 5 przy typowym obciążeniu rozliczanym tokenami.
Sześć miesięcy danych o użyciu Claude Code
Post, napisany przez Michaela Segnera, opiera się na zbiorczych danych o użyciu obejmujących okres od marca do września 2026 r. Liczba promptów na sesję pozostała stała, podaje post, podczas gdy praca w każdym promptcie wzrosła: model teraz działa 3,3‑krotnie dłużej na jeden prompt i wykonuje o ponad 40 % więcej wywołań modelu w każdym z nich, a przerwy spadły o 68 %. Programiści teraz łączą się z serwerem narzędzi lub używają umiejętności około dwa razy częściej, a wklejanie tekstu do promptów jest o jedną trzecią rzadsze.
Ilość kontekstu w każdym żądaniu wzrosła 2,6‑krotnie w tym okresie, a stosunek tokenów wejściowych do wyjściowych zmienił się z 189:1 na 324:1. Anthropic interpretuje te liczby jako wskazówkę, że programiści dążą do modelu pracującego dłużej i lepiej poinformowanego przy większych, bardziej otwartych zadaniach, i twierdzi, że oszczędności z Opus 5.5 są największe właśnie w tych dłuższych sesjach o wysokim kontekście, gdy użycie jest rozliczane tokenami.
Analiza opiera się na wydaniu przez Anthropic Claude Opus 5.5, które pojawiło się z niższymi cenami niż Opus 5. Tam, gdzie premiera ustaliła ceny, post z 24 września oraz towarzysząca analiza opublikowana 22 września 2026 r. przez Addy’ego Osmani’ego badają, co te ceny oznaczają dla rzeczywistych obciążeń Claude Code.
Ceny tokenów i obniżka kosztu odczytu z pamięci podręcznej
Przy rozliczaniu użycia tokenami, Anthropic obniżyło ceny tokenów wejściowych i wyjściowych o 20 % oraz zmniejszyło koszt odczytu tokenu z pamięci podręcznej o 60 %. Firma twierdzi, że redukcja kosztu odczytu z cache ma największe znaczenie, ponieważ odczyty z pamięci podręcznej stanowią większość kosztów prac agentowych i kodowania, i podaje, że w momencie publikacji token z pamięci podręcznej w Opus 5.5 kosztuje jedną piątą kosztu konkurencyjnych modeli i przewyższa je.
Towarzysząca analiza Osmani’ego podaje ceny listy API Opus 5.5: 4 $ za milion tokenów wejściowych, 20 $ za milion tokenów wyjściowych oraz 0,20 $ za milion odczytów z pamięci podręcznej. Przy tych cenach odczyt z pamięci podręcznej kosztuje 5 % kosztu świeżego tokenu wejściowego, podczas gdy zapisy do pamięci podręcznej kosztują 1,25‑krotność ceny wejściowej przy pięciominutowej pamięci i dwukrotność przy jednorazowej godzinie, przy czym każdy odczyt odnawia czas życia za darmo. W planach Pro, Max lub Team niższa cena Opus 5.5 jest przenoszona na limity planów, dzięki czemu działają one około 25 % dłużej niż w Opus 5; dodatkowa zniżka na odczyt z pamięci podręcznej obowiązuje wyłącznie w cenach API.
Wykorzystaj zmiany chroniące pamięć podręczną
Nawet gdy kontekst na żądanie wzrósł około 2,6‑krotnie, odsetek wejścia, które nie trafiało do pamięci podręcznej, spadł o ponad 50 % w ciągu sześciomiesięcznego okresu, podaje post. Przypisuje to serię zmian w Claude Code, które redukują przypadkowe przerwania pamięci podręcznej, obejmując małe zakłócenia, takie jak odświeżenie logowania, oraz większe, takie jak dodawanie instrukcji w trakcie rozmowy lub ładowanie narzędzi na żądanie. W Opus 5.5 i Fable 5.1 programiści mogą także zmieniać poziomy wysiłku w trakcie sesji bez resetowania pamięci podręcznej.
Oficjalna dokumentacja buforowania promptów określa, że zachowanie poziomu wysiłku obowiązuje przy użyciu klucza API lub subskrypcji Claude, i nie obowiązuje na Amazon Bedrock, platformie Agent Platform firmy Google Cloud, ani na bramce aplikacji Claude, ani gdy ustawiono flagę CLAUDECODEDISABLEEXPERIMENTALBETAS lub organizacja ma konfigurację HIPAA.
Programiści korzystający z kluczy API i dostawców chmury mogą teraz ustawić jednoczasowy limit pamięci podręcznej na jedną godzinę, co subskrybenci już mieli. Dokumentacja pokazuje domyślne wartości: jedna godzina dla głównej rozmowy w subskrypcji Claude w ramach limitu planu oraz pięć minut dla kredytów użycia, kluczy API lub dostawców chmury. Ustawienie promptCacheTtl lub zmienna środowiskowa CLAUDECODEPROMPTCACHETTL wybierają dłuższy limit, a oba sterowanie wymagają Claude Code w wersji 2.1.242 lub nowszej.
Rozdzielone podagenty teraz zaczynają od pamięci podręcznej sesji nadrzędnej, zamiast płacić za ponowne przetworzenie tego samego kontekstu. Dokumentacja wyjaśnia, że fork przejmuje systemowy prompt rodzica, zestaw narzędzi i pełną historię rozmowy, więc jego początkowe żądanie odczytuje bezpośrednio z pamięci podręcznej rodzica.
Mniej tur na zadanie
Anthropic informuje, że Opus 5.5 może ukończyć zadanie w mniejszej liczbie tur niż inne modele. Według posta, Zeta Labs odnotowało mniej tur i wywołań narzędzi na zadanie niż w Opus 5, przy prawie połowie kosztów, i zakończyło dwa razy więcej swoich najtrudniejszych zadań.
Post ostrzega, że ten wzorzec nie będzie obowiązywał dla każdego zadania, cytując analizę Osmani’ego: „W dobrze określonym zadaniu oba modele kończą w mniej więcej tej samej liczbie tur, a obniżka ceny to wszystko, co otrzymujesz. Różnica powinna być największa w zadaniach otwartych, gdzie model może poświęcić wiele tur na niewłaściwy pomysł.”
Anthropic informuje również, że Opus 5.5 generuje wyniki ponad 30 % szybciej niż Opus 5. Zysk nie zmienia zużycia tokenów ani wskaźnika trafień w pamięci podręcznej; post zauważa, że skraca to oczekiwanie przy długich uruchomieniach, ponieważ Claude spędza więcej czasu pracując bez nadzoru.
Post kończy się praktykami ochrony odczytów z pamięci podręcznej: uruchom /usage w Claude Code, aby zobaczyć, jaka część sesji jest obsługiwana z pamięci podręcznej, wybierz model na początku sesji zamiast zmieniać go w trakcie, przeprowadź kompresję przed odejściem zamiast po, a w przypadku klucza API lub dostawcy chmury włącz jednoczasowy limit pamięci podręcznej wynoszący jedną godzinę dla długich sesji.












