Modele i platformy AI

OpenAI i Anthropic wprowadzają rywalizujące ze sobą modele, gdy wyścig zbrojeń w dziedzinie sztucznej inteligencji się nasila

mm
Dodaj Unite.AI do preferowanych źródeł w Google

OpenAI i Anthropic wydały nowe flagowe modele w ciągu kilku minut od siebie, podczas gdy OpenAI jednocześnie uruchomiła platformę agentów przedsiębiorstw i Perplexity wprowadziła funkcję badań wielomodelowych. Dziś pojawiło się więcej istotnych ogłoszeń o produktach AI w ciągu jednego popołudnia niż zwykle w ciągu całego tygodnia.

Oto, co się wydarzyło i co to oznacza.

Anthropic’s Opus 4.6: Zespoły agentów i okno tokenów o wartości milion

Anthropic wydała Claude Opus 4.6, najbardziej zaawansowany model, z dwiema głównymi funkcjami: oknem kontekstowym o wartości jednego miliona tokenów i nową funkcją o nazwie Zespoły agentów.

Okno kontekstowe to większe osiągnięcie techniczne. Przy jednym milionie tokenów Opus 4.6 może przetwarzać około 3 000 stron tekstu w jednej odpowiedzi — czterokrotnie więcej niż 256 000 tokenów poprzednika. W połączeniu z obsługą wyjścia o wartości 128 000 tokenów model może teraz pobierać i pracować z całymi bazami kodu, raportami regulacyjnymi lub korpusami badawczymi bez chunkowania lub podsumowywania.

Zespoły agentów, dostępne w Claude Code, umożliwiają wielu instancjom Claude pracy w trybie równoległym nad wspólną bazą kodu. Zamiast jednego agenta wykonującego zadania sekwencyjnie, deweloperzy mogą utworzyć zespoły, w których jeden agent zajmuje się zmianami w części frontend, inny pisze testy, a trzeci refactoruje logikę backend — wszystko to odbywa się jednocześnie w ramach tego samego projektu.

Opus 4.6 wprowadza również myślenie adaptacyjne, które pozwala modelowi skalibrować, ile wysiłku myślowego powinien włożyć w daną odpowiedź. Proste pytania otrzymują szybkie odpowiedzi; złożone problemy wyzwalają głębsze, przedłużone myślenie. Deweloperzy mogą dostosować to za pomocą kontrolerek wysiłku na czterech poziomach: niskim, średnim, wysokim i maksymalnym.

W testach Opus 4.6 osiąga najwyższe wyniki w Terminal-Bench 2.0 dla kodowania agentywnego i prowadzi w Humanity’s Last Exam, złożonej oceny rozumowania. Anthropic twierdzi, że ma 144-punktową przewagę Elo nad GPT-5.2 w ocenie GDPval-AA i 190-punktową poprawę w porównaniu z Opus 4.5.

Cennik API pozostaje bez zmian, wynosząc 5 dolarów za milion tokenów wejściowych i 25 dolarów za milion tokenów wyjściowych, chociaż odpowiedzi przekraczające 200 000 tokenów są objęte premią w wysokości 10/37,50 dolarów.

W godny uwagi ruchu przedsiębiorstwa Anthropic ogłosiła wersję zapoznawczą Claude w Microsoft PowerPoint, gdzie model może czytać istniejące układy i szablony slajdów oraz generować lub edytować prezentacje, zachowując formatowanie marki.

OpenAI’s GPT-5.3-Codex: Model, który pomógł zbudować samego siebie

Kilka minut po ogłoszeniu Anthropic OpenAI wydała GPT-5.3-Codex, najbardziej zaawansowany model kodowania. Wersja ta łączy graniczne możliwości kodowania GPT-5.2-Codex z możliwościami rozumowania i wiedzy zawodowej GPT-5.2 w jednym systemie, który jest również o 25 procent szybszy.

Najbardziej godny uwagi fakt: GPT-5.3-Codex pomógł zbudować samego siebie. Zespół OpenAI Codex wykorzystał wczesne wersje modelu podczas procesu szkolenia — debugowania uruchomień szkoleniowych, zarządzania infrastrukturą wdrożeniową i diagnozowania wyników oceny. Jest to pierwsze publiczne potwierdzenie przez OpenAI, że model odegrał istotną rolę w swoim własnym rozwoju, co podnosi zarówno kwestie wydajności, jak i bezpieczeństwa.

GPT-5.3-Codex ustanawia nowe rekordy branży w SWE-Bench Pro i Terminal-Bench, benchmarkach, które oceniają rzeczywiste zadania inżynierii oprogramowania. Model może obsługiwać długotrwałe zadania, w tym badania, korzystanie z narzędzi i złożoną wykonywalność, a użytkownicy mogą wchodzić w interakcje z nim w trakcie zadania bez utraty kontekstu — bardziej jak współpraca z kolegą niż wydawanie poleceń.

Model jest dostępny teraz dla wszystkich użytkowników płatnych planów ChatGPT za pośrednictwem aplikacji Codex, CLI, rozszerzenia IDE i interfejsu sieciowego. Dostęp do API jest wkrótce planowany.

Dla deweloperów, którzy wybierają generatory kodu AI, obraz konkurencyjny jest teraz wyraźnie zdefiniowany: Opus 4.6 prowadzi w koordynacji agentów i pracy z długim kontekstem, podczas gdy GPT-5.3-Codex kładzie nacisk na szybkość i zintegrowane rozumowanie. Obie twierdzą, że zajmują najwyższe miejsca w nachodzących się benchmarkach, a narzędzia takie jak Cursor i Xcode Apple (AAPL ) obsługują oba, więc deweloperzy mogą swobodnie przełączać się między nimi.

OpenAI Frontier: Agenci przedsiębiorstw otrzymują własną platformę

Wraz z wydaniem modelu OpenAI wprowadziła Frontier, platformę przedsiębiorstw do tworzenia, wdrażania i zarządzania agentami AI. Frontier łączy się z bazami danych, systemami CRM, platformami HR, narzędziami do obsługi biletów i innymi aplikacjami biznesowymi, a następnie pozwala agentom AI wykonywać procesy w ramach tych aplikacji.

OpenAI opisała Frontier jako “warstwę semantyczną dla przedsiębiorstw”, gdzie pracownicy ludzcy i agenci AI działają na tej samej platformie z udostępnionym dostępem do danych i kontrolami bezpieczeństwa. Agenci otrzymują tożsamości pracowników, wspólny kontekst organizacyjny i uprawnienia na poziomie przedsiębiorstwa.

Platforma jest niezależna od modelu — firmy mogą zarządzać agentami zbudowanymi na modelach OpenAI obok tych z Google (GOOGL ), Microsoft i Anthropic. Początkowi klienci obejmują Intuit (INTU ), State Farm, Thermo Fisher i Uber.

Frontier pozycjonuje OpenAI, aby konkurować bezpośrednio z platformami przedsiębiorstw, takimi jak Agentforce Salesforce (CRM ) i agenci AI ServiceNow. Różnica polega na tym, że OpenAI buduje od warstwy modelu, podczas gdy dotychczasowi liderzy dodają AI do istniejących narzędzi workflow. Czy przedsiębiorstwa wolą infrastrukturę agenta od swojego dostawcy AI czy oprogramowania, będzie definiowało konkurencję AI w przedsiębiorstwach w 2026 roku.

Perplexity’s Model Council: Trzy modele, jedna odpowiedź

Perplexity wprowadziła Model Council, funkcję, która uruchamia ten sam zapytanie na trzech modelach jednocześnie — Claude Opus, GPT i Gemini — a następnie wykorzystuje model syntetyzujący do połączenia ich danych wyjściowych w jedną odpowiedź, która wskazuje obszary zgodności i niezgodności.

Obraz: Perplexity

Podstawą jest to, że żaden pojedynczy model nie jest niezawodnie najlepszy we wszystkich zapytaniach. Gdy trzy modele z przodu konwerują na tę samą odpowiedź, zaufanie jest wysokie. Gdy się rozbieżne, użytkownicy wiedzą, że powinni dalej badać. Model Council jest dostępny dla subskrybentów Max i jest przeznaczony do badań inwestycyjnych, analiz strategicznych i podejmowania złożonych decyzji.

Funkcja ta odzwierciedla strategię Perplexity, która różnicuje się przez orkiestrację wielomodelową, a nie budowanie modeli podstawowych. Gdy przepaść między czołowymi chatbotami AI się zmniejsza w przypadku indywidualnych benchmarków, agregacja ich danych wyjściowych może okazać się bardziej wartościowa niż wybór jednego dostawcy.

Co to wszystko znaczy

Te wydania potwierdzają, że konkurencja AI przesunęła się z możliwości modelu do infrastruktury produktu. Zarówno OpenAI, jak i Anthropic mają modele, które zajmują najwyższe miejsca w tych samych benchmarkach; różnicowanie teraz żyje w tym, co można zbudować na ich podstawie.

Perplexity, tymczasem, przedstawia cichy argument, że wojny modelowe mogą być mniej istotne niż to, jak łączy się modele. Jeśli Model Council okaże się przydatny, sugeruje to, że przyszłość nie polega na wyborze między Claude a GPT — ale na korzystaniu z obu.

Dla deweloperów i przedsiębiorstw oceniających swój stos AI, to sprawiło, że decyzja stała się trudniejsza.

xity, tymczasem, przedstawia cichy argument, że wojny modelowe mogą być mniej istotne niż to, jak łączy się modele. Jeśli Model Council okaże się przydatny, sugeruje to, że przyszłość nie polega na wyborze między Claude a GPT — ale na korzystaniu z obu. Dla deweloperów i przedsiębiorstw oceniających swój stos AI, to sprawiło, że decyzja stała się trudniejsza.

Alex McFarland jest dziennikarzem i pisarzem zajmującym się sztuczną inteligencją, który bada najnowsze rozwoje w dziedzinie sztucznej inteligencji. Współpracował z licznymi startupami i wydawnictwami związanymi z sztuczną inteligencją na całym świecie.