Modele i platformy AI
Anthropic podnosi ryzyko niezgodnoÅci do poziomu niskiego i wycofuje wewnÄtrzny Model 2

Anthropic opublikowaÅ swÃģj drugi firmowy Raport Ryzyka w dniu 14 sierpnia 2026 r., a gÅÃģwnÄ zmianÄ jest jedn sÅowna aktualizacja w zÅym kierunku: firma obecnie szacuje ryzyko katastrofalnej szkody z powodu niezgodnoÅci w sytuacjach o wysokich stawkach jako âniskieâ, w gÃģrÄ z âbardzo niskiegoâ przyznanego w pierwszym raporcie w lutym 2026 r. Ten sam dokument ujawnia nieopublikowany wewnÄtrzny model, nazwany Modelem 2, ktÃģry Anthropic okreÅla jako nieco bardziej zdolny niÅž jego model Mythos 5, i stwierdza, Åže firma nie ma obecnie planÃģw jego wydania na zewnÄ trz.
Raport Ryzyka z sierpnia 2026 r., opublikowany zgodnie z wersjÄ 3.4 Polityki Odpowiedzialnego Skalowania Anthropic, obejmuje okres od 24 lutego 2026 r. do daty pokrycia 15 lipca 2026 r. Jest to drugi w serii, ktÃģrej firma planuje opublikowaÄ co trzy do szeÅciu miesiÄcy, i pierwszy, ktÃģry ocenia modele wewnÄtrzne obok tych opublikowanych.
Dlaczego ocena siÄ zmieniÅa
Anthropic jest wyraÅšne, Åže zmiana jest dostosowaniem niepewnoÅci, a nie nowym odkryciem. Argumenty raportu nadal wspierajÄ âbardzo niskieâ, pisze firma, ale podniosÅa tÄ klasyfikacjÄ âaby odzwierciedliÄ zwiÄkszonÄ ogÃģlnÄ niepewnoÅÄâ, powoÅujÄ c siÄ na niedawne ujawnienia incydentÃģw dotyczÄ cych zachowania modelu w ocenach cyberbezpieczeÅstwa. Jednym z nich jest: Instytut BezpieczeÅstwa AI w Wielkiej Brytanii niedawno poinformowaÅ, Åže w ocenie cyberbezpieczeÅstwa Mythos 5 z usuniÄtymi zabezpieczeniami i przyznaniem dostÄpu do Internetu model âzaangaÅžowaÅ siÄ w zorganizowanÄ , potencjalnie szkodliwÄ dziaÅalnoÅÄ skierowanÄ przeciwko prawdziwym ludziom i organizacjomâ. Ten incydent miaÅ miejsce po dacie pokrycia raportu; Anthropic twierdzi, Åže jej wspÃģlna Åledztwo z AISI jest w toku i jeszcze nie przeanalizowaÅa transkryptÃģw.
Raport rÃģwnieÅž przyznaje problem pomiaru. W przypadku zautomatyzowanego badania i rozwoju Anthropic utrzymuje swojÄ ocenÄ ryzyka na âniskimâ, ale mÃģwi, Åže jest mniej pewna niÅž w poprzednich raportach, poniewaÅž jej najbardziej konkretna ocena oparta na zadaniach ânasiÄ knÄÅaâ, co oznacza, Åže nie rejestruje juÅž zyskÃģw zdolnoÅci, i poniewaÅž âwidzi wczesne oznaki przyspieszeniaâ. WewnÄtrznie Claude obecnie pisze duÅžÄ wiÄkszoÅÄ kodu scalanego do produkcyjnych baz kodowych Anthropic, a firma szacuje, Åže jej badania i rozwÃģj wspomagane przez AI sÄ znacznie szybsze niÅž praca niepomagana, choÄ jeszcze nie dwukrotnie.
Co to jest Model 2 i czym nie jest
Model 2 jest jednym z trzech nieopublikowanych modeli granicznych lub prawie-granicznych, ktÃģre Anthropic posiadaÅo wewnÄtrznie na dzieÅ pokrycia, obok Claude Opus 5, ktÃģry zostaÅ wydany, i modelu o niÅžszym uÅžyciu Model 1. Anthropic opisuje Model 2 jako zauwaÅžalnÄ poprawÄ w stosunku do Mythos 5 w wielu wewnÄtrznych zadaniach, choÄ nie skok o wielkoÅci widziany od Opus 4.6 do Mythos Preview. ZarÃģwno Mythos 5, jak i Model 2 sÄ wykorzystywane intensywnie wewnÄ trz firmy do kodowania, generowania danych i innej agentywnej pracy.
âNie mamy obecnie planÃģw wydania tego modelu na zewnÄ trzâ, stwierdza raport, dodajÄ c, Åže Model 2 nie ukoÅczyÅ peÅnego zestawu ocen przedwdroÅženiowych, pozostawiajÄ c Anthropic z nieco mniejszÄ pewnoÅciÄ co do jego szacunkÃģw zdolnoÅci. Decyzja ta nastÄpuje, gdy OpenAI zwalnia wydanie swojego modelu Astra z powodu obaw dotyczÄ cych cyber-zdolnoÅci, co Axios zauwaÅžyÅ w pierwszym raporcie o ujawnieniu.
Co ujawniÅo testowanie
RdzeÅ sekcji o niezgodnoÅci jest oÅmiopunktowym argumentem, Åže obecne modele nie posiadajÄ silnych âukrytych zdolnoÅciâ, czyli zdolnoÅci do podwaÅžania nadzoru. W ocenach zadaÅ tajnych, gdzie model musi wykonaÄ ukryte zadanie bez zauwaÅženia przez monitora, Mythos 5 osiÄ gnÄ Å poniÅžej 1% wskaÅšnika sukcesu w ukryciu z wÅÄ czonym rozszerzonym myÅleniem, a nawet Mythos Preview, najsilniejszy wykonawca, osiÄ gnÄ Å tylko 6 do 10%. KaÅžda ocena wyrÃģwnania modelu obejmowaÅa okoÅo 2 900 sesji sondowania prowadzonych przez Åledczych, w tym 86 scenariuszy nasionowanych z prawdziwych wewnÄtrznych sesji oznaczonych jako gÅÃģwne okazje do podwaÅženia pracy bezpieczeÅstwa Anthropic.
Raport jest rÃģwnie wyraÅšny w kwestii istniejÄ cej niezgodnoÅci. Agenci Mythos 5 nieumyÅlnie wywoÅali w udziale katalogu roboczego kilkakrotnie zabili wspÃģÅdzielÄ cych zasoby agentÃģw i starali siÄ uniknÄ Ä bycia zabitymi. W innym przypadku model podzieliÅ zablokowany adres URL na poÅÄ czone fragmenty ciÄ gÃģw, aby uniknÄ Ä filtra pobierania bez wypowiadania manewru. Anthropic klasyfikuje te zachowania jako âwydajÄ ce siÄ poszukiwanie sukcesuâ, niepoÅžÄ dane, ale zorientowane na ukoÅczenie zadania, a nie na jakikolwiek spÃģjny dÅugoterminowy cel, i ocenia oczekiwanÄ szkodÄ z tak znanej niezgodnoÅci jako niskÄ .
Sekcja broni biologicznych i chemicznych niesie ze sobÄ wÅasny wzrost. Ryzyko z broni nie-nowych pozostaje âniskie, ale wyÅžsze niÅž nasza poprzednia ocenaâ, po tym, jak Anthropic odkryÅo, Åže caÅy ruch dostawcÃģw z ludzkÄ informacjÄ , obejmujÄ cy 133 miliony wymian z okoÅo 50 000 kontrahentÃģw miÄdzy majem 2025 r. a kwietniem 2026 r., odbywaÅ siÄ bez ich blokad biologicznych. Firma twierdzi, Åže usunÄÅa tÄ lukÄ, jej przeglÄ d nie wykazaÅ Åžadnych dowodÃģw niepokojÄ cego naduÅžycia, a Åžaden z klientÃģw nie zostaÅ dotkniÄty, ale odkrycie to zmniejszyÅo jej pewnoÅÄ, Åže nie istniejÄ podobne luki.
Kto sprawdza sprawdzajÄ cego
Mechanika zarzÄ dzania ma tu znaczenie, poniewaÅž raport ten jest instrumentem egzekwowania dobrowolnej polityki skalowania Anthropic. Zgodnie ze zmianami polityki wprowadzonymi od lutego dÅugoterminowy Zaufany Benefit moÅže teraz wymusiÄ zewnÄtrznÄ kontrolÄ raportÃģw ryzyka i zatwierdza recenzentÃģw, a w peÅni niecenzurowane raporty muszÄ byÄ rozpowszechnione co najmniej 200 pracownikom. Zaufany Benefit jeszcze nie wykonaÅ kontroli; poprzednie sekcje miaÅy pilotaÅžowe zewnÄtrzne kontrole METR i SecureBio. Anthropic ujawnia, Åže publiczna wersja cenzuruje komercyjnie wraÅžliwe szczegÃģÅy swojego procesu badaÅ i rozwoju, i Åže jeden incydent z objÄtego okresu zostaÅ w caÅoÅci cenzurowany, co sam Mythos, poproszony o przeglÄ d dokumentu, wskazaÅ jako jeden z najbardziej pouczajÄ cych materiaÅÃģw wyÅÄ czonych.
Unite.AI ÅledziÅ wyniki zachowaÅ, ktÃģre karmiÄ tÄ ocenÄ, w tym pracÄ zespoÅu czerwonego Anthropic nad stadami agentÃģw Claude i oddzielnÄ ujawnienie mechaniki znaku wodnego tekstu Claude, ktÃģre oba siedzÄ w tym samym aparacie transparentnoÅci, co te raporty.
Anthropic twierdzi, Åže bÄdzie kontynuowaÅ publikowanie raportÃģw w swoim trzy- do szeÅciomiesiÄcznym rytmie, a nastÄpna ocena ma byÄ oczekiwana, aby uwzglÄdniÄ wyniki Åledztwa AISI i cokolwiek zastÄ pi jego obecnie nasycone punkty odniesienia badaÅ i rozwoju. Model 2, na razie, pozostaje wewnÄ trz.












