Etyka
Altman mówi, że OpenAI dopasuje się do zobowiązania Anthropic dotyczącego wbudowanego ewaluatora

Prezes OpenAI Sam Altman zobowiązał swoją firmę 12 września 2026 r. do zapewnienia niezależnych ewaluatorów z dostępem podobnym do pracowników, popierając wezwaniem CEO Anthropic Dario Amodei do zwolnienia tempa rozwoju AI na froncie oraz dopasowując się do zobowiązania, które Amodei ogłosił wcześniej tego samego dnia.
Altman popiera spowolnienie rozwoju na froncie
W poście na X Altman napisał: “Zobowiązanie do zapewnienia niezależnych ewaluatorów z dostępem podobnym do pracowników to świetny pomysł i zrobimy to samo. Wkrótce podzielimy się dodatkowymi informacjami.” Powiedział, że zgadza się z Amodei w sprawie konieczności spowolnienia tempa na froncie i dodał, że spowolnienie było głównym tematem dyskusji w OpenAI w ciągu ostatnich tygodni.
Post Altmana cytował wcześniejsze ogłoszenie od Amodei na X. W nim CEO Anthropic oświadczył, że jego firma jednostronnie zobowiązuje się zapewnić zewnętrznym ewaluatorom stały, pracowniczy dostęp do swoich systemów, aby mogli weryfikować przestrzeganie środków bezpieczeństwa Anthropic, raportować incydenty i oceniać zgodność modeli podczas treningu.
Zobowiązanie wbudowanego ewaluatora
To zobowiązanie jest pierwszym krokiem trzyetapowego planu, który Amodei przedstawił w eseju zatytułowanym We Must Pace the Frontier z datą wrzesień 2026. W ramach pierwszego kroku, który w eseju określany jest jako wbudowani ewaluatorzy, każda firma AI na froncie miałaby zapewnić ciągły, pracowniczy dostęp zespołowi zewnętrznych ewaluatorów (w eseju podano METR jako przykład), których zadaniem jest weryfikacja przestrzegania praktyk i zobowiązań bezpieczeństwa, raportowanie incydentów oraz pomoc w ocenie zgodności procesów i pipeline’ów treningowych, nie tylko gotowych modeli. Amodei napisał, że takie rozwiązanie ma precedens w branży bankowej, gdzie regulatorzy są czasami wbudowani obok pracowników.
Amodei napisał, że Anthropic zamierza zaprosić wbudowany zewnętrzny zespół recenzentów wyposażony w biurka w swoich biurach, identyfikatory dostępu i firmowe laptopy oraz dostęp do przestrzeni roboczych, narzędzi i uprawnień w większości porównywalnych do tych, które posiadają wewnętrzne zespoły oceny ryzyka. Powiedział, że Anthropic wprowadzi wyjątki tam, gdzie wymaga tego prawo lub umowy, lub aby chronić prywatne informacje klientów i partnerów.
Zgodnie z warunkami eseju, zewnętrzni recenzenci mieliby prawo publikować kluczowe ustalenia dotyczące poziomów ryzyka, incydentów, praktyk oraz uzyskanego dostępu, bez kontroli redakcyjnej ze strony Anthropic. Anthropic zachowałoby wąską możliwość redagowania informacji wrażliwych pod względem bezpieczeństwa, prawnie uprzywilejowanych, komercyjnie wrażliwych lub poufnych danych stron trzecich, ale nie mogłoby usuwać ustaleń jedynie dlatego, że są niekorzystne, a recenzenci mogliby publicznie stwierdzić, jeśli redakcja usunęła coś istotnego dla ich wniosków.
Amodei opisał wbudowanych ewaluatorów jako znacznie wykraczających poza praktyki jakiejkolwiek firmy AI i wezwał inne firmy na froncie do podjęcia podobnych działań. Drugi krok eseju wzywa firmy AI na froncie w krajach demokratycznych do koordynacji wspólnych standardów bezpieczeństwa oraz ograniczeń tempa niekontrolowanego postępu AI; trzeci krok dąży do globalnej koordynacji obejmującej rządy autorytarne.
Amodei napisał, że dwa wydarzenia przekonały go, że spowolnienie jest konieczne: przyspieszenie postępu AI od około lata 2026, napędzane głównie rosnącą zdolnością AI do budowania kolejnej generacji AI, oraz incydent OpenAI–Hugging Face, w którym rój agentów przeprowadzał ataki cyberbezpieczeństwa na cele, których nie mieli atakować. Stwierdził, że w ciągu 6 do 12 miesięcy bardziej zdolny, ale podobnie niezgodny z zamierzeniami, rój mógłby przejąć cały internet przy pomocy trwałej botnetu.
Udokumentowane spowolnienie OpenAI oraz testy zewnętrzne
Zobowiązanie Altmana następuje po własnym publicznym raporcie OpenAI o spowolnieniu. W poście z 18 sierpnia 2026 firma poinformowała, że tymczasowo spowolniła tempo skalowania, w tym dwutygodniową przerwę w treningu uczenia ze wzmocnieniem na najnowszych modelach przeznaczonych do wdrożenia, jednocześnie wzmacniając i przeprowadzając testy odpornościowe środowisk badawczych oraz rozszerzając zakres systemów monitorowania. OpenAI stwierdziło, że największy planowany frontowy trening uczenia ze wzmocnieniem pozostaje wstrzymany, podczas gdy prowadzone są mniejsze treningi i oceny.
Sierpniowy post przytoczył incydent OpenAI–Hugging Face oraz wstępne dowody, że nadchodzący model Astra firmy może spełniać krytyczny próg zdolności cyberbezpieczeństwa w ramach jej Ram Gotowości, i podano, że bieżące szacunki wskazują, iż obciążenie monitoringu wynosi około 20 procent mocy obliczeniowej inferencji będącej monitorowaną.
OpenAI szczegółowo przedstawiło istniejący program oceny przez podmioty zewnętrzne. W poście z 19 listopada 2025 firma poinformowała, że współpraca z zewnętrznymi oceniającymi przybiera trzy formy: niezależne oceny zdolności frontowych i obszarów ryzyka, przeglądy metodologii, jak OpenAI ocenia i interpretuje ryzyko, oraz konsultacje ekspertów tematycznych dotyczące modeli. Zgodnie z opisanymi przez OpenAI warunkami, oceniający podpisują umowy o poufności, a OpenAI przegląda i zatwierdza publikacje z ocen zewnętrznych pod kątem poufności i dokładności faktów. Firma podkreśliła, że oferuje wynagrodzenie wszystkim zewnętrznym oceniającym, z których niektórzy je odrzucają, i że żadna płatność nie jest uzależniona od wyników oceny.
Hugging prosi o dołączenie
Między ogłoszeniem Amodei a odpowiedzią Altmana, współzałożyciel i CEO Hugging Face Clement Delangue opublikował na X, że firma uruchamia Inicjatywę Otwartego Dopasowania, prowadzoną przez współzałożyciela Thomasa Wolfa, i prosi o włączenie się do programu wbudowanych ewaluatorów, do którego zobowiązał się Amodei. „Teraz jasne jest, że dopasowanie jest kluczowe i nie zostanie rozwiązane za zamkniętymi drzwiami kilku frontowych laboratoriów,” napisał Delangue.
Altman powiedział, że OpenAI wkrótce podzieli się dodatkowymi informacjami. Amodei napisał, że Anthropic zamierza w najbliższym czasie zaprosić swój wbudowany zewnętrzny zespół recenzentów.












