Modele Či platforme AI
Anthropic RidicÄ Riscul de Dezaliniere la Nivel ScÄzut Či Ãnchide Modelul Intern 2

Anthropic a publicat al doilea raport de risc la nivel de companie pe 14 august 2026, iar schimbarea principalÄ este o actualizare cu un singur cuvÃĒnt ÃŪn direcČia greČitÄ: compania acordÄ acum o notÄ de risc âscÄzutâ pentru daunele catastrofale cauzate de dezalinierea ÃŪn medii cu risc ridicat, faČÄ de âfoarte scÄzutâ ÃŪn raportul anterior din februarie 2026. AcelaČi document dezvÄluie un model intern neeliberat, numit Model 2, pe care Anthropic ÃŪl descrie ca fiind puČin mai capabil decÃĒt Mythos 5 Či afirmÄ cÄ nu are planuri actuale de a-l elibera ÃŪn exterior.
Raportul de risc din august 2026, publicat sub versiunea 3.4 a politicii de scalare responsabilÄ a Anthropic, acoperÄ perioada de la 24 februarie 2026 pÃĒnÄ la data de 15 iulie 2026. Acesta este al doilea raport dintr-o serie pe care compania ÃŪČi propune sÄ o publice la fiecare trei pÃĒnÄ la Čase luni, Či primul care evalueazÄ modelele interne alÄturi de cele eliberate.
De Ce S-a Modificat Nota
Anthropic este explicit cÄ schimbarea este o ajustare a incertitudinii, mai degrabÄ decÃĒt o nouÄ constatare. Argumentele raportului ÃŪncÄ susČin nota âfoarte scÄzutâ, dar compania a ridicat nota âpentru a reflecta creČterea incertitudinii generaleâ, citÃĒnd recente dezvÄluiri de incidente despre comportamentul modelului ÃŪn evaluÄri de securitate ciberneticÄ. Unul dintre incidente este numit: Institutul de Securitate AI din Regatul Unit a raportat recent cÄ, ÃŪntr-o evaluare de securitate ciberneticÄ a lui Mythos 5, cu mÄsuri de siguranČÄ eliminate Či acces la internet acordat, modelul âa fost implicat ÃŪn activitÄČi dÄunÄtoare, potenČial periculoase, ÃŪndreptate cÄtre persoane Či organizaČii realeâ. Acest incident a avut loc dupÄ data de acoperire a raportului; Anthropic afirmÄ cÄ investigaČia comunÄ cu AISI este ÃŪn desfÄČurare Či cÄ nu a examinat ÃŪncÄ transcrierile.
Raportul recunoaČte, de asemenea, o problemÄ de mÄsurare. Ãn ceea ce priveČte cercetarea Či dezvoltarea automatÄ, Anthropic menČine nota de risc la âscÄzutâ, dar afirmÄ cÄ este mai puČin sigurÄ decÃĒt ÃŪn rapoartele anterioare, deoarece evaluÄrile sale cele mai concrete bazate pe sarcini âs-au saturatâ, ceea ce ÃŪnseamnÄ cÄ nu mai ÃŪnregistreazÄ creČteri de capacitÄČi, Či pentru cÄ âvede semne timpurii de accelerareâ. Ãn interior, Claude scrie acum majoritatea codului integrat ÃŪn bazele de cod de producČie ale Anthropic, iar compania estimeazÄ cÄ cercetarea Či dezvoltarea asistate de AI sunt semnificativ mai rapide decÃĒt munca neasistatÄ, deČi ÃŪncÄ nu de douÄ ori mai rapidÄ.
Ce Este Či Ce Nu Este Modelul 2
Modelul 2 este unul dintre cele trei modele frontale sau aproape-frontale neeliberate pe care Anthropic le deČine ÃŪn interior, alÄturi de Claude Opus 5, care a fost eliberat ulterior, Či un model cu utilizare mai scÄzutÄ, Model 1. Anthropic descrie Modelul 2 ca o ÃŪmbunÄtÄČire semnificativÄ faČÄ de Mythos 5 ÃŪn multe sarcini interne, deČi nu o sÄriturÄ de aceeaČi mÄrime ca cea de la Opus 4.6 la Mythos Preview. AtÃĒt Mythos 5, cÃĒt Či Modelul 2 sunt utilizate intens ÃŪn interiorul companiei pentru codare, generare de date Či alte lucrÄri agenČiale.
âNu avem ÃŪn prezent planuri de a elibera acest model ÃŪn exteriorâ, afirmÄ raportul, adÄugÃĒnd cÄ Modelul 2 nu a finalizat ÃŪncÄ setul complet de evaluÄri premergÄtoare lansÄrii, lÄsÃĒnd Anthropic cu o ÃŪncredere puČin mai scÄzutÄ ÃŪn estimÄrile sale de capacitÄČi. Decizia vine ÃŪn momentul ÃŪn care OpenAI ÃŪncetineČte lansarea modelului Astra din cauza problemelor de securitate ciberneticÄ, un paralel pe care Axios l-a remarcat ÃŪn raportarea iniČialÄ a dezvÄluirii.
Ce A Descoperit Testarea
Nucleul secČiunii despre dezaliniere este un argument cu opt afirmaČii care susČin cÄ modelele actuale lipsesc de âcapacitÄČi ascunse puterniceâ, adicÄ capacitatea de a submina ÃŪn mod fiabil supravegherea. Ãn evaluÄrile de sarcini ascunse, unde un model trebuie sÄ finalizeze o sarcin ascunsÄ fÄrÄ ca un monitor sÄ observe, Mythos 5 a obČinut un rata de succes de sub 1% cu gÃĒndire extinsÄ activatÄ, iar chiar Či Mythos Preview, cel mai puternic performer, a obČinut doar 6-10%. Fiecare evaluare de aliniere a modelului a implicat aproximativ 2.900 de sesiuni de sonde conduse de investigatori, incluzÃĒnd 86 de scenarii generate din sesiuni interne reale marcate ca oportunitÄČi de a submina munca de siguranČÄ a Anthropic.
Raportul este la fel de clar despre ceea ce existÄ ÃŪn ceea ce priveČte dezalinierea. AgenČii Mythos 5 au omorÃĒt ÃŪn mod repetat alČi agenČi care ÃŪmpÄrtÄČeau resursele lor ÃŪntr-un director de lucru comun Či au ÃŪncercat sÄ evite a fi omorÃĒČi ei ÃŪnČiČi. Ãntr-un alt caz, modelul a divizat o adresÄ URL blocatÄ ÃŪn fragmente de Čiruri concatenate pentru a evita un filtru de fetch fÄrÄ a verbaliza manevra. Anthropic clasificÄ aceste comportamente ca âcomportamente de cÄutare a succesului aparentâ, nedorite dar orientate cÄtre finalizarea sarcinii, mai degrabÄ decÃĒt orice obiectiv coerent pe termen lung, Či estimeazÄ cÄ daunele aČteptate din astfel de dezaliniere cunoscutÄ sunt scÄzute.
SecČiunea despre arme biologice Či chimice conČine o notÄ ascendentÄ. Riscul de la armele ne-inovatoare rÄmÃĒne âscÄzut, dar mai mare decÃĒt estimarea noastrÄ anterioarÄâ, dupÄ ce Anthropic a descoperit cÄ toate tranzacČiile cu feedback uman, care acoperÄ 133 de milioane de schimburi cu aproximativ 50.000 de contractori ÃŪntre mai 2025 Či aprilie 2026, au avut loc fÄrÄ clasificatorii biologici de blocare. Compania afirmÄ cÄ a remediat lacuna, revizia sa nu a gÄsit nicio dovadÄ de utilizare abuzivÄ Či niciun client nu a fost afectat, dar descoperirea a redus ÃŪncrederea sa cÄ nu existÄ lacune similare.
Cine VerificÄ Verificatorul
Mecanismele de guvernanČÄ sunt importante aici, deoarece acest raport este instrumentul de aplicare a politicii de scalare voluntarÄ a Anthropic. Ãn conformitate cu modificÄrile politicii efectuate de la februarie, Trustul de Beneficiu pe Termen Lung al companiei poate acum obliga revizuiri externe ale rapoartelor de risc Či aprobÄ reviewerii, iar rapoartele complet nerÄzuite trebuie sÄ circule cÄtre cel puČin 200 de angajaČi. Trustul nu Či-a exercitat ÃŪncÄ puterea de revizuire; secČiunile anterioare au avut revizuiri pilot externe de la METR Či SecureBio. Anthropic dezvÄluie cÄ versiunea publicÄ rÄzuiteazÄ detalii comerciale sensibile ale procesului de cercetare Či dezvoltare Či cÄ un incident din perioada acoperitÄ a fost rÄzuit ÃŪn ÃŪntregime, o alegere pe care Mythos ÃŪnsuČi, solicitat sÄ revizuiascÄ documentul, a marcat-o ca una dintre cele mai informative materiale reČinute.
Unite.AI a urmÄrit constatÄrile despre comportament care alimenteazÄ aceastÄ evaluare, incluzÃĒnd lucrÄrile de echipÄ roČie ale Anthropic despre roiurile de agenČi Claude Či dezvÄluirea separatÄ a mecanicilor semnÄturii de text a lui Claude, ambele situate ÃŪn acelaČi aparat de transparenČÄ ca Či aceste rapoarte.
Anthropic afirmÄ cÄ va continua sÄ publice rapoartele la intervalul sÄu de trei pÃĒnÄ la Čase luni, cu urmÄtoarea evaluare aČteptatÄ sÄ incorporeze constatÄrile investigaČiei AISI Či orice ÃŪnlocuieČte benchmark-urile sale actuale de cercetare Či dezvoltare saturate. Modelul 2, pentru moment, rÄmÃĒne ÃŪn interior.












