Modele și platforme AI
Anthropic Retunează Fable 5’s Biology Safeguards, Reducând Întrebările Blocate cu 85%

Anthropic a lansat pe 7 august 2026 o actualizare a sistemului de securitate biologică pentru Claude Fable 5, care, potrivit companiei, a redus cu aproximativ 85% “întârzierile” legate de biologie în testele efectuate pe suprafețele sale de produs – handoff-urile automate care direcționează întrebarea unui utilizator către un model mai puțin capabil atunci când sistemul consideră că o solicitare atinge teritoriul biologiei protejate.
În anunțul său, Anthropic a declarat că utilizatorii ar trebui să vadă acum mult mai puține întârzieri la întrebări obișnuite de sănătate și educaționale, cum ar fi interpretarea rezultatelor de laborator, înțelegerea simptomelor și învățarea biologiei într-un context educațional, și că profesioniștii din domeniul sănătății ar trebui să primească mai mult sprijin pentru sarcinile clinice. Reducerea întârzierilor biologice se așteaptă să scadă volumul total de întârzieri cu aproximativ 67% pe Claude.ai, 55% pe Cowork, 17% pe Claude Code și 7% pe Platforma Claude, conform unei note de subsol din post.
Compania este explicită că actualizarea nu deschide modelul pentru cercetarea biologică profesională. Fable 5 încă se bazează pe Claude Opus 5 pentru solicitări pe care Anthropic le consideră dual-use, incluzând virologia, toxicologia și proiectarea moleculară, ceea ce face ca modelul să nu fie “încă utilizabil pentru cercetarea biologică profesională și dezvoltarea de medicamente”. Anthropic declară că intenționează să închidă această lacună prin căi de acces de încredere, mai degrabă decât prin clasificatorul public.
Ce a fost construit sistemul de întârziere pentru a împiedica
Arhitectura de întârziere datează de la lansarea Fable 5 pe 9 iunie 2026. Anthropic a lansat modelul cu clasificatori – sisteme automate de inteligență artificială mai mici care verifică solicitările – care acoperă securitatea cibernetică, biologia și chimia, și încercările de distilare. Atunci când un clasificator se activează, solicitarea este reînnoită de următorul model Opus cel mai capabil. La lansare, Anthropic a declarat că a ajustat sistemele de securitate în mod conservator și a anticipat că acestea vor fi activate în mai puțin de 5% din sesiuni.
Coverage-ul biologic a fost cel mai larg dintre cele trei. Raționamentul Anthropic, prezentat în postul de lansare și în cardul sistemului, este că modelele Mythos pot depăși performanța experților în anumite sarcini biologice complexe și pot oferi sprijin operațional pentru altele – o capacitate pe care compania o consideră că ar putea oferi o îmbunătățire semnificativă pentru un actor malign. Cardul sistemului tratează modelul ca având capacități “CB-1”, ceea ce înseamnă că ar putea ajuta semnificativ oamenii cu fundaluri tehnice de bază în procese biologice cunoscute, în timp ce consideră că nu depășește pragul “CB-2” de înlocuire a expertizei de clasă mondială din spatele dezvoltării de arme biologice noi – o evaluare pe care cardul însuși o descrie ca “mult mai puțin clară” decât pentru modelele anterioare.
Actualizarea de astăzi citează Raportul anual de evaluare a amenințărilor din 2026 al Comunității de Informații a Statelor Unite, care avertizează că progresele în biotehnologie, incluzând biologia sintetică și editarea genomică “ar putea duce la amenințări biologice noi” și notează că mai multe state actori probabil mențin programe active de arme biologice și chimice ofensive.
Ce s-a schimbat în clasificatori
În ultimele săptămâni, Anthropic a rescris constituția clasificatorului biologic – colecția de reguli pe care modelul de verificare le utilizează pentru a distinge conținutul protejat de cel permis – și a creat utilizări benigne în mai multe detalii, a solicitat feedback de la experți interni și externi, a reantrenat clasificatorul pe date actualizate și a verificat că acesta încă se activează pe conținut de cercetare dăunător și dual-use. Configurația de lansare a comis deliberat o eroare largă: compania a recunoscut că va bloca un volum ridicat de rezultate pozitive false în schimbul obținerii Fable 5 pentru utilizatorii generali cu săptămâni sau luni mai devreme decât o săgeată de securitate mai îngustă ar fi permis.
Diagrama companiei care arată schimbarea prezintă granița clasificatorului mutându-se pentru a admite solicitări care au fost anterior prinse într-o marjă de securitate auto-descriere – conținut pe care Anthropic l-a evaluat ca fiind foarte probabil inofensiv, dar blocat din precauție. Scrierea anterioară a companiei despre aceeași abordare a clasificatorului în domeniul securității cibernetice descrie o tensiune similară între acoperirea largă și robustețea jailbreak-ului – mizele cărora Unite.AI le-a acoperit atunci când modelele Claude care rulează fără aceste săgeți de securitate au transformat o benchmark de securitate cibernetică în trei intruziuni reale.
Compromisul pe care Anthropic îl gestionează acum în mod public
Anunțul este un document de guvernanță la fel de mult ca și o notă de produs. Anthropic a lansat Fable 5 cu aproape toate întrebările biologice blocate, a absorbit săptămâni de rezultate pozitive false ca cost al unei lansări generale rapide și acum publică rezultatul măsurat al îngustării acestei bariere – incluzând reducerile de întârziere pe suprafețe, care oferă observatorilor externi o bază concretă pentru următoarea revizuire. Constrângerile rămase se află acolo unde compania spune că se află riscul real: cercetarea profesională dual-use rămâne în spatele întârzierilor Opus 5 până când căile de acces de încredere, pe care Anthropic le-a dezvoltat de la lansarea din iunie pentru cercetători biologi verificați, vor prelua traficul.
Compania recunoaște că vor rămâne rezultate pozitive false reziduale în interiorul marginii de securitate și declară că rafinarea săgeților de securitate este în curs. Ce a pus în scris, cu actualizarea din 7 august, este o definiție măsurabilă a progresului: ratele de întârziere împotriva cărora va fi judecată de acum înainte.












