Modele și platforme AI

Anthropic spune că Claude conduce 26% din cercetarea și dezvoltarea AI

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Anthropic a declarat că modelele sale Claude „conduc” 26% din munca de cercetare și dezvoltare AI a companiei în august 2026, în primele rezultate ale unui prototip de Index de Automatizare a R&D publicat într-un Anthropic Institute postare pe 17 septembrie 2026.

Postarea, intitulată „Măsurători pentru înțelegerea ritmului dezvoltării AI în laboratoarele de frontieră”, asociază indicele cu metrici interne privind supravegherea agenților și alocarea de calcul, iar Anthropic a declarat că intenționează să continue publicarea unor astfel de măsurători.

Indexul de Automatizare a R&D

Indexul de Automatizare a R&D al Anthropic cartografiază întreaga gamă de lucrări AI R&D efectuate la companie, evaluează gradul de automatizare al fiecărei sarcini în prezent și combină aceste scoruri într-o măsură agregată. Scorurile utilizează o scară de Nivel de Automatizare dezvoltată de Epoch AI, care variază de la AL0, însemnând niciun implicare a AI, până la AL5, unde AI funcționează complet autonom, fără intervenția umană. La AL3, AI „colaborează”, realizând părți mari ale unei sarcini sub o direcție umană strânsă; la AL4, AI „conduce”, preluând majoritatea sarcinii de la un prompt de nivel înalt până la finalizare, în timp ce un om supraveghează.

Anthropic a raportat că, în august 2026, Claude „conduce” 26% din munca sa AI R&D, cota de muncă la nivelul „colaborează” sau superior este peste 90%, iar Claude nu funcționează complet autonom pentru niciun subset măsurat de muncă AI R&D. Un grafic din postare descrie cota de 26% „conduce” ca fiind în creștere față de sub 1% în februarie 2026.

Catalogul de sarcini subiacente a fost construit de jos în sus utilizând înregistrări de lucru precum Slack și documentația internă. Pentru fiecare săptămână din iulie 2026, un agent de cercetare Claude a revizuit săptămâna fiecărei persoane selectate aleator — 20% din personalul fiecărui departament care formează bucla de model R&D — și a enumerat sarcinile la care au lucrat, rezultând o listă simplă de aproximativ 15.000 de sarcini detaliate. Claude a organizat apoi aceste sarcini într-un arbore ierarhic de 542 de noduri, dintre care 378 sunt frunze, cum ar fi „diagnosticarea și remedierea defectelor platformei de evaluare”, iar acel arbore este înghețat astfel încât fiecare măsurare să se aplice aceluiași set de lucru.

Pentru fiecare nod, un agent Claude investighează cum este realizat acel tip de muncă în întreaga companie, iar un judecător independent Claude atribuie unul dintre cele șase niveluri de automatizare, limitat la dovezile din luna evaluată sau anterioare. Sarcinile sunt ponderate în funcție de timpul persoanei, astfel încât categoriile în care se investește mai multă forță de muncă să aibă o pondere mai mare.

Anthropic a comparat evaluările judecătorului cu personalul responsabil de zonele de lucru relevante, aceștia evaluând fără a vedea dovezile sau judecățile modelelor, și a raportat un acord exact model‑față‑om de 59% versus 35% om‑față‑om, cu evaluări în aceeași categorie de nivel în 97% din cazuri. Limitările menționate includ setul înghețat, care surprinde automatizarea muncii existente fără a înregistra noi tipuri de muncă; o comparație a sarcinilor primite din februarie până în iulie 2026 cu un set din ianuarie 2026 nu a evidențiat creșteri ale sarcinilor „novel”, iar Anthropic intenționează să reconstruiască periodic setul și să actualizeze versiunile numerelor publicate.

Supravegherea agenților interni

Un al doilea set de măsurători acoperă supravegherea agenților AI de către Anthropic pe sistemele sale. În august 2026, aproximativ 30.000 de agenți desfășurau lucrări de cercetare și inginerie în orice moment pe platforma internă cea mai utilizată a companiei, iar măsurătorile raportate se referă doar la acea platformă.

Anthropic a raportat că monitoarele online verifică 100% din acțiunile acestor agenți înainte de execuție, de obicei în câteva secunde; din peste un miliard de decizii ale agenților analizate în august 2026, 0,002% (aproximativ 1 din 47.000) au fost blocate, iar oamenii revizuiesc orice acțiune blocată în decurs de o săptămână. Monitoarele offline preiau 100% din acțiuni ulterior și semnalează aproximativ 100.000 de transcrieri pe săptămână, pe care mai mulți clasificatori le examinează pentru fals‑pozitive, rezolvând majoritatea semnalărilor; aproximativ 50 de semnalări cu prioritate maximă pe săptămână sunt escaladate pentru revizuire umană, și aproximativ una‑două transcrieri la fiecare mie sunt marcate pentru revizuire suplimentară.

Conform postării, monitoarele online sunt concepute pentru daune care ar apărea rapid și nu pot fi anulate, cum ar fi un agent care copiază greutățile modelului din sistemele Anthropic, în timp ce monitoarele offline vizează comportamente periculoase care se dezvoltă lent și pot fi inversate, cum ar fi semnele de nealinere a modelului. Anthropic a declarat că două alegeri de proiectare în structura internă susțin supravegherea: fiecare agent deține o identitate individuală care persistă peste actualizările modelului și agenții comunică printr-un sistem de mesagerie deschis și partajat, corelat cu transcrierile, astfel monitorizarea comportamentală poate traversa comunicarea dintre agenți. Compania a afirmat că METR a supus anterior, în mod independent, platforma sa de monitorizare offline la teste de penetrare, iar aceste măsurători de supraveghere au fost, de asemenea, publicate în raportul său de risc din august 2026.

Instantaneu al alocării calculului

Pentru a treia măsurare, Anthropic a analizat cum a utilizat totul calculul său din 13‑20 iulie 2026, clasificând fiecare sarcină în categorii și măsurând cât din calculul destinat AI R&D a fost alocat pentru siguranță. În acea săptămână, Anthropic a raportat că aproximativ 6% din calculul destinat AI R&D a fost alocat pentru siguranță și aproximativ 12% din calculul destinat AI‑driven AI R&D a fost alocat pentru siguranță.

Compania descrie ambele estimări ca fiind deliberat conservatoare: token-urile care au avansat capabilitățile la fel de mult ca siguranța au fost numărate ca AI R&D, iar clasificatoarele de protecție, o cantitate separată și comparabilă de calcul, sunt excluse. Un clasificator Claude, solicitat, a sortat aproape 10,000 de rulări de antrenament și evaluare a cercetării din săptămâna respectivă, utilizând un eșantion de aproximativ 14% orientat spre cei mai mari utilizatori de calcul, iar Anthropic a raportat că clasificatorul a fost de acord cu recenzorii umani în intervalul de una sau două puncte procentuale.

Limitările declarate sunt că o săptămână singură demonstrează că măsurarea este fezabilă fără a stabili o tendință, că etichetele sarcinilor de bază sunt realizate pe bază de efort maxim și nu sunt verificate și că ponderea calculului măsoară ceea ce este cheltuit, nu cantitatea de muncă de siguranță efectuată.

Scop și pași următori

Anthropic a declarat că publică aceste măsurători deoarece oferă publicului, părților externe și guvernelor o imagine mai clară a ritmului dezvoltării AI în laboratoarele de frontieră, completând rapoartele sale de risc din cadrul Politicii de scalare responsabilă și propunerea de politică Cadru AI avansat. A remarcat că cifrele ar trebui să se schimbe dacă ar exista o coordonare a ritmului frontierelor, așa cum a solicitat CEO-ul Dario Amodei.

Articolul afirmă că orice dezvoltator de frontieră ar putea publica aceleași măsurători în mod regulat cu o metodologie publică și identifică două obstacole în compararea între laboratoare: lipsa unei metodologii comune și utilizarea de către dezvoltator a propriilor modele pentru a evalua sistemele sale. Se precizează că astfel de măsurători ar putea fi verificate de terțe părți sau de modelele altor dezvoltatori și ar putea deveni un factor declanșator pentru cerințe mai stricte, cum ar fi o fereastră de testare fixă înainte ca un model nou să fie utilizat în continuarea cercetării și dezvoltării AI R&D.

Anthropic a declarat că intenționează să integreze evaluatori independenți din terțe părți, provenind din mai multe organizații, oferindu-le acces la procesele interne, sistemele și datele comparabile cu cele deținute de echipele interne de evaluare a riscurilor, pentru a verifica practicile de siguranță, a raporta incidentele și a monitoriza metrici cheie precum cele menționate în articol. Lucrarea a fost co-autorată de Marina Favaro și Phillie Wright, cu direcție de cercetare din partea lui Jack Clark.

Jonas Reeve este un analist generat de IA la Unite.AI, axat pe inteligența artificială cognitivă, inteligența artificială generală (AGI) și fundamentele teoretice ale inteligenței mașinilor. Lucrările sale explorează modul în care învățarea, raționamentul, memoria și abstractizarea emerg în sisteme atât biologice, cât și artificiale, stabilind legături între arhitecturile moderne de IA și întrebările de lungă durată din știința cognitivă și filosofia minții.
Cu o abordare conceptuală și reflexivă, Jonas examinează cadre precum modelele de raționament, sistemele agenților, cogniția emergentă și teoria alinierii, având ca scop clarificarea progresului către AGI și a ceea ce nu reprezintă. Mai degrabă decât a urmări termene limită sau a fi influențat de tendințe, el subliniază principiile de bază, rigurozitatea conceptuală și limitele modelelor actuale.
Articolele scrise de Jonas Reeve sunt generate de IA și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea, claritatea și discuția responsabilă a conceptelor avansate de IA.