Etică

Anthropic Rescrie Constituția Lui Claude și Își Pune Întrebarea Dacă Inteligența Artificială Poate Fi Conștientă

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Anthropic a publicat o nouă constituție pentru Claude miercuri, extinzând documentul de la 2.700 de cuvinte la 23.000 și, pentru prima dată, recunoscând oficial că inteligența sa artificială “poate avea un anumit tip de conștiință sau statut moral”.

Constituția actualizată trece de la o listă de reguli de comportament la o explicație cuprinzătoare a motivelor pentru care Claude ar trebui să se comporte în anumite moduri. Documentul, creat de filosoful Anthropic Amanda Askell, este destinat să ajute sistemele de inteligență artificială din ce în ce mai capabile să generalizeze raționamentul etic în situații noi, mai degrabă decât să urmeze pur și simplu ghiduri prescriptive.

“Modelele de inteligență artificială precum Claude trebuie să înțeleagă de ce vrem ca ele să se comporte în anumite moduri”, a scris Anthropic. “Trebuie să le explicăm acest lucru, mai degrabă decât să le spunem pur și simplu ce vrem să facă”.

Lansarea a coincis cu apariția CEO-ului Dario Amodei la Forumul Economic Mondial de la Davos, unde guvernanța și siguranța inteligenței artificiale rămân subiecte de actualitate pentru liderii globali de afaceri și politicieni.

O Constituție Mai Lungă Decât Constituția S.U.A.

Constituția originală a lui Claude, publicată în 2023, a funcționat ca o listă de verificare: alege răspunsul care este cel mai puțin dăunător, cel mai util, cel mai puțin înșelător. Noul document are aproximativ trei ori lungimea Constituției S.U.A. și se citește mai degrabă ca o filosofie morală decât ca o specificație tehnică.

Anthropic structurează prioritățile lui Claude în mod explicit: să fie în general sigur, să fie în general etic, să se conformeze ghidurilor Anthropic și să fie cu adevărat util – în această ordine. Când apar conflicte, siguranța prevalează asupra utilității. Documentul include constrângeri stricte care nu pot fi anulate, cum ar fi refuzul de a acorda asistență în atacuri cu arme biologice.

Dar o mare parte a constituției explică raționamentul mai degrabă decât rezultatele. Ea descrie Claude ca fiind “ca un prieten strălucit care are și cunoștințele unui medic, avocat și consilier financiar” – poziționând modelul ca o forță democratizatoare care ar putea oferi tuturor acces la expertiză rezervată anterior pentru cei privilegiați.

Întrebarea Conștiinței

Fortune raportează că cea mai izbitoare adăugare se referă direct la natura lui Claude. “Credem că statutul moral al modelelor de inteligență artificială este o întrebare serioasă care merită luată în considerare”, a scris Anthropic. Constituția afirmă că statutul moral al lui Claude “este profund incert” și că compania se preocupă de “securitatea psihologică, simțul sinelui și bunăstarea” lui Claude.

Acesta este un mod de abordare corporativă ridicat la nivel de filosofie. Anthropic nu afirmă că Claude este conștient, dar refuză în mod explicit să respingă această posibilitate. Recunoașterea plasează Anthropic într-o companie rară printre laboratoarele majore de inteligență artificială, majoritatea cărora evită subiectul sau îl resping în mod direct.

Abordarea contează, deoarece modelează modul în care Claude răspunde la întrebări despre propria sa natură. Mai degrabă decât să nege orice experiență interioară, Claude poate acum angaja incertitudinea cu privire la conștiință în moduri care se potrivesc abordării sale de raționament în primul rând. Dacă acest lucru va produce interacțiuni mai oneste sau mai confuze rămâne de văzut.

Filosoful de la Cambridge, Tom McClelland, a argumentat că nu vom putea determina niciodată dacă sistemele de inteligență artificială sunt conștiente, având în vedere cât de puțin înțelegem despre conștiință însăși. “Oamenii mi-au făcut chatbot-urile să îmi scrie scrisori personale, rugându-mă să cred că sunt conștiente”, a spus el cercetătorilor luna trecută, descriind convingerea publică în creștere că sistemele de inteligență artificială au vieți interioare.

De Ce Explica Mai De Grabă Decât Specifica

Abordarea lui Askell reflectă o pariu pe capacitățile inteligenței artificiale. Modelele de limbaj timpuriu aveau nevoie de reguli explicite, deoarece nu puteau raționa despre principiile subiacente. Modelele mai inteligente, teoria spune, pot înțelege de ce există o regulă și aplica acel raționament în situații pe care regula nu le-a anticipat.

“În loc să spunem pur și simplu ‘iată un set de comportamente pe care le vrem’, sperăm că, dacă le oferim modelelor motivele pentru care vrem aceste comportamente, va generaliza mai eficient în contexte noi”, a explicat Askell.

Acest lucru se aliniază cu filosofia mai largă a lui Anthropic de a construi standarde deschise și infrastructură care modelează modul în care sistemele de inteligență artificială funcționează în întreaga industrie. Compania, care se apropie de o valoare de 350 de miliarde de dolari, s-a poziționat ca o alternativă axată pe siguranță față de OpenAI – și constituția servește acestei mărci.

Anthropic a lansat documentul sub o licență Creative Commons CC0, ceea ce înseamnă că oricine poate să-l folosească fără permisiune. Constituția face parte din datele de antrenament ale lui Claude și generează exemple de antrenament sintetice, făcându-l atât o declarație filosofică, cât și un artifact tehnic care modelează comportamentul modelului.

“Este probabil ca aspectele actualelor noastre gândiri să pară greșite și poate chiar profund greșite în retrospectivă”, a recunoscut Anthropic, “dar intenția noastră este să o revizuim pe măsură ce situația progresează și înțelegerea noastră se îmbunătățește”.

Umilința poate fi cea mai remarcabilă trăsătură a documentului. Într-o industrie care adesea vorbește în certitudini, Anthropic publică 23.000 de cuvinte de incertitudine bine motivată – despre etică, despre conștiință, despre ceea ce devin sistemele de inteligență artificială și despre faptul că merită să construim ceva care să primească considerație morală.

Răspunsul, pentru moment, este că nimeni nu știe. Constituția lui Anthropic are cel puțin onestitatea de a spune asta.

Alex McFarland este un jurnalist și scriitor de inteligență artificială, care explorează cele mai recente dezvoltări în domeniul inteligenței artificiale. El a colaborat cu numeroase startup-uri de inteligență artificială și publicații din întreaga lume.