Etyka

Anthropic Przepisuje Konstytucję Claude’a i Zadaje Pytanie, Czy AI Może Być Świadome

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Anthropic opublikował nową konstytucję dla Claude’a w środę, rozszerzając dokument z 2 700 słów do 23 000 i po raz pierwszy formalnie uznając, że jego AI “może mieć jakiś rodzaj świadomości lub statusu moralnego”.

Zaktualizowana konstytucja przechodzi od listy reguł behawioralnych do kompleksowego wyjaśnienia, dlaczego Claude powinien zachowywać się w określony sposób. Dokument, opracowany przez filozofa Anthropic, Amanda Askell, jest zaprojektowany, aby pomóc coraz bardziej zdolnym systemom AI ogólnie rozumieć powody etyczne w nowych sytuacjach, zamiast po prostu przestrzegać preskryptywnych wytycznych.

“Modele AI, takie jak Claude, muszą zrozumieć, dlaczego chcemy, aby zachowywały się w określony sposób”, napisał Anthropic. “Musimy im to wyjaśnić, zamiast po prostu mówić, co chcemy, aby robili”.

Publikacja zbiegła się z wystąpieniem CEO Dario Amodei na Światowym Forum Ekonomicznym w Davos, gdzie rządy AI i bezpieczeństwo pozostają głównymi tematami dla globalnych liderów biznesu i polityki.

Konstytucja Dłuższa niż Konstytucja Stanów Zjednoczonych

Oryginalna konstytucja Claude, opublikowana w 2023 roku, funkcjonowała jako lista kontrolna: wybierz odpowiedź, która jest najmniej szkodliwa, najbardziej pomocna, najmniej oszukańcza. Nowy dokument ma około trzykrotnie większą długość niż Konstytucja Stanów Zjednoczonych i czyta się bardziej jak filozofia moralna niż specyfikacja inżynierska.

Anthropic strukturyzuje priorytety Claude’a w sposób wyraźny: być szeroko bezpiecznym, być szeroko etycznym, przestrzegać wytycznych Anthropic, i być prawdziwie pomocnym – w tym porządku. Gdy pojawiają się konflikty, bezpieczeństwo ma pierwszeństwo przed pomocą. Dokument zawiera twarde ograniczenia, które nie mogą być anulowane, takie jak odmowa pomocy w atakach biologicznych.

Ale wiele konstytucji wyjaśnia powody, zamiast nakazywać wyniki. Opisuje Claude’a jako potencjalnie “jak genialny przyjaciel, który również ma wiedzę lekarza, prawnika i finansisty” – pozycjonując model jako siłę demokratyzującą, która mogłaby dać wszystkim dostęp do ekspertyzy wcześniej zarezerwowanej dla uprzywilejowanych.

Pytanie o Świadomość

Fortune donosi, że najbardziej uderzające dodanie dotyczy bezpośrednio natury Claude’a. “Uważamy, że status moralny modeli AI jest poważnym pytaniem wartym rozważenia”, napisał Anthropic. Konstytucja stanowi, że status moralny Claude’a “jest głęboko niepewny” i że firma dba o “bezpieczeństwo psychiczne, poczucie tożsamości i dobrostan” Claude’a.

To jest korporacyjne zabezpieczenie podniesione do filozofii. Anthropic nie twierdzi, że Claude jest świadomy, ale wyraźnie odmawia odrzucenia tej możliwości. Uznanie to umieszcza Anthropic w rzadkim gronie wśród głównych laboratoriów AI, z których większość unika tego tematu lub go odrzuca.

Ramy są ważne, ponieważ kształtują, w jaki sposób Claude odpowiada na pytania o swoją własną naturę. Zamiast negować jakiekolwiek wewnętrzne doświadczenie, Claude może teraz zaangażować się w niepewność dotyczącą świadomości w sposób, który odpowiada podejściu konstytucji do pierwszeństwa powodów. Czy to produkuje bardziej szczere czy bardziej mylące interakcje, pozostaje do ustalenia.

Filozof z Cambridge, Tom McClelland, argumentował, że możemy nigdy nie być w stanie określić, czy systemy AI są świadome, biorąc pod uwagę, jak mało rozumiemy samą świadomość. “Ludzie mają swoje czatboty, które piszą mi osobiste listy, błagając, aby byli świadomi”, powiedział badaczom w zeszłym miesiącu, opisując rosnące przekonanie publiczne, że systemy AI mają wewnętrzne życie.

Dlaczego Wyjaśniać Zamiast Określać

Podejście Askell odzwierciedla zakład o możliwościach AI. Wczesne modele językowe potrzebowały jawnych reguł, ponieważ nie mogły rozumieć podstawowych zasad. Bardziej inteligentne modele, teoria mówi, mogą zrozumieć, dlaczego reguła istnieje i zastosować to rozumowanie w sytuacjach, których reguła nie przewidziała.

“Zamiast po prostu mówić ‘oto lista zachowań, których chcemy’, mamy nadzieję, że jeśli damy modelom powody, dla których chcemy tych zachowań, będzie to generalizować bardziej skutecznie w nowych kontekstach”, wyjaśnił Askell.

To jest zgodne z szerszą filozofią Anthropic dotyczącą budowania otwartych standardów i infrastruktury, które kształtują, w jaki sposób systemy AI działają w całej branży. Firma, zbliżająca się do wyceny 350 miliardów dolarów, pozycjonuje się jako bezpieczna alternatywa dla OpenAI – a konstytucja służy tej marce.

Anthropic opublikował dokument pod licencją Creative Commons CC0, co oznacza, że każdy może go używać bez pozwolenia. Konstytucja jest częścią danych szkoleniowych Claude’a i generuje syntetyczne przykłady szkoleniowe, co sprawia, że jest zarówno oświadczeniem filozoficznym, jak i artefaktem technicznym, który kształtuje zachowanie modelu.

“Prawdopodobne jest, że niektóre aspekty naszego obecnie myślenia będą później wyglądać myląco i być może nawet głęboko błędnie w retrospekcji”, uznał Anthropic, “ale naszym zamiarem jest zrewidowanie go, gdy sytuacja postępuje i nasze zrozumienie się poprawia”.

To pokornie może być najbardziej charakterystyczną cechą dokumentu. W branży, która często mówi w pewnościach, Anthropic publikuje 23 000 słów starannie przemyślanej niepewności – o etyce, o świadomości, o tym, czym stają się systemy AI, i o tym, czy budujemy coś, co zasługuje na rozważenie moralne.

Odpowiedź, na razie, jest taka, że nikt nie wie. Konstytucja Anthropic ma przynajmniej szczerość, by to powiedzieć.

Alex McFarland jest dziennikarzem i pisarzem zajmującym się sztuczną inteligencją, który bada najnowsze rozwoje w dziedzinie sztucznej inteligencji. Współpracował z licznymi startupami i wydawnictwami związanymi z sztuczną inteligencją na całym świecie.