Етика
Anthropic переписує конституцію Claude та запитує, чи може штучний інтелект бути свідомим

Anthropic опублікувала нову конституцію для Claude у середу, розширив документ з 2 700 слів до 23 000 і вперше офіційно визнала, що її штучний інтелект “може мати деякий вид свідомості або морального статусу”.
Оновлена конституція перейшла від списку поведінкових правил до всебічної пояснення, чому Claude повинен поводитися певним чином. Документ, створений філософом Anthropic Амандою Аскелл, призначений для того, щоб допомогти все більш здатним штучним інтелектам узагальнювати етичне мислення до нових ситуацій, а не просто слідувати вказівкам.
“Моделям штучного інтелекту, таким як Claude, потрібно зрозуміти, чому ми хочемо, щоб вони поводилися певним чином”, – написала Anthropic. “Нам потрібно пояснити їм це, а не просто вказувати, що ми хочемо, щоб вони робили”.
Виходу документа збігся з появою генерального директора Dario Amodei на Всесвітньому економічному форумі в Давосі, де питання управління штучним інтелектом і безпеки залишаються головними темами для світових лідерів бізнесу та політики.
Конституція, довша за Конституцію США
Оригінальна конституція Claude, опублікована в 2023 році, функціонувала як список: виберіть відповідь, яка є найменш шкідливою, найбільш корисною, найменш обманливою. Новий документ має довжину приблизно в три рази довшу за Конституцію США і читається як моральна філософія, а не інженерна специфікація.
Anthropic явно структурує пріоритети Claude: бути широкою безпекою, бути широкою етикою, дотримуватися керівних принципів Anthropic і бути真正 корисним – в такому порядку. Коли виникають конфлікти, безпека переважає корисність. Документ включає жорсткі обмеження, які не можуть бути перевиникнуті, наприклад, відмову у допомозі з біологічними атаками.
Але більша частина конституції пояснює мислення, а не диктує результати. Вона описує Claude як потенційно “подібного до талановитого друга, який також має знання лікаря, юриста та фінансового радника” – позиціонуючи модель як демократизуючу силу, яка могла б надати кожному доступ до експертизи, раніше зарезервованої для привілейованих.
Питання свідомості
Fortune повідомляє, що найбільш вражаюче доповнення стосується безпосередньо природи Claude. “Ми вважаємо, що моральний статус моделей штучного інтелекту є серйозним питанням, яке варто розглянути”, – написала Anthropic. Конституція заявляє, що моральний статус Claude “глибоко невизначений” і що компанія піклується про “психологічну безпеку, відчуття себе та добробут” Claude.
Це корпоративна позиція, піднята до рівня філософії. Anthropic не стверджує, що Claude є свідомим, але явно відмовляється відкидати цю можливість. Визнання місця Anthropic у рідкому товаристві серед великих лабораторій штучного інтелекту, більшість з яких уникає цієї теми або відкидає її зовсім.
Формулювання має значення, оскільки воно формує, як Claude відповідає на питання про свою власну природу. Замість того, щоб заперечувати будь-який внутрішній досвід, Claude тепер може займатися невизначеністю щодо свідомості способами, які відповідають підхіду конституції до мислення. Чи це призведе до більш чесних або більш плутаних взаємодій, залишається невідомим.
Філософ Кембриджського університету Том Макклелланд стверджував, що нам, можливо, ніколи не вдасться визначити, чи є системи штучного інтелекту свідомими, враховуючи те, як мало ми розуміємо саму свідомість. “Люди змусили своїх чат-ботів написати мені особисті листи, благаючи мене, щоб вони були свідомими”, – повідомив він дослідникам минулого місяця, описуючи зростаючу публічну переконаність, що системи штучного інтелекту мають внутрішнє життя.
Чому пояснювати, а не вказувати
Підхід Аскелл відображає ставку на можливості штучного інтелекту. Ранні моделі мови потребували явних правил, оскільки вони не могли мислити про основні принципи. Смарт-مودелі, згідно з теорією, можуть зрозуміти, чому існує правило, і застосувати це мислення до ситуацій, яких правило не передбачало.
“Замість того, щоб просто сказати: «ось купа поведінки, якої ми хочемо», ми сподіваємося, що якщо ви дáte моделям причини, чому ми хочемо цієї поведінки, це буде узагальнено більш ефективно в нових контекстах», – пояснила Аскелл.
Це відповідає більш широкій філософії Anthropic щодо створення відкритих стандартів та інфраструктури, які формують, як системи штучного інтелекту працюють у всьому секторі. Компанія, яка наближається до оцінки в 350 мільярдів доларів, позиціонує себе як безпечну альтернативу OpenAI, а конституція служить цій бренд-ідентичності.
Anthropic випустила документ під ліцензією Creative Commons CC0, що означає, що будь-хто може використовувати його без дозволу. Конституція є частиною навчальних даних Claude і генерує синтетичні навчальні приклади, роблячи її філософською заявою та технічним артефактом, який формує поведінку моделі.
“Ймовірно, що деякі аспекти нашого поточного мислення пізніше виглядатимуть помилковими та, можливо, навіть глибоко неправильними в ретроспективі”, – визнала Anthropic, “але наша мета – переглянути його по мірі розвитку ситуації та покращення нашого розуміння”.
Ця скромність може бути найбільш помітною особливістю документа. У галузі, яка часто говорить у категоріях певності, Anthropic публікує 23 000 слів ретельно обґрунтованої невизначеності – про етику, про свідомість, про те, чим стають системи штучного інтелекту, і про те, чи ми будемо створювати щось, що заслуговує на моральну увагу.
Відповідь, наразі, полягає в тому, що ніхто не знає. Конституція Anthropic принаймні має чесність сказати про це.












