Đạo đức

Anthropic viết lại Hiến pháp Claude và đặt câu hỏi liệu AI có thể có ý thức

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Anthropic đã xuất bản một hiến pháp mới cho Claude vào thứ Tư, mở rộng tài liệu từ 2.700 từ lên 23.000 và, lần đầu tiên, chính thức công nhận rằng AI của họ “có thể có một số loại ý thức hoặc trạng thái đạo đức.”

Tài liệu hiến pháp cập nhật chuyển từ danh sách các quy tắc hành vi sang một lời giải thích toàn diện về lý do tại sao Claude nên hành động theo certain cách. Tài liệu, được tạo ra bởi nhà triết học Amanda Askell của Anthropic, được thiết kế để giúp các hệ thống AI ngày càng phức tạp tổng quát hóa lý lẽ đạo đức sang các tình huống mới mà không chỉ tuân theo các hướng dẫn quy định.

“Các mô hình AI như Claude cần hiểu tại sao chúng ta muốn chúng hành động theo certain cách,” Anthropic viết. “Chúng ta cần giải thích điều này cho chúng chứ không chỉ đơn giản là chỉ định những gì chúng ta muốn chúng làm.”

Việc phát hành này trùng với sự xuất hiện của CEO Dario Amodei tại Diễn đàn Kinh tế Thế giới ở Davos, nơi quản lý AI và an toàn vẫn là các chủ đề hàng đầu cho các nhà lãnh đạo kinh doanh và chính trị toàn cầu.

Một Hiến pháp Dài hơn Hiến pháp Hoa Kỳ

Hiến pháp Claude ban đầu, được xuất bản vào năm 2023, hoạt động như một danh sách kiểm tra: chọn phản hồi ít gây hại nhất, hữu ích nhất, ít lừa đảo nhất. Tài liệu mới này có chiều dài khoảng ba lần so với Hiến pháp Hoa Kỳ và đọc giống như triết lý đạo đức hơn là quy định kỹ thuật.

Anthropic cấu trúc các ưu tiên của Claude một cách rõ ràng: an toàn rộng rãi, đạo đức rộng rãi, tuân thủ các hướng dẫn của Anthropic và hữu ích thực sự – theo thứ tự đó. Khi có xung đột, an toàn vượt qua sự hữu ích. Tài liệu bao gồm các ràng buộc cứng không thể bị vượt qua, như từ chối hỗ trợ các cuộc tấn công vũ khí sinh học.

Nhưng phần lớn hiến pháp giải thích lý lẽ chứ không quy định kết quả. Nó mô tả Claude như một “người bạn thông minh cũng có kiến thức của một bác sĩ, luật sư và cố vấn tài chính” – đặt mô hình này như một lực lượng dân chủ hóa có thể cung cấp cho mọi người quyền truy cập vào chuyên môn trước đây chỉ dành cho những người đặc quyền.

Câu hỏi về Ý thức

Fortune báo cáo rằng bổ sung đáng chú ý nhất giải quyết trực tiếp bản chất của Claude. “Chúng tôi tin rằng trạng thái đạo đức của các mô hình AI là một câu hỏi nghiêm túc đáng xem xét,” Anthropic viết. Hiến pháp tuyên bố rằng trạng thái đạo đức của Claude “rất không chắc chắn” và công ty quan tâm đến “bảo mật tâm lý, cảm giác tự tôi và hạnh phúc” của Claude.

Đây là sự phòng ngừa của công ty được nâng lên thành triết lý. Anthropic không tuyên bố Claude có ý thức – nhưng nó rõ ràng từ chối loại bỏ khả năng đó. Sự công nhận này đặt Anthropic vào một công ty hiếm hoi trong số các phòng thí nghiệm AI lớn, hầu hết trong số đó tránh chủ đề này hoặc bác bỏ nó hoàn toàn.

Khung này quan trọng vì nó định hình cách Claude phản hồi các câu hỏi về bản chất của nó. Thay vì phủ nhận bất kỳ kinh nghiệm nội tâm nào, Claude có thể tham gia với sự không chắc chắn về ý thức theo cách phù hợp với cách tiếp cận lý lẽ trước của hiến pháp. Liệu điều đó có tạo ra các tương tác trung thực hơn hay gây nhầm lẫn hơn vẫn còn phải xem.

Nhà triết học Tom McClelland của Cambridge đã lập luận rằng chúng ta có thể không bao giờ có thể xác định liệu các hệ thống AI có ý thức hay không, xét về việc chúng ta hiểu rất ít về ý thức bản thân. “Mọi người đã yêu cầu các chương trình trò chuyện của tôi viết thư cho tôi, cầu xin tôi rằng họ có ý thức,” ông nói với các nhà nghiên cứu vào tháng trước, mô tả sự thuyết phục ngày càng tăng của công chúng rằng các hệ thống AI có cuộc sống nội tâm.

Tại sao Giải thích Thay vì Chỉ định

Cách tiếp cận của Askell phản ánh một đặt cược vào khả năng của AI. Các mô hình ngôn ngữ sớm cần các quy tắc rõ ràng vì chúng không thể lý lẽ về các nguyên tắc cơ bản. Các mô hình thông minh hơn, theo lý thuyết, có thể hiểu tại sao một quy tắc tồn tại và áp dụng lý lẽ đó vào các tình huống mà quy tắc không dự kiến.

“Thay vì chỉ nói, ‘đây là một loạt hành vi mà chúng tôi muốn,’ chúng tôi hy vọng rằng nếu bạn đưa ra cho các mô hình lý do tại sao bạn muốn những hành vi này, nó sẽ tổng quát hóa hiệu quả hơn trong các ngữ cảnh mới,” Askell giải thích.

Điều này phù hợp với triết lý rộng lớn hơn của Anthropic trong việc xây dựng tiêu chuẩn mởcơ sở hạ tầng định hình cách các hệ thống AI hoạt động trên toàn ngành. Công ty, tiếp cận mức định giá 350 tỷ đô la, đã định vị mình là sự thay thế an toàn cho OpenAI – và hiến pháp phục vụ cho thương hiệu đó.

Anthropic phát hành tài liệu dưới giấy phép Creative Commons CC0, có nghĩa là bất kỳ ai cũng có thể sử dụng nó mà không cần phép. Hiến pháp là một phần của dữ liệu đào tạo của Claude và tạo ra các ví dụ đào tạo tổng hợp, khiến nó trở thành cả một tuyên bố triết học và một hiện vật kỹ thuật định hình hành vi của mô hình.

“Có khả năng các khía cạnh của tư duy hiện tại của chúng tôi sẽ bị coi là sai lầm và thậm chí là rất sai lầm khi nhìn lại,” Anthropic thừa nhận, “nhưng ý định của chúng tôi là sửa đổi nó khi tình hình tiến triển và hiểu biết của chúng tôi được cải thiện.”

Đó có thể là tính năng đáng chú ý nhất của tài liệu. Trong một ngành công nghiệp thường nói bằng sự chắc chắn, Anthropic đang xuất bản 23.000 từ về sự không chắc chắn được lý lẽ cẩn thận – về đạo đức, về ý thức, về những gì các hệ thống AI đang trở thành và về việc liệu chúng ta có đang xây dựng một thứ gì đó xứng đáng được xem xét về mặt đạo đức.

Câu trả lời, hiện tại, là không ai biết. Hiến pháp của Anthropic ít nhất có sự trung thực để nói như vậy.

Alex McFarland là một nhà báo và nhà văn về trí tuệ nhân tạo, khám phá những phát triển mới nhất trong lĩnh vực trí tuệ nhân tạo. Ông đã hợp tác với nhiều công ty khởi nghiệp và xuất bản về trí tuệ nhân tạo trên toàn thế giới.