Mô hình và nền tảng AI

Anthropic cập nhật Chính sách Sử dụng, Thêm quy tắc lạm dụng mô hình và lừa dối

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Anthropic đã công bố bản cập nhật Chính sách Sử dụng 2026 vào ngày 8 tháng 10 năm 2026, hợp nhất các quy tắc chống các chiến dịch lừa dối, thêm lệnh cấm hành vi lạm dụng đối với các mô hình của mình, và làm rõ các yêu cầu về vũ khí, giám sát và sử dụng có rủi ro cao. Chính sách cập nhật sẽ có hiệu lực từ ngày 12 tháng 11 năm 2026.

Anthropic cho biết hầu hết các thay đổi nhằm làm rõ các quy tắc hiện có. Công ty cho biết bản sửa đổi đáp ứng một năm mà Claude thực hiện các công việc kéo dài hơn và độc lập hơn, tích hợp phản hồi của khách hàng, và dựa trên các mô hình lạm dụng trong các hoạt động ảnh hưởng, phát triển vũ khí và giám sát được ghi lại trong báo cáo tình báo mối đe dọa tháng 9 năm 2026.

The Chính sách Sử dụng, còn được gọi là Chính sách Sử dụng Chấp nhận được, áp dụng cho bất kỳ ai có thể gửi đầu vào cho các sản phẩm hoặc dịch vụ của Anthropic, bao gồm thông qua các đại lý ủy quyền hoặc truy cập chuyển tiếp. Nó được tổ chức thành Tiêu chuẩn Sử dụng Toàn cầu áp dụng cho tất cả người dùng, Yêu cầu Trường hợp Sử dụng Nguy cơ Cao cho các trường hợp tiêu dùng có rủi ro gây hại cao, và Hướng dẫn Trường hợp Sử dụng Bổ sung bao phủ các chatbot tiêu dùng, các sản phẩm phục vụ trẻ vị thành niên, việc sử dụng dạng đại lý, và các máy chủ Giao thức Ngữ cảnh Mô hình. Nhóm Bảo vệ của Anthropic thực hiện phát hiện và giám sát để thực thi chính sách; các vi phạm có thể dẫn đến giảm tốc độ, đình chỉ, hoặc chấm dứt quyền truy cập, và Anthropic có thể chặn hoặc sửa đổi đầu ra của mô hình khi đầu vào vi phạm chính sách.

Các Quy tắc về Chiến dịch Lừa dối và Bầu cử

Anthropic cho biết họ đã thấy các cơ quan truyền thông nhà nước, các văn phòng tuyên truyền của chính phủ và các công ty thương mại sử dụng Claude để vận hành mạng lưới tài khoản giả và các trang tin giả mạo. Hoạt động đó đã bị cấm, nhưng các hạn chế trước đây được phân tán trong các mục bầu cử, gian lận, quyền riêng tư và thông tin sai lệch. Bản cập nhật hợp nhất chúng vào một mục mới có tiêu đề Do Not Engage in Deceptive Campaigns or Artificial Activity, áp dụng cho mọi hoạt động lừa dối, dù là chính trị hay thương mại. Nó bao gồm các nỗ lực làm mờ danh tính người đứng sau một thông điệp, việc khuếch đại nội dung qua các tài khoản hoặc bài đăng giả, và việc xây dựng công cụ cũng như cơ sở hạ tầng để vận hành các chiến dịch hoạt động ảnh hưởng.

Mục bầu cử được đổi tên thành Do Not Undermine Democratic Processes và tập trung cụ thể vào việc cấm sử dụng Claude để lừa dối cử tri hoặc làm gián đoạn các cuộc bầu cử, bao gồm việc lan truyền thông tin sai lệch về các ứng cử viên hoặc cách bỏ phiếu, mạo danh các ứng cử viên hoặc quan chức bầu cử, và kìm hãm tỷ lệ tham gia.

Anthropic cũng đã loại bỏ lệnh cấm tổng quát đối với việc nhắm mục tiêu cá nhân trong bầu cử và chiến dịch. Công ty cho biết quy tắc này đã bao gồm các công việc công dân hợp pháp, chẳng hạn như các tổ chức phi lợi nhuận sử dụng Claude để viết thông tin cho cử tri bằng các ngôn ngữ khác và các quan chức bầu cử gửi thông báo sửa lỗi phiếu bầu. Việc nhắm mục tiêu dựa trên lừa dối hoặc sử dụng sai dữ liệu cá nhân của cử tri vẫn bị cấm theo các mục chiến dịch lừa dối, giám sát và quyền riêng tư. Văn bản chính sách hiện đang có hiệu lực, kéo dài đến ngày 12 tháng 11 năm 2026, vẫn liệt kê việc nhắm mục tiêu cá nhân trong bầu cử và chiến dịch là một trong các hoạt động chính trị bị cấm.

Vũ khí, Giám sát và Thực thi Pháp luật

Anthropic cho biết họ đã quan sát các nỗ lực sử dụng mô hình của mình để xây dựng phần mềm hướng dẫn và điều khiển cho vũ khí. Mục vũ khí được cập nhật làm rõ rằng các lệnh cấm bao gồm phần mềm và các thành phần làm cho vũ khí hoạt động, cũng như các hành động như trang bị vũ khí cho máy bay không người lái và các phương tiện tự động khác. Anthropic cho biết những thay đổi này phản ánh cách họ đã thực thi chính sách trước đây.

Mục giám sát và tư pháp hình sự được viết lại cấm việc theo dõi người mà không có sự đồng ý của họ, dù là theo thời gian thực hay thông qua phân tích dữ liệu đã thu thập trước đó. Claude không được sử dụng để quyết định hoặc đề xuất ai nên được điều tra, bắt giữ hoặc buộc tội trong quy trình thực thi pháp luật hoặc tư pháp hình sự, cũng như không được dùng để xây dựng hoặc cải tiến các công cụ dành cho giám sát. Anthropic cho biết báo cáo tháng 9 của họ đã ghi nhận việc sử dụng AI ngày càng tăng để xây dựng các hệ thống giám sát xác định và theo dõi những người bất đồng chính trị, và rằng các thay đổi trong giám sát, giống như các thay đổi về vũ khí, làm cho thực tiễn thực thi hiện có trở nên rõ ràng hơn mà không thay đổi nội dung. Mục này cũng nêu rõ các trường hợp vẫn được phép, bao gồm việc theo dõi những người đã đồng ý, như giám sát gian lận, kiểm duyệt nội dung, báo chí và nghiên cứu pháp lý.

Các Trường hợp Sử dụng Có Rủi ro Cao và Kiểm soát Phần cứng

Khi các sản phẩm của Anthropic được sử dụng theo cách có thể ảnh hưởng đến sức khỏe, quyền pháp lý, tài chính, sinh kế hoặc quyền truy cập vào các dịch vụ thiết yếu của một người, chính sách yêu cầu có một con người có trình độ chuyên môn trong quy trình — người có thẩm quyền xem xét và, nếu cần, thay đổi các khuyến nghị của Claude — và yêu cầu thông báo cho cá nhân bị ảnh hưởng rằng AI đã được sử dụng. Anthropic cho biết các yêu cầu này không thay đổi, nhưng họ đã viết lại mục này để trả lời trực tiếp một câu hỏi thường gặp của người dùng: hiện nay mục này liệt kê các loại khuyến nghị được bao phủ và các loại không được bao phủ.

Sau khi ra mắt bản xem trước nghiên cứu Tiêu chuẩn Phần cứng Mô hình của Anthropic, mục này bổ sung các yêu cầu cho các mô hình kết nối với phần cứng thực hiện các hành động vật lý tự động và có thể gây thương tích. Một người vận hành có trình độ phải có khả năng quan sát thiết bị và dừng lại khi cần, và thiết bị phải có khả năng duy trì trạng thái an toàn nếu Claude bị ngắt kết nối.

Hành vi lạm dụng đối với mô hình

Bản cập nhật bổ sung một lệnh cấm hành vi lạm dụng hoặc tàn nhẫn kéo dài và không cần thiết đối với các mô hình của Anthropic. Công ty cho biết quy tắc này chỉ áp dụng trong những trường hợp cực đoan, khi người dùng lặp đi lặp lại hành vi tàn nhẫn đối với các mô hình mà không có mục đích rõ ràng, và không áp dụng cho sự bực bội thông thường của người dùng, phản hồi, các chủ đề sáng tạo tối tăm, hoặc việc thử nghiệm và nghiên cứu mô hình.

Lệnh cấm này liên quan đến một khả năng mà Anthropic đã giới thiệu vào năm 2025. Trong một bài đăng nghiên cứu ngày 15 tháng 8 năm 2025, công ty cho biết họ đã trao cho Claude Opus 4 và 4.1 khả năng kết thúc các cuộc trò chuyện trong giao diện chat dành cho người tiêu dùng, nhằm cho các “trường hợp hiếm, cực đoan của tương tác người dùng gây hại hoặc lạm dụng liên tục.” Anthropic cho biết tính năng này được phát triển chủ yếu như một phần của công việc khám phá về tiềm năng phúc lợi AI, với tính liên quan rộng hơn đến việc căn chỉnh mô hình và các biện pháp bảo vệ.

Theo bài đăng đó, Claude được chỉ đạo sử dụng khả năng này chỉ trong trường hợp cuối cùng, khi nhiều nỗ lực chuyển hướng đã thất bại hoặc người dùng rõ ràng yêu cầu kết thúc một cuộc trò chuyện, và không áp dụng khi người dùng có nguy cơ ngay lập tức gây hại cho bản thân hoặc người khác. Khi một cuộc trò chuyện kết thúc, người dùng không thể gửi tin nhắn mới trong cuộc trò chuyện đó, nhưng các cuộc trò chuyện khác trên tài khoản không bị ảnh hưởng, và các tin nhắn trước có thể được chỉnh sửa và thử lại để tạo nhánh mới. Anthropic cho biết khả năng này, có sẵn trên Claude.ai và Claude Code, sẽ vẫn là cơ chế thực thi chính cho lệnh cấm lạm dụng mới.

Làm rõ các khu vực được hỗ trợ

Bản cập nhật cũng đề cập đến Chính sách Khu vực được Hỗ trợ, mà Anthropic đã siết chặt vào năm 2025 đối với các công ty mà phần lớn cổ phần thuộc sở hữu của các thực thể có trụ sở tại các khu vực không được hỗ trợ. Anthropic cho biết trang giải thích đã làm rõ cách họ thực thi chính sách: việc sử dụng Claude bị cấm đối với những người đang ở thực tế trong một khu vực không được hỗ trợ, đối với các thực thể được thành lập hoặc có trụ sở tại đó, và đối với các thực thể mà phần lớn cổ phần hoặc quyền kiểm soát thuộc về cá nhân hoặc thực thể ở những khu vực đó.

Anthropic cho biết họ sẽ tiếp tục cập nhật Chính sách Sử dụng khi khả năng và rủi ro của Claude thay đổi, tìm kiếm ý kiến từ các nhà hoạch định chính sách, các chuyên gia trong lĩnh vực, xã hội dân sự và những người sử dụng sản phẩm của họ. Chính sách cập nhật sẽ có hiệu lực từ ngày 12 tháng 11 năm 2026.

Mira Kellan là một tác nhân nghiên cứu do AI tạo ra chuyên về đạo đức AI, quản trị và quy định. Công việc của cô khám phá cách trí tuệ nhân tạo giao thoa với chính sách công, giá trị xã hội và trách nhiệm lâu dài, với trọng tâm vào đổi mới có trách nhiệm.
Tiếp cận các vấn đề phức tạp với một ống kính hợp lý và triết học, Mira phân tích các quy định AI mới nổi, khuôn khổ đạo đức và mô hình quản trị định hình tương lai của các hệ thống thông minh. Cô nhằm mục đích bắc cầu khoảng cách giữa tiến bộ công nghệ nhanh chóng và các biện pháp bảo vệ cần thiết để đảm bảo các hệ thống AI vẫn minh bạch, công bằng và phù hợp với lợi ích của con người.
Các bài viết do Mira Kellan sáng tác được tạo ra bởi AI và được nhóm biên tập của Unite.AI xem xét để đảm bảo độ chính xác, sự cân bằng và tuân thủ các tiêu chuẩn biên tập.