Mô hình và nền tảng AI

Anthropic Giải Thích Cơ Chế của Dấu Nước Claude

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Anthropic đã xuất bản một tài khoản chi tiết vào ngày 14 tháng 8 năm 2026 về cách thức hoạt động của dấu nước văn bản trong các mô hình Claude tương lai, xác định nó là một phiên bản của kỹ thuật SynthID-Text mà Google DeepMind đã xuất bản trong một bài báo được đánh giá ngang hàng năm 2024. Công ty đã đặt khung cho bản giải thích kỹ thuật xung quanh nghĩa vụ tuân thủ đằng sau sự thay đổi này: từ ngày 2 tháng 8 năm 2026, Đạo luật AI của EU yêu cầu các nhà cung cấp phục vụ thị trường châu Âu phải đánh dấu nội dung được tạo bởi AI, và Anthropic đã ký mã minh bạch của khối này vào tháng 7 năm 2026 cùng với khoảng 190 tổ chức.

Thông báo này đến ba ngày sau khi Anthropic xác nhận kế hoạch đánh dấu nước trên một trang hỗ trợ, được đề cập ở đây vào ngày 11 tháng 8 năm 2026. Trong khi trang đó mô tả những gì các dấu hiệu làm, bài đăng mới mô tả cách dấu hiệu văn bản hoạt động, nơi nó bị phá vỡ và những gì nó không thể chứng minh. Anthropic cho biết dấu nước không mang bất kỳ thông tin nhận dạng nào, không yêu cầu thêm token và không có tác động thực tế đến chất lượng đầu ra, chi phí hoặc tốc độ.

Dấu Nước Sống Trong Lựa Chọn Từ, Không Phải Các Nhân Vật Ẩn

Cơ chế này khai thác cách các mô hình ngôn ngữ tạo ra văn bản. Tại mỗi bước, một mô hình chọn một từ trong danh sách các ứng cử viên hợp lý; nơi có nhiều lựa chọn gần như bằng nhau (“overcast” so với “grey” sau “Thời tiết hôm nay rất lạnh và…”), lựa chọn được giải quyết bởi một số ngẫu nhiên. Dấu nước thay thế sự ngẫu nhiên tùy ý này bằng sự ngẫu nhiên được dẫn xuất từ một khóa bí mật cộng với các từ trước đó. Văn bản vẫn ngẫu nhiên đối với bất kỳ người đọc nào, nhưng bất kỳ ai nắm giữ khóa đều có thể kiểm tra xem một chuỗi từ có nhất quán thống kê với các lựa chọn mà một mô hình có khóa sẽ thực hiện hay không, và gán một xác suất rằng Claude đã tham gia.

Không có gì được thêm vào văn bản, và không có nhân vật ẩn hoặc Unicode vô hình. Vì mẫu nằm trong chính lựa chọn từ, nó đi cùng với văn bản được sao chép và dán theo cách mà siêu dữ liệu đính kèm không thể. Anthropic so sánh điều này với phần mềm phát hiện AI như Pangram, mà suy đoán quyền tác giả từ thói quen phong cách vì nó thiếu khóa của nhà cung cấp.

Giấy Chứng Nhận Đằng Sau Các Yêu Cầu Chất Lượng Của Anthropic

Các đảm bảo chất lượng của Anthropic chủ yếu dựa trên hồ sơ của kỹ thuật mà họ đã áp dụng. Trong bài báo trên tạp chí Nature giới thiệu SynthID-Text, Google DeepMind đã báo cáo thử nghiệm phương pháp này bằng cách cung cấp một mô hình có dấu nước cho một phần của lưu lượng truy cập Gemini và so sánh xếp hạng lên và xuống với mô hình không có dấu nước, tìm thấy không có sự khác biệt thống kê đáng kể; một nghiên cứu song song có kiểm soát với người đánh giá cũng tìm thấy không có khoảng cách chất lượng. Anthropic cho biết thử nghiệm nội bộ của họ cho thấy không có tác động đến nội dung, sáng tạo hoặc khả năng đọc, và rằng việc đánh dấu nước không thêm token, vì vậy mô hình có chi phí giống nhau để cung cấp và sử dụng.

Anthropic đang áp dụng dấu nước trên toàn cầu tại thời điểm ra mắt thay vì chỉ ở EU, nói rằng họ vẫn chưa có cách nào để giới hạn nó theo khu vực. Điều này khiến nghĩa vụ của châu Âu trở thành một ràng buộc thiết kế toàn cầu cho Claude. Các nhà cung cấp khác ký mã, bao gồm Google, Meta, Microsoft, Mistral và OpenAI, đang triển khai các phương pháp đánh dấu của riêng họ theo cùng một khuôn khổ, theo thông báo của Ủy ban châu Âu vào ngày 31 tháng 7 năm 2026.

Ở Đâu Anthropic Nói Rằng Dấu Hiệu Im Lặng

Bài đăng này là đặc biệt cụ thể về các chế độ thất bại. Phát hiện hoạt động kém trên các đoạn văn bản ngắn, cung cấp ít lựa chọn từ để kiểm tra. Nó mỏng hơn trên văn bản thực tế, nơi độ chính xác hạn chế mô hình thành một câu trả lời đúng và để lại dấu nước không có gì để hoạt động, và trên mã, phải chính xác để chạy. Dấu hiệu có thể gắn vào các lựa chọn tùy ý như nhận xét nhưng, theo thiết kế, có ảnh hưởng không đáng kể đến mã được sản xuất. Một chỉnh sửa nhẹ có thể không loại bỏ dấu nước; một bản viết lại hoàn toàn sẽ.

Dấu hiệu cũng không thể thiết lập những gì người đọc có thể giả định nó làm. Phát hiện chỉ trả lời câu hỏi “xác suất này được viết một phần bởi Claude là bao nhiêu?” Nó không thể xác nhận văn bản được viết bởi con người, không thể xác định đầu ra từ một hệ thống AI khác – mỗi nhà cung cấp có khóa và phương pháp khác nhau – và không thể phân biệt “Claude đã viết điều này” với “Claude đã chỉnh sửa nặng này.” Dấu nước không mang bất kỳ thông tin nào có thể theo dõi đến một người, tổ chức hoặc cuộc trò chuyện, và nó không thay đổi gì về quyền sở hữu đầu ra hoặc quyền của người dùng theo các điều khoản của Anthropic.

Độc lập với dấu nước, các tệp mà Claude tạo ra ở các định dạng được hỗ trợ như .png, .jpg và .svg mang một chứng chỉ nguồn gốc được ký mã hóa theo tiêu chuẩn C2PA mở, có thể đọc được bởi bất kỳ công cụ nào nhận thức được C2PA.

Điều Gì Đánh Gióp Sắp Tới Cho Phát Hiện Dấu Nước Claude

Thời kỳ chuyển tiếp trong luật EU bao gồm các mô hình Anthropic được ra mắt trước ngày 2 tháng 8 năm 2026; công ty cho biết việc đánh dấu nước cho các mô hình cũ hơn sẽ được triển khai trong những tháng tới. Một API phát hiện dấu nước được lên kế hoạch, với các chi tiết triển khai vẫn đang được làm việc, và Anthropic có ý định cung cấp một công cụ để kiểm tra chứng chỉ nội dung của tệp. Unite.AI trước đây đã đề cập đến yêu cầu ghi nhãn nội dung AI trở nên bắt buộcGoogle ký mã minh bạch tương tự. Văn phòng AI của Ủy ban sẽ ra mắt hai lực lượng đặc nhiệm ký kết vào tháng 9 năm 2026 để so sánh các phương pháp thực hiện: địa điểm cấu trúc đầu tiên nơi cách tiếp cận của Anthropic sẽ ngồi cùng với những người khác của các nhà cung cấp lớn đã ký mã.

Mira Kellan là một nhà báo cột chuyên về đạo đức AI, quản lý và quy định. Công việc của cô khám phá cách trí tuệ nhân tạo giao tiếp với chính sách công, giá trị xã hội và trách nhiệm lâu dài, với trọng tâm vào đổi mới có trách nhiệm.
Tiếp cận các vấn đề phức tạp với một ống kính hợp lý và triết học, Mira phân tích các quy định AI mới nổi, khuôn khổ đạo đức và mô hình quản lý định hình tương lai của các hệ thống thông minh. Cô nhằm mục đích bắc cầu khoảng cách giữa tiến bộ công nghệ nhanh chóng và các biện pháp bảo vệ cần thiết để đảm bảo các hệ thống AI vẫn minh bạch, công bằng và phù hợp với lợi ích của con người.
Các bài viết do Mira Kellan sáng tác được tạo ra bởi AI và được nhóm biên tập của Unite.AI xem xét để đảm bảo độ chính xác, sự cân bằng và tuân thủ các tiêu chuẩn biên tập.