Lãnh đạo tư tưởng
Điều gì mà Đạo luật Trí tuệ Nhân tạo của EU không nói với các Nhà sáng lập về Dữ liệu Huấn luyện

Điều 50 của Đạo luật Trí tuệ Nhân tạo của EU yêu cầu một hệ thống trí tuệ nhân tạo phải tiết lộ rằng một người đang nói chuyện với một máy. Nó không nói gì về việc gì xảy ra với cuộc trò chuyện đó một khi việc tiết lộ đã được thực hiện.
Các nhà sáng lập xây dựng sản phẩm trên nền tảng một mô hình cơ sở tập trung vào độ chính xác và giá cả. Câu hỏi về việc gì xảy ra với dữ liệu của người dùng sau khi rời khỏi sản phẩm và được xử lý bởi một mô hình của bên thứ ba hiếm khi được đặt ra trong quá trình lựa chọn nhà cung cấp.
Qui định này đã có hiệu lực vào ngày 2 tháng 8 năm 2026, và các khoản phạt cho việc không tuân thủ có thể lên đến 15 triệu euro hoặc 3% doanh thu hàng năm toàn cầu, tùy theo mức nào cao hơn. Việc giữ lại và huấn luyện nằm hoàn toàn ngoài phạm vi của nó. Nếu ứng dụng của bạn gửi cuộc trò chuyện của người dùng đến một mô hình của bên thứ ba, thì các phương pháp xử lý dữ liệu của nhà cung cấp đó sẽ trở thành một phần của sản phẩm của bạn, cho dù bạn có ý định hay không.
Giả định mặc định trong Ngành là Huấn luyện, không phải Hỏi
Các nhà nghiên cứu tại Viện Trí tuệ Nhân tạo lấy con người làm trung tâm của Stanford đã xem xét các chính sách bảo mật của sáu nhà phát triển trí tuệ nhân tạo hàng đầu của Mỹ, bao gồm Amazon, Anthropic, Google, Meta, Microsoft và OpenAI, và phát hiện ra rằng tất cả họ đều sử dụng dữ liệu trò chuyện của khách hàng để huấn luyện mô hình của họ theo mặc định, với một số giữ lại dữ liệu đó vô thời hạn. Nhà nghiên cứu chính Jennifer King đã nói một cách thẳng thắn khi được hỏi liệu người dùng hệ thống trò chuyện trí tuệ nhân tạo có nên lo lắng về quyền riêng tư của họ hay không, và trả lời “tuyệt đối có”. Do đó, việc huấn luyện nên được coi là giả định mặc định trừ khi tài liệu của nhà cung cấp nói khác. Tuy nhiên, các chi tiết lại khác nhau từ nhà cung cấp này sang nhà cung cấp khác và xứng đáng được chú ý kỹ lưỡng trước khi cam kết với một nền tảng.
Trước đây, Anthropic đã được ca ngợi vì cách tiếp cận bảo mật quyền riêng tư, nhưng đã thay đổi các điều khoản của người tiêu dùng để các cuộc trò chuyện với Claude hiện được sử dụng để huấn luyện theo mặc định, với người dùng có thể chọn không tham gia. Điều này minh họa cho việc chính sách huấn luyện của một nhà cung cấp có thể thay đổi nhanh chóng, ngay cả khi quyền riêng tư là một phần của đề xuất ban đầu của họ.
Trong các mô hình khác, việc chọn không tham gia không hoạt động hoàn toàn. Google giữ lại các cuộc trò chuyện Gemini được xem xét bởi các annotator người lên đến ba năm, và việc tắt thiết lập Hoạt động của Gemini Apps không làm thay đổi điều đó. Một khi một cuộc trò chuyện đã được đánh dấu để xem xét của con người, nó sẽ vẫn trong hệ thống của Google trên một đường giữ lại riêng biệt, bất kể người dùng làm gì sau đó.
Character.AI đã được huấn luyện trên các cuộc trò chuyện của người dùng theo mặc định và chỉ cung cấp tùy chọn không tham gia cho người dùng ở EEA và Vương quốc Anh, điều này đặt nó ở mức cho phép nhất trong các phương pháp xử lý dữ liệu được đề cập ở đây. Ngoài ra, công ty đã phải đối mặt với các thách thức pháp lý và danh tiếng. Vào tháng 1 năm 2026, Character.AI và Google đã đồng ý nguyên tắc giải quyết một nhóm vụ kiện cáo buộc gây hại từ các tương tác của chatbot với trẻ vị thành niên, không liên quan đến chính sách huấn luyện dữ liệu của nó. Google được đề cập là bị đơn vì quan hệ với các nhà sáng lập của Character.AI, và mặc dù không có trách nhiệm nào được thừa nhận và các điều khoản không được tiết lộ, vụ việc này cho thấy rằng sự phơi nhiễm pháp lý liên quan đến nhà cung cấp trí tuệ nhân tạo có thể ảnh hưởng đến các công ty hỗ trợ nó.
Các cửa sổ giữ lại, kích hoạt xem xét của con người và truy cập của nhà thầu phụ hiếm khi xuất hiện ngoài phần chữ nhỏ của chính sách bảo mật. Các công ty tích hợp các API này thường phải điều tra kỹ lưỡng để tìm hiểu xem dữ liệu của người dùng sẽ ở lại trong xem xét hoặc ai khác có thể nhìn thấy nó. Gần như không có chi tiết nào trong số đó từng đến được người dùng cuối, điều này có nghĩa là một công ty có thể kế thừa các phương pháp xử lý dữ liệu của nhà cung cấp và truyền đạt cùng mức độ phơi nhiễm mà không có bên nào nhận ra điều đó.
Tại sao đây là Vấn đề của Nhà sáng lập và không chỉ là Cuộc tranh luận về Chính sách
Nếu sản phẩm của bạn định tuyến các cuộc trò chuyện của người dùng đến một mô hình cơ sở với huấn luyện mặc định được bật, bạn đã chấp nhận một chính sách dữ liệu thay mặt cho người dùng mà không thông báo cho họ, ngay cả khi bạn không có ý định làm như vậy. Điều 50 không yêu cầu bạn phải tiết lộ quyết định đó vì nó chỉ đề cập đến việc họ đang nói chuyện với trí tuệ nhân tạo.
Truy cập của bên thứ ba mở rộng mức độ phơi nhiễm đó hơn nữa. Các nhà cung cấp mô hình thường outsource việc chú thích dữ liệu và xem xét an toàn cho các nhà thầu phụ. Vào tháng 5 năm 2026, Tổng chưởng lý Texas Ken Paxton đã mở một cuộc điều tra về kính trí tuệ nhân tạo của Meta sau khi các annotator dữ liệu tại một nhà thầu phụ có trụ sở tại Kenya gọi là Sama được cho là đã nói rằng họ có thể truy cập vào cảnh quay của các khoảnh khắc riêng tư của người dùng, bao gồm cả việc vào phòng tắm. Meta phản bác rằng điều này không phản ánh toàn bộ bức tranh về các phương pháp của họ, và cuộc điều tra đang tiếp tục. Mặc dù ví dụ này liên quan đến máy ảnh đeo được, nhưng vấn đề tương tự cũng có thể áp dụng cho trí tuệ nhân tạo trò chuyện. Một lời hứa rằng một công ty không bán dữ liệu của bạn không nói gì về việc ai khác có thể đọc nó nội bộ trước khi nó đến được đường ống huấn luyện.
Điều gì cần Kiểm tra trước khi Chọn một Nhà cung cấp
Trước khi kết nối một mô hình cơ sở với dữ liệu người dùng thực, có một số câu hỏi mà mỗi nhà sáng lập nên trả lời.
Thỏa thuận xử lý dữ liệu là nơi để bắt đầu. Thỏa thuận đó là tài liệu quản lý cách dữ liệu của người dùng được xử lý, và đáng để đọc toàn bộ.
Hợp đồng itself xứng đáng được chú ý tương tự. Các nhà cung cấp thường cung cấp các điều khoản không huấn luyện nghiêm ngặt hơn trên các hợp đồng doanh nghiệp hoặc API hơn là trên các sản phẩm trò chuyện của người tiêu dùng, vì vậy hãy xác nhận bằng văn bản các điều khoản nào áp dụng cho tích hợp cụ thể của bạn. Nhiều công ty thường đưa ra giả định sai lầm rằng ngôn ngữ bảo mật cấp doanh nghiệp tự động bao gồm chúng.
Các điều khoản không tham gia cũng đáng được xem xét. Cài đặt Gemini của Google minh họa tại sao, vì trong mô hình đó, việc tắt theo dõi hoạt động không ngăn chặn việc xem xét của con người. Một nhà cung cấp nên có thể nói một cách rõ ràng liệu việc không tham gia có停止 huấn luyện, xem xét của con người hay cả hai.
Cuối cùng, hãy lập bản đồ nơi dữ liệu đi sau nhà cung cấp. Việc chú thích và xem xét an toàn thường được outsource, và các lời hứa bảo mật của nhà cung cấp không tự động mở rộng đến mọi nhà thầu phụ trong chuỗi đó.
Không có câu hỏi nào trong số này nên được coi là một bài tập một lần. Các điều khoản của nhà cung cấp thay đổi, đôi khi nhanh chóng, và nhà cung cấp mà bạn đã ký hợp đồng vào năm ngoái có thể không hoạt động theo cùng một quy tắc ngày hôm nay.
Thị trường có thể Thiết lập một Tiêu chuẩn mà Quy định Chưa Đạt được
Điều 50 không thể là lời cuối cùng về quản trị dữ liệu trí tuệ nhân tạo từ EU, và các nhà sáng lập không nên chờ đợi vòng quy định tiếp theo để bắt kịp với khoảng trống mà nó để lại. Các công ty có thể vượt lên trên khoảng trống đó ngay bây giờ bằng cách xây dựng một tùy chọn tham gia rõ ràng và có thể nhìn thấy cho việc huấn luyện trên dữ liệu của người dùng. Có một ranh giới thực sự giữa việc cải thiện mô hình và im lặng tận dụng niềm tin của người dùng. Nhiều dịch vụ trí tuệ nhân tạo vẫn vượt qua ranh giới đó bằng cách sử dụng các cuộc trò chuyện để huấn luyện mà không bao giờ yêu cầu sự đồng ý thông báo rõ ràng. Các nhà sáng lập谁 vẽ ranh giới đó cho chính mình ngay bây giờ sẽ không cần phải cải tạo sự tuân thủ sau này.
Đây là một động thái có tiền lệ. Các ứng dụng nhắn tin mã hóa và quản lý mật khẩu không chờ đợi các quy định để làm cho các mặc định mạnh trở thành tiêu chuẩn. Họ đã tự đưa ra những lựa chọn đó và biến chúng thành một vị trí trên thị trường. Các sản phẩm trí tuệ nhân tạo có cùng cơ hội. Các nhà sáng lập vẽ ranh giới đó trước khi nó trở thành bắt buộc sẽ là những người được tin cậy với cuộc trò chuyện nhạy cảm tiếp theo của người dùng.












