Mô hình và nền tảng AI

Vấn đề đạo văn: Làm thế nào các mô hình Trí tuệ nhân tạo sinh ra nội dung bản quyền

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Sự phát triển nhanh chóng của trí tuệ nhân tạo đã tạo ra sự phấn khích về tiềm năng sáng tạo của công nghệ này. Tuy nhiên, những mô hình mạnh mẽ này cũng đặt ra những rủi ro đáng lo ngại về việc sao chép nội dung bản quyền hoặc đạo văn mà không có sự ghi nhận thích hợp.

Làm thế nào các mạng nơ-ron hấp thụ dữ liệu đào tạo

Các hệ thống trí tuệ nhân tạo hiện đại như GPT-3 được đào tạo thông qua một quá trình gọi là chuyển giao học. Chúng tiêu thụ các tập dữ liệu lớn được thu thập từ các nguồn công khai như trang web, sách, bài báo học thuật và nhiều hơn nữa. Ví dụ, dữ liệu đào tạo của GPT-3 bao gồm 570 gigabyte văn bản. Trong quá trình đào tạo, trí tuệ nhân tạo tìm kiếm các mẫu và mối quan hệ thống kê trong tập dữ liệu lớn này. Nó học các mối tương quan giữa các từ, câu, đoạn, cấu trúc ngôn ngữ và các tính năng khác.

Điều này cho phép trí tuệ nhân tạo tạo ra văn bản hoặc hình ảnh mới nhất quán bằng cách dự đoán các chuỗi có thể theo sau một đầu vào hoặc lời nhắc. Tuy nhiên, nó cũng có nghĩa là những mô hình này hấp thụ nội dung mà không quan tâm đến bản quyền, ghi nhận hoặc rủi ro đạo văn. Do đó, trí tuệ nhân tạo sinh ra có thể vô tình sao chép các đoạn văn bản hoặc改述 nội dung bản quyền từ tập dữ liệu đào tạo của chúng.

Ví dụ chính về đạo văn trí tuệ nhân tạo

Các lo ngại về đạo văn trí tuệ nhân tạo đã nổi lên rõ ràng kể từ năm 2020 sau khi GPT được phát hành.

Nghiên cứu gần đây đã chỉ ra rằng các mô hình ngôn ngữ lớn (LLM) như GPT-3 có thể sao chép các đoạn văn bản lớn từ dữ liệu đào tạo của chúng mà không có trích dẫn (Nasr et al., 2023; Carlini et al., 2022). Ví dụ, một vụ kiện của The New York Times đã tiết lộ phần mềm OpenAI tạo ra các bài báo của The New York Times gần như nguyên văn (The New York Times, 2023).

Những phát hiện này cho thấy một số hệ thống trí tuệ nhân tạo sinh ra có thể tạo ra các nội dung đạo văn không mong muốn, rủi ro vi phạm bản quyền. Tuy nhiên, mức độ phổ biến vẫn còn không chắc chắn do tính chất “hộp đen” của LLM. Vụ kiện của The New York Times cho rằng những nội dung như vậy cấu thành vi phạm, điều này có thể có những ý nghĩa quan trọng đối với sự phát triển của trí tuệ nhân tạo. Tổng thể, bằng chứng cho thấy đạo văn là một vấn đề vốn có trong các mô hình mạng nơ-ron lớn và đòi hỏi sự cảnh giác và các biện pháp phòng ngừa.

Những trường hợp này tiết lộ hai yếu tố chính ảnh hưởng đến rủi ro đạo văn trí tuệ nhân tạo:

  1. Kích thước mô hình – Các mô hình lớn hơn như GPT-3.5 có nhiều khả năng tái tạo các đoạn văn bản nguyên văn so với các mô hình nhỏ hơn. Tập dữ liệu đào tạo lớn hơn của chúng tăng khả năng tiếp xúc với tài liệu nguồn bản quyền.
  2. Dữ liệu đào tạo – Các mô hình được đào tạo trên dữ liệu internet hoặc các tác phẩm bản quyền (ngay cả khi được cấp phép) có nhiều khả năng đạo văn hơn so với các mô hình được đào tạo trên các tập dữ liệu được kiểm duyệt cẩn thận.

Tuy nhiên, việc đo lường trực tiếp sự phổ biến của các nội dung đạo văn là khó khăn. Tính chất “hộp đen” của mạng nơ-ron khiến việc theo dõi đầy đủ mối liên kết giữa dữ liệu đào tạo và đầu ra mô hình trở nên khó khăn. Tỷ lệ có thể phụ thuộc nặng vào kiến trúc mô hình, chất lượng tập dữ liệu và cách thức tạo lời nhắc. Nhưng những trường hợp này xác nhận rằng đạo văn trí tuệ nhân tạo xảy ra một cách không thể phủ nhận, điều này có những ý nghĩa quan trọng về mặt pháp lý và đạo đức.

Hệ thống phát hiện đạo văn mới nổi

Để đáp lại, các nhà nghiên cứu đã bắt đầu khám phá các hệ thống trí tuệ nhân tạo để tự động phát hiện văn bản và hình ảnh được tạo ra bởi mô hình so với được tạo ra bởi con người. Ví dụ, các nhà nghiên cứu tại Mila đã đề xuất GenFace, phân tích các mẫu ngôn ngữ chỉ ra văn bản được viết bởi trí tuệ nhân tạo. Công ty khởi nghiệp Anthropic cũng đã phát triển khả năng phát hiện đạo văn nội bộ cho trí tuệ nhân tạo hội thoại Claude của họ.

Tuy nhiên, những công cụ này có những hạn chế. Dữ liệu đào tạo lớn của các mô hình như GPT-3 khiến việc xác định nguồn gốc của văn bản đạo văn trở nên khó khăn, nếu không nói là không thể. Các kỹ thuật mạnh mẽ hơn sẽ được cần thiết khi các mô hình sinh ra tiếp tục phát triển nhanh chóng. Cho đến lúc đó, việc xem xét thủ công vẫn là điều cần thiết để sàng lọc các đầu ra trí tuệ nhân tạo có thể bị đạo văn hoặc vi phạm trước khi sử dụng công khai.

Các phương pháp hay nhất để giảm thiểu đạo văn trí tuệ nhân tạo

Dưới đây là các phương pháp hay nhất mà cả nhà phát triển trí tuệ nhân tạo và người dùng có thể áp dụng để giảm thiểu rủi ro đạo văn:

Đối với nhà phát triển trí tuệ nhân tạo:

  • Cẩn thận kiểm tra nguồn dữ liệu đào tạo để loại bỏ tài liệu bản quyền hoặc được cấp phép mà không có sự cho phép thích hợp.
  • Phát triển các thủ tục ghi chép và theo dõi nguồn gốc dữ liệu nghiêm ngặt. Ghi lại các siêu dữ liệu như giấy phép, thẻ, người tạo, v.v.
  • Triển khai các công cụ phát hiện đạo văn để đánh dấu nội dung có rủi ro cao trước khi phát hành.
  • Cung cấp các báo cáo minh bạch chi tiết về nguồn dữ liệu đào tạo, giấy phép và nguồn gốc của đầu ra trí tuệ nhân tạo khi có lo ngại.
  • Cho phép các nhà tạo nội dung chọn không tham gia vào tập dữ liệu đào tạo một cách dễ dàng. Tuân thủ nhanh chóng các yêu cầu gỡ bỏ hoặc loại trừ.

Đối với người dùng trí tuệ nhân tạo:

  • Kiểm tra kỹ lưỡng các đầu ra để tìm bất kỳ đoạn văn bản hoặc đoạn trích dẫn nào có thể bị đạo văn hoặc không được trích dẫn trước khi triển khai quy mô lớn.
  • Tránh coi trí tuệ nhân tạo là hệ thống sáng tạo hoàn toàn tự động. Có người xem xét và kiểm tra nội dung cuối cùng.
  • Ưu tiên việc tạo nội dung hỗ trợ bởi trí tuệ nhân tạo hơn là tạo nội dung hoàn toàn mới từ đầu. Sử dụng mô hình cho việc改述 hoặc tạo ý tưởng thay vì.
  • Tư vấn các điều khoản dịch vụ, chính sách nội dung và biện pháp phòng ngừa đạo văn của nhà cung cấp trí tuệ nhân tạo trước khi sử dụng. Tránh các mô hình không minh bạch.
  • Trích dẫn rõ ràng nguồn gốc nếu bất kỳ tài liệu bản quyền nào xuất hiện trong đầu ra cuối cùng, mặc dù đã cố gắng hết sức. Đừng trình bày công việc trí tuệ nhân tạo như hoàn toàn nguyên bản.
  • Giới hạn việc chia sẻ đầu ra riêng tư hoặc bí mật cho đến khi rủi ro đạo văn có thể được đánh giá và giải quyết thêm.

Các quy định về dữ liệu đào tạo nghiêm ngặt hơn cũng có thể được yêu cầu khi các mô hình sinh ra tiếp tục phổ biến. Điều này có thể liên quan đến việc yêu cầu sự đồng ý của người tạo trước khi thêm tác phẩm của họ vào tập dữ liệu. Tuy nhiên, trách nhiệm nằm ở cả nhà phát triển và người dùng để thực hành các phương pháp trí tuệ nhân tạo đạo đức, tôn trọng quyền của người tạo nội dung.

Đạo văn trong Midjourney’s V6 Alpha

Sau khi được nhắc hạn chế, mô hình V6 của Midjourney một số nhà nghiên cứu đã có thể tạo ra các hình ảnh gần như giống hệt với các bộ phim, chương trình truyền hình và ảnh chụp màn hình trò chơi điện tử bản quyền có thể được bao gồm trong dữ liệu đào tạo của nó.

Hình ảnh được tạo bởi Midjourney giống với cảnh từ các bộ phim và trò chơi điện tử nổi tiếng

Hình ảnh được tạo bởi Midjourney giống với cảnh từ các bộ phim và trò chơi điện tử nổi tiếng

Những thí nghiệm này xác nhận thêm rằng ngay cả các hệ thống trí tuệ nhân tạo thị giác hiện đại cũng có thể vô tình đạo văn nội dung được bảo vệ nếu nguồn dữ liệu đào tạo không được kiểm soát. Điều này nhấn mạnh nhu cầu về sự cảnh giác, các biện pháp phòng ngừa và giám sát của con người khi triển khai các mô hình sinh ra thương mại để hạn chế rủi ro vi phạm.

Phản hồi của các công ty trí tuệ nhân tạo về nội dung bản quyền

Ranh giới giữa sáng tạo của con người và trí tuệ nhân tạo đang trở nên mờ nhạt, tạo ra các câu hỏi bản quyền phức tạp. Các tác phẩm kết hợp giữa đầu vào của con người và trí tuệ nhân tạo có thể chỉ được bảo vệ bản quyền trong các khía cạnh được thực hiện hoàn toàn bởi con người.

Văn phòng Bản quyền Hoa Kỳ gần đây đã từ chối bản quyền cho hầu hết các khía cạnh của một cuốn truyện tranh đồ họa trí tuệ nhân tạo – con người, coi nghệ thuật trí tuệ nhân tạo là phi nhân. Nó cũng đã ban hành hướng dẫn loại trừ các hệ thống trí tuệ nhân tạo khỏi ‘tác giả’. Các tòa án liên bang đã xác nhận quan điểm này trong một vụ việc bản quyền nghệ thuật trí tuệ nhân tạo.

Trong khi đó, các vụ kiện cáo buộc vi phạm bản quyền trí tuệ nhân tạo, như Getty v. Stability AI và nghệ sĩ v. Midjourney/Stability AI. Nhưng không có ‘tác giả’ trí tuệ nhân tạo, một số người đặt câu hỏi liệu các yêu cầu vi phạm có áp dụng được.

Để đáp lại, các công ty trí tuệ nhân tạo lớn như Meta, Google (GOOGL ), Microsoft (MSFT ) và Apple (AAPL ) cho rằng họ không nên cần giấy phép hoặc trả tiền bản quyền để đào tạo mô hình trí tuệ nhân tạo trên dữ liệu bản quyền.

Dưới đây là tóm tắt các lập luận chính từ các công ty trí tuệ nhân tạo lớn trong phản hồi về các quy tắc bản quyền mới tiềm năng của Mỹ xung quanh trí tuệ nhân tạo, cùng với trích dẫn:

Meta lập luận việc áp đặt giấy phép ngay bây giờ sẽ gây ra sự混乱 và mang lại rất ít lợi ích cho người nắm giữ bản quyền.

Google cho rằng đào tạo trí tuệ nhân tạo tương tự như các hành động không xâm phạm như đọc một cuốn sách (Google, 2022).

Microsoft cảnh báo việc thay đổi luật bản quyền có thể gây bất lợi cho các nhà phát triển trí tuệ nhân tạo nhỏ.

Apple muốn bản quyền mã được tạo ra bởi trí tuệ nhân tạo được kiểm soát bởi nhà phát triển con người.

Tổng thể, hầu hết các công ty đều phản đối các yêu cầu cấp phép mới và giảm thiểu lo ngại về việc các hệ thống trí tuệ nhân tạo sao chép các tác phẩm được bảo vệ mà không có ghi nhận. Tuy nhiên, quan điểm này gây tranh cãi khi xem xét các vụ kiện bản quyền trí tuệ nhân tạo gần đây và các cuộc tranh luận.

Con đường cho sự đổi mới Trí tuệ nhân tạo có trách nhiệm

Khi những mô hình sinh ra mạnh mẽ này tiếp tục phát triển, việc ngăn chặn rủi ro đạo văn là điều quan trọng cho sự chấp nhận rộng rãi. Một cách tiếp cận đa diện là cần thiết:

  • Cải cách chính sách về minh bạch dữ liệu đào tạo, cấp phép và đồng ý của người tạo.
  • Công nghệ phát hiện đạo văn mạnh mẽ hơn và quản trị nội bộ bởi các nhà phát triển.
  • Sự nhận thức của người dùng về rủi ro và tuân thủ các nguyên tắc đạo đức trí tuệ nhân tạo.
  • Tiền lệ pháp lý và án lệ rõ ràng xung quanh các vấn đề bản quyền trí tuệ nhân tạo.

Với các biện pháp phòng ngừa phù hợp, sáng tạo hỗ trợ bởi trí tuệ nhân tạo có thể phát triển một cách đạo đức. Nhưng rủi ro đạo văn không được kiểm soát có thể làm suy yếu đáng kể niềm tin của công chúng. Việc giải quyết trực tiếp vấn đề này là chìa khóa để hiện thực hóa tiềm năng sáng tạo khổng lồ của trí tuệ nhân tạo sinh ra trong khi tôn trọng quyền của người tạo. Việc đạt được sự cân bằng đúng đắn sẽ đòi hỏi phải đối mặt trực tiếp với điểm mù đạo văn được xây dựng vào bản chất của mạng nơ-ron. Nhưng bằng cách làm như vậy, sẽ đảm bảo rằng những mô hình mạnh mẽ này không làm suy yếu sự sáng tạo của con người mà chúng nhằm mục đích tăng cường.

Tôi đã dành 5 năm qua để đắm mình trong thế giới hấp dẫn của Máy học và Học sâu. Đam mê và chuyên môn của tôi đã dẫn tôi đến việc đóng góp vào hơn 50 dự án kỹ thuật phần mềm đa dạng, với sự tập trung đặc biệt vào AI/ML. Sự tò mò liên tục của tôi cũng đã thu hút tôi đến với Xử lý Ngôn ngữ Tự nhiên, một lĩnh vực tôi渴望 khám phá thêm.