Góc nhìn Anderson

Phương pháp Rửa IP trong Trí tuệ Nhân tạo

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
An AI-generated image of Lady Justice surrounded by 'laundered' data. GPT-1.5.

Nếu có một sự tính toán pháp lý về việc sử dụng tài sản trí tuệ trong đào tạo AI, cũng có một số phương pháp che giấu việc sử dụng như vậy.

 

Ý kiến Cuộc cách mạng hiện tại, đang diễn ra nhanh chóng, trong lĩnh vực trí tuệ nhân tạo tạo ra đang diễn ra trong môi trường pháp lý dễ bị tổn thương nhất mà đã từng đi kèm với bất kỳ sự phát triển công nghệ biến đổi nào từ thế kỷ 19.

Cho đến 3-4 năm trước, cộng đồng nghiên cứu học máy đã có một sự cho phép ngầm (thường là rõ ràng) để khai thác tài liệu được bảo vệ bởi quyền sở hữu trí tuệ trong quá trình phát triển các hệ thống mới; vì những hệ thống này chưa thành công, về mặt trưởng thành hoặc khả năng thương mại, kết quả là, theo mọi nghĩa, là học thuật.

Trong giai đoạn đó, sự thành công đột ngột của một thế hệ mới của các mô hình ngôn ngữ lớn dựa trên khuếch tán (LLMs, như ChatGPT và Claude) và Mô hình Ngôn ngữ-Hình ảnh (VLMs, như Sora) cho thấy rằng những sợi nghiên cứu trừu tượng và trước đây ‘vô hại’ này đã phát triển thành khả năng thương mại, và vượt quá ‘hộ chiếu miễn phí’, về mặt khai thác tài sản trí tuệ của người khác.

Từ bây giờ, những người nắm giữ quyền sẽ tìm kiếm một phần trong kết quả của các hệ thống AI được đào tạo chủ yếu hoặc một phần trên dữ liệu được bảo vệ bởi quyền sở hữu trí tuệ của họ, dẫn đến một luồng các vụ việc pháp lý đang diễn ra đòi hỏi một số nỗ lực để thậm chí theo dõi.

Chỉ giới hạn ở các vụ việc được đưa ra ở Mỹ, các vụ việc mới xuất hiện với tốc độ nhanh chóng ở Hoa Kỳ và hơn thế nữa. Nguồn - https://copyrightalliance.org/artificial-intelligence-copyright/court-cases/

Ở đây chỉ giới hạn ở các vụ việc được đưa ra ở Mỹ, các vụ việc mới xuất hiện với tốc độ nhanh chóng ở Hoa Kỳ và hơn thế nữa. Nguồn

Qui định ‘Bữa trưa miễn phí’

Cam kết tài chính hiện tại liên quan đến cơ sở hạ tầng phục vụ AI đã được đặt ra bởi một số tiếng nói như một nỗ lực để thiết lập ‘AI có nguy cơ bản quyền’ sâu sắc trong kinh tế xã hội đến mức nó trở nên không chỉ ‘quá lớn để thất bại’, mà còn ‘quá mạnh để kiện’ – hoặc quá mạnh, ít nhất, rằng các vụ kiện thành công có thể được phép lật đổ cuộc cách mạng.

Về xu hướng chung này, tổng thống hiện tại của Hoa Kỳ đang cam kết vào chính sách quan điểm rằng ‘Bạn không thể được mong đợi có một chương trình AI thành công khi mọi bài viết, sách, hoặc bất cứ thứ gì khác mà bạn đã đọc hoặc nghiên cứu, bạn phải trả tiền’.

Thật vậy? Không có gì tương tự hoặc so sánh đã xảy ra trong kỷ nguyên công nghiệp phương Tây, và đây là một phong trào mài mòn nghiêm trọng chống lại văn hóa truyền thống của Hoa Kỳ về kiện tụng và bồi thường; có lẽ vị trí tương tự nhất là việc hết hạn bắt buộc của các bằng sáng chế thuốc sau 20 năm (chính nó thường bị tấn công), và giới hạn về kỳ vọng về quyền riêng tư ở những nơi công cộng.

Tuy nhiên, thời gian thay đổi; trong sự vắng mặt của bất kỳ bảo đảm nào rằng xu hướng hiện tại hướng tới ‘thuộc địa’ chống lại các bảo vệ quyền sở hữu trí tuệ sẽ không suy yếu, hoặc bị đảo ngược sau này, có một số cách tiếp cận thứ cấp đang trở thành thông lệ trong việc phát triển các hệ thống AI, và việc đối xử với dữ liệu đào tạo tranh chấp mà cung cấp năng lượng cho nó.

Các tập dữ liệu bằng Proxy

Một trong những cách tiếp cận này thực hiện một phương pháp tương tự như sự phòng thủ (không phải lúc nào cũng thành công) của các trang web liệt kê torrent rằng họ không thực sự lưu trữ bất kỳ tài liệu tranh chấp nào – hoặc bất kỳ tài liệu nào cả.

Bên cạnh việc loại bỏ nhu cầu lưu trữ và cung cấp một lượng lớn dữ liệu hình ảnh hoặc video không thể nén tối thiểu, các bộ sưu tập như vậy cho phép cập nhật nhanh chóng – chẳng hạn như việc loại bỏ tài liệu theo yêu cầu của chủ sở hữu bản quyền – và phiên bản.

Giống như các torrent chỉ là biển chỉ nơi tài liệu được bảo vệ bởi quyền sở hữu trí tuệ có thể được tìm thấy, một số tập dữ liệu có ảnh hưởng cao là chính họ chỉ là danh sách ‘con trỏ’ của dữ liệu hiện có; nếu người dùng cuối muốn sử dụng các danh sách này như một danh sách tải xuống cho bộ sưu tập dữ liệu của riêng họ, đó là trên họ, về mặt trách nhiệm của người quản lý.

Trong số đó là tập dữ liệu Conceptual 12M của Google Research, cung cấp chú thích cho hình ảnh, nhưng chỉ trỏ đến vị trí trên web nơi những hình ảnh này tồn tại (hoặc tồn tại tại thời điểm quản lý):

Hai ví dụ từ tập dữ liệu Conceptual 12M của Google Research. Nguồn - https://github.com/google-research-datasets/conceptual-12m/blob/main/images/cc12m_1.jpg

Hai ví dụ từ tập dữ liệu Conceptual 12M của Google Research. Nguồn

Một ví dụ nổi bật khác, và một trong những ví dụ có thể tuyên bố hợp pháp trong lịch sử của AI, là tập dữ liệu LAION đã tạo điều kiện cho sự ra đời của hệ thống tạo sinh Stable Diffusion vào năm 2022 – khuôn khổ tạo sinh đầu tiên cung cấp hình ảnh tạo sinh mạnh mẽ và mã nguồn mở cho người dùng cuối, ngay khi các hệ thống độc quyền dường như thiết lập các dịch vụ như một lĩnh vực thương mại thuần túy:

Một trong những biến thể của dự án LAION, với các tác phẩm nghệ thuật hiện đại và được bản quyền. Nguồn - https://huggingface.co/datasets/laion/relaion-pop/viewer/default/train

Một trong những biến thể của dự án LAION, với các tác phẩm nghệ thuật hiện đại và được bản quyền. Nguồn

Trong nhiều trường hợp, kích thước tệp lớn của một số bộ sưu tập ‘con trỏ’ này cho thấy nội dung hình ảnh được bao gồm trong tệp có thể tải xuống và lưu trữ; tuy nhiên, kích thước tải xuống không tầm thường thường là do khối lượng lớn nội dung văn bản, và đôi khi bao gồm các bản nhúng hoặc tính năng – tóm tắt hoặc nút của nội dung áp dụng khác được trích xuất từ dữ liệu nguồn trong quá trình đào tạo.

Phí cao cấp cho Video

Các tập dữ liệu video trình bày một trường hợp mạnh mẽ hơn cho cách tiếp cận ‘tập dữ liệu bằng proxy’ hoặc ‘con trỏ’, vì khối lượng lưu trữ dữ liệu cần thiết để tổng hợp một số lượng có ý nghĩa và hữu ích của video vào một bộ sưu tập có thể tải xuống là không thể chấp nhận được, và một phương pháp ‘phân tán’ là mong muốn.

Tuy nhiên, trong cả hai trường hợp – nhưng đặc biệt là với video – các URL nguồn có thể tải xuống đại diện cho dữ liệu sẽ cần sự chú ý đáng kể trước khi được sử dụng trong các quá trình đào tạo. Cả hình ảnh và video sẽ cần được thay đổi kích thước, hoặc quyết định cắt xén để tạo ra các mẫu phù hợp với không gian GPU có sẵn. Thậm chí các video được giảm kích thước nghiêm trọng cũng sẽ yêu cầu cắt thành các đoạn rất ngắn, chẳng hạn như 3-5 giây, thường.

Các tập dữ liệu video đáng chú ý sử dụng tham chiếu đến các video trực tuyến (thay vì việc quản lý và đóng gói video) bao gồm tập dữ liệu Kinetics Human Action Video Dataset của Google, và tập dữ liệu YouTube-8M của công ty này, sử dụng chú thích phân đoạn để chỉ ra cách đối xử với từng video một lần tải xuống – nhưng lại để người dùng cuối tải xuống các video từ các URL được cung cấp.

Đóng và Mở

Cuối cùng, trong danh mục này, ‘mở’ dữ liệu VFX có thể được tạo ra với các nền tảng đóng mà sau đó xuất bản và cung cấp tập dữ liệu. Điều này làm cho người ta tự hỏi tại sao điều này xảy ra, và xem xét liệu nó có thể xảy ra vì công ty ban đầu muốn làm sạch một mô hình không thân thiện với IP, cho mục đích của riêng họ; hoặc rằng một ‘tập dữ liệu đã rửa’ được yêu cầu từ bên ngoài.

Một trường hợp như vậy của ‘rửa thế hệ’ là, có thể nói, tập dữ liệu Omni-VFX, bao gồm nhiều điểm dữ liệu từ tập dữ liệu Open-VFX (chính nó tham chiếu đến nhiều nền tảng đóng và bán đóng, như Pika và PixVerse).

Để nói thật, Omni-VFX không thậm chí cố gắng che giấu:

Trong tập dữ liệu Omni-VFX mã nguồn mở, một khuôn mặt quen thuộc. Nguồn - https://huggingface.co/datasets/GD-ML/Omni-VFX/blob/main/Harley/pixverse%252Fmp4%252Fmedia%252Fweb%252F15e45744-64b1-4a41-84de-626225cf017b_seed734716767.mp4

Trong tập dữ liệu Omni-VFX mã nguồn mở, một khuôn mặt quen thuộc. Nguồn

Trách nhiệm Tổ tiên

Cách tiếp cận thứ hai để rửa IP là thông qua việc sử dụng tài liệu được bản quyền tại một hoặc nhiều cấp độ. Một trong những phương pháp trong danh mục này là sử dụng dữ liệu tổng hợp đã được đào tạo, tại một số điểm phía trên, trên dữ liệu được bản quyền. Trong những trường hợp như vậy, đặc biệt là khi dữ liệu tổng hợp có thể đạt được kết quả nhìn giống thật, tài liệu được bản quyền cung cấp các biến đổi mà không thể đoán được một cách hợp lý hoặc xấp xỉ bằng các mô hình thế giới chung hoặc không chuyên biệt.

Đây là trường hợp rõ ràng khi các hệ thống tạo sinh video được yêu cầu tạo ra ‘sự kiện không thể’, và các sự kiện thuộc loại ‘hiệu ứng hình ảnh’ (VFX).

Trên thực tế, điều gì đã đưa chủ đề này đến tâm trí là bài báo nghiên cứu mới nhất trong một loạt các bài báo cung cấp khả năng ‘tóm tắt’ các loại hiệu ứng hình ảnh khác nhau, chẳng hạn như tạo ra tia laser từ các bộ phận không thể của cơ thể, bằng cách được đào tạo trên các đoạn VFX tùy chỉnh hoặc ‘mã nguồn mở’ (thay vì nguồn rõ ràng hơn, chẳng hạn như các đoạn VFX rất tốn kém trong các bộ phim của vũ trụ điện ảnh Marvel):

Ví dụ từ trang web EffectMaker, nơi ‘hành động’ trong đoạn nguồn (xa trái) được áp dụng cho hình ảnh nguồn (giữa). Nguồn

Các ví dụ trên đến từ trang dự án cho dự án EffectMaker. EffectMaker không phải là dự án đầu tiên trong năm nay cung cấp khả năng trích xuất động lực VFX từ một đoạn video và chuyển nó sang một đoạn mới, và trên thực tế, đây đang trở thành một nhiệm vụ con trong nghiên cứu VFX AI*.

Người ta nhận thức được rằng các gã khổng lồ truyền thông như Marvel có khả năng cao hơn trung bình để giành chiến thắng trong các vụ việc pháp lý về IP (ngay cả trong khí hậu ‘sự khoan dung cưỡng bức’ đã đề cập), các công ty và công ty khởi nghiệp VFX đang đi đến những độ dài đáng kể để đảm bảo rằng các khuôn khổ VFX tạo sinh của họ không chứa IP của các công ty khác.

Đầu tiên và quan trọng nhất trong số này là Meta, đã được báo cáo trên subreddit r/vfx đã đi vào một đợt tuyển dụng mùa đông có trả lương vào năm 2026, cung cấp cho các nghệ sĩ VFX công việc đào tạo các mô hình AI để tạo ra các cảnh VFX cấp Hollywood. Mặc dù mức lương không được chỉ định trên các bài đăng khác nhau, một đã mô tả nó là ‘tiền hưu trí’.

Theo dõi Tiền

Tuy nhiên, người ta phải tự hỏi bao nhiêu tiền thậm chí các công ty như Meta sẵn sàng trả cho sự đa dạng và phong phú thực sự của các cảnh VFX tùy chỉnh – với chi phí trung bình cho một cảnh VFX duy nhất trong một bộ phim bom tấn là khoảng 42.000 USD – và nhiều cảnh có giá cao hơn nhiều.

Hơn nữa, có lý do để tin rằng các mô hình AI tạo VFX tùy chỉnh sẽ tuân theo nhu cầu phổ biến, bao gồm các hiệu ứng tiêu chuẩn từ các loại phim phổ biến và đắt tiền nhất.

Bên cạnh quan điểm rằng các chuyên gia VFX ‘còn lại’ có thể kết thúc bằng việc tái tạo các cảnh mà họ đã làm việc trong một danh mục phim hiện có – điều này tự nó đặt ‘công việc tập dữ liệu tùy chỉnh’ như một sự bắt chước – không có gì đảm bảo rằng những mẫu mới này sẽ được đào tạo ‘từ đầu’ trong một kiến trúc hoàn toàn mới.

Thật vậy, nếu những sự tái tạo này được chuyển hướng vào các mô-đun phụ như LoRAs, phụ thuộc vào một mô hình cơ sở, thì quá trình này chỉ có thể bảo vệ được nếu mô hình cơ sở là ‘sạch về IP’ – và không nhiều mô hình như vậy.

Tương tự, nếu ‘quá trình mới’ sử dụng các kỹ thuật ‘hybrid’ như tinh chỉnh, nơi giá trị của hiệu ứng hình ảnh phụ thuộc vào các mô hình, xác suất trước, hoặc các bản nhúng từ các bộ sưu tập hoặc mô hình cũ hơn không có tính toàn vẹn, sự nguyên bản của công việc là có thể có, và có thể bị thách thức.

Nhiệm vụ Không thể

Lĩnh vực đầu ra VFX là một trường hợp nghiên cứu thú vị về khả năng rửa IP trong các tập dữ liệu AI, vì các cảnh VFX thường mô tả ‘điều không thể’, đối với đó sẽ không có thay thế mã nguồn mở nào có sẵn.

Chẳng hạn, trong khi việc phá hủy một tòa nhà có thể được đào tạo vào một mô hình tạo sinh từ các đoạn phim công cộng hoặc có thể mua được, nếu bạn muốn đào tạo một mô hình để tạo ra tia laser của con người, bạn sẽ cần đào tạo trên các đoạn VFX, bị đánh cắp hoặc được ủy quyền; những thứ như vậy không xảy ra ở bất kỳ nơi nào khác.

Ngay cả trong trường hợp các loại thảm họa tự nhiên khác, chẳng hạn như lũ lụt nghiêm trọng, tài liệu nguồn thực tế có sẵn không có khả năng tái tạo các góc nhìn dramatized về các sự kiện thảm khốc, vì (với một số ngoại lệ) người ta không thường xuyên phát trực tuyến từ các địa điểm thảm khốc. Do đó, ‘góc nhìn mát mẻ’ về thảm họa là hiếm trong các tập dữ liệu thực tế, và bất kỳ mô hình AI nào có thể tạo ra chúng có khả năng đã nhận được thông tin từ nơi khác.

Hầu hết các luồng công việc AI mong muốn không có mức độ cụ thể như vậy, và trong những trường hợp như vậy, sự che giấu của lợi ích của dữ liệu được bảo vệ bởi quyền sở hữu trí tuệ có thể không yêu cầu nhiều nỗ lực.

Kết luận: Mạng lưới Nhện

Chỉ những người đã sử dụng AI tạo sinh rộng rãi và trong một thời gian dài sẽ hiểu trực giác rằng các hệ thống như vậy gặp khó khăn khi kết hợp nhiều khái niệm khi không có ví dụ tương tự trong dữ liệu đào tạo của chúng.

Giới hạn này được gọi là sự gắn kết, trong đó các khía cạnh khác nhau của các khái niệm được đào tạo có xu hướng tụ họp lại với các yếu tố liên quan, chứ không phải phân rã thành các viên gạch Lego có thể được sắp xếp vào bất kỳ cấu hình mới nào mà người dùng mong muốn.

Sự gắn kết là một hố hấp dẫn kiến trúc mà gần như không thể thoát khỏi, ít nhất là đối với các cách tiếp cận dựa trên khuếch tán đặc trưng của tất cả các khuôn khổ AI hiện tại. Tuy nhiên, có thể các cách tiếp cận mới sẽ xuất hiện trong vài năm tới, tốt hơn trong việc rời rạc hóa các khái niệm được đào tạo để chúng có thể được dán lại một cách khéo léo hơn, và cung cấp ít dấu hiệu hơn về nguồn gốc của chúng.

 

* Tôi không đưa ra bất kỳ cáo buộc nào chống lại EffectMaker, nhưng tôi bình luận ở đây về tính tổng quát của một thực tiễn mới nổi trong nghiên cứu video AI.

Vì những cảnh này, trong những loại phim này, đã tạo ra và tiếp tục tạo ra tiền.

Được xuất bản lần đầu vào thứ Hai, ngày 16 tháng 3 năm 2026

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được giải thể vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]