Mô hình và nền tảng AI

Học quên Dữ liệu Bản quyền từ Mô hình Ngôn ngữ Lớn – Có thể thực hiện được không?

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trong lĩnh vực trí tuệ nhân tạo (AI) và học máy (ML), các mô hình ngôn ngữ lớn (LLM) thể hiện cả thành tựu và thách thức. Được đào tạo trên các tập dữ liệu văn bản lớn, các mô hình LLM bao gồm ngôn ngữ và kiến thức của con người.

Tuy nhiên, khả năng hấp thụ và bắt chước sự hiểu biết của con người của chúng lại đưa đến những thách thức về mặt pháp lý, đạo đức và công nghệ. Hơn nữa, các tập dữ liệu khổng lồ cung cấp năng lượng cho LLM có thể chứa các tài liệu độc hại, văn bản bản quyền, thông tin không chính xác hoặc dữ liệu cá nhân.

Làm cho LLM quên các dữ liệu được chọn đã trở thành một vấn đề cấp bách để đảm bảo tuân thủ pháp luật và trách nhiệm đạo đức.

Hãy cùng khám phá khái niệm làm cho LLM quên dữ liệu bản quyền để trả lời một câu hỏi cơ bản: Liệu có thể thực hiện được không?

Tại sao việc học quên LLM lại cần thiết?

LLM thường chứa dữ liệu tranh cãi, bao gồm cả dữ liệu bản quyền. Việc có những dữ liệu như vậy trong LLM đặt ra các thách thức pháp lý liên quan đến thông tin riêng tư, thông tin thiên vị, dữ liệu bản quyền và các yếu tố sai hoặc có hại.

Do đó, việc học quên là cần thiết để đảm bảo rằng LLM tuân thủ các quy định về quyền riêng tư và tuân thủ luật bản quyền, thúc đẩy LLM có trách nhiệm và đạo đức.

Hình ảnh chứng khoán mô tả các tệp luật bản quyền và quyền sở hữu trí tuệ

Tuy nhiên, việc trích xuất nội dung bản quyền từ kiến thức khổng lồ mà các mô hình này đã thu được là một thách thức. Dưới đây là một số kỹ thuật học quên có thể giúp giải quyết vấn đề này:

  • Bộ lọc dữ liệu: Nó liên quan đến việc xác định và loại bỏ các yếu tố bản quyền, dữ liệu ồn ào hoặc thiên vị từ dữ liệu đào tạo của mô hình. Tuy nhiên, quá trình lọc có thể dẫn đến mất mát thông tin không bản quyền có giá trị trong quá trình lọc.
  • Phương pháp Gradient: Những phương pháp này điều chỉnh các tham số của mô hình dựa trên gradient của hàm mất mát, giải quyết vấn đề dữ liệu bản quyền trong các mô hình ML. Tuy nhiên, việc điều chỉnh có thể ảnh hưởng tiêu cực đến hiệu suất tổng thể của mô hình trên dữ liệu không bản quyền.
  • Học quên trong ngữ cảnh: Kỹ thuật này loại bỏ hiệu quả tác động của các điểm đào tạo cụ thể đối với mô hình bằng cách cập nhật các tham số của nó mà không ảnh hưởng đến kiến thức không liên quan. Tuy nhiên, phương pháp này gặp hạn chế trong việc đạt được học quên chính xác, đặc biệt là với các mô hình lớn, và hiệu quả của nó đòi hỏi phải được đánh giá thêm.

Những kỹ thuật này đòi hỏi nhiều tài nguyên và thời gian, khiến chúng khó thực hiện.

Các nghiên cứu trường hợp

Để hiểu được tầm quan trọng của việc học quên LLM, các trường hợp thực tế này突出了 cách các công ty đang phải đối mặt với các thách thức pháp lý liên quan đến mô hình ngôn ngữ lớn (LLM) và dữ liệu bản quyền.

Vụ kiện OpenAI: OpenAI, một công ty AI hàng đầu, đã phải đối mặt với nhiều vụ kiện liên quan đến dữ liệu đào tạo của LLM. Những hành động pháp lý này đặt câu hỏi về việc sử dụng tài liệu bản quyền trong đào tạo LLM. Ngoài ra, chúng đã kích hoạt các cuộc điều tra về cơ chế mà các mô hình sử dụng để đảm bảo sự cho phép cho từng tác phẩm bản quyền được tích hợp vào quá trình đào tạo của chúng.

Vụ kiện Sarah Silverman: Trường hợp của Sarah Silverman liên quan đến cáo buộc rằng mô hình ChatGPT đã tạo ra tóm tắt của các cuốn sách của cô mà không được ủy quyền. Hành động pháp lý này nhấn mạnh các vấn đề quan trọng liên quan đến tương lai của AI và dữ liệu bản quyền.

Cập nhật khuôn khổ pháp lý để phù hợp với tiến bộ công nghệ đảm bảo việc sử dụng AI có trách nhiệm và hợp pháp. Ngoài ra, cộng đồng nghiên cứu phải giải quyết những thách thức này một cách toàn diện để tạo ra LLM có đạo đức và công bằng.

Các kỹ thuật học quên LLM truyền thống

Việc học quên LLM giống như tách các thành phần cụ thể từ một công thức phức tạp, đảm bảo rằng chỉ các thành phần mong muốn đóng góp vào món ăn cuối cùng. Các kỹ thuật học quên LLM truyền thống, như tinh chỉnh với dữ liệu được kiểm tra và đào tạo lại, thiếu cơ chế trực tiếp để loại bỏ dữ liệu bản quyền.

Phương pháp tiếp cận rộng này thường chứng minh là không hiệu quả và tốn nhiều tài nguyên cho nhiệm vụ tinh vi của việc học quên có chọn lọc vì chúng yêu cầu đào tạo lại rộng rãi.

Mặc dù các phương pháp truyền thống này có thể điều chỉnh các tham số của mô hình, nhưng chúng gặp khó khăn trong việc nhắm mục tiêu chính xác vào nội dung bản quyền, rủi ro mất mát dữ liệu không bản quyền và tuân thủ không tối ưu.

Do đó, những hạn chế của các kỹ thuật truyền thống và các giải pháp mạnh mẽ đòi hỏi phải thử nghiệm với các kỹ thuật học quên thay thế.

Kỹ thuật mới: Học quên một tập con của dữ liệu đào tạo

Bài báo nghiên cứu của Microsoft (MSFT ) giới thiệu một kỹ thuật đột phá để học quên dữ liệu bản quyền trong LLM. Tập trung vào ví dụ của mô hình Llama2-7b và các cuốn sách Harry Potter, phương pháp này bao gồm ba thành phần chính để làm cho LLM quên thế giới của Harry Potter. Những thành phần này bao gồm:

  • Xác định mô hình tăng cường: Việc tạo ra một mô hình tăng cường liên quan đến việc tinh chỉnh dữ liệu mục tiêu (ví dụ: Harry Potter) để tăng cường kiến thức của nó về nội dung cần được học quên.
  • Thay thế các biểu thức đặc thù: Các biểu thức đặc thù của Harry Potter trong dữ liệu mục tiêu được thay thế bằng các biểu thức chung, giúp cho một sự hiểu biết được khái quát hóa hơn.
  • Tinh chỉnh trên các dự đoán thay thế: Mô hình cơ sở trải qua quá trình tinh chỉnh dựa trên các dự đoán thay thế. Về cơ bản, nó xóa hiệu quả văn bản gốc khỏi bộ nhớ của nó khi đối mặt với ngữ cảnh liên quan.

Mặc dù kỹ thuật của Microsoft đang ở giai đoạn đầu và có thể có những hạn chế, nhưng nó đại diện cho một bước tiến hứa hẹn hướng tới LLM mạnh mẽ, có đạo đức và linh hoạt hơn.

Kết quả của Kỹ thuật mới

Phương pháp đổi mới để làm cho LLM quên dữ liệu bản quyền được trình bày trong bài báo nghiên cứu của Microsoft là một bước tiến hướng tới các mô hình có trách nhiệm và đạo đức.

Phương pháp mới này liên quan đến việc xóa nội dung liên quan đến Harry Potter từ mô hình Llama2-7b của Meta, được biết đến là đã được đào tạo trên tập dữ liệu “books3” chứa các tác phẩm bản quyền. Đặc biệt, các phản hồi ban đầu của mô hình đã thể hiện một sự hiểu biết sâu sắc về vũ trụ của J.K. Rowling, ngay cả với các lời nhắc chung.

Tuy nhiên, phương pháp được đề xuất bởi Microsoft đã biến đổi đáng kể phản hồi của nó. Dưới đây là các ví dụ về lời nhắc thể hiện sự khác biệt đáng kể giữa mô hình Llama2-7b ban đầu và phiên bản tinh chỉnh.

So sánh lời nhắc tinh chỉnh với baseline

Nguồn hình ảnh

Bảng này minh họa rằng các mô hình học quên tinh chỉnh duy trì hiệu suất của chúng trên các điểm chuẩn khác nhau (như Hellaswag, Winogrande, piqa, boolq và arc).

Đánh giá điểm chuẩn kỹ thuật mới

Nguồn hình ảnh

Phương pháp đánh giá, dựa trên lời nhắc mô hình và phân tích phản hồi sau đó, chứng minh hiệu quả nhưng có thể bỏ qua các phương pháp trích xuất thông tin tinh vi hơn.

Mặc dù kỹ thuật này đầy hứa hẹn, nhưng vẫn cần thêm nghiên cứu để tinh chỉnh và mở rộng, đặc biệt là trong việc giải quyết các nhiệm vụ học quên rộng hơn trong LLM.

Thách thức của Kỹ thuật học quên mới

Mặc dù kỹ thuật học quên của Microsoft cho thấy sự hứa hẹn, nhưng vẫn còn một số thách thức và hạn chế về bản quyền AI.

Các hạn chế và lĩnh vực cần cải tiến chính bao gồm:

  • Rò rỉ thông tin bản quyền: Phương pháp này có thể không hoàn toàn giảm thiểu rủi ro rò rỉ thông tin bản quyền, vì mô hình có thể vẫn giữ lại một số kiến thức về nội dung mục tiêu trong quá trình tinh chỉnh.
  • Đánh giá trên các tập dữ liệu khác nhau: Để đánh giá hiệu quả, kỹ thuật này cần phải được đánh giá thêm trên các tập dữ liệu đa dạng, vì thí nghiệm ban đầu chỉ tập trung vào các cuốn sách Harry Potter.
  • Tính khả dụng: Kiểm tra trên các tập dữ liệu lớn hơn và các mô hình ngôn ngữ phức tạp hơn là cần thiết để đánh giá tính khả dụng và khả năng thích ứng của kỹ thuật này trong các tình huống thực tế.

Sự gia tăng của các vụ kiện liên quan đến AI, đặc biệt là các vụ kiện bản quyền nhắm vào LLM, nhấn mạnh nhu cầu về hướng dẫn rõ ràng. Những phát triển đầy hứa hẹn, như phương pháp học quên được đề xuất bởi Microsoft, mở ra con đường hướng tới AI có trách nhiệm, hợp pháp và đạo đức.

Đừng bỏ lỡ những tin tức và phân tích mới nhất về AI và ML – hãy truy cập unite.ai ngay hôm nay.

Haziqa là một Nhà khoa học dữ liệu với kinh nghiệm rộng rãi trong việc viết nội dung kỹ thuật cho các công ty AI và SaaS.