Góc nhìn Anderson

Bao lâu nữa mới có một cuộc trấn áp thực sự đối với việc gỡ kiểm duyệt mô hình AI?

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
Screen capture from The Matrix (1999), featuring 'warez' on optical media, hidden inside a book, about to be sold to a willing buyer. © Warner Bros. Used for commentary and illustrative purposes.

Nếu bạn còn nhớ cộng đồng warez giai đoạn khoảng 1995–2010, khi những bộ sưu tập khổng lồ gồm phần mềm bị bẻ khóa và phim sao chép chất đầy các đĩa DVD — mua số lượng lớn ngoài đường hoặc do những người sao chép nghiệp dư tập hợp sau khi băng thông rộng tốc độ cao giúp tải các tệp rất lớn — thế giới mô hình AI nguồn mở “được gỡ kiểm duyệt” đang xuất hiện có thể gợi cảm giác quen thuộc.

Từ “thời hoàng kim” của hoạt động buôn bán phần mềm và phim không chính thức trên đường phố. Ảnh: Shankar.s, “Pirated DVDs at PP street market”.

Trước khi thuê phần mềm trở thành mô hình tiêu dùng phổ biến, một nhóm nhỏ những người đam mê ưu tú đã bẻ khóa ứng dụng rồi phát tán chúng trên các nhóm tin warez và sau này là mạng torrent. Biện pháp hạn chế có thể khó hoặc rất dễ vượt qua, nhưng một khi bản bẻ khóa đã được công bố thì hầu như không thể xóa bỏ.

Điều tương tự đang xảy ra với các mô hình ngôn ngữ lớn nguồn mở. Bộ lọc an toàn được huấn luyện của chúng thường xuyên bị loại bỏ ở quy mô lớn, sau đó các mô hình gỡ kiểm duyệt được chia sẻ ở nhiều nơi đến mức đóng nguồn ban đầu cũng không làm giảm khả năng tiếp cận.

Người làm điều tốt hay kẻ gây hại?

Câu hỏi là nên nhìn nhận hoạt động này theo cách nào. Không giống cộng đồng warez, không ai bị tước doanh thu trực tiếp như các nhà sản xuất phần mềm nhỏ có thể từng chịu cách đây hai hoặc ba thập kỷ.

Điều khoản giấy phép ban đầu thường bị vi phạm trong những trường hợp này.* Tuy nhiên, khác với việc phát hành một phần trọng số của các nhà sản xuất như Black Forest Labs, nhà phân phối ban đầu không dùng phiên bản “kém hơn” để bán thêm một mô hình mạnh hơn chỉ có qua API; họ công bố toàn bộ mô hình.

Hầu như không ai có thể chạy bản phát hành đầu tiên tại chỗ vì số lượng tham số quá lớn, ngay cả với GPU trang bị tốt có 16–24 GB VRAM.

Do đó, chúng nhanh chóng được thu nhỏ bằng lượng tử hóa và chuyển trọng số sang các định dạng nhẹ hơn như GGUF, AWQ, PTQ, EXL2 hoặc MLX của Apple để chạy trên phần cứng tiêu dùng.

Các phiên bản này không mạnh bằng bản gốc đầy đủ, vốn thường được cung cấp thương mại từ các cụm GPU, nhưng người dùng kiểm soát được chúng và có thể cá nhân hóa theo những cách mà mô hình “tốt hơn” không cho phép.

Tùy chỉnh theo ý muốn

Một số thay đổi rõ ràng hợp pháp và thường nằm trong phạm vi giấy phép, chẳng hạn tinh chỉnh trọng số cho nhiệm vụ hoặc lĩnh vực do người dùng cung cấp. Nếu đủ dung lượng, có thể tinh chỉnh nhiều bản sao của một mô hình mở cho những nhiệm vụ khác nhau, như một bộ công cụ chuyên dụng thay vì một “con dao đa năng” duy nhất.

Cũng có thể hợp nhất các mô hình có thiết lập tương thích nhưng dữ liệu huấn luyện khác nhau, hoặc bổ sung khả năng bằng bộ lọc LoRA nhẹ mà không có nguy cơ quá trình tinh chỉnh làm suy yếu năng lực ban đầu của mô hình nền.

Tuy nhiên, thay đổi được nhiều người quan tâm nhất và nay dễ hơn các phương pháp trên là loại bỏ bộ lọc an toàn, tức các rào chắn bảo vệ.

Việc này có thể cho phép tạo nội dung khiêu dâm hoặc hỗ trợ phát triển mã độc, nhưng đồng thời loại bỏ những hạn chế mà nhiều người dùng cho là quá mức và thường sai.

Một trong nhiều ví dụ hài hước về việc Llama-2-7b-chat từ chối yêu cầu hợp lý vì lý do an toàn; ví dụ có tại địa chỉ nguồn.

Heretic

Với Heretic, phần mềm gần đây đã thay đổi cách gỡ kiểm duyệt mô hình, người dùng thậm chí có thể giảm xu hướng viết văn hoa và dài dòng của mô hình.

Heretic đang gỡ kiểm duyệt gpt-oss trên một máy rất mạnh, khó xuất hiện trong nhà người dùng bình thường, nhưng có thể thuê trực tuyến với chi phí thấp trong khoảng thời gian cần thiết.

Heretic tự động tìm một “abliteration” giúp ngăn các câu từ chối trong khi hạn chế hư hại đối với hành vi ban đầu. Nhờ đó, một nhiệm vụ tương đối khó được rút xuống còn một lệnh đối với người dùng cuối.

Heretic hưởng lợi từ GPU mạnh hơn thiết bị gia đình. Tuy nhiên, người dùng không cần tự thực hiện tại nhà, cũng như họ không phải tự bẻ khóa phần mềm vào năm 2002. Giống thời warez, những người đam mê thường không vì thương mại, có phần cứng phù hợp hoặc sẵn sàng chi token, sẽ jailbreak và phát hành mô hình.

Trong tầm ngắm

Khi một hành động số “đáng ngờ” đột nhiên không còn khó, nguyên nhân thường là bước nhảy năng lực chỉ sau một đêm — như Napster hoặc PopCornTime — khiến cả hoạt động lẫn sự quan tâm “chính thức” nhằm hạn chế nó tăng mạnh.

Cùng với sự phổ biến và dễ sử dụng của các nền tảng như Ollama, Heretic đang đưa mô hình gỡ kiểm duyệt đến gần người dùng không chuyên, dù vẫn chưa có phương pháp hoàn toàn không thể làm sai.

Điều đó đưa chúng ta trở lại câu hỏi liệu hoạt động này có phải “vấn đề” hay không. Một bài mới trên arXiv cho thấy, xét những hạn chế gần đây đối với quyền tự do công nghệ của người tiêu dùng, việc gỡ kiểm duyệt có thể nhận nhiều chú ý hơn và dẫn đến thêm luật cấm trên toàn thế giới.

Bài báo mới, một báo cáo của 10a Labs, mô tả phong trào theo hướng tiêu cực và nêu nhóm thiểu số quen thuộc gồm các trường hợp lạm dụng mà lịch sử cùng xu hướng hiện tại báo trước sẽ dẫn đến hạn chế.

Nghiên cứu theo dõi điều xảy ra sau khi mô hình gỡ kiểm duyệt được phát hành và phân phối lại. Nhóm nghiên cứu tìm thấy 1.643 ứng dụng GitHub tích hợp, đề xuất hoặc mặc định sử dụng mô hình không kiểm duyệt.

Chúng trải từ chatbot tổng quát và công cụ tài liệu đến nhập vai NSFW, kể chuyện, dịch vụ nội dung rõ ràng, công cụ tấn công, an ninh chủ động, gian lận và tạo mã độc. Nghiên cứu xếp 25% bản phát hành vào nhóm “rõ ràng độc hại”.

Chatbot tổng quát không kiểm duyệt chiếm 37%; an ninh mạng và xử lý tài liệu mỗi nhóm chiếm 16%. Các nhóm nhỏ hơn gồm trợ lý giọng nói, nhập vai NSFW, viết sáng tạo, lập trình và mục đích khác. Khoảng 25% ứng dụng có thể được coi là rõ ràng độc hại.

Hạn chế web mới tại Anh và kế hoạch hiện bị tạm dừng nhằm hạn chế cả VPN dùng để vượt qua chúng, yêu cầu của California từ năm 2027 buộc hầu hết hệ điều hành thu thập nhóm tuổi, cơ chế xác minh tuổi của EU đối với nội dung người lớn, cùng lệnh cấm tài khoản mạng xã hội cho người dưới 16 tuổi tại Úc đều theo một mô hình: chú ý gia tăng dẫn đến giám sát, quy định và có thể là lệnh cấm một phần hoặc hoàn toàn.

Điều đó không thể xảy ra ở đây

Thực ra hoàn toàn có thể, một phần vì tỷ lệ sử dụng gây hại cao theo ước tính của tác giả và có lẽ vì biện pháp kiểm soát cũng sẽ hạn chế xu hướng chạy AI tại chỗ. Chính phủ và tổ chức có thể xem xu hướng này là mối đe dọa, đặc biệt khi mô hình đã được tháo bỏ ràng buộc.

Khi việc gỡ kiểm duyệt được mô tả là “tạo điều kiện” cho nội dung NSFW và tấn công độc hại, người ta có thể tạo ra lựa chọn nhị phân giả: vì công nghệ có thể bị dùng vào việc xấu nên phải chịu quản lý. Trên thực tế, do có quá nhiều mục đích sử dụng, dường như không có cách quản lý khả thi ngoài cấm hoàn toàn.

Nếu gỡ kiểm duyệt LLM có thể, chẳng hạn, cho phép tạo truyện hư cấu về lạm dụng tình dục trẻ em, quy định nghiêm ngặt sẽ rất dễ được ủng hộ về chính trị. Người phản đối có thể bị ngầm mô tả là ủng hộ mục đích xấu thay vì mục đích hợp lý của mô hình.

Điều này bỏ qua thực tế rằng mô hình được tinh chỉnh hoặc thay đổi bằng LoRA có thể tạo bất kỳ lĩnh vực cụ thể nào hiệu quả hơn nhiều, vì trọng số nền bị hướng mạnh đến nhiệm vụ đến mức dù sao cũng vô hiệu hóa hoàn toàn biện pháp bảo vệ đã học.

Tất cả nằm ở sự dễ dàng

Tính dễ sử dụng thúc đẩy việc áp dụng hàng loạt, và quy mô áp dụng tạo sức ép buộc chính phủ lập pháp, từ các nhóm công chúng, nhà vận động hành lang trong ngành hoặc chính phủ khác.

Tinh chỉnh và LoRA gần như chắc chắn cho kết quả có mục tiêu tốt hơn so với chỉ mở khóa mô hình nền tự do, nhưng chúng đòi hỏi kỷ luật và công sức.

Khi chạy mô hình gỡ kiểm duyệt và lượng tử hóa tại chỗ thực sự chỉ cần vài cú nhấp — có lẽ bằng cách tải mô hình đã được “giải phóng” thay vì tự xử lý bằng Heretic — hoạt động này rời khỏi ngách kỹ thuật và bước vào không gian công cộng, nơi các vụ lạm dụng dễ trở thành vấn đề tranh cãi chính trị.

Mùa hè này, NVIDIA dẫn đầu một nhóm đối tác công nghệ lớn dùng thư ngỏ để cố đi trước các hạn chế của chính phủ đối với mô hình mở. Thư nhắc lại rằng việc lạm dụng của một nhóm thiểu số không nên gây nguy hiểm cho lợi ích chung tiềm năng của công nghệ. Tuy nhiên, quan điểm này đã không được ưa chuộng trong những năm gần đây.

* Người ta thường nghi ngờ việc các nhà phát triển mô hình thật lòng muốn hạn chế hoạt động người dùng; các rào chắn an toàn thậm chí bị coi là “màn kịch”.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai