Góc nhìn Anderson

Mô hình ngôn ngữ cá nhân hóa dễ tạo – và khó phát hiện

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
A robot hand at large in an exam room - Flux, Krita (AI GENERATED).

Các bản sao mã nguồn mở của ChatGPT có thể được tinh chỉnh quy mô lớn và với chuyên môn hạn chế hoặc không có, tạo điều kiện cho các mô hình ngôn ngữ “riêng tư” tránh bị phát hiện. Hầu hết các công cụ không thể theo dõi nguồn gốc của các mô hình này hoặc chúng đã được đào tạo để làm gì, cho phép sinh viên và người dùng khác tạo văn bản AI mà không bị phát hiện; nhưng một phương pháp mới cho rằng nó có thể xác định các biến thể ẩn này bằng cách phát hiện các “đặc điểm gia đình” chung trong đầu ra của các mô hình.

 

Theo một nghiên cứu mới từ Canada, các mô hình trò chuyện AI tùy chỉnh của người dùng, tương tự như ChatGPT, có khả năng tạo nội dung truyền thông xã hội giống như viết của con người và có thể đánh lừa các thuật toán phát hiện và con người.

Bản nghiên cứu cho biết:

‘Một kẻ tấn công có động lực là có thể tinh chỉnh mô hình cho phong cách và trường hợp sử dụng cụ thể của họ, vì điều đó rẻ và dễ dàng. Với nỗ lực tối thiểu, thời gian và tiền bạc, chúng tôi đã tạo ra các mô hình tinh chỉnh có khả năng tạo ra các tweet trên truyền thông xã hội thực tế hơn, dựa trên cả tính năng ngôn ngữ và độ chính xác phát hiện, và được xác minh thông qua chú thích của con người.’

Các tác giả nhấn mạnh rằng các mô hình tùy chỉnh này không giới hạn ở nội dung truyền thông xã hội ngắn:

‘Mặc dù được thúc đẩy bởi sự lan truyền của nội dung AI trên truyền thông xã hội và các rủi ro liên quan đến astroturfing và chiến dịch ảnh hưởng, chúng tôi nhấn mạnh rằng các phát hiện chính mở rộng trên tất cả các lĩnh vực văn bản.

‘Thực tế, việc tinh chỉnh mô hình cho việc tạo nội dung theo phong cách cụ thể là một phương pháp có thể áp dụng chung, và có thể đã được sử dụng bởi nhiều người dùng AI tạo – đặt câu hỏi liệu các phương pháp hiện có để phát hiện AIGT có hiệu quả trong thế giới thực như trong phòng thí nghiệm nghiên cứu.’

Khi nghiên cứu quan sát, phương pháp được sử dụng để tạo ra các mô hình ngôn ngữ tùy chỉnh này là tinh chỉnh, nơi người dùng thu thập một lượng dữ liệu mục tiêu hạn chế của riêng họ và đưa nó vào số lượng ngày càng tăng các công cụ đào tạo trực tuyến dễ sử dụng và giá rẻ.

Ví dụ, kho lưu trữ phổ biến Hugging Face cung cấp tinh chỉnh Mô hình ngôn ngữ lớn (LLM) thông qua giao diện đơn giản hóa, sử dụng hệ thống AutoTrain Advanced, có thể được chạy với vài đô la thông qua GPU trực tuyến hoặc miễn phí, cục bộ, nếu người dùng có phần cứng đủ điều kiện:

Các cấu trúc giá khác nhau trên các GPU có sẵn cho hệ thống AutoTrain của Hugging Face. Nguồn: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Các cấu trúc giá khác nhau trên các GPU có sẵn cho hệ thống AutoTrain của Hugging Face. Nguồn: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Các phương pháp và nền tảng đơn giản hóa khác bao gồm Axolotl, UnslothTorchTune mạnh mẽ nhưng đòi hỏi hơn.

Một trường hợp sử dụng ví dụ sẽ là một sinh viên đã mệt mỏi khi viết bài luận của riêng mình, nhưng sợ bị phát hiện bởi các công cụ phát hiện AI trực tuyến, người có thể sử dụng các bài luận lịch sử thực tế của chính họ làm dữ liệu đào tạo để tinh chỉnh một mô hình mã nguồn mở phổ biến như sê-ri Mistral.

Mặc dù tinh chỉnh mô hình có xu hướng làm sai lệch hiệu suất của nó về phía dữ liệu đào tạo bổ sung và làm giảm hiệu suất tổng thể, nhưng các mô hình “cá nhân hóa” có thể được sử dụng để “làm cho AI” đầu ra ngày càng đặc trưng từ các hệ thống như ChatGPT, theo cách phản ánh phong cách lịch sử của riêng người dùng (và, để tăng tính xác thực, điểm yếu của họ).

Tuy nhiên, người ta có thể sử dụng độc quyền một mô hình tinh chỉnh đã được đào tạo cho một nhiệm vụ hoặc tập hợp nhiệm vụ hẹp, chẳng hạn như một LLM tinh chỉnh trên khóa học của một mô-đun đại học cụ thể. Một mô hình cụ thể như vậy sẽ có một cái nhìn sâu sắc nhưng hẹp hơn về lĩnh vực đó so với một LLM đa năng như ChatGPT và có khả năng sẽ tốn ít hơn 10-20 đô la để đào tạo.

Đảo băng trôi LLM

Thật khó để nói về quy mô của việc thực hành này. Theo cách nói chuyện, trên các nền tảng truyền thông xã hội đa dạng, tôi đã gặp nhiều ví dụ về kinh doanh tinh chỉnh LLM – chắc chắn nhiều hơn những gì tôi đã thấy một năm trước; trong một trường hợp, một công ty đã tinh chỉnh một mô hình ngôn ngữ trên các tác phẩm lãnh đạo tư tưởng đã xuất bản của chính họ, sau đó có thể chuyển đổi một cuộc gọi Zoom vụn về với một khách hàng mới thành một bài đăng B2B bóng bẩy gần như trong một lần, theo yêu cầu:

Một mô hình như vậy đòi hỏi dữ liệu ghép nối (trước và sau các ví dụ, với quy mô), trong khi việc tạo một “lớp bóng” cá nhân hóa của các đặc điểm của một tác giả nhất định là một nhiệm vụ dễ dàng hơn, tương tự như chuyển đổi phong cách.

Mặc dù đây là một sự theo đuổi bí mật (mặc dù có nhiều tiêu đềnghiên cứu học thuật về chủ đề này), nơi không có số liệu, thì cùng một logic thông thường đã đưa đạo luật TAKE IT DOWN thành luật này năm – hoạt động mục tiêu là có thể và có thể tiếp cận được, và có một sự hiểu biết thông thường rằng người dùng tiềm năng rất có động lực.

Chỉ có đủ ma sát còn lại trong các hệ thống tinh chỉnh trực tuyến “dumbed-down” nhất mà việc đào tạo và sử dụng các mô hình tinh chỉnh một cách “không trung thực” vẫn còn là một trường hợp sử dụng đặc biệt – mặc dù chắc chắn không vượt quá sự sáng tạo truyền thống của sinh viên.

PhantomHunter

Điều này đưa chúng ta đến bài báo chính mà chúng tôi quan tâm ở đây – một cách tiếp cận mới từ Trung Quốc, tập hợp nhiều kỹ thuật khác nhau vào một khuôn khổ duy nhất – được gọi là PhantomHunter – tuyên bố xác định đầu ra của các mô hình ngôn ngữ tinh chỉnh, sẽ vượt qua như là công việc gốc của con người.

Hệ thống được thiết kế để hoạt động ngay cả khi mô hình tinh chỉnh cụ thể chưa từng được gặp trước đó, thay vào đó dựa trên các dấu vết còn lại của mô hình cơ sở ban đầu – mà các tác giả mô tả là “đặc điểm gia đình” tồn tại sau quá trình tinh chỉnh.

Trong các thử nghiệm, bài báo – có tiêu đề PhantomHunter: Phát hiện văn bản được tạo bởi LLM tinh chỉnh riêng tư thông qua học tập nhận thức gia đình – báo cáo độ chính xác phát hiện mạnh mẽ, với hệ thống vượt trội zero-shot GPT-4-mini đánh giá trong việc theo dõi một mẫu văn bản trở lại gia đình mô hình của nó.

Điều này cho thấy rằng, càng tinh chỉnh mô hình, nó càng tiết lộ về tổ tiên của mình, chống lại giả định rằng tinh chỉnh riêng tư luôn che giấu nguồn gốc của mô hình; thay vào đó, quá trình tinh chỉnh có thể để lại một dấu vết có thể phát hiện được, nếu được đọc đúng – ít nhất, cho đến khi có những tiến bộ hơn nữa, dường như đến hàng tuần bây giờ.

Bản nghiên cứu cho biết*:

‘Phát hiện văn bản được tạo bằng máy [MGT] thường phân biệt văn bản được tạo bởi LLM và văn bản được viết bởi con người thông qua phân loại nhị phân. Các phương pháp hiện có hoặc học các tính năng văn bản chung được chia sẻ trên các LLM bằng cách học đại diện hoặc thiết kế các số liệu phân biệt giữa văn bản con người và LLM dựa trên tín hiệu nội bộ của LLM (ví dụ: xác suất token).

‘Đối với cả hai loại, các thử nghiệm của chúng chủ yếu được thực hiện trên dữ liệu từ LLM công khai, giả định rằng người dùng tạo văn bản bằng cách sử dụng các dịch vụ ngoài hộp.

Chúng tôi lập luận rằng tình hình này đang thay đổi do sự phát triển gần đây của cộng đồng LLM mã nguồn mở. Với sự giúp đỡ của các nền tảng như HuggingFace và các kỹ thuật đào tạo LLM hiệu quả như tích hợp thấp, việc xây dựng các LLM tinh chỉnh với các tập dữ liệu riêng tư tùy chỉnh đã trở nên dễ dàng hơn bao giờ hết.

‘Ví dụ, đã có hơn 60.000 mô hình phái sinh dựa trên Llama trên HuggingFace. Sau khi tinh chỉnh riêng tư trên corpus không xác định, các đặc điểm đã học của mô hình cơ sở có thể thay đổi và các bộ phát hiện LLMGT sẽ [thất bại], tạo thành một rủi ro mới mà người dùng độc hại có thể tạo văn bản có hại riêng tư mà không bị phát hiện bởi các bộ phát hiện LLMGT.

‘Một thách thức mới xuất hiện: Làm thế nào để phát hiện văn bản được tạo bởi LLM tinh chỉnh riêng tư?

Phương pháp và đào tạo

Hệ thống PhantomHunter sử dụng một chiến lược học tập nhận thức gia đình, kết hợp ba thành phần: một trình trích xuất tính năng, thu thập xác suất đầu ra từ các mô hình cơ sở đã biết; một mã hóa tương phản được đào tạo để phân biệt giữa các gia đình; và (như được mô tả dưới đây) một phân loại hỗn hợp chuyên gia gán nhãn gia đình cho các mẫu văn bản mới:

Sơ đồ của hệ thống. PhantomHunter xử lý một mẫu văn bản bằng cách đầu tiên trích xuất các tính năng xác suất từ nhiều mô hình cơ sở, sau đó được mã hóa bằng các lớp CNN và transformer. Nó ước tính gia đình mô hình để tính toán trọng số cổng, điều này hướng dẫn một mô-đun hỗn hợp chuyên gia trong việc dự đoán liệu văn bản có được tạo bởi LLM hay không. Một sự mất mát tương phản được áp dụng trong quá trình đào tạo để tinh chỉnh sự tách biệt giữa các gia đình mô hình. Nguồn: https://arxiv.org/pdf/2506.15683

Sơ đồ của hệ thống. PhantomHunter xử lý một mẫu văn bản bằng cách đầu tiên trích xuất các tính năng xác suất từ nhiều mô hình cơ sở, sau đó được mã hóa bằng các lớp CNN và transformer. Nó ước tính gia đình mô hình để tính toán trọng số cổng, điều này hướng dẫn một mô-đun hỗn hợp chuyên gia trong việc dự đoán liệu văn bản có được tạo bởi LLM hay không. Một sự mất mát tương phản được áp dụng trong quá trình đào tạo để tinh chỉnh sự tách biệt giữa các gia đình mô hình. Nguồn: https://arxiv.org/pdf/2506.15683

PhantomHunter hoạt động bằng cách truyền một đoạn văn bản qua nhiều mô hình cơ sở đã biết và ghi lại khả năng mỗi mô hình nghĩ rằng từ tiếp theo là, ở mọi bước. Các mẫu này sau đó được đưa vào một mạng nơ-ron học các đặc điểm phân biệt của từng gia đình mô hình.

Trong quá trình đào tạo, hệ thống so sánh các văn bản từ cùng một gia đình và học cách nhóm chúng lại với nhau, đồng thời phân biệt chúng với những văn bản từ các gia đình khác, giúp xác định các kết nối ẩn giữa các mô hình tinh chỉnh và mô hình cơ sở của chúng.

MOE

Để quyết định liệu một đoạn văn bản được viết bởi con người hay bởi AI, PhantomHunter sử dụng một hệ thống hỗn hợp chuyên gia, trong đó mỗi “chuyên gia” được tinh chỉnh để phát hiện văn bản từ một gia đình mô hình cụ thể.

Khi hệ thống đoán gia đình mà văn bản có khả năng đến từ nhất, nó sử dụng đoán đó để quyết định trọng số nào cho ý kiến của mỗi chuyên gia. Những ý kiến có trọng số này sau đó được kết hợp để đưa ra quyết định cuối cùng: AI hoặc con người.

Đào tạo hệ thống liên quan đến nhiều mục tiêu: học cách nhận ra các gia đình mô hình; học cách phân biệt văn bản AI với văn bản con người; và học cách tách biệt các gia đình khác nhau bằng cách học tương phản – các mục tiêu được cân bằng trong quá trình đào tạo thông qua các tham số có thể điều chỉnh.

Bằng cách tập trung vào các mẫu được chia sẻ trên từng gia đình, thay vì các đặc điểm của từng mô hình, PhantomHunter nên có khả năng phát hiện thậm chí các mô hình tinh chỉnh mà nó chưa từng thấy trước đây.

Dữ liệu và thử nghiệm

Để phát triển dữ liệu cho các thử nghiệm, các tác giả tập trung vào hai kịch bản học thuật phổ biến nhất: viết và trả lời câu hỏi. Đối với viết, họ đã thu thập 69.297 tóm tắt từ kho lưu trữ học thuật Arxiv, chia thành các lĩnh vực chính. Đối với Q&A, 2.062 cặp đã được thu thập từ bộ dữ liệu HC3 trên ba môn học: ELI5; kinh tế; và y học:

Danh sách các nguồn dữ liệu và số lượng của chúng, trong dữ liệu được thu thập cho nghiên cứu.

Danh sách các nguồn dữ liệu và số lượng của chúng, trong dữ liệu được thu thập cho nghiên cứu.

Tổng cộng, mười hai mô hình đã được đào tạo cho thử nghiệm. Ba mô hình cơ sở là LLaMA-2 7B-Chat; Mistral 7B-Instruct-v0.1; và Gemma 7B-it), từ đó chín biến thể tinh chỉnh đã được tạo ra, mỗi biến thể được tùy chỉnh để bắt chước một lĩnh vực hoặc phong cách viết khác nhau, sử dụng dữ liệu cụ thể cho từng lĩnh vực:

Thống kê của tập dữ liệu đánh giá, nơi 'FT Domain' đề cập đến lĩnh vực được sử dụng trong quá trình tinh chỉnh và 'cơ sở' chỉ ra không có tinh chỉnh.

Thống kê của tập dữ liệu đánh giá, nơi ‘FT Domain’ đề cập đến lĩnh vực được sử dụng trong quá trình tinh chỉnh và ‘cơ sở’ chỉ ra không có tinh chỉnh.

Tổng cộng, ba mô hình cơ sở đã được tinh chỉnh bằng cả kỹ thuật tinh chỉnh thông số đầy đủ và LoRA trên ba lĩnh vực khác nhau trong mỗi kịch bản sử dụng: viết tóm tắt học thuậttrả lời câu hỏi. Để phản ánh các thách thức phát hiện trong thế giới thực, các mô hình tinh chỉnh trên dữ liệu khoa học máy tính đã được giữ lại khỏi các thử nghiệm viết, trong khi những mô hình tinh chỉnh trên dữ liệu tài chính đã được giữ lại khỏi các đánh giá Q&A.

Các khuôn khổ đối thủ được chọn là RoBERTa; T5-Sentinel; SeqXGPT; DNA-GPT; DetectGPT; Fast-DetectGPT; và DeTeCtive.

PhantomHunter được đào tạo bằng hai loại lớp mạng nơ-ron: ba lớp mạng nơ-ron tích hợp với lớp gộp tối đa để bắt các mẫu văn bản cục bộ và hai lớp mạng nơ-ron transformer với bốn đầu chú ý mỗi lớp để mô hình hóa các mối quan hệ dài hạn.

Đối với học tương phản, điều này khuyến khích hệ thống phân biệt giữa các gia đình mô hình, tham số nhiệt độ được đặt thành 0,07.

Mục tiêu đào tạo kết hợp ba thuật ngữ mất mát: L1 (đối với phân loại gia đình) và L2 (đối với phát hiện nhị phân), mỗi thuật ngữ được trọng số ở 1,0, và L3 (đối với học tương phản), được trọng số ở 0,5.

Mô hình được tối ưu hóa bằng Adam với tốc độ học là 2e-5 và kích thước lô là 32. Đào tạo diễn ra trong mười kỳ, với điểm kiểm tra hoạt động tốt nhất được chọn bằng tập xác thực. Tất cả các thí nghiệm được thực hiện trên một máy chủ với bốn GPU NVIDIA A100.

Các chỉ số được sử dụng là điểm F1 cho mỗi tập con thử nghiệm, cùng với tỷ lệ dương tính thực, để so sánh với các bộ phát hiện thương mại.

Điểm F1 để phát hiện văn bản từ các mô hình ngôn ngữ tinh chỉnh không nhìn thấy. Hai kết quả hàng đầu trong mỗi loại được in đậm và gạch chân. 'BFE' đề cập đến trích xuất tính năng xác suất cơ sở, 'CL' đến học tương phản và 'MoE' đến mô-đun hỗn hợp chuyên gia.

Điểm F1 để phát hiện văn bản từ các mô hình ngôn ngữ tinh chỉnh không nhìn thấy. Hai kết quả hàng đầu trong mỗi loại được in đậm và gạch chân. ‘BFE’ đề cập đến trích xuất tính năng xác suất cơ sở, ‘CL’ đến học tương phản và ‘MoE’ đến mô-đun hỗn hợp chuyên gia.

Kết quả của thử nghiệm ban đầu, được hiển thị trong bảng trên, cho thấy PhantomHunter vượt trội so với tất cả các hệ thống cơ sở, duy trì điểm F1 trên 90% cho cả văn bản được tạo bởi con người và máy, ngay cả khi được đánh giá trên đầu ra từ các mô hình tinh chỉnh bị loại khỏi đào tạo.

Các tác giả nhận xét:

‘Với tinh chỉnh đầy đủ, PhantomHunter cải thiện điểm MacF1 hơn 3,65% và 2,96% so với baseline tốt nhất trên cả hai tập dữ liệu, tương ứng; và với tinh chỉnh LoRA, các cải tiến là 2,01% và 6,09% tương ứng.

‘Kết quả chứng minh khả năng phát hiện mạnh mẽ của PhantomHunter đối với văn bản được tạo bởi các LLM tinh chỉnh không nhìn thấy.’

Các nghiên cứu loại bỏ được thực hiện để đánh giá vai trò của từng thành phần cốt lõi trong PhantomHunter. Khi các yếu tố riêng lẻ bị loại bỏ, chẳng hạn như trình trích xuất tính năng, mã hóa tương phản hoặc phân loại hỗn hợp chuyên gia, sự giảm độ chính xác nhất quán được quan sát, cho thấy kiến trúc phụ thuộc vào sự phối hợp của tất cả các phần.

Kết luận

Một lập luận ủng hộ các mô hình ngôn ngữ tạo sinh được đào tạo bởi người dùng là ít nhất những mô hình tinh chỉnh nhỏ này này bảo tồn hương vị và đặc điểm riêng của một tác giả, trong một môi trường mà ngôn ngữ chung, được SEO启发 của các rô-bốt trò chuyện AI đe dọa làm cho ngôn ngữ trở nên chung chung ở bất kỳ nơi nào AI trở thành một yếu tố đóng góp lớn hoặc thống trị.

Với sự mất giá của bài luận đại học, và với sinh viên bây giờ quay video các phiên viết lớn để chứng minh rằng họ không sử dụng AI trong các bài nộp của mình, nhiều giáo viên ngoài châu Âu (nơi các kỳ thi miệng được chuẩn hóa) đang xem xét các kỳ thi miệng như một giải pháp thay thế cho các bài nộp văn bản. Gần đây hơn, một trở lại với công việc viết tay đã được đề xuất.

Có thể lập luận rằng cả hai giải pháp này đều vượt trội so với những gì đe dọa trở thành một cuộc chạy đua vũ trang dựa trên LLM; mặc dù chúng có chi phí là nỗ lực và chú ý của con người, điều mà văn hóa công nghệ hiện đang cố gắng tự động hóa.

 

Vui lòng xem phần cuối sau kết quả chính, trong bài báo nguồn, để biết thêm chi tiết về điều này.

* Sự chuyển đổi của tôi các chú thích nội tuyến của tác giả thành liên kết. Tác giả nhấn mạnh văn bản / không phải của tôi.

Được xuất bản lần đầu vào thứ Năm, ngày 19 tháng 6 năm 2025

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai