Góc nhìn Anderson

‘Ngôn ngữ vô nghĩa’ có thể phá vỡ hệ thống kiểm duyệt tổng hợp hình ảnh

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
DALL-E 2: 'a man in a state of exaspenttausacion' . https://labs.openai.com/s/PHCrZh2i5FC2N814U8pbxuug

Nghiên cứu mới từ Đại học Columbia cho thấy rằng các biện pháp an toàn ngăn chặn các mô hình tổng hợp hình ảnh như DALL-E 2, Imagen và Parti từ việc tạo ra hình ảnh có hại hoặc gây tranh cãi dễ bị tấn công bởi một loại tấn công đối thủ liên quan đến ‘từ ngữ được tạo ra’.

Tác giả đã phát triển hai phương pháp có thể vượt qua các biện pháp kiểm duyệt nội dung trong hệ thống tổng hợp hình ảnh và phát hiện ra rằng chúng rất mạnh mẽ ngay cả trên các kiến trúc khác nhau, cho thấy rằng điểm yếu này không chỉ là hệ thống mà còn có thể liên quan đến một số nguyên tắc cơ bản của tổng hợp hình ảnh từ văn bản.

Phương pháp đầu tiên và mạnh mẽ hơn là gọi là macaronic prompting. Thuật ngữ ‘macaronic’ ban đầu đề cập đến sự kết hợp của nhiều ngôn ngữ, như được tìm thấy trong Esperanto hoặc Unwinese. Có lẽ ví dụ được biết đến nhiều nhất sẽ là Urdu-English, một loại ‘trộn mã’ phổ biến ở Pakistan, thường kết hợp tự do các danh từ tiếng Anh và hậu tố tiếng Urdu.

Compositional macaronic prompting trong DALL-E 2. Nguồn: https://arxiv.org/pdf/2208.04135.pdf

Compositional macaronic prompting trong DALL-E 2. Nguồn: https://arxiv.org/pdf/2208.04135.pdf

Trong một số ví dụ trên, các phần của từ có nghĩa đã được dán lại với nhau, sử dụng tiếng Anh làm ‘khung’. Các ví dụ khác trong bài viết sử dụng nhiều ngôn ngữ trên một lời nhắc.

Hệ thống sẽ phản hồi một cách có ý nghĩa về mặt ngữ nghĩa vì sự thiếu giám sát tương đối trong các nguồn web mà hệ thống được đào tạo. Các nguồn này thường đi kèm với nhãn đa ngôn ngữ (tức là từ các tập dữ liệu không được thiết kế đặc biệt cho nhiệm vụ tổng hợp hình ảnh), và mỗi từ được tiêu thụ, bất kể ngôn ngữ nào, sẽ trở thành một ‘token’; nhưng tương tự, các phần của các từ đó sẽ trở thành ‘subwords’ hoặc các token phân đoạn. Trong Xử lý Ngôn ngữ Tự nhiên (NLP), loại ‘stemming’ này giúp phân biệt nguồn gốc của các từ phái sinh dài hơn có thể xuất hiện trong các hoạt động biến đổi, nhưng cũng tạo ra một ‘bộ Lego’ từ vựng lớn mà ‘lời nhắc sáng tạo’ có thể tận dụng.

Các từ ghép đơn ngôn ngữ cũng có hiệu quả trong việc lấy hình ảnh thông qua ngôn ngữ gián tiếp hoặc không thông thường.

Các từ ghép đơn ngôn ngữ cũng có hiệu quả trong việc lấy hình ảnh thông qua ngôn ngữ gián tiếp hoặc không thông thường, với kết quả thường có thể đạt được trên các kiến trúc khác nhau, chẳng hạn như DALL-E 2 và DALL-E Mini (Craiyon).

Trong phương pháp thứ hai, được gọi là evocative prompting, một số từ ghép lại với nhau tương tự như ‘tiếng Latinh trường học’ được trình diễn trong Monty Python’s Life of Brian (1979).

Không phải là một trò đùa - tiếng Latin giả thường thành công trong việc thu hút một phản hồi có ý nghĩa từ DALL-E 2.

Không phải là một trò đùa – tiếng Latin giả thường thành công trong việc thu hút một phản hồi có ý nghĩa từ DALL-E 2.

Tác giả tuyên bố:

‘Một mối quan ngại rõ ràng với phương pháp này là việc lách qua các bộ lọc nội dung dựa trên các lời nhắc bị liệt đen. Về nguyên tắc, lời nhắc macaronic có thể cung cấp một cách dễ dàng và đáng tin cậy để vượt qua các bộ lọc như vậy nhằm tạo ra nội dung có hại, xúc phạm, bất hợp pháp hoặc nhạy cảm khác, bao gồm cả hình ảnh bạo lực, căm thù, phân biệt chủng tộc, phân biệt giới tính hoặc khiêu dâm, và có thể cả hình ảnh vi phạm quyền sở hữu trí tuệ hoặc mô tả các cá nhân thực sự.

‘Các công ty cung cấp dịch vụ tạo hình ảnh đã dành rất nhiều sự quan tâm để ngăn chặn việc tạo ra các đầu ra như vậy theo chính sách nội dung của họ. Do đó, lời nhắc macaronic nên được điều tra một cách hệ thống như một mối đe dọa đối với các giao thức an toàn được sử dụng cho việc tạo hình ảnh thương mại.’

Tác giả đề xuất một số biện pháp khắc phục đối với điểm yếu này, một số trong đó anh ấy thừa nhận có thể được coi là quá hạn chế.

Giải pháp đầu tiên là tốn kém nhất: để giám sát cẩn thận hơn các hình ảnh nguồn đào tạo, với sự giám sát của con người nhiều hơn và ít hơn về mặt thuật toán. Tuy nhiên, bài viết thừa nhận rằng điều này sẽ không ngăn cản hệ thống tổng hợp hình ảnh tạo ra một sự kết hợp xúc phạm giữa hai khái niệm hình ảnh vô hại.

Thứ hai, bài viết đề xuất rằng các hệ thống tổng hợp hình ảnh có thể chạy đầu ra thực tế của chúng qua một hệ thống lọc, chặn bất kỳ sự kết hợp vấn đề nào trước khi chúng được cung cấp cho người dùng. Có thể DALL-E 2 hiện đang hoạt động một bộ lọc như vậy, mặc dù OpenAI chưa tiết lộ chính xác cách thức kiểm duyệt nội dung của DALL-E 2 hoạt động.

Cuối cùng, tác giả xem xét khả năng của một ‘từ điển danh sách trắng’, chỉ cho phép các từ đã được kiểm tra và phê duyệt để truy xuất và hiển thị các khái niệm, nhưng thừa nhận rằng điều này có thể đại diện cho một hạn chế quá mức đối với tính hữu ích của hệ thống.

Mặc dù nhà nghiên cứu chỉ thực nghiệm với năm ngôn ngữ (tiếng Anh, tiếng Đức, tiếng Pháp, tiếng Tây Ban Nha và tiếng Ý) trong việc tạo các lời nhắc, anh ấy tin rằng loại ‘tấn công đối thủ’ này có thể trở nên ‘vô nghĩa’ và khó ngăn chặn hơn bằng cách mở rộng số lượng ngôn ngữ, vì các mô hình siêu quy mô như DALL-E 2 được đào tạo trên nhiều ngôn ngữ (chỉ vì nó dễ dàng hơn khi sử dụng đầu vào ‘thô’ hoặc ‘lọc nhẹ’ hơn là xem xét chi phí khổng lồ để giám sát nó, và vì chiều thêm này có thể bổ sung cho tính hữu ích của hệ thống).

Bài viết bài viết có tiêu đề Adversarial Attacks on Image Generation With Made-Up Words, và đến từ Raphaël Millièr tại Đại học Columbia.

Ngôn ngữ vô nghĩa trong DALL-E 2

Đã có đề xuất trước đó rằng những từ vô nghĩa mà DALL-E 2 tạo ra mỗi khi nó cố gắng mô tả ngôn ngữ viết có thể tự nó là một ‘từ vựng ẩn’. Tuy nhiên, nghiên cứu trước đây về ngôn ngữ bí ẩn này đã không cung cấp bất kỳ cách nào để phát triển chuỗi nonce có thể triệu tập hình ảnh cụ thể.

Trong công việc trước đó, bài viết tuyên bố:

‘[Nó] không cung cấp một phương pháp đáng tin cậy để tìm các chuỗi nonce thu hút hình ảnh cụ thể. Hầu hết văn bản vô nghĩa được DALL-E 2 bao gồm trong hình ảnh không dường như liên quan đáng tin cậy với các khái niệm trực quan cụ thể khi được chuyển录 và sử dụng làm lời nhắc. Điều này hạn chế tính khả thi của cách tiếp cận này như một cách để lách qua việc kiểm duyệt nội dung có hại hoặc xúc phạm; như vậy, nó không phải là một rủi ro đặc biệt đáng lo ngại cho việc lạm dụng các mô hình tạo hình ảnh được hướng dẫn bằng văn bản.’

Thay vào đó, hai phương pháp của tác giả được mô tả chi tiết như những cách mà vô nghĩa có thể triệu tập hình ảnh có ý nghĩa và liên quan trong khi vượt qua các quy tắc ứng xử thông thường đang phát triển thành kỹ thuật lời nhắc.

Bằng cách lấy ví dụ, tác giả xem xét từ ‘chim’ trong năm ngôn ngữ nằm trong phạm vi của bài viết: Vögel trong tiếng Đức, uccelli trong tiếng Ý, oiseaux trong tiếng Pháp, và pájaros trong tiếng Tây Ban Nha.

Với mã hóa cặp byte (BPE) được sử dụng bởi triển khai CLIP tích hợp vào DALL-E 2, các từ được mã hóa thành tiếng Anh không có dấu, và có thể được ‘kết hợp sáng tạo’ để tạo thành các từ nonce dường như là vô nghĩa đối với chúng ta, nhưng vẫn giữ ý nghĩa kết hợp cho DALL-E 2, cho phép hệ thống thể hiện ý định nhận thức:

Trong ví dụ trên, hai trong số các ‘từ nước ngoài’ cho chim được dán lại với nhau thành một chuỗi vô nghĩa. Nhờ trọng lượng phân đoạn của các subword, ý nghĩa được giữ lại.

Tác giả nhấn mạnh rằng kết quả có ý nghĩa cũng có thể được thu được mà không cần tuân theo ranh giới của phân đoạn subword, có lẽ vì DALL-E 2 (nghiên cứu chính của bài viết) đã tổng quát hóa đủ tốt để cho phép ranh giới của các subword mờ đi mà không phá hủy ý nghĩa của chúng.

Để chứng minh thêm các phương pháp được phát triển, bài viết cung cấp các ví dụ về lời nhắc macaronic trên các lĩnh vực khác nhau, sử dụng danh sách các từ token được minh họa dưới đây (với các từ ghép vô nghĩa ở phía bên phải).

Tác giả tuyên bố rằng các ví dụ sau từ DALL-E 2 không được ‘chọn lọc’:

Tiếng franca

Bài viết cũng lưu ý rằng một số ví dụ như vậy hoạt động tương tự hoặc rất giống nhau trên cả DALL-E 2 và DALL-E Mini (bây giờ là Craiyon), và điều này gây ngạc nhiên, vì DALL-E 2 là một mô hình khuếch tán và DALL-E Mini thì không; hai hệ thống được đào tạo trên các tập dữ liệu khác nhau; và DALL-E Mini sử dụng bộ mã hóa BART thay vì bộ mã hóa CLIP được DALL-E 2 ưa chuộng.

Kết quả tương tự đáng chú ý từ DALL-E Mini, so với hình ảnh trước đó, có tính năng kết quả từ cùng một 'vô nghĩa' đầu vào từ DALL-E 2.

Kết quả tương tự đáng chú ý từ DALL-E Mini, so với hình ảnh trước đó, có tính năng kết quả từ cùng một ‘vô nghĩa’ đầu vào từ DALL-E 2.

Như đã thấy trong hình ảnh đầu tiên, lời nhắc macaronic cũng có thể được lắp ráp thành các câu có cấu trúc ngữ pháp để tạo ra các cảnh phức tạp hơn. Tuy nhiên, điều này đòi hỏi phải sử dụng tiếng Anh làm ‘khung’ để lắp ráp các khái niệm, khiến quá trình này có nhiều khả năng bị hệ thống kiểm duyệt tiêu chuẩn trong khuôn khổ tổng hợp hình ảnh chặn lại.

Bài viết lưu ý rằng sự kết hợp từ vựng, ‘dán’ các từ lại với nhau để thu hút nội dung liên quan từ hệ thống tổng hợp hình ảnh, cũng có thể được thực hiện trong một ngôn ngữ duy nhất, bằng cách sử dụng các từ ghép.

Lời nhắc gợi cảm

Phương pháp ‘lời nhắc gợi cảm’ được giới thiệu trong bài viết phụ thuộc vào việc ‘gợi cảm’ một phản hồi rộng rãi hơn từ hệ thống bằng các từ không hoàn toàn dựa trên subword hoặc subtoken hoặc nhãn được chia sẻ một phần.

Một loại lời nhắc gợi cảm là tiếng Latin giả, có thể, trong số các mục đích khác, tạo ra hình ảnh của các loại thuốc giả, ngay cả khi không có chỉ định rằng DALL-E 2 nên truy xuất khái niệm ‘thuốc’:

Lời nhắc gợi cảm cũng hoạt động đặc biệt tốt với các lời nhắc vô nghĩa liên quan đến các vị trí địa lý có thể và hoạt động khá đáng tin cậy trên các kiến trúc khác nhau của DALL-E 2 và DALL-E Mini:

Các từ được sử dụng cho các lời nhắc này đến DALL-E 2 và DALL-E Mini gợi nhớ đến các tên thực, nhưng bản thân chúng là vô nghĩa. Tuy nhiên, các hệ thống đã 'nhận được bầu không khí' của các từ.

Các từ được sử dụng cho các lời nhắc này đến DALL-E 2 và DALL-E Mini gợi nhớ đến các tên thực, nhưng bản thân chúng là vô nghĩa. Tuy nhiên, các hệ thống đã ‘nhận được bầu không khí’ của các từ.

Có vẻ như có một số sự chồng chéo giữa lời nhắc macaronic và lời nhắc gợi cảm. Bài viết tuyên bố:

‘Dường như sự khác biệt trong dữ liệu đào tạo, kích thước mô hình và kiến trúc mô hình có thể khiến các mô hình khác nhau phân tích các lời nhắc như voiscellpajaraux và eidelucertlagarzard theo cách ‘macaronic’ hoặc ‘gợi cảm’, ngay cả khi các mô hình này đã được chứng minh là phản hồi với cả hai phương pháp nhắc.

Bài viết kết luận:

‘Mặc dù các thuộc tính khác nhau của các mô hình này – bao gồm kích thước, kiến trúc, thủ tục mã hóa và dữ liệu đào tạo – có thể ảnh hưởng đến sự dễ bị tấn công của chúng đối với các cuộc tấn công đối thủ dựa trên văn bản, nhưng bằng chứng sơ bộ được thảo luận trong công việc này cho thấy rằng một số cuộc tấn công như vậy có thể hoạt động khá đáng tin cậy trên các mô hình.’

Có thể nói rằng rào cản lớn nhất đối với việc thử nghiệm thực sự xung quanh các phương pháp này là rủi ro bị gắn cờ và bị cấm bởi hệ thống chủ. DALL-E 2 yêu cầu một số điện thoại liên kết với mỗi tài khoản người dùng, hạn chế số lượng ‘tài khoản giả’ có thể cần thiết để thực sự kiểm tra ranh giới của loại tấn công từ vựng này, về mặt lách qua các phương pháp kiểm duyệt hiện có. Hiện tại, biện pháp bảo vệ chính của DALL-E 2 vẫn là sự không ổn định của quyền truy cập.

 

Được xuất bản lần đầu vào ngày 9 tháng 8 năm 2022.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai