Góc nhìn Anderson

Giải Pháp Độc Đáo Của DALL-E 2 Đối Với Các Nghĩa Kép

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Bất kỳ ai học tiếng Ý đều học cách chú ý đến ngữ cảnh khi mô tả một chổi, vì từ tiếng Ý cho vật dụng gia đình tầm thường này có một ý nghĩa thứ hai cực kỳ không phù hợp như một động từ*. Mặc dù chúng ta học cách tách rời ánh xạ ngữ nghĩa và tính áp dụng của các từ có nhiều nghĩa, nhưng đây không phải là một kỹ năng dễ dàng truyền đạt cho các hệ thống tổng hợp hình ảnh siêu quy mô như DALL-E 2 và Stable Diffusion, vì chúng dựa trên mô-đun huấn luyện ngôn ngữ-hình ảnh tương phản của OpenAI (CLIP), điều này xử lý các đối tượng và thuộc tính của chúng một cách lỏng lẻo hơn (mặc dù đang ngày càng phát triển trong không gian tổng hợp hình ảnh và video khuếch tán tiềm ẩn).

Khi nghiên cứu sự thiếu hụt này, một nghiên cứu hợp tác mới từ Đại học Bar-Ilan và Viện Trí tuệ Nhân tạo Allen cung cấp một nghiên cứu sâu về mức độ mà DALL-E 2 có xu hướng mắc lỗi ngữ nghĩa như vậy:

Các nghĩa kép được tách ra thành nhiều đối tượng trong DALL-E 2 – mặc dù bất kỳ hệ thống khuếch tán tiềm ẩn nào cũng có thể tạo ra các ví dụ như vậy. Trong hình ảnh trên cùng bên phải, việc loại bỏ 'vàng' khỏi lời nhắc sẽ thay đổi loài cá, trong khi trong trường hợp của 'đường zebra', cần phải chỉ định rõ bề mặt đường để loại bỏ sự liên kết trùng lặp. Nguồn: https://export.arxiv.org/pdf/2210.10606

Các nghĩa kép được tách ra thành nhiều cách hiểu trong DALL-E 2 – mặc dù bất kỳ hệ thống khuếch tán tiềm ẩn nào cũng có thể tạo ra các ví dụ như vậy. Trong hình ảnh trên cùng bên phải, việc loại bỏ ‘vàng’ khỏi lời nhắc sẽ thay đổi loài cá, trong khi trong trường hợp của ‘đường zebra’, cần phải chỉ định rõ bề mặt đường để loại bỏ sự liên kết trùng lặp. Nguồn: https://export.arxiv.org/pdf/2210.10606

Các tác giả đã phát hiện ra rằng xu hướng này để giải thích từ và cụm từ một cách kép dường như không chỉ phổ biến đối với tất cả các mô hình khuếch tán được hướng dẫn bởi CLIP, mà còn trở nên tồi tệ hơn khi các mô hình được đào tạo trên số lượng dữ liệu ngày càng lớn. Bài báo lưu ý rằng các phiên bản ‘giảm’ của các mô hình hình ảnh đến văn bản, bao gồm DALL-E Mini (bây giờ là Craiyon) tạo ra những lỗi này ít thường xuyên hơn, và rằng Stable Diffusion cũng mắc lỗi ít hơn – mặc dù chỉ vì, rất thường, nó không tuân theo lời nhắc một cách hoàn toàn, điều này là một loại lỗi khác.

Lời nhắc đơn giản 'ngày' buộc DALL-E 2 phải gọi hai trong số nhiều nghĩa của từ, trong khi từ 'quạt' cũng tách thành hai ánh xạ ngữ nghĩa của nó, và trong hình ảnh thứ ba, cụm từ 'nón' đáng tin cậy biến thức ăn không xác định trong lời nhắc thành kem, được liên kết với 'nón'.

Lời nhắc đơn giản ‘ngày’ buộc DALL-E 2 phải gọi hai trong số nhiều nghĩa của từ, trong khi từ ‘quạt’ cũng tách thành hai ánh xạ ngữ nghĩa của nó, và trong hình ảnh thứ ba, cụm từ ‘nón’ đáng tin cậy biến thức ăn không xác định trong lời nhắc thành kem, được liên kết với ‘nón’.

Giải thích cách chúng ta thực hiện các phân tách từ vựng hiệu quả, bài báo cho biết:

‘Trong khi các ký hiệu – cũng như cấu trúc câu – có thể mơ hồ, sau khi một cách giải thích được xây dựng, sự mơ hồ này đã được giải quyết. Ví dụ, trong khi ký hiệu ‘dơi’ trong một ‘dơi bay’ có thể được hiểu là một cây gậy gỗ hoặc một con vật, cách giải thích của chúng tôi về câu là hoặc một ‘dơi gỗ bay’ hoặc một ‘con vật bay’, nhưng không phải cả hai cùng một lúc. Khi từ ‘dơi’ đã được sử dụng trong cách giải thích để chỉ định một đối tượng (ví dụ một cây gậy gỗ), nó không thể được sử dụng lại để chỉ định một đối tượng khác (một con vật) trong cùng một cách giải thích.’

DALL-E 2, bài báo quan sát, không bị giới hạn theo cách này:

'Một con dơi đang bay trên một sân vận động bóng chày' – hình ảnh đầu tiên là từ bài báo, ba hình ảnh còn lại được lấy bằng cách cho cùng một lời nhắc vào DALL-E 2.

‘Một con dơi đang bay trên một sân vận động bóng chày’ – hình ảnh đầu tiên là từ bài báo, ba hình ảnh còn lại được lấy bằng cách cho cùng một lời nhắc vào DALL-E 2.

Thuộc tính này đã được đặt tên độ nhạy tài nguyên.

Các tác giả xác định ba hành vi bất thường được DALL-E 2 thể hiện: rằng một từ hoặc cụm từ có thể được giải thích và hiệu quả tách thành hai thực thể riêng biệt, tạo ra một đối tượng hoặc khái niệm cho mỗi trong cùng một cảnh; rằng một từ có thể được giải thích như một bộ sửa đổi của hai thực thể khác nhau (xem các ví dụ ‘cá vàng’ và các ví dụ khác ở trên); và rằng một từ có thể được giải thích đồng thời như một bộ sửa đổi và một thực thể thay thế – được minh họa bằng lời nhắc ‘một con hải cẩu đang mở một bức thư’:

'Một con hải cẩu đang mở một bức thư' – hình ảnh đầu tiên là từ bài báo, ba hình ảnh tiếp theo là các bản sao giống hệt từ DALL-E 2. Các ví dụ hình ảnh thực tế dưới đây có thêm văn bản 'hình ảnh, Canon50, 85mm, F5.6, hình ảnh giành giải thưởng'.

‘Một con hải cẩu đang mở một bức thư’ – hình ảnh đầu tiên là từ bài báo, ba hình ảnh tiếp theo là các bản sao giống hệt từ DALL-E 2. Các ví dụ hình ảnh thực tế dưới đây có thêm văn bản ‘hình ảnh, Canon50, 85mm, F5.6, hình ảnh giành giải thưởng’.

Các tác giả xác định hai chế độ thất bại cho các mô hình khuếch tán trong khía cạnh này: rằng kết quả của các lời nhắc người dùng với từ có nghĩa mơ hồ sẽ thường xuyên thể hiện từ được cụ thể hóa cùng với một số biểu hiện của khái niệm; và rò rỉ khái niệm, nơi các thuộc tính của một đối tượng ‘rò rỉ’ vào một đối tượng khác được tạo.

‘Khi xem xét các hiện tượng chúng tôi nghiên cứu, cung cấp bằng chứng cho những hạn chế trong khả năng ngôn ngữ của DALLE-2 và mở ra các hướng nghiên cứu trong tương lai để khám phá xem những hạn chế này có nguồn gốc từ vấn đề với mã hóa văn bản, mô hình tạo hoặc cả hai. Một cách tổng quát hơn, phương pháp được đề xuất có thể được mở rộng sang các kịch bản khác nơi quá trình giải mã được sử dụng để tiết lộ sự thiên vị và điểm yếu của các mô hình hình ảnh đến văn bản.’

Sử dụng 17 từ sẽ khiến DALL-E 2 tách đầu vào thành nhiều đầu ra, các tác giả quan sát thấy rằng sự nhân đôi đồng nghĩa xảy ra trong hơn 80% trong số 216 hình ảnh được tạo.

Các nhà nghiên cứu sử dụng các cặp kiểm soát kích thích để kiểm tra mức độ mà ngôn ngữ cụ thể và có thể quá cụ thể là cần thiết để ngăn chặn những sự nhân đôi này xảy ra. Đối với các thử nghiệm thực thể-sở hữu, 10 cặp như vậy đã được tạo, và các tác giả lưu ý rằng các lời nhắc kích thích gây ra thuộc tính chung trong 92,5% số trường hợp, trong khi lời nhắc kiểm soát chỉ gây ra nó trong 6,6% số trường hợp.

‘[Để] chứng minh, hãy xem xét một con zebra và một con đường, ở đây, zebra là một thực thể, nhưng nó sửa đổi đường, và DALLE-2 thường tạo ra vạch qua đường, có thể là do sự giống nhau của sọc zebra với vạch qua đường. Và phù hợp với suy đoán của chúng tôi, kiểm soát một con zebra và một con đường sỏi chỉ định một loại đường thường không có vạch qua đường, và thực sự, tất cả các mẫu kiểm soát của chúng tôi cho lời nhắc này không chứa vạch qua đường.’

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai