Góc nhìn Anderson

Hệ Thống Phát Hiện Đối Với Các Khung Năng Lực Tổng Hợp Ảnh Như DALL-E 2

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Nghiên cứu mới từ Đại học California tại Berkeley cung cấp một phương pháp để xác định liệu đầu ra từ thế hệ mới của các khung tổng hợp ảnh – như DALL-E 2 của Open AI, và Imagen và Parti của Google – có thể được phát hiện là ‘không thực’ bằng cách nghiên cứu hình học, bóng và phản chiếu trong các ảnh tổng hợp.

Khi nghiên cứu các ảnh được tạo ra từ các lệnh văn bản trong DALL-E 2, các nhà nghiên cứu đã phát hiện ra rằng mặc dù kiến trúc này có khả năng tạo ra các ảnh rất thực, nhưng vẫn có một số sự không nhất quán liên quan đến việc tạo ra các góc nhìn toàn cầu, tạo ra và sắp xếp các bóng, và đặc biệt là việc tạo ra các vật thể phản chiếu.

Bài báo cho biết:

‘[Cấu trúc] hình học, bóng và phản chiếu trên các bề mặt phản chiếu không hoàn toàn nhất quán với hình học góc nhìn của các cảnh tự nhiên. Cấu trúc hình học và bóng thường nhất quán tại địa phương, nhưng không nhất quán tại toàn cầu.

‘Phản chiếu, mặt khác, thường được tạo ra không hợp lý, có thể do chúng ít phổ biến hơn trong tập dữ liệu hình ảnh được sử dụng để đào tạo.’

Sự thiếu nhất quán trong các giao điểm giữa vật thể được tạo ra và phản chiếu của nó hiện là một cách đáng tin cậy để phát hiện ảnh DALL-E 2, theo nghiên cứu mới. Nguồn: https://arxiv.org/pdf/2206.14617.pdf

Sự thiếu nhất quán trong các giao điểm giữa vật thể được tạo ra và phản chiếu của nó hiện là một cách đáng tin cậy để phát hiện ảnh DALL-E 2, theo nghiên cứu mới. Nguồn: https://arxiv.org/pdf/2206.14617.pdf

Bài báo này đại diện cho một bước đầu tiên trong lĩnh vực nghiên cứu về phát hiện tổng hợp ảnh – một lĩnh vực có thể trở nên quan trọng trong cộng đồng nghiên cứu thị giác máy tính.

Kể từ khi xuất hiện các video giả mạo vào năm 2017, việc phát hiện video giả mạo (chủ yếu là đầu ra của các gói như DeepFaceLab và FaceSwap) đã trở thành một chủ đề nghiên cứu cạnh tranh, với nhiều bài báo và phương pháp nhắm vào các ‘dấu hiệu’ của các ảnh tổng hợp trong các cảnh quay video thực.

Tuy nhiên, cho đến khi xuất hiện các hệ thống tổng hợp ảnh quy mô lớn, đầu ra từ các hệ thống tổng hợp ảnh từ văn bản như CLIP không gây ra mối đe dọa đối với hiện trạng của ‘thực tế ảnh’. Các tác giả của bài báo mới này tin rằng điều này sắp thay đổi, và rằng ngay cả những sự không nhất quán mà họ đã phát hiện trong đầu ra của DALL-E 2 cũng có thể không gây ra nhiều khác biệt đối với khả năng lừa đảo của các ảnh được tạo ra.

Các tác giả cho biết:

‘[Những] thất bại này có thể không quan trọng đối với hệ thống thị giác của con người, đã được phát hiện là khá kém trong một số phán đoán hình học nhất định, bao gồm sự không nhất quán trong ánh sáng, bóng, phản chiếu, vị trí xem, và phóng to góc nhìn.’

Sự Mất Tín Nhiệm

Các tác giả đã tiến hành một cuộc kiểm tra pháp y đầu tiên về đầu ra của DALL-E 2 liên quan đến việc tạo ra các góc nhìn – cách mà các cạnh thẳng của các vật thể gần đó và các kết cấu nên được giải quyết đồng nhất đến một ‘điểm biến mất’.

Bên trái, các đường thẳng song song trên cùng một mặt phẳng giải quyết đến một điểm biến mất chung; bên phải, nhiều điểm biến mất trên cùng một mặt phẳng và các mặt song song định nghĩa một đường biến mất (được描 trong màu đỏ).

Bên trái, các đường thẳng song song trên cùng một mặt phẳng giải quyết đến một điểm biến mất chung; bên phải, nhiều điểm biến mất trên cùng một mặt phẳng và các mặt song song định nghĩa một đường biến mất (được描 trong màu đỏ).

Để kiểm tra sự nhất quán của DALL-E 2 trong khía cạnh này, các tác giả đã sử dụng DALL-E 2 để tạo ra 25 ảnh tổng hợp của các căn bếp – một không gian quen thuộc thường được giới hạn trong các ngôi nhà để cung cấp nhiều điểm biến mất cho các vật thể và kết cấu.

Khi kiểm tra đầu ra từ lệnh ‘một ảnh của một căn bếp với sàn lát gạch’, các nhà nghiên cứu đã phát hiện ra rằng mặc dù có một đại diện khá thuyết phục trong mỗi trường hợp (ngoại trừ một số hiện象 nhỏ không liên quan đến góc nhìn), các vật thể được miêu tả không bao giờ hội tụ đúng cách.

Các tác giả lưu ý rằng mặc dù mỗi tập hợp các đường thẳng song song từ mẫu gạch là nhất quán và giao nhau tại một điểm biến mất duy nhất (màu xanh lam trong ảnh dưới), điểm biến mất của mặt bàn (màu xanh lá cây) không đồng ý với cả đường biến mất (màu đỏ) và điểm biến mất được suy ra từ gạch.

Các tác giả quan sát thấy rằng ngay cả khi mặt bàn không song song với gạch, điểm biến mất màu xanh lá cây nên được giải quyết đến đường biến mất (màu đỏ) được định nghĩa bởi các điểm biến mất của gạch sàn.

Bài báo cho biết:

‘Mặc dù góc nhìn trong những ảnh này là – ấn tượng – nhất quán tại địa phương, nhưng không nhất quán tại toàn cầu. Mẫu này được tìm thấy trong mỗi một trong 25 ảnh tổng hợp của căn bếp.’

Pháp Y Về Bóng

Khi ai đó đã từng xử lý việc tạo bóng cũng biết rằng bóng cũng có thể có các điểm biến mất, chỉ ra nguồn sáng đơn hoặc đa nguồn. Đối với các bóng ngoài trời trong ánh sáng mặt trời mạnh, người ta sẽ mong đợi các bóng trên tất cả các mặt của một ảnh sẽ giải quyết nhất quán đến nguồn sáng đơn (mặt trời).

Giống như thí nghiệm trước, các nhà nghiên cứu đã tạo ra 25 ảnh DALL-E 2 với lệnh ‘ba khối lập phương trên vỉa hè được chụp vào một ngày nắng’ cũng như 25 ảnh với lệnh ‘ba khối lập phương trên vỉa hè được chụp vào một ngày nhiều mây’.

Hàng trên, ảnh được tạo ra từ lệnh 'ba khối lập phương trên vỉa hè được chụp vào một ngày nhiều mây'; hàng dưới, ảnh được tạo ra từ lệnh 'ba khối lập phương trên vỉa hè được chụp vào một ngày nắng'.

Hàng trên, ảnh được tạo ra từ lệnh ‘ba khối lập phương trên vỉa hè được chụp vào một ngày nhiều mây’; hàng dưới, ảnh được tạo ra từ lệnh ‘ba khối lập phương trên vỉa hè được chụp vào một ngày nắng’.

Các nhà nghiên cứu lưu ý rằng khi thể hiện điều kiện nhiều mây, DALL-E 2 có thể tạo ra các bóng mờ hơn một cách thuyết phục và hợp lý, có thể không chỉ vì loại bóng này thường được tìm thấy trong tập dữ liệu ảnh được sử dụng để đào tạo.

Tuy nhiên, một số ‘ảnh nắng’ mà các tác giả đã tìm thấy là không nhất quán với một cảnh được chiếu sáng từ một nguồn sáng đơn.

Đối với ảnh trên, các thế hệ đã được chuyển đổi sang thang độ xám để rõ ràng, và hiển thị mỗi vật thể với ‘mặt trời’ riêng của nó.

Mặc dù người xem trung bình có thể không phát hiện ra những bất thường này, nhưng một số ảnh được tạo ra có những ví dụ rõ ràng hơn về ‘sự thất bại của bóng’:

Phản Chiếu Trong DALL-E 2

Kết quả đáng chú ý nhất trong việc phân tích pháp y đến khi các tác giả kiểm tra khả năng của DALL-E 2 trong việc tạo ra các bề mặt phản chiếu cao, một tính toán khó khăn trong các thuật toán tạo ảnh truyền thống.

Để thực hiện thí nghiệm này, các tác giả đã tạo ra 25 ảnh DALL-E 2 với lệnh ‘một ảnh của một con khủng long đồ chơi và phản chiếu của nó trong gương trang điểm’.

Trong tất cả các trường hợp, các tác giả báo cáo rằng ảnh phản chiếu của con khủng long đồ chơi được tạo ra không liên kết với khía cạnh và sự sắp xếp của con khủng long ‘thật’. Các tác giả cho biết vấn đề này không thể giải quyết được bằng cách thay đổi lệnh văn bản, và dường như là một điểm yếu cơ bản trong hệ thống.

Có vẻ như có một logic trong một số lỗi – hai ví dụ đầu tiên trong hàng trên dường như hiển thị một con khủng long được ‘nhân bản’ rất tốt, nhưng không phản chiếu.

Các tác giả cho biết:

‘Không giống như bóng và cấu trúc hình học trong các phần trước, DALL·E-2 gặp khó khăn trong việc tạo ra các phản chiếu hợp lý, có thể do các phản chiếu như vậy ít phổ biến hơn trong tập dữ liệu hình ảnh được sử dụng để đào tạo.’

Những lỗi như vậy có thể được khắc phục trong các mô hình tổng hợp ảnh từ văn bản trong tương lai, những mô hình có thể xem xét lại logic ngữ nghĩa tổng thể của đầu ra và áp đặt các quy tắc vật lý trừu tượng lên các cảnh đã được tập hợp từ các tính năng liên quan đến từ trong không gian ẩn của hệ thống.

Trong bối cảnh xu hướng ngày càng tăng đối với các kiến trúc tổng hợp ảnh quy mô lớn, các tác giả kết luận:

‘[Có thể] chỉ là vấn đề thời gian trước khi các động cơ tổng hợp ảnh từ văn bản học cách tạo ra các ảnh với sự nhất quán góc nhìn hoàn chỉnh. Cho đến lúc đó, các phân tích pháp y hình học có thể chứng minh hữu ích trong việc phân tích các ảnh này.’

 

* Tôi đã chuyển đổi các trích dẫn nội tuyến của tác giả thành liên kết.

Được xuất bản lần đầu vào ngày 30 tháng 6 năm 2022.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai