Góc nhìn Anderson
Lợi ích không lường trước của việc ánh xạ không gian tiềm ẩn của GAN

Trong khi cố gắng cải thiện chất lượng và độ trung thực của hình ảnh được tạo ra bởi trí tuệ nhân tạo, một nhóm các nhà nghiên cứu từ Trung Quốc và Úc đã vô tình phát hiện ra một phương pháp để kiểm soát tương tác không gian tiềm ẩn của một Mạng đối抗 tạo sinh (GAN) – ma trận tính toán bí ẩn đằng sau làn sóng mới của kỹ thuật tổng hợp hình ảnh đang được thiết lập để cách mạng hóa điện ảnh, trò chơi, truyền thông xã hội và nhiều lĩnh vực khác trong giải trí và nghiên cứu.
Khám phá của họ, một sản phẩm phụ của mục tiêu trung tâm của dự án, cho phép người dùng khám phá không gian tiềm ẩn của GAN một cách tùy ý và tương tác với chuột, như nếu họ đang scrub qua một video hoặc lật qua một cuốn sách.

Một đoạn trích từ video đi kèm của các nhà nghiên cứu (xem embed ở cuối bài viết cho nhiều ví dụ hơn). Lưu ý rằng người dùng đang thao tác các biến đổi với con trỏ ‘grab’ (trên cùng bên trái). Nguồn: https://www.youtube.com/watch?v=k7sG4XY5rIc
Phương pháp này sử dụng ‘bản đồ nhiệt’ để chỉ ra những khu vực của hình ảnh nên được cải thiện khi GAN chạy qua cùng một tập dữ liệu hàng nghìn (hoặc hàng trăm nghìn) lần. Các bản đồ nhiệt được thiết kế để cải thiện chất lượng hình ảnh bằng cách chỉ ra cho GAN nơi nó đang làm sai, để nó có thể thực hiện lại tốt hơn; nhưng, đồng thời, điều này cũng cung cấp một ‘bản đồ’ của toàn bộ không gian tiềm ẩn mà có thể được duyệt bằng cách di chuyển chuột.

Chú ý thị giác không gian được nhấn mạnh thông qua GradCAM, chỉ ra các khu vực cần chú ý bằng cách áp dụng màu sắc sáng. Nguồn: https://arxiv.org/pdf/2112.00718.pdf
Bài báo này được gọi là Cải thiện sự cân bằng của GAN bằng cách tăng cường nhận thức không gian, và đến từ các nhà nghiên cứu tại Đại học Trung Quốc Hồng Kông và Đại học Quốc gia Úc. Ngoài bài báo, video và các tài liệu khác có thể được tìm thấy tại trang dự án.
Công việc này vẫn còn trong giai đoạn đầu, và hiện chỉ giới hạn ở hình ảnh độ phân giải thấp (256×256), nhưng nó là một bằng chứng về khái niệm hứa hẹn sẽ phá vỡ ‘hộp đen’ của không gian tiềm ẩn, và đến vào thời điểm khi nhiều dự án nghiên cứu đang cố gắng kiểm soát tốt hơn quá trình tổng hợp hình ảnh.
Mặc dù những hình ảnh này rất hấp dẫn (và bạn có thể xem thêm chúng, với độ phân giải tốt hơn, trong video được nhúng ở cuối bài viết này), điều quan trọng hơn có lẽ là dự án đã tìm ra cách để tạo ra chất lượng hình ảnh tốt hơn, và có thể làm điều đó nhanh hơn, bằng cách chỉ ra cho GAN cụ thể nơi nó đang làm sai trong quá trình đào tạo.
Nhưng, như Đối抗 chỉ ra, GAN không phải là một thực thể duy nhất, mà thay vào đó là một cuộc xung đột không công bằng giữa quyền lực và lao động. Để hiểu được những cải tiến mà các nhà nghiên cứu đã thực hiện trong khía cạnh này, hãy cùng xem xét cách cuộc chiến này đã được đặc trưng cho đến nay.
Tình huống khó khăn của Bộ tạo sinh
Nếu bạn đã từng bị ám ảnh bởi suy nghĩ rằng một số món đồ mới mà bạn mua được sản xuất trong một nhà máy lao động ở một quốc gia bị bóc lột, hoặc có một ông chủ hoặc khách hàng luôn yêu cầu bạn ‘Làm lại!’ mà không bao giờ nói cho bạn biết điều gì là sai với nỗ lực cuối cùng của bạn, hãy dành một chút cảm thông cho Bộ tạo sinh trong Mạng đối抗 tạo sinh.

Bộ tạo sinh là công cụ làm việc chăm chỉ đã giúp GAN tạo ra hình ảnh người thật như đời thực không tồn tại, nâng cấp trò chơi video cũ lên độ phân giải 4k, và chuyển đổi đoạn phim cũ thành hình ảnh màu đầy đủ ở 60fps, trong số nhiều điều kỳ diệu khác của trí tuệ nhân tạo.

Từ việc tạo ra khuôn mặt thật như đời thực của những người không tồn tại đến việc phục hồi đoạn phim cũ và làm sống lại trò chơi video lưu trữ, GAN đã bận rộn trong những năm qua.
Bộ tạo sinh chạy qua tất cả dữ liệu đào tạo lại và lại (chẳng hạn như hình ảnh khuôn mặt, để tạo ra một GAN có thể tạo ra ảnh của những người ngẫu nhiên không tồn tại), một ảnh một lần, trong nhiều ngày, hoặc thậm chí nhiều tuần, cho đến khi nó có thể tạo ra hình ảnh thuyết phục như những ảnh thật mà nó đã nghiên cứu.
Vậy làm thế nào Bộ tạo sinh biết nó đang làm tiến bộ, mỗi lần nó cố gắng tạo ra một hình ảnh tốt hơn nỗ lực trước đó?
Bộ tạo sinh có một ông chủ từ địa ngục.

Độ không minh bạch tàn nhẫn của Bộ phân biệt
Công việc của Bộ phân biệt là nói với Bộ tạo sinh rằng nó không làm đủ tốt trong việc tạo ra một hình ảnh đích thực so với dữ liệu gốc, và để Làm lại!. Bộ phân biệt không nói với Bộ tạo sinh Điều gì là sai với nỗ lực cuối cùng của nó; nó chỉ xem xét riêng, so sánh hình ảnh được tạo với hình ảnh nguồn (cũng riêng), và gán một điểm số.
Điểm số không bao giờ đủ tốt. Bộ phân biệt sẽ không ngừng nói ‘Làm lại!’ cho đến khi các nhà nghiên cứu tắt nó (khi họ quyết định rằng đào tạo thêm sẽ không cải thiện đầu ra thêm nữa).
Theo cách này, vắng sự chỉ trích xây dựng, và chỉ có một điểm số mà metric là một bí ẩn, Bộ tạo sinh phải đoán ngẫu nhiên những phần hoặc khía cạnh của hình ảnh gây ra một điểm số cao hơn trước; điều này sẽ dẫn nó đến nhiều con đường không满意 hơn trước khi nó thay đổi một điều gì đó đủ tích cực để có được một điểm số cao hơn.
Bộ phân biệt như một người hướng dẫn và người cố vấn
Đổi mới được cung cấp bởi nghiên cứu mới này cơ bản là Bộ phân biệt bây giờ chỉ ra cho Bộ tạo sinh những phần của hình ảnh là không满意, để Bộ tạo sinh có thể tập trung vào những khu vực đó trong lần lặp lại tiếp theo, và không vứt bỏ những phần được đánh giá cao hơn. Bản chất của mối quan hệ đã thay đổi từ đối抗 sang hợp tác.

Để khắc phục sự chênh lệch về nhận thức giữa Bộ phân biệt và Bộ tạo sinh, các nhà nghiên cứu sử dụng GradCAM như một cơ chế có thể tạo ra sự phản hồi trực quan cho nỗ lực tiếp theo của Bộ tạo sinh.
Phương pháp đào tạo mới được gọi là EqGAN. Để có tính tái tạo tối đa, các nhà nghiên cứu đã kết hợp các kỹ thuật và phương pháp hiện có với các thiết lập mặc định, bao gồm việc sử dụng StyleGan2 kiến trúc.

Kiến trúc của EqGAN. Mã hóa không gian của Bộ tạo sinh được căn chỉnh với nhận thức không gian của Bộ phân biệt, với các mẫu ngẫu nhiên của bản đồ nhiệt không gian (xem hình ảnh trước) được mã hóa lại vào bộ tạo sinh thông qua lớp mã hóa không gian (SEL). GradCAM là cơ chế mà qua đó các bản đồ chú ý của Bộ phân biệt được làm cho có sẵn cho bộ tạo sinh.
GradCAM tạo ra bản đồ nhiệt (xem hình ảnh trên) phản ánh sự chỉ trích của Bộ phân biệt đối với nỗ lực cuối cùng, và làm cho nó có sẵn cho Bộ tạo sinh.
Khi mô hình được đào tạo, bản đồ vẫn còn như một di tích của quá trình hợp tác này, nhưng cũng có thể được sử dụng để khám phá mã tiềm ẩn cuối cùng theo cách tương tác được chứng minh trong video dự án của các nhà nghiên cứu (xem dưới).
EqGAN
Dự án sử dụng một số tập dữ liệu phổ biến, bao gồm tập dữ liệu LSUN Cat và Churches, cũng như tập dữ liệu FFHQ. Video dưới đây cũng có các ví dụ về việc thao tác khuôn mặt và mèo sử dụng EqGAN.
Tất cả hình ảnh đã được thay đổi kích thước thành 256×256 trước khi đào tạo EqGAN trên triển khai chính thức của StyleGAN2. Mô hình được đào tạo với kích thước batch 64 trên 8 GPU cho đến khi Bộ phân biệt đã được hiển thị hơn 25 triệu hình ảnh.
Kiểm tra kết quả của hệ thống trên các mẫu được chọn với khoảng cách Frechet Inception (FID), các tác giả đã thiết lập một metric gọi là Chỉ số Disequilibrium (DI) – mức độ mà Bộ phân biệt vẫn giữ được lợi thế kiến thức so với Bộ tạo sinh, với mục tiêu thu hẹp khoảng cách đó.
Trên ba tập dữ liệu được đào tạo, metric mới này cho thấy một sự giảm hữu ích sau khi mã hóa nhận thức không gian vào Bộ tạo sinh, với sự cân bằng được cải thiện được chứng minh bởi cả FID và DI.

Các nhà nghiên cứu kết luận:
‘Chúng tôi hy vọng công việc này có thể truyền cảm hứng cho nhiều công việc khác về việc xem xét lại sự cân bằng của GAN và phát triển các phương pháp mới để cải thiện chất lượng tổng hợp hình ảnh thông qua việc điều khiển sự cân bằng của GAN. Chúng tôi cũng sẽ tiến hành nhiều cuộc điều tra lý thuyết về vấn đề này trong công việc tương lai.’
Và tiếp tục:
‘Kết quả định lượng cho thấy phương pháp của chúng tôi thành công [buộc Bộ tạo sinh] tập trung vào các khu vực cụ thể. Thử nghiệm trên các tập dữ liệu khác nhau xác nhận rằng phương pháp của chúng tôi giảm thiểu sự mất cân bằng trong đào tạo GAN và cải thiện đáng kể chất lượng tổng hợp hình ảnh chung. Mô hình kết quả với nhận thức không gian cũng cho phép thao tác tương tác của hình ảnh đầu ra.’
Hãy xem video dưới đây để biết thêm chi tiết về dự án và các ví dụ khác về khám phá động và tương tác của không gian tiềm ẩn trong GAN.
11:12am 4th Dec 2021 – Corrected URL for GradCAM and tidied up surrounding reference.












