Góc nhìn Anderson

Sửa lỗi hạn chế của mô hình khuếch tán về sự phản chiếu và ánh xạ

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
ChatGPT-4o and Adobe Firefly

Kể từ khi AI tạo sinh thu hút sự chú ý của công chúng, giới nghiên cứu thị giác máy tính đã quan tâm sâu hơn đến việc xây dựng các mô hình có thể hiểu và tái tạo những định luật vật lý. Tuy nhiên, việc dạy hệ thống học máy mô phỏng trọng lực hay động lực học chất lỏng vẫn là một thách thức lớn trong ít nhất năm năm qua.

Từ khi mô hình khuếch tán tiềm ẩn (LDM) thống trị AI tạo sinh vào năm 2022, các nhà nghiên cứu ngày càng tập trung vào khả năng hạn chế của kiến trúc này trong việc hiểu và tái hiện hiện tượng vật lý. Vấn đề càng nổi bật sau sự xuất hiện của mô hình video Sora của OpenAI cùng các mô hình nguồn mở Hunyuan Video và Wan 2.1.

Phản chiếu chưa đạt yêu cầu

Phần lớn nghiên cứu nhằm cải thiện hiểu biết vật lý của LDM tập trung vào mô phỏng dáng đi, vật lý hạt và các dạng chuyển động Newton. Những lĩnh vực này được chú ý vì sai lệch trong hành vi vật lý cơ bản sẽ lập tức phá vỡ tính chân thực của video do AI tạo ra.

Tuy nhiên, một hướng nghiên cứu nhỏ nhưng đang phát triển tập trung vào một trong những điểm yếu lớn nhất của LDM: khả năng tương đối hạn chế trong việc tạo ra phản chiếu chính xác.

Các ví dụ về “lỗi phản chiếu” và phương pháp của nhóm nghiên cứu trong bài báo tháng 1/2025 “Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections”. Nguồn: https://arxiv.org/pdf/2409.14677

From the tháng 1 2025 paper 'Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections', examples of 'reflection failure' versus the researchers' own approach. Source: https://arxiv.org/pdf/2409.14677

Ví dụ về lỗi phản chiếu và phương pháp của nhóm nghiên cứu. Nguồn: https://arxiv.org/pdf/2409.14677

Đây cũng là một thách thức từ thời CGI và vẫn tồn tại trong trò chơi điện tử, nơi thuật toán dò tia mô phỏng đường đi của ánh sáng khi tương tác với bề mặt. Dò tia tính toán cách tia sáng ảo phản xạ khỏi hoặc xuyên qua vật thể để tạo phản chiếu, khúc xạ và bóng đổ chân thực.

Mỗi lần phản xạ bổ sung làm chi phí tính toán tăng mạnh. Vì vậy, ứng dụng thời gian thực phải cân bằng độ trễ và độ chính xác bằng cách giới hạn số lần tia sáng được phép phản xạ.

A representation of a virtually-calculated light-beam in a traditional 3D-based (i.e., CGI) scenario, using technologies and principles first developed in the 1960s, and which came to fulmination between 1982-93 (the span between Tron [1982] and Jurassic Park [1993]. Source: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing

Biểu diễn tia sáng được tính toán trong môi trường 3D hoặc CGI truyền thống. Nguồn: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing

Chẳng hạn, một ấm trà mạ crôm trước gương có thể khiến tia sáng liên tục nảy giữa các bề mặt phản chiếu, tạo vòng lặp gần như vô hạn nhưng đem lại rất ít lợi ích cho hình ảnh cuối. Trong đa số trường hợp, độ sâu hai hoặc ba lần phản xạ đã vượt quá khả năng nhận biết của người xem. Nếu chỉ có một lần, gương sẽ đen vì ánh sáng cần hoàn thành ít nhất hai hành trình để tạo phản chiếu nhìn thấy được.

Mỗi lần phản xạ thêm có thể làm thời gian kết xuất gần như tăng gấp đôi. Do đó, xử lý phản chiếu nhanh hơn là một trong những cơ hội quan trọng nhất để cải thiện chất lượng kết xuất dò tia.

Phản chiếu cũng thiết yếu đối với tính chân thực trong nhiều cảnh ít rõ ràng hơn: mặt đường hoặc chiến trường sau mưa, con phố đối diện hiện trên cửa kính cửa hàng, hay môi trường xuất hiện trong kính mắt của nhân vật.

Hiệu ứng phản chiếu kép được tạo bằng kỹ thuật ghép hình truyền thống trong một cảnh nổi tiếng của The Matrix (1999).

A simulated twin-reflection achieved via traditional compositing for an iconic scene in 'The Matrix' (1999).

Phản chiếu kép được tạo bằng kỹ thuật ghép hình truyền thống trong The Matrix (1999).

Những vấn đề về hình ảnh

Các khung phổ biến trước thời mô hình khuếch tán, như Neural Radiance Fields (NeRF), và đối thủ mới hơn như Gaussian Splatting cũng gặp khó khăn khi tạo phản chiếu tự nhiên.

Dự án REF²-NeRF đề xuất phương pháp dựa trên NeRF cho cảnh có tủ kính. Khúc xạ và phản chiếu được mô hình hóa bằng các thành phần phụ thuộc và không phụ thuộc góc nhìn. Nhờ đó, nhóm nghiên cứu ước lượng được bề mặt khúc xạ, đặc biệt là kính, rồi tách ánh sáng trực tiếp khỏi ánh sáng phản chiếu.

Examples from the Ref2Nerf paper. Source: https://arxiv.org/pdf/2311.17116

Ví dụ từ nghiên cứu Ref²-NeRF. Nguồn: https://arxiv.org/pdf/2311.17116

Các giải pháp NeRF khác trong vài năm gần đây gồm NeRFReN, Reflecting Reality và Planar Reflection-Aware Neural Radiance Fields của Meta. Với Gaussian Splatting có Mirror-3DGS, Reflective Gaussian Splatting và RefGaussian; dự án Nero năm 2023 cũng đề xuất một cách riêng để đưa đặc tính phản chiếu vào biểu diễn nơ-ron.

MirrorVerse

Buộc mô hình khuếch tán tuân thủ logic phản chiếu khó hơn so với các phương pháp có cấu trúc rõ ràng như Gaussian Splatting và NeRF. Quy tắc như vậy chỉ được học đáng tin cậy nếu dữ liệu huấn luyện có nhiều ví dụ đa dạng trong nhiều bối cảnh, nên kết quả phụ thuộc lớn vào phân bố và chất lượng dữ liệu gốc.

Thông thường, hành vi cụ thể được bổ sung bằng LoRA hoặc tinh chỉnh mô hình nền. Nhưng cả hai đều không lý tưởng: LoRA có xu hướng kéo kết quả về phía dữ liệu huấn luyện ngay cả khi không được yêu cầu, còn tinh chỉnh vừa tốn kém vừa có thể tách mô hình khỏi nhánh chính và tạo ra hệ công cụ riêng không hoạt động với phiên bản gốc hay phiên bản khác.

Việc cải thiện mô hình khuếch tán đòi hỏi dữ liệu huấn luyện chú ý hơn đến vật lý của phản chiếu. Tuy nhiên, nhiều điểm yếu khác cũng cần được quan tâm tương tự. Với tập dữ liệu siêu lớn, việc tuyển chọn riêng vừa khó vừa tốn kém, nên sửa từng khuyết điểm theo cách này không thực tế.

Dù vậy, các giải pháp vẫn thỉnh thoảng xuất hiện. Dự án MirrorVerse từ Ấn Độ cung cấp tập dữ liệu và phương pháp huấn luyện cải tiến nhằm nâng chuẩn xử lý phản chiếu trong nghiên cứu khuếch tán.

MirrorVerse cải thiện so với các phương pháp gần đây nhưng vẫn chưa hoàn hảo. Trong ví dụ, các bình gốm nằm lệch vị trí; ở một hình khác vốn không nên có phản chiếu của chiếc cốc, một phản chiếu sai lại bị chèn vào phía bên phải trái với góc phản chiếu tự nhiên.

Right-most, the results from MirrorVerse pitted against two prior approaches (central two columns). Source: https://arxiv.org/pdf/2504.15397

Kết quả MirrorVerse ở cột phải so với hai phương pháp trước. Nguồn: https://arxiv.org/pdf/2504.15397

Phương pháp mới đáng xem xét không chỉ vì có thể là trạng thái tốt nhất hiện tại, mà còn vì nó cho thấy phản chiếu có thể là vấn đề rất khó giải đối với cả khuếch tán ảnh lẫn video. Những ví dụ cần thiết thường gắn với hành động và bối cảnh cụ thể. Vì vậy, LDM có thể tiếp tục thua kém NeRF, Gaussian Splatting và CGI truyền thống trong chức năng này.

Bài báo mới mang tên MirrorVerse: Pushing Diffusion Models to Realistically Reflect the World, do ba nhà nghiên cứu từ Vision and AI Lab, IISc Bangalore và Samsung R&D Institute Bangalore thực hiện. Nghiên cứu có trang dự án, tập dữ liệu trên Hugging Face và mã nguồn trên GitHub.

Phương pháp

Ngay từ đầu, các tác giả minh họa khó khăn của Stable Diffusion và Flux khi phải tuân theo lời nhắc về phản chiếu. SD3.5 và Flux thường không tạo được phản chiếu nhất quán và chính xác về hình học.

From the paper: Current state-of-the-art text-to-image models, SD3.5 and Flux, exhibited significant challenges in producing consistent and geometrically accurate reflections when prompted to generate reflections in the scene.

SD3.5 và Flux gặp khó khăn khi tạo phản chiếu nhất quán, chính xác về hình học.

Nhóm phát triển MirrorFusion 2.0, một mô hình tạo sinh dựa trên khuếch tán nhằm cải thiện độ chân thực và độ chính xác hình học của phản chiếu trong ảnh tổng hợp. Mô hình được huấn luyện trên tập MirrorGen2 mới do họ tuyển chọn để khắc phục điểm yếu về khả năng khái quát của các phương pháp trước.

MirrorGen2 mở rộng phương pháp cũ bằng cách định vị vật thể ngẫu nhiên, xoay ngẫu nhiên và đặt vật thể chạm nền một cách rõ ràng. Mục tiêu là giữ phản chiếu hợp lý trong nhiều tư thế và vị trí khác nhau so với mặt gương.

Schema for the generation of synthetic data in MirrorVerse: the dataset generation pipeline applied key augmentations by randomly positioning, rotating, and grounding objects within the scene using the 3D-Positioner. Objects are also paired in semantically consistent combinations to simulate complex spatial relationships and occlusions, allowing the dataset to capture more realistic interactions in multi-object scenes.

Quy trình dữ liệu tổng hợp MirrorVerse định vị, xoay và neo vật thể ngẫu nhiên, đồng thời tạo các cặp hợp lý về ngữ nghĩa.

Để biểu diễn quan hệ không gian phức tạp, quy trình còn dùng các cặp vật thể phù hợp về ngữ nghĩa. Chẳng hạn, ghế được ghép với bàn. Sau khi vật thể chính được đặt và xoay, một vật thể thuộc nhóm đi kèm được bố trí sao cho không chồng lấn và mỗi vật thể chiếm vùng không gian riêng.

Việc neo vật thể xuống nền ngăn chúng “lơ lửng” không tự nhiên, lỗi thường xảy ra khi dữ liệu tổng hợp được tạo ở quy mô lớn hoặc bằng phương pháp tự động hóa cao.

Dữ liệu và thử nghiệm

SynMirrorV2

Tập SynMirrorV2 được xây dựng để tăng tính đa dạng và chân thực của dữ liệu huấn luyện phản chiếu. Các vật thể 3D đến từ Objaverse và Amazon Berkeley Objects (ABO), sau đó được tinh lọc bằng OBJECT 3DIT cùng quy trình lọc của dự án MirrorFusion V1 để loại tài sản chất lượng thấp. Kết quả là một tập gồm 66.062 vật thể.

Examples from the Objaverse dataset, used in the creation of the curated dataset for the new system. Source: https://arxiv.org/pdf/2212.08051

Ví dụ từ Objaverse, được dùng để tạo tập dữ liệu tuyển chọn cho hệ thống mới. Nguồn: https://arxiv.org/pdf/2212.08051

Cảnh được dựng bằng cách đặt các vật thể lên sàn có họa tiết từ CC-Textures và nền HDRI từ PolyHaven, với gương phủ toàn bộ tường hoặc gương chữ nhật cao. Ánh sáng được chuẩn hóa bằng một nguồn sáng vùng ở phía trên và sau vật thể, nghiêng 45 độ.

Vật thể được thu nhỏ để nằm trong một khối lập phương đơn vị và đặt tại giao điểm tính trước giữa trường nhìn của gương và camera để bảo đảm khả năng quan sát. Hệ thống áp dụng phép xoay ngẫu nhiên quanh trục y và kỹ thuật neo nền để tránh hiện tượng vật thể lơ lửng.

Để mô phỏng cảnh phức tạp, tập dữ liệu còn bố trí nhiều vật thể thành các cặp hợp lý theo nhóm ABO. Vật thể phụ được đặt tránh chồng lấn, tạo 3.140 cảnh nhiều vật thể với nhiều dạng che khuất và quan hệ chiều sâu.

Examples of rendered views from the authors' dataset containing multiple (more than two) objects, with illustrations of object segmentation and depth map visualizations seen below.

Các cảnh kết xuất nhiều vật thể cùng bản đồ phân đoạn và chiều sâu.

Quy trình huấn luyện

Nhận thấy độ chân thực tổng hợp chưa đủ để khái quát tốt sang dữ liệu đời thực, nhóm nghiên cứu phát triển một chương trình học ba giai đoạn cho MirrorFusion 2.0.

Ở giai đoạn đầu, trọng số của cả nhánh điều kiện và nhánh tạo được khởi tạo từ điểm kiểm tra Stable Diffusion v1.5. Mô hình được tinh chỉnh trên phần huấn luyện một vật thể của SynMirrorV2. Khác với dự án Reflecting Reality, nhánh tạo không bị đóng băng. Giai đoạn này kéo dài 40.000 vòng lặp.

Trong giai đoạn hai, mô hình được tinh chỉnh thêm 10.000 vòng trên phần nhiều vật thể của SynMirrorV2 để học cách xử lý che khuất và bố cục không gian phức tạp hơn.

Ở giai đoạn cuối, mô hình được tinh chỉnh thêm 10.000 vòng bằng dữ liệu đời thực từ MSD, với bản đồ chiều sâu do bộ ước lượng chiều sâu đơn mắt Matterport3D tạo ra.

Examples from the MSD dataset, with real-world scenes analyzed into depth and segmentation maps. Source: https://arxiv.org/pdf/1908.09101

Cảnh đời thực từ MSD được phân tích thành bản đồ chiều sâu và phân đoạn. Nguồn: https://arxiv.org/pdf/1908.09101

Trong 20% thời gian huấn luyện, lời nhắc văn bản bị bỏ đi để khuyến khích mô hình tận dụng tối đa thông tin chiều sâu. Tất cả giai đoạn chạy trên bốn GPU NVIDIA A100, với tốc độ học 1e-5, cỡ lô bốn mẫu trên mỗi GPU và bộ tối ưu AdamW.

Độ khó tăng dần từ cảnh tổng hợp đơn giản tới bố cục khó hơn, nhằm xây dựng khả năng chuyển giao bền vững sang dữ liệu thực.

Thử nghiệm

Các tác giả so sánh MirrorFusion 2.0 với MirrorFusion, phương pháp tốt nhất trước đó và là đường cơ sở, trên MirrorBenchV2 gồm cả cảnh một và nhiều vật thể. Thử nghiệm định tính bổ sung được thực hiện trên MSD và Google Scanned Objects (GSO).

Đánh giá dùng 2.991 ảnh một vật thể thuộc cả nhóm đã thấy và chưa thấy, cùng 300 cảnh hai vật thể từ ABO. Chất lượng phản chiếu trong vùng gương được đo bằng PSNR, SSIM và LPIPS; độ tương đồng CLIP đánh giá mức phù hợp giữa ảnh với lời nhắc.

Trong thử nghiệm định lượng, mỗi lời nhắc được tạo với bốn hạt ngẫu nhiên và chọn ảnh có điểm SSIM cao nhất. MirrorFusion 2.0 vượt đường cơ sở trong thử nghiệm một vật thể; phiên bản huấn luyện với nhiều vật thể cũng tốt hơn phiên bản không dùng chúng ở những cảnh phức tạp.

Left, Quantitative results for single object reflection generation quality on the MirrorBenchV2 single object split. MirrorFusion 2.0 outperformed the baseline, with the best results shown in bold. Right, quantitative results for multiple object reflection generation quality on the MirrorBenchV2 multiple object split. MirrorFusion 2.0 trained with multiple objects outperformed the version trained without them, with the best results shown in bold.

Kết quả định lượng một và nhiều vật thể trên MirrorBenchV2; MirrorFusion 2.0 vượt đường cơ sở.

Nhóm nghiên cứu kết luận rằng phương pháp mới vượt đường cơ sở và việc tinh chỉnh với nhiều vật thể cải thiện kết quả trong cảnh khó.

Phần lớn kết quả được nhấn mạnh là định tính. Trong MirrorBenchV2, đường cơ sở không giữ được phản chiếu và quan hệ không gian chính xác: hướng ghế sai và phản chiếu của nhiều vật thể bị méo. Theo tác giả, MirrorFusion 2.0 dựng ghế và sofa đúng vị trí, hướng và cấu trúc.

Comparison on MirrorBenchV2: the baseline failed to maintain accurate reflections and spatial consistency, showing incorrect chair orientation and distorted reflections of multiple objects, whereas (the authors contend) MirrorFusion 2.0 correctly renders the chair and the sofas, with accurate position, orientation, and structure.

So sánh MirrorBenchV2: phương pháp mới giữ vị trí, hướng và cấu trúc tốt hơn.

Họ cho rằng mô hình cũ thường tạo phép xoay sai và vật thể lơ lửng. MirrorFusion 2.0 được huấn luyện trên SynMirrorV2 giữ hướng và vị trí tốt hơn trong cả cảnh một lẫn nhiều vật thể, tạo phản chiếu hợp lý hơn.

Trên GSO, đường cơ sở mô tả sai cấu trúc vật thể và tạo phản chiếu thiếu hoặc méo. MirrorFusion 2.0 giữ được tính toàn vẹn không gian và tạo hình học, màu sắc, chi tiết chính xác hơn ngay cả với vật thể ngoài phân bố huấn luyện.

Comparison on the GSO dataset. The baseline misrepresented object structure and produced incomplete, distorted reflections, while MirrorFusion 2.0, the authors contend, preserves spatial integrity and generates accurate geometry, color, and detail, even on out-of-distribution objects.

So sánh trên GSO: MirrorFusion 2.0 giữ hình học, màu sắc và chi tiết tốt hơn.

Chẳng hạn, tay nắm ngăn kéo được phản chiếu đúng trong MirrorFusion 2.0, còn đường cơ sở tạo kết quả phi lý. Với chiếc cốc trắng-vàng, mô hình mới cho hình học thuyết phục với ít lỗi, trong khi mô hình cũ không thể hiện đúng hình dạng và diện mạo.

Thử nghiệm định tính cuối dùng cảnh đời thực từ MSD. Theo nhóm tác giả, MirrorFusion 2.0 nắm bắt chi tiết của cảnh phức tạp tốt hơn, bao gồm các vật thể lộn xộn trên bàn và nhiều gương trong không gian ba chiều.

Real-world scene results comparing MirrorFusion, MirrorFusion 2.0, and MirrorFusion 2.0, fine-tuned on the MSD dataset. MirrorFusion 2.0, the authors contend, captures complex scene details more accurately, including cluttered objects on a table, and the presence of multiple mirrors within a three-dimensional environment. Only partial results are shown  here, due to the dimensions of the results in the original paper, to which we refer the reader for full results and better resolution.

Kết quả cảnh MSD đời thực của MirrorFusion, MirrorFusion 2.0 và phiên bản tinh chỉnh trên MSD.

Mô hình hoạt động tốt trên MirrorBenchV2 và GSO nhưng ban đầu gặp khó với cảnh MSD phức tạp. Tinh chỉnh trên một phần MSD giúp nó xử lý môi trường lộn xộn và nhiều gương tốt hơn, tạo phản chiếu nhất quán và chi tiết hơn trên tập kiểm tra giữ lại.

Một nghiên cứu người dùng cho biết 84% người tham gia thích ảnh của MirrorFusion 2.0 hơn đường cơ sở. Chi tiết của nghiên cứu được trình bày trong phụ lục bài báo.

Results of the user study.

Kết quả nghiên cứu người dùng.

Nghiên cứu và liên kết nguồn

Các nghiên cứu, tập dữ liệu, trang dự án và nguồn kỹ thuật được đề cập trong bài:

Kết luận

Một số kết quả là cải thiện ấn tượng so với trạng thái tốt nhất trước đây. Tuy nhiên, mức nền của nhiệm vụ này quá thấp đến mức một giải pháp tổng hợp chưa thật thuyết phục vẫn có thể chiến thắng với nỗ lực vừa phải. Kiến trúc nền tảng của mô hình khuếch tán không thuận lợi cho việc học và thể hiện vật lý nhất quán một cách đáng tin cậy, nên bài toán dường như không có lời giải thanh lịch.

Bổ sung dữ liệu để khắc phục thiếu sót của LDM vốn đã là phương pháp tiêu chuẩn, cùng tất cả nhược điểm đã nêu. Nếu các tập dữ liệu quy mô lớn trong tương lai chú ý hơn đến phân bố và gán nhãn các ví dụ phản chiếu, những mô hình được huấn luyện trên chúng có thể xử lý tình huống này tốt hơn.

Nhưng điều tương tự cũng đúng với nhiều điểm yếu khác trong đầu ra LDM. Rất khó xác định vấn đề nào xứng đáng nhất với công sức và chi phí của một giải pháp như bài báo mới đề xuất.

 

Xuất bản lần đầu vào thứ Hai, ngày 28 tháng 4 năm 2025. Thứ Ba, ngày 29 tháng 4: sửa ngữ pháp trong các đoạn cuối.

Nhà viết về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng bộ phận nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó sáp nhập vào Brahma.ai của DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai