Mô hình và nền tảng AI

DreamCraft3D: Tạo hình 3D phân cấp với kỹ thuật khuếch tán khởi tạo

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Các mô hình AI tạo sinh đã là chủ đề thảo luận nóng trong ngành AI trong một thời gian. Sự thành công gần đây của các mô hình tạo sinh 2D đã mở đường cho các phương pháp chúng ta sử dụng để tạo nội dung hình ảnh ngày nay. Mặc dù cộng đồng AI đã đạt được thành công đáng kể với các mô hình tạo sinh 2D, việc tạo nội dung 3D vẫn là một thách thức lớn đối với các khung khổ AI tạo sinh sâu. Điều này đặc biệt đúng khi nhu cầu về nội dung 3D tạo sinh đang đạt mức cao nhất từ trước đến nay, được thúc đẩy bởi một loạt các trò chơi trực quan, ứng dụng, thực tế ảo và thậm chí cả điện ảnh. Điều đáng chú ý là mặc dù có các khung khổ AI tạo sinh 3D cung cấp kết quả chấp nhận được cho một số danh mục và nhiệm vụ nhất định, nhưng chúng không thể tạo ra các đối tượng 3D một cách hiệu quả. Sự thiếu hụt này có thể được quy cho sự thiếu dữ liệu 3D rộng lớn để đào tạo các khung khổ. Gần đây, các nhà phát triển đã đề xuất tận dụng hướng dẫn do các mô hình AI tạo sinh hình ảnh từ văn bản (T2I) đã được đào tạo trước đó cung cấp, một phương pháp đã cho thấy kết quả đầy hứa hẹn.

Trong bài viết này, chúng ta sẽ thảo luận về khung khổ DreamCraft3D, một mô hình phân cấp để tạo nội dung 3D sản xuất các đối tượng 3D nhất quán và có độ trung thực cao. Khung khổ DreamCraft3D sử dụng một hình ảnh tham chiếu 2D để hướng dẫn giai đoạn điêu khắc hình học, tăng cường kết cấu với trọng tâm là giải quyết các vấn đề về tính nhất quán mà các khung khổ hoặc phương pháp hiện tại gặp phải. Ngoài ra, khung khổ DreamCraft3D sử dụng một mô hình khuếch tán phụ thuộc vào góc nhìn để chưng cất điểm số, giúp điêu khắc hình học góp phần vào việc kết xuất nhất quán.

Chúng ta sẽ đi sâu vào khung khổ DreamCraft3D để tạo nội dung 3D. Hơn nữa, chúng ta sẽ khám phá khái niệm tận dụng các mô hình T2I đã được đào tạo trước để tạo nội dung 3D và kiểm tra cách khung khổ DreamCraft3D nhằm tận dụng phương pháp này để tạo nội dung 3D thực tế.

DreamCraft3D: Giới thiệu

DreamCraft3D là một đường ống phân cấp để tạo nội dung 3D. Khung khổ DreamCraft3D cố gắng tận dụng một khung khổ tạo sinh hình ảnh từ văn bản (T2I) hiện đại để tạo ra hình ảnh 2D chất lượng cao bằng cách sử dụng một đề xuất văn bản. Phương pháp này cho phép khung khổ DreamCraft3D tối đa hóa khả năng của các mô hình khuếch tán 2D hiện đại để thể hiện các ngữ nghĩa hình ảnh được mô tả trong đề xuất văn bản, đồng thời giữ lại sự tự do sáng tạo được cung cấp bởi các khung khổ AI tạo sinh 2D này. Hình ảnh được tạo ra sau đó được chuyển thành 3D với sự giúp đỡ của các giai đoạn tăng cường kết cấu hình học và điêu khắc hình học, và các kỹ thuật chuyên dụng được áp dụng tại mỗi giai đoạn với sự giúp đỡ của việc phân hủy vấn đề.

Về mặt hình học, khung khổ DreamCraft3D tập trung mạnh vào cấu trúc 3D toàn cầu và tính nhất quán của nhiều góc nhìn, do đó tạo điều kiện cho việc thỏa hiệp về các kết cấu chi tiết trong hình ảnh. Khi khung khổ loại bỏ các vấn đề liên quan đến hình học, nó chuyển sự chú ý sang việc tối ưu hóa các kết cấu nhất quán và thực tế bằng cách thực hiện một kỹ thuật khuếch tán nhận thức 3D khởi tạo. Có hai yếu tố thiết kế chính cho hai giai đoạn tối ưu hóa, đó là Điêu khắc Hình học và Tăng cường Kết cấu.

Với tất cả những điều đã nói, sẽ an toàn khi mô tả DreamCraft3D như một khung khổ AI tạo sinh sử dụng một đường ống tạo nội dung 3D phân cấp để chuyển đổi hình ảnh 2D thành các đối ứng 3D của chúng, đồng thời duy trì tính nhất quán 3D toàn diện.

Tận dụng các mô hình T2I hoặc Text-to-Image đã được đào tạo trước

Ý tưởng tận dụng các mô hình T2I hoặc Text-to-Image đã được đào tạo trước để tạo nội dung 3D được giới thiệu lần đầu tiên bởi khung khổ DreamFusion vào năm 2022. Khung khổ DreamFusion cố gắng thực thi một tổn thất Chưng cất Điểm số (SDS) để tối ưu hóa khung khổ 3D theo cách mà kết xuất tại các góc nhìn ngẫu nhiên sẽ phù hợp với phân phối hình ảnh có điều kiện văn bản được giải thích bởi một khung khổ khuếch tán hình ảnh từ văn bản hiệu quả. Mặc dù phương pháp DreamFusion cung cấp kết quả tốt, nhưng có hai vấn đề chính, đó là sự mờ và quá bão hòa. Để giải quyết những vấn đề này, các công việc gần đây thực hiện các chiến lược tối ưu hóa giai đoạn theo giai đoạn để cải thiện tổn thất khuếch tán 2D, điều này cuối cùng dẫn đến hình ảnh 3D tạo sinh chất lượng tốt hơn và thực tế hơn.

Tuy nhiên, mặc dù những khung khổ này gần đây đã thành công, chúng không thể sánh với khả năng của các khung khổ tạo sinh 2D trong việc tổng hợp nội dung phức tạp. Hơn nữa, những khung khổ này thường bị ảnh hưởng bởi vấn đề “Janus Issue”, một tình trạng trong đó kết xuất 3D dường như hợp lý khi xem xét riêng lẻ, nhưng lại cho thấy sự không nhất quán về phong cách và ngữ nghĩa khi được kiểm tra như một toàn thể.

Để giải quyết các vấn đề mà các công việc trước đây gặp phải, khung khổ DreamCraft3D khám phá khả năng sử dụng một đường ống tạo nội dung 3D phân cấp, và tìm kiếm cảm hứng từ quá trình nghệ thuật thủ công trong đó một khái niệm được viết xuống thành một bản thảo 2D, sau đó nghệ sĩ điêu khắc hình học thô, tinh chỉnh các chi tiết hình học và sơn các kết cấu có độ trung thực cao. Theo cách tiếp cận tương tự, khung khổ DreamCraft3D chia nhỏ các nhiệm vụ tạo nội dung 3D hoặc hình ảnh thành các bước có thể quản lý. Nó bắt đầu bằng cách tạo ra một hình ảnh 2D chất lượng cao bằng cách sử dụng một đề xuất văn bản, và sau đó sử dụng tăng cường kết cấu và điêu khắc hình học để chuyển hình ảnh lên các giai đoạn 3D. Việc chia quá trình thành các giai đoạn giúp khung khổ DreamCraft3D tối đa hóa tiềm năng của việc tạo sinh phân cấp, điều này cuối cùng dẫn đến việc tạo ra hình ảnh 3D chất lượng cao hơn.

Trong giai đoạn đầu tiên, khung khổ DreamCraft3D triển khai điêu khắc hình học để tạo ra hình dạng hình học 3D nhất quán và hợp lý bằng cách sử dụng hình ảnh 2D làm tham chiếu. Hơn nữa, giai đoạn này không chỉ sử dụng tổn thất SDS cho các tổn thất quang học và các góc nhìn mới tại góc nhìn tham chiếu, mà khung khổ còn giới thiệu một loạt các chiến lược để thúc đẩy tính nhất quán hình học. Khung khổ nhằm tận dụng Zero-1-to-3, một mô hình dịch hình ảnh có điều kiện góc nhìn, để sử dụng hình ảnh tham chiếu để mô hình hóa phân phối của các góc nhìn mới. Ngoài ra, khung khổ còn chuyển từ biểu diễn bề mặt ngầm sang biểu diễn lưới để tinh chỉnh hình học từ thô đến mịn.

Giai đoạn thứ hai của khung khổ DreamCraft3D sử dụng một phương pháp chưng cất điểm số khởi tạo để tăng cường kết cấu của hình ảnh, vì các mô hình khuếch tán có điều kiện góc nhìn hiện tại được đào tạo trên một lượng dữ liệu 3D hạn chế, điều này khiến chúng thường gặp khó khăn trong việc đạt được hiệu suất hoặc độ trung thực của các mô hình khuếch tán 2D. Nhờ vào sự hạn chế này, khung khổ DreamCraft3D tinh chỉnh mô hình khuếch tán theo các hình ảnh đa góc nhìn của thể 3D đang được tối ưu hóa, và cách tiếp cận này giúp khung khổ tăng cường kết cấu 3D đồng thời duy trì tính nhất quán đa góc nhìn. Khi mô hình khuếch tán được đào tạo trên các kết xuất đa góc nhìn, nó cung cấp hướng dẫn tốt hơn cho việc tối ưu hóa kết cấu 3D, và cách tiếp cận này giúp khung khổ DreamCraft3D đạt được một lượng chi tiết kết cấu đáng kinh ngạc đồng thời duy trì tính nhất quán góc nhìn.

Như có thể quan sát được trong hình ảnh trên, khung khổ DreamCraft3D có khả năng tạo ra hình ảnh và nội dung 3D sáng tạo với kết cấu thực tế và cấu trúc hình học phức tạp. Trong hình ảnh đầu tiên, là cơ thể của Son Goku, một nhân vật anime kết hợp với đầu của một con lợn hoang dã đang chạy, trong khi hình ảnh thứ hai mô tả một con Beagle mặc trang phục của một thám tử. Dưới đây là một số ví dụ thêm.

DreamCraft3D: Hoạt động và Kiến trúc

Khung khổ DreamCraft3D cố gắng tận dụng một khung khổ tạo sinh hình ảnh từ văn bản (T2I) hiện đại để tạo ra hình ảnh 2D chất lượng cao bằng cách sử dụng một đề xuất văn bản. Phương pháp này cho phép khung khổ DreamCraft3D tối đa hóa khả năng của các mô hình khuếch tán 2D hiện đại để thể hiện các ngữ nghĩa hình ảnh được mô tả trong đề xuất văn bản, đồng thời giữ lại sự tự do sáng tạo được cung cấp bởi các khung khổ AI tạo sinh 2D này. Hình ảnh được tạo ra sau đó được chuyển thành 3D với sự giúp đỡ của các giai đoạn tăng cường kết cấu hình học và điêu khắc hình học, và các kỹ thuật chuyên dụng được áp dụng tại mỗi giai đoạn với sự giúp đỡ của việc phân hủy vấn đề. Dưới đây là hình ảnh tóm tắt hoạt động của khung khổ DreamCraft3D.

Hãy cùng xem xét kỹ lưỡng các yếu tố thiết kế chính cho các giai đoạn tăng cường kết cấu và điêu khắc hình học.

Điêu khắc Hình học

Điêu khắc Hình học là giai đoạn đầu tiên nơi khung khổ DreamCraft3D cố gắng tạo ra một mô hình 3D theo cách phù hợp với hình ảnh của hình ảnh tham chiếu tại cùng một góc nhìn tham chiếu, đồng thời đảm bảo tính hợp lý tối đa ngay cả dưới các góc nhìn khác nhau. Để đảm bảo tính hợp lý tối đa, khung khổ sử dụng tổn thất SDS để khuyến khích kết xuất hình ảnh hợp lý cho từng góc nhìn mẫu được một mô hình khuếch tán đã được đào tạo trước nhận ra. Hơn nữa, để tận dụng hướng dẫn từ hình ảnh tham chiếu một cách hiệu quả, khung khổ phạt các sự khác biệt quang học giữa hình ảnh tham chiếu và hình ảnh được kết xuất tại góc nhìn tham chiếu, và tổn thất được tính toán chỉ trong khu vực tiền cảnh của góc nhìn. Ngoài ra, để khuyến khích sự thưa thớt của cảnh, khung khổ cũng thực hiện một tổn thất mặt nạ để kết xuất hình dạng. Mặc dù vậy, việc duy trì hình ảnh và ngữ nghĩa trên các góc nhìn sau vẫn còn là một thách thức, đó là lý do tại sao khung khổ sử dụng các phương pháp bổ sung để tạo ra hình học chi tiết và nhất quán.

Trước khuếch tán 3D

Các phương pháp tối ưu hóa 3D sử dụng giám sát từng góc nhìn riêng lẻ là không đủ, đó là lý do chính tại sao khung khổ DreamCraft3D sử dụng Zero-1-to-3, một mô hình khuếch tán có điều kiện góc nhìn, vì Zero-1-to-3 cung cấp nhận thức góc nhìn được cải thiện vì nó đã được đào tạo trên một lượng lớn tài sản dữ liệu 3D. Hơn nữa, Zero-1-to-3 là một mô hình khuếch tán tinh chỉnh, nó ảo hóa hình ảnh liên quan đến tư thế máy ảnh cho hình ảnh tham chiếu.

Đào tạo góc nhìn tiến bộ

Việc suy dẫn trực tiếp các góc nhìn miễn phí trong 360 độ có thể dẫn đến các hiện tượng hình học hoặc sự không nhất quán như một chân thừa trên ghế, một sự kiện có thể được quy cho sự mơ hồ vốn có của một hình ảnh tham chiếu đơn. Để giải quyết chướng ngại vật này, khung khổ DreamCraft3D mở rộng các góc nhìn đào tạo một cách tiến bộ, sau đó hình học đã được thiết lập tốt sẽ được truyền đạt dần để đạt được kết quả trong 360 độ.

Giảm dần bước thời gian khuếch tán

Khung khổ DreamCraft3D sử dụng một chiến lược giảm dần bước thời gian khuếch tán để phù hợp với tiến trình từ thô đến tinh của tối ưu hóa 3D. Tại đầu quá trình tối ưu hóa, khung khổ ưu tiên việc lấy mẫu một bước khuếch tán lớn hơn, nhằm cung cấp cấu trúc toàn cầu. Khi khung khổ tiến hành quá trình đào tạo, nó giảm dần phạm vi lấy mẫu theo thời gian trong hàng trăm lần lặp. Nhờ vào chiến lược giảm dần, khung khổ quản lý để thiết lập một hình học toàn cầu hợp lý trong các bước tối ưu hóa đầu tiên trước khi tinh chỉnh các chi tiết cấu trúc.

Cải thiện cấu trúc chi tiết

Khung khổ DreamCraft3D tối ưu hóa một biểu diễn bề mặt ngầm ban đầu để thiết lập một cấu trúc thô. Sau đó, khung khổ sử dụng kết quả này và kết hợp nó với một lưới tetrahedral có thể biến dạng hoặc DMTet để khởi tạo một biểu diễn lưới 3D có kết cấu, giúp tách biệt việc học kết cấu và hình học. Khi khung khổ hoàn thành việc cải thiện cấu trúc, mô hình có khả năng giữ lại các chi tiết tần số cao lấy từ hình ảnh tham chiếu bằng cách tinh chỉnh kết cấu một cách duy nhất.

Tăng cường Kết cấu bằng cách sử dụng Lấy mẫu Điểm số Khởi tạo

Mặc dù giai đoạn điêu khắc hình học tập trung vào việc học hình học chi tiết và nhất quán, nhưng nó có thể làm mờ kết cấu đến một mức độ nhất định, điều này có thể là kết quả của việc khung khổ phụ thuộc vào một mô hình trước 2D hoạt động ở độ phân giải thô cùng với độ sắc nét hạn chế được cung cấp bởi mô hình khuếch tán 3D. Hơn nữa, các vấn đề kết cấu phổ biến bao gồm quá bão hòa và quá mịn có thể phát sinh do sự hướng dẫn tự do lớn của phân loại.

Khung khổ sử dụng một tổn thất Chưng cất Điểm số Biến thể (VSD) để tăng cường tính thực tế của kết cấu. Khung khổ chọn một mô hình Khuếch tán Ổn định trong giai đoạn này để có được các gradient độ phân giải cao. Hơn nữa, khung khổ giữ lưới tetrahedral cố định để thúc đẩy việc kết xuất thực tế và tối ưu hóa cấu trúc tổng thể của lưới. Trong quá trình học, khung khổ DreamCraft3D không sử dụng Zero-1-to-3 vì nó có tác động bất lợi đến chất lượng kết cấu, và những kết cấu không nhất quán này có thể lặp lại, dẫn đến đầu ra 3D kỳ lạ.

Thử nghiệm và Kết quả

Để đánh giá hiệu suất của khung khổ DreamCraft3D, nó được so sánh với các khung khổ hiện đại và các kết quả định lượng và định tính được phân tích.

So sánh với các Mô hình Cơ sở

Để đánh giá hiệu suất, khung khổ DreamCraft3D được so sánh với 5 khung khổ hiện đại, bao gồm DreamFusion, Magic3D, ProlificDreamer, Magic123 và Make-it-3D. Bộ thử nghiệm bao gồm 300 hình ảnh đầu vào là sự kết hợp của hình ảnh thế giới thực và những hình ảnh được tạo ra bởi mô hình Khuếch tán Ổn định. Mỗi hình ảnh trong bộ thử nghiệm có một đề xuất văn bản, một bản đồ độ sâu dự đoán và một mặt nạ alpha cho tiền cảnh. Khung khổ lấy đề xuất văn bản cho hình ảnh thực từ một khuôn khổ chú thích hình ảnh.

Phân tích Định tính

Hình ảnh sau so sánh khung khổ DreamCraft3D với các mô hình cơ sở hiện tại, và như có thể thấy, các khung khổ dựa trên phương pháp văn bản-sang-3D thường gặp phải các vấn đề về tính nhất quán đa góc nhìn.

Một mặt, bạn có khung khổ ProlificDreamer cung cấp kết cấu thực tế, nhưng nó không đủ khả năng tạo ra một đối tượng 3D hợp lý. Các khung khổ như Make-it-3D dựa trên phương pháp Hình ảnh-sang-3D có thể tạo ra các góc nhìn phía trước chất lượng cao, nhưng chúng không thể duy trì hình học lý tưởng cho hình ảnh. Các hình ảnh được tạo ra bởi khung khổ Magic123 cung cấp sự điều hòa hình học tốt hơn, nhưng chúng tạo ra các kết cấu hình học quá bão hòa và mịn. So với các khung khổ này, khung khổ DreamCraft3D sử dụng một phương pháp chưng cất điểm số khởi tạo không chỉ duy trì tính nhất quán ngữ nghĩa mà còn cải thiện sự đa dạng của tưởng tượng.

Phân tích Định lượng

Trong một nỗ lực để tạo ra hình ảnh 3D hấp dẫn không chỉ giống với hình ảnh tham chiếu đầu vào mà còn truyền đạt ngữ nghĩa từ nhiều góc nhìn một cách nhất quán, các kỹ thuật được sử dụng bởi khung khổ DreamCraft3D được so sánh với các mô hình cơ sở, và quá trình đánh giá sử dụng bốn chỉ số: PSNR và LPIPS để đo độ trung thực tại góc nhìn tham chiếu, Khoảng cách Ngữ cảnh để đánh giá sự phù hợp pixel, và CLIP để ước tính sự phù hợp ngữ nghĩa. Kết quả được thể hiện trong hình ảnh sau.

Kết luận

Trong bài viết này, chúng ta đã thảo luận về DreamCraft3D, một đường ống phân cấp để tạo nội dung 3D. Khung khổ DreamCraft3D nhằm tận dụng một khung khổ tạo sinh hình ảnh từ văn bản (T2I) hiện đại để tạo ra hình ảnh 2D chất lượng cao bằng cách sử dụng một đề xuất văn bản. Phương pháp này cho phép khung khổ DreamCraft3D tối đa hóa khả năng của các mô hình khuếch tán 2D hiện đại để thể hiện các ngữ nghĩa hình ảnh được mô tả trong đề xuất văn bản, đồng thời giữ lại sự tự do sáng tạo được cung cấp bởi các khung khổ AI tạo sinh 2D này. Hình ảnh được tạo ra sau đó được chuyển thành 3D thông qua các giai đoạn tăng cường kết cấu hình học và điêu khắc hình học, và các kỹ thuật chuyên dụng được áp dụng tại mỗi giai đoạn với sự giúp đỡ của việc phân hủy vấn đề. Nhờ vào cách tiếp cận này, khung khổ DreamCraft3D có thể tạo ra các tài sản 3D có độ trung thực cao và nhất quán với kết cấu hấp dẫn, có thể xem từ nhiều góc độ.

"Một kỹ sư theo nghề nghiệp, một nhà văn theo trái tim". Kunal là một nhà văn kỹ thuật với tình yêu và hiểu biết sâu sắc về AI và ML, dành để đơn giản hóa các khái niệm phức tạp trong các lĩnh vực này thông qua tài liệu hấp dẫn và thông tin của mình.