Mô hình và nền tảng AI

Paint3D : Mô hình khuếch tán không cần ánh sáng cho Tạo hình ảnh

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Sự phát triển nhanh chóng của các mô hình tạo sinh AI, đặc biệt là các mô hình tạo sinh sâu, đã nâng cao đáng kể khả năng tạo sinh ngôn ngữ tự nhiên, tạo sinh 3D, tạo sinh hình ảnh và tổng hợp giọng nói. Những mô hình này đã cách mạng hóa sản xuất 3D trong nhiều ngành công nghiệp. Tuy nhiên, nhiều mô hình này gặp phải một thách thức: các mạch phức tạp và lưới tạo sinh của chúng thường không tương thích với các đường ống kết xuất truyền thống như Rendering Vật lý (PBR). Các mô hình dựa trên khuếch tán, đặc biệt là không có kết cấu ánh sáng, đã chứng minh khả năng tạo sinh tài sản 3D đa dạng, nâng cao các khuôn khổ 3D trong sản xuất phim, trò chơi và AR/VR.

Bài viết này giới thiệu Paint3D, một khuôn khổ mới để tạo ra các bản đồ kết cấu 2K UV đa dạng, độ phân giải cao cho các lưới 3D không có kết cấu, có điều kiện trên các đầu vào hình ảnh hoặc văn bản. Thách thức chính của Paint3D là tạo ra các kết cấu chất lượng cao mà không có ánh sáng nhúng, cho phép người dùng chỉnh sửa lại hoặc chiếu sáng lại trong các đường ống đồ họa hiện đại. Nó sử dụng một mô hình khuếch tán 2D đã được đào tạo trước để hợp nhất kết cấu đa góc nhìn, tạo ra các bản đồ kết cấu thô ban đầu. Tuy nhiên, những bản đồ này thường hiển thị các hiện象 ánh sáng và các khu vực không đầy đủ do hạn chế của mô hình 2D trong việc vô hiệu hóa các hiệu ứng ánh sáng và đại diện đầy đủ các hình dạng 3D. Chúng tôi sẽ đi sâu vào cách thức hoạt động, kiến trúc và so sánh của Paint3D với các khuôn khổ tạo sinh sâu khác. Hãy bắt đầu.

Paint3D : Giới thiệu

Khả năng của các mô hình tạo sinh AI sâu trong tạo sinh ngôn ngữ tự nhiên, tạo sinh 3D và tổng hợp hình ảnh là nổi tiếng và được triển khai trong các ứng dụng thực tế, cách mạng hóa ngành công nghiệp tạo sinh 3D. Mặc dù có khả năng đáng kể, các khuôn khổ tạo sinh AI sâu hiện đại tạo ra các lưới có dây phức tạp và kết cấu ánh sáng hỗn loạn thường không tương thích với các đường ống kết xuất truyền thống bao gồm PBR hoặc Rendering Vật lý. Giống như các mô hình tạo sinh AI sâu, tổng hợp kết cấu cũng đã phát triển nhanh chóng, đặc biệt là trong việc sử dụng các mô hình khuếch tán 2D. Các mô hình tổng hợp kết cấu sử dụng các mô hình khuếch tán đã được đào tạo trước hiệu quả để sử dụng các điều kiện văn bản để tạo ra các kết cấu chất lượng cao. Tuy nhiên, những cách tiếp cận này gặp phải khó khăn với các kết cấu đã được chiếu sáng trước, điều này có thể ảnh hưởng đáng kể đến kết quả kết xuất cuối cùng của môi trường 3D và giới thiệu các lỗi ánh sáng khi ánh sáng được thay đổi trong các công việc phổ biến như được trình diễn trong hình ảnh sau.

Như có thể quan sát được, bản đồ kết cấu với ánh sáng tự do hoạt động đồng bộ với các đường ống kết xuất truyền thống, cung cấp kết quả chính xác, trong khi bản đồ kết cấu với ánh sáng đã được chiếu sáng trước bao gồm các bóng không phù hợp khi chiếu sáng lại được áp dụng. Mặt khác, các khuôn khổ tạo sinh kết cấu được đào tạo trên dữ liệu 3D cung cấp một cách tiếp cận thay thế, trong đó khuôn khổ tạo ra các kết cấu bằng cách hiểu toàn bộ hình học của một đối tượng 3D cụ thể. Mặc dù chúng có thể cung cấp kết quả tốt hơn, các khuôn khổ tạo sinh kết cấu được đào tạo trên dữ liệu 3D thiếu khả năng khái quát hóa, điều này cản trở khả năng áp dụng mô hình cho các đối tượng 3D ngoài dữ liệu đào tạo của chúng.

Các mô hình tạo sinh kết cấu hiện tại gặp phải hai thách thức quan trọng: sử dụng hướng dẫn hình ảnh hoặc các gợi ý đa dạng để đạt được mức độ khái quát hóa rộng hơn trên các đối tượng khác nhau, và thách thức thứ hai là loại bỏ ánh sáng耦合 trên các kết quả thu được từ đào tạo trước. Các kết cấu đã được chiếu sáng trước có thể can thiệp vào kết quả cuối cùng của các đối tượng có kết cấu trong các động cơ kết xuất, và vì các mô hình khuếch tán 2D đã được đào tạo trước chỉ cung cấp kết quả 2D trong miền xem, chúng thiếu hiểu biết toàn diện về hình dạng, dẫn đến việc chúng không thể duy trì tính nhất quán của góc nhìn cho các đối tượng 3D.

Do những thách thức trên, khuôn khổ Paint3D cố gắng phát triển một mô hình khuếch tán kết cấu hai giai đoạn cho các đối tượng 3D, khái quát hóa cho các mô hình tạo sinh trước đào tạo khác nhau và bảo tồn tính nhất quán của góc nhìn trong khi học cách tạo ra kết cấu không có ánh sáng.

Paint3D là một mô hình tạo sinh kết cấu thô đến tinh, nhằm tận dụng khả năng hướng dẫn mạnh mẽ và khả năng tạo hình ảnh của các mô hình tạo sinh AI đã được đào tạo trước để tạo kết cấu cho các đối tượng 3D. Trong giai đoạn đầu, khuôn khổ Paint3D đầu tiên lấy mẫu các hình ảnh đa góc nhìn từ một mô hình khuếch tán hình ảnh 2D đã được đào tạo trước, cho phép khái quát hóa các kết quả kết cấu chất lượng cao và phong phú từ các gợi ý đa dạng. Sau đó, mô hình tạo ra một bản đồ kết cấu ban đầu bằng cách chiếu các hình ảnh này lên bề mặt lưới. Trong giai đoạn thứ hai, mô hình tập trung vào việc tạo ra các kết cấu không có ánh sáng bằng cách thực hiện các cách tiếp cận được sử dụng bởi các mô hình khuếch tán chuyên về việc loại bỏ ảnh hưởng của ánh sáng và tinh chỉnh các khu vực không đầy đủ. Trong suốt quá trình, khuôn khổ Paint3D liên tục tạo ra các bản đồ kết cấu 2K chất lượng cao về mặt ngữ nghĩa và loại bỏ các hiệu ứng ánh sáng nội tại.

Tóm lại, Paint3D là một mô hình tạo sinh AI thô đến tinh mới, nhằm tạo ra các bản đồ kết cấu 2K UV đa dạng, không có ánh sáng và độ phân giải cao cho các lưới 3D không có kết cấu, để đạt được hiệu suất tốt nhất trong việc tạo kết cấu cho các đối tượng 3D với các đầu vào có điều kiện khác nhau, bao gồm văn bản và hình ảnh, và cung cấp lợi thế đáng kể cho các nhiệm vụ tổng hợp và chỉnh sửa đồ họa.

Phương pháp và Kiến trúc

Khuôn khổ Paint3D tạo ra và tinh chỉnh các bản đồ kết cấu tiến bộ để tạo ra các bản đồ kết cấu đa dạng và chất lượng cao cho các mô hình 3D sử dụng các đầu vào có điều kiện mong muốn, bao gồm hình ảnh và gợi ý, như được trình diễn trong hình ảnh sau.

Trong giai đoạn thô, mô hình Paint3D sử dụng các mô hình khuếch tán hình ảnh 2D đã được đào tạo trước để lấy mẫu các hình ảnh đa góc nhìn, và sau đó tạo ra các bản đồ kết cấu ban đầu bằng cách chiếu các hình ảnh này lên bề mặt lưới. Trong giai đoạn thứ hai, tức là giai đoạn tinh chỉnh, mô hình Paint3D sử dụng một quá trình khuếch tán trong không gian UV để nâng cao các bản đồ kết cấu thô, đạt được chức năng tạo kết cấu chất lượng cao, không có ánh sáng và hoàn thiện, đảm bảo vẻ ngoài và sự hoàn chỉnh của bản đồ kết cấu cuối cùng.

Giai đoạn 1: Tạo kết cấu thô tiến bộ

Trong giai đoạn tạo kết cấu thô tiến bộ, mô hình Paint3D tạo ra một bản đồ kết cấu UV thô cho các lưới 3D sử dụng một mô hình khuếch tán 2D đã được đào tạo trước. Cụ thể hơn, mô hình đầu tiên sử dụng các góc nhìn máy ảnh khác nhau để kết xuất bản đồ độ sâu, sau đó sử dụng các điều kiện độ sâu để lấy mẫu các hình ảnh từ mô hình khuếch tán hình ảnh, và sau đó chiếu các hình ảnh này lên bề mặt lưới. Khuôn khổ thực hiện các cách tiếp cận kết xuất, lấy mẫu và chiếu lại một cách thay thế để cải thiện tính nhất quán của các lưới kết cấu, điều này cuối cùng giúp tạo ra bản đồ kết cấu tiến bộ.

Mô hình bắt đầu tạo kết cấu của vùng nhìn thấy được với các góc nhìn máy ảnh tập trung vào lưới 3D, và kết xuất lưới 3D thành một bản đồ độ sâu từ góc nhìn đầu tiên. Mô hình sau đó lấy mẫu một hình ảnh kết cấu cho một điều kiện ngoại hình và một điều kiện độ sâu. Mô hình sau đó chiếu hình ảnh này lên lưới 3D. Đối với các góc nhìn, mô hình Paint3D thực hiện một cách tiếp cận tương tự nhưng với một chút thay đổi bằng cách thực hiện quá trình lấy mẫu kết cấu sử dụng một cách tiếp cận vẽ hình ảnh. Hơn nữa, mô hình lấy các vùng đã được kết cấu từ các góc nhìn trước vào tài khoản, cho phép quá trình kết xuất không chỉ xuất ra một hình ảnh độ sâu, mà còn một hình ảnh RGB một phần màu với một mặt nạ không màu trong góc nhìn hiện tại.

Mô hình sau đó sử dụng một mô hình vẽ hình ảnh có nhận thức độ sâu với một bộ mã hóa vẽ để lấp đầy vùng không màu trong hình ảnh RGB. Mô hình sau đó tạo ra bản đồ kết cấu từ góc nhìn bằng cách chiếu hình ảnh đã được vẽ vào lưới 3D dưới góc nhìn hiện tại, cho phép mô hình tạo ra bản đồ kết cấu tiến bộ và đạt được toàn bộ cấu trúc thô. Cuối cùng, mô hình mở rộng quá trình lấy mẫu kết cấu lên một cảnh hoặc đối tượng với nhiều góc nhìn. Cụ thể hơn, mô hình sử dụng một cặp máy ảnh để chụp hai bản đồ độ sâu trong quá trình lấy mẫu kết cấu ban đầu từ các góc nhìn đối xứng. Mô hình sau đó kết hợp hai bản đồ độ sâu và tạo thành một lưới độ sâu. Mô hình thay thế hình ảnh độ sâu đơn bằng lưới độ sâu để thực hiện lấy mẫu kết cấu đa góc nhìn có nhận thức độ sâu.

Giai đoạn 2: Tinh chỉnh kết cấu trong không gian UV

Mặc dù bản đồ kết cấu thô có vẻ logic, nhưng nó vẫn gặp phải một số thách thức như các lỗ kết cấu gây ra trong quá trình kết xuất bởi tự che khuất hoặc bóng ánh sáng do sự tham gia của các mô hình khuếch tán hình ảnh 2D. Mô hình Paint3D nhằm thực hiện một quá trình khuếch tán trong không gian UV dựa trên bản đồ kết cấu thô, nhằm giảm thiểu các vấn đề và nâng cao vẻ ngoài của bản đồ kết cấu thậm chí còn hơn trong quá trình tinh chỉnh kết cấu. Tuy nhiên, tinh chỉnh mô hình khuếch tán hình ảnh chủ đạo với các bản đồ kết cấu trong không gian UV giới thiệu sự không liên tục của kết cấu vì bản đồ kết cấu được tạo ra bởi việc ánh xạ UV của kết cấu bề mặt 3D, cắt kết cấu liên tục thành một loạt các mảnh riêng lẻ trong không gian UV. Kết quả của sự phân mảnh, mô hình gặp khó khăn trong việc học các mối quan hệ lân cận 3D giữa các mảnh, dẫn đến các vấn đề không liên tục của kết cấu.

Mô hình tinh chỉnh bản đồ kết cấu trong không gian UV bằng cách thực hiện quá trình khuếch tán dưới sự hướng dẫn của thông tin lân cận của các mảnh kết cấu. Điều quan trọng cần lưu ý là trong không gian UV, nó là bản đồ vị trí đại diện cho thông tin lân cận 3D của các mảnh kết cấu, với mô hình xử lý mỗi phần tử không phải nền như một tọa độ điểm 3D. Trong quá trình khuếch tán, mô hình kết hợp thông tin lân cận 3D bằng cách thêm một bộ mã hóa vị trí riêng vào mô hình khuếch tán hình ảnh đã được đào tạo trước. Bộ mã hóa mới giống như thiết kế của khuôn khổ ControlNet và có cùng kiến trúc với bộ mã hóa được thực hiện trong mô hình khuếch tán hình ảnh, với lớp convolution zero kết nối hai bộ mã hóa. Hơn nữa, mô hình khuếch tán kết cấu được đào tạo trên một tập dữ liệu bao gồm bản đồ kết cấu và bản đồ vị trí, và mô hình học cách dự đoán nhiễu được thêm vào vectơ nhiễu. Mô hình sau đó tối ưu hóa bộ mã hóa vị trí và đóng băng bộ khử nhiễu đã được đào tạo cho nhiệm vụ khuếch tán hình ảnh của nó.

Mô hình sau đó sử dụng đồng thời vị trí của bộ mã hóa có điều kiện và các bộ mã hóa khác để thực hiện các nhiệm vụ tinh chỉnh trong không gian UV. Trong khía cạnh này, mô hình có hai khả năng tinh chỉnh: UVHD hoặc UV High Definition và UV inpainting. Phương pháp UVHD được thiết kế để nâng cao vẻ ngoài và thẩm mỹ của bản đồ kết cấu. Để đạt được UVHD, mô hình sử dụng một bộ mã hóa nâng cao hình ảnh và một bộ mã hóa vị trí với mô hình khuếch tán. Mô hình sử dụng phương pháp UV inpainting để lấp đầy các lỗ kết cấu trong mặt phẳng UV, có khả năng tránh các vấn đề tự che khuất được tạo ra trong quá trình kết xuất. Trong giai đoạn tinh chỉnh, mô hình Paint3D đầu tiên thực hiện UV inpainting và sau đó thực hiện UVHD để tạo ra bản đồ kết cấu tinh chỉnh cuối cùng. Bằng cách tích hợp hai phương pháp tinh chỉnh, khuôn khổ Paint3D có thể tạo ra các bản đồ kết cấu UV hoàn chỉnh, đa dạng, độ phân giải cao và không có ánh sáng.

Paint3D : Thử nghiệm và Kết quả

Mô hình Paint3D sử dụng mô hình text2image Stable Diffusion để hỗ trợ nó trong các nhiệm vụ tạo kết cấu, trong khi nó sử dụng thành phần mã hóa hình ảnh để xử lý các điều kiện hình ảnh. Để nâng cao khả năng kiểm soát điều kiện của nó, chẳng hạn như inpainting hình ảnh, độ sâu và độ phân giải cao của hình ảnh, khuôn khổ Paint3D sử dụng các bộ mã hóa miền của ControlNet. Mô hình được thực hiện trên khuôn khổ PyTorch với kết xuất và chiếu kết cấu được thực hiện trên Kaolin.

So sánh Kết cấu từ Văn bản

Để phân tích hiệu suất của nó, chúng tôi bắt đầu bằng cách đánh giá hiệu ứng tạo kết cấu của Paint3D khi được điều kiện bằng các gợi ý văn bản, và so sánh nó với các khuôn khổ hiện đại, bao gồm Text2Tex, TEXTure và LatentPaint. Như có thể quan sát được trong hình ảnh sau, khuôn khổ Paint3D không chỉ vượt trội trong việc tạo ra các chi tiết kết cấu chất lượng cao, mà còn tổng hợp một bản đồ kết cấu không có ánh sáng một cách hợp lý.

So sánh, khuôn khổ Latent-Paint có xu hướng tạo ra các kết cấu mờ, dẫn đến hiệu ứng hình ảnh không tối ưu. Mặt khác, mặc dù khuôn khổ TEXTure tạo ra các kết cấu rõ ràng, nhưng nó thiếu sự mịn màng và hiển thị các mối nối và các đường may rõ ràng. Cuối cùng, khuôn khổ Text2Tex tạo ra các kết cấu mịn một cách đáng kể, nhưng nó không thể tái tạo hiệu suất trong việc tạo ra các kết cấu tinh tế với chi tiết phức tạp.

Hình ảnh sau so sánh khuôn khổ Paint3D với các khuôn khổ hiện đại về mặt định lượng.

Như có thể quan sát được, khuôn khổ Paint3D vượt trội so với tất cả các mô hình hiện có, và với một khoảng cách đáng kể, với gần 30% cải thiện về baseline FID và khoảng 40% cải thiện về baseline KID. Sự cải thiện về điểm baseline FID và KID cho thấy khả năng của Paint3D trong việc tạo ra các kết cấu chất lượng cao trên các đối tượng và danh mục đa dạng.

So sánh Kết cấu từ Hình ảnh

Để tạo ra khả năng tạo sinh của Paint3D sử dụng các gợi ý hình ảnh, chúng tôi sử dụng mô hình TEXTure làm baseline. Như đã đề cập trước đó, mô hình Paint3D sử dụng một bộ mã hóa hình ảnh được lấy từ mô hình text2image của Stable Diffusion. Như có thể thấy trong hình ảnh sau, khuôn khổ Paint3D tổng hợp các kết cấu tuyệt vời một cách đáng kể, và vẫn có thể duy trì độ trung thực cao so với điều kiện hình ảnh.

Mặt khác, khuôn khổ TEXTure có thể tạo ra một kết cấu tương tự như Paint3D, nhưng nó không thể đại diện chính xác cho các chi tiết kết cấu trong điều kiện hình ảnh. Hơn nữa, như được trình diễn trong hình ảnh sau, khuôn khổ Paint3D cung cấp các điểm baseline FID và KID tốt hơn khi so sánh với khuôn khổ TEXTure, với điểm FID giảm từ 40,83 xuống 26,86, trong khi điểm KID giảm từ 9,76 xuống 4,94.

Thoughts Cuối cùng

Trong bài viết này, chúng tôi đã thảo luận về Paint3D, một khuôn khổ mới có khả năng tạo ra các bản đồ kết cấu 2K UV đa dạng, không có ánh sáng và độ phân giải cao cho các lưới 3D không có kết cấu, có điều kiện trên các đầu vào hình ảnh hoặc văn bản. Điểm nổi bật chính của khuôn khổ Paint3D là nó có khả năng tạo ra các kết cấu không có ánh sáng, độ phân giải cao 2K UV mà không cần điều kiện trên các đầu vào hình ảnh hoặc văn bản. Nhờ cách tiếp cận từ thô đến tinh, khuôn khổ Paint3D tạo ra các bản đồ kết cấu không có ánh sáng, đa dạng và độ phân giải cao, và cung cấp hiệu suất tốt hơn so với các khuôn khổ hiện đại.

"Một kỹ sư theo nghề nghiệp, một nhà văn theo trái tim". Kunal là một nhà văn kỹ thuật với tình yêu và hiểu biết sâu sắc về AI và ML, dành để đơn giản hóa các khái niệm phức tạp trong các lĩnh vực này thông qua tài liệu hấp dẫn và thông tin của mình.