Mô hình và nền tảng AI

Hình ảnh Splatter: Một nỗ lực để xây dựng lại 3D siêu nhanh từ một góc nhìn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Xây dựng lại 3D của các vật thể từ một góc nhìn duy nhất bằng cách sử dụng mạng nơ-ron tích hợp đã chứng minh khả năng đáng kể. Các mô hình xây dựng lại 3D từ một góc nhìn tạo ra mô hình 3D của bất kỳ vật thể nào bằng cách sử dụng một hình ảnh duy nhất làm tài liệu tham khảo, khiến nó trở thành một trong những chủ đề nghiên cứu nóng nhất trong tầm nhìn máy tính.

Ví dụ, hãy xem xét chiếc xe máy trong hình ảnh trên. Việc tạo ra cấu trúc 3D của nó đòi hỏi một quy trình phức tạp kết hợp các gợi ý từ hình ảnh cấp thấp với thông tin ngữ nghĩa cấp cao và kiến thức về sự sắp xếp cấu trúc của các bộ phận.

Do quá trình phức tạp này, việc xây dựng lại 3D từ một góc nhìn đã trở thành một thách thức lớn trong tầm nhìn máy tính. Để tăng cường hiệu quả của việc xây dựng lại 3D từ một góc nhìn, các nhà phát triển đã làm việc trên Hình ảnh Splatter, một phương pháp nhằm đạt được xây dựng lại hình dạng và ngoại hình 3D siêu nhanh của các vật thể. Tại trung tâm của khuôn khổ Hình ảnh Splatter là việc sử dụng phương pháp Gaussian Splatting để phân tích các biểu diễn 3D, tận dụng tốc độ và chất lượng mà nó mang lại.

Gần đây, phương pháp Gaussian Splatting đã được thực hiện bởi nhiều mô hình xây dựng lại đa góc nhìn để渲染 thời gian thực, tăng cường khả năng mở rộng và huấn luyện nhanh. Với điều đó, Hình ảnh Splatter là khuôn khổ đầu tiên thực hiện phương pháp Gaussian Splatting cho các nhiệm vụ xây dựng lại từ một góc nhìn.

Trong bài viết này, chúng tôi sẽ khám phá cách khuôn khổ Hình ảnh Splatter sử dụng Gaussian Splatting để đạt được xây dựng lại 3D siêu nhanh từ một góc nhìn. Vậy hãy bắt đầu.

Hình ảnh Splatter: Một nỗ lực để xây dựng lại 3D siêu nhanh từ một góc nhìn

Như đã đề cập trước đó, Hình ảnh Splatter là một phương pháp siêu nhanh để xây dựng lại 3D của các vật thể dựa trên phương pháp Gaussian Splatting. Hình ảnh Splatter là khuôn khổ tầm nhìn máy tính đầu tiên thực hiện Gaussian Splatting cho việc tạo ra các vật thể 3D từ một góc nhìn duy nhất, vì truyền thống, Gaussian Splatting đã được sử dụng để xây dựng lại 3D của các vật thể từ nhiều góc nhìn. Tuy nhiên, điều gì phân biệt khuôn khổ Hình ảnh Splatter với các phương pháp trước đó là nó là một phương pháp dựa trên học tập, và việc xây dựng lại trong quá trình kiểm tra chỉ đòi hỏi việc đánh giá feed-forward của mạng nơ-ron.

Hình ảnh Splatter dựa cơ bản vào chất lượng渲染 của Gaussian Splatting và tốc độ xử lý cao để tạo ra các xây dựng lại 3D. Khuôn khổ Hình ảnh Splatter có thiết kế đơn giản: khuôn khổ sử dụng mạng nơ-ron hình ảnh đến hình ảnh 2D để dự đoán một Gaussian 3D cho mỗi pixel đầu vào, và ánh xạ hình ảnh đầu vào đến một Gaussian 3D cho mỗi pixel. Các Gaussian 3D kết quả có hình dạng của một hình ảnh, được gọi là Hình ảnh Splatter, và chúng cũng cung cấp biểu diễn 360 độ của hình ảnh. Quá trình được minh họa trong hình ảnh sau.

Mặc dù quá trình này đơn giản và trực tiếp, nhưng vẫn có một số thách thức mà khuôn khổ Hình ảnh Splatter phải đối mặt khi sử dụng Gaussian Splatting để tạo ra các Gaussian 3D cho các biểu diễn 3D từ một góc nhìn. Thách thức lớn đầu tiên là thiết kế một mạng nơ-ron chấp nhận hình ảnh của một vật thể làm đầu vào và tạo ra một hỗn hợp Gaussian đại diện cho tất cả các mặt của hình ảnh làm đầu ra. Để giải quyết vấn đề này, Hình ảnh Splatter tận dụng lợi thế của việc hỗn hợp Gaussian có thể được lưu trữ trong một cấu trúc dữ liệu có thứ tự. Theo đó, khuôn khổ sử dụng một hình ảnh 2D làm容器 cho các Gaussian 3D, và mỗi pixel trong容器 chứa các tham số của một Gaussian, bao gồm các thuộc tính như hình dạng, độ trong suốt và màu sắc.

Bằng cách lưu trữ các tập hợp Gaussian 3D trong một hình ảnh, khuôn khổ Hình ảnh Splatter có thể giảm thiểu các khó khăn trong việc xây dựng lại khi học một mạng nơ-ron hình ảnh đến hình ảnh. Bằng cách sử dụng phương pháp này, quá trình xây dựng lại có thể được thực hiện chỉ bằng cách sử dụng các toán tử 2D hiệu quả thay vì dựa vào các toán tử 3D. Hơn nữa, trong khuôn khổ Hình ảnh Splatter, biểu diễn 3D là một hỗn hợp của các Gaussian 3D, cho phép nó khai thác lợi thế về tốc độ渲染 và hiệu quả bộ nhớ được cung cấp bởi Gaussian Splatting, điều này tăng cường hiệu quả trong cả quá trình huấn luyện và suy luận. Tiếp theo, khuôn khổ Hình ảnh Splatter không chỉ tạo ra các biểu diễn 3D từ một góc nhìn, mà nó cũng chứng minh khả năng đáng kể khi có thể được huấn luyện thậm chí trên một GPU duy nhất trên các chuẩn mực 3D đối tượng tiêu chuẩn. Hơn nữa, khuôn khổ Hình ảnh Splatter có thể được mở rộng để chấp nhận nhiều hình ảnh làm đầu vào. Nó có thể làm được điều này bằng cách đăng ký các hỗn hợp Gaussian riêng lẻ đến một tham chiếu chung và sau đó bằng cách kết hợp các hỗn hợp Gaussian được dự đoán từ các góc nhìn riêng lẻ. Khuôn khổ cũng tiêm các lớp chú ý chéo nhẹ vào kiến trúc của nó, cho phép các góc nhìn khác nhau giao tiếp với nhau trong quá trình dự đoán.

Từ quan điểm thực nghiệm, điều đáng chú ý là khuôn khổ Hình ảnh Splatter có thể tạo ra biểu diễn 360 độ của vật thể ngay cả khi nó chỉ nhìn thấy một mặt của vật thể. Khuôn khổ sau đó phân bổ các Gaussian khác nhau trong một khu vực lân cận 2D đến các phần khác nhau của vật thể 3D để mã hóa thông tin 360 độ được tạo ra trong hình ảnh 2D. Hơn nữa, khuôn khổ đặt độ trong suốt của một số Gaussian thành zero, điều này vô hiệu hóa chúng, cho phép chúng được loại bỏ trong quá trình hậu xử lý.

Để tóm tắt, khuôn khổ Hình ảnh Splatter là

  1. Một phương pháp mới để tạo ra các biểu diễn 3D của các vật thể từ một góc nhìn bằng cách chuyển giao phương pháp Gaussian Splatting.
  2. Mở rộng phương pháp này cho việc xây dựng lại 3D của các vật thể từ nhiều góc nhìn.
  3. Đạt được hiệu suất xây dựng lại 3D của các vật thể trên các chuẩn mực tiêu chuẩn với tốc độ và chất lượng vượt trội.

Hình ảnh Splatter: Phương pháp và Kiến trúc

Gaussian Splatting

Như đã đề cập trước đó, Gaussian Splatting là phương pháp chính được khuôn khổ Hình ảnh Splatter thực hiện để tạo ra các biểu diễn 3D của các vật thể từ một góc nhìn. Trong thuật ngữ đơn giản, Gaussian Splatting là một phương pháp渲染 cho các hình ảnh 3D và thời gian thực, và渲染 các hình ảnh có nhiều điểm nhìn. Không gian 3D trong hình ảnh được gọi là Gaussian, và các kỹ thuật học máy được thực hiện để học các tham số của mỗi Gaussian. Gaussian Splatting không đòi hỏi huấn luyện trong quá trình渲染, điều này cho phép thời gian渲染 nhanh hơn. Hình ảnh sau tóm tắt kiến trúc của Gaussian Splatting 3D.

Gaussian Splatting 3D đầu tiên sử dụng tập hợp hình ảnh đầu vào để tạo ra một đám mây điểm. Gaussian Splatting sau đó sử dụng các hình ảnh đầu vào để ước tính các tham số ngoài của máy ảnh như độ nghiêng và vị trí bằng cách匹配 các pixel giữa các hình ảnh, và các tham số này sau đó được sử dụng để tính toán đám mây điểm. Sử dụng các phương pháp học máy khác nhau, Gaussian Splatting sau đó tối ưu hóa bốn tham số cho mỗi Gaussian, cụ thể là: Vị trí (nơi nó được đặt), Covariance (mức độ kéo giãn hoặc tỷ lệ trong ma trận 3×3), Màu sắc (màu sắc RGB), và Alpha (độ trong suốt). Quá trình tối ưu hóa渲染 hình ảnh cho mỗi vị trí máy ảnh và sử dụng nó để xác định các tham số gần hơn với hình ảnh gốc. Kết quả là, đầu ra Gaussian Splatting 3D là một hình ảnh, được gọi là Hình ảnh Splatter, giống như hình ảnh gốc nhất tại vị trí máy ảnh mà nó được chụp.

Hơn nữa, hàm độ trong suốt và hàm màu sắc trong Gaussian Splatting cung cấp một trường bức xạ với hướng nhìn của điểm 3D. Khuôn khổ sau đó渲染 trường bức xạ này lên một hình ảnh bằng cách tích hợp các màu sắc quan sát được dọc theo tia đi qua pixel. Gaussian Splatting biểu diễn các hàm này như một tổ hợp của các Gaussian có màu sắc, nơi trung tâm Gaussian và ma trận hiệp phương sai giúp xác định hình dạng và kích thước của nó. Mỗi Gaussian cũng có một thuộc tính độ trong suốt và một thuộc tính màu sắc phụ thuộc vào góc nhìn, cùng nhau định nghĩa trường bức xạ.

Hình ảnh Splatter

Thành phần渲染 ánh xạ tập hợp các Gaussian 3D đến một hình ảnh. Để thực hiện việc xây dựng lại 3D từ một góc nhìn, khuôn khổ sau đó tìm kiếm một hàm ngược cho các Gaussian 3D, nhằm tái tạo hỗn hợp các Gaussian 3D từ một hình ảnh. Sự kết hợp quan trọng ở đây là đề xuất một thiết kế hiệu quả nhưng đơn giản cho hàm ngược. Cụ thể, cho một hình ảnh đầu vào, khuôn khổ dự đoán một Gaussian cho mỗi pixel riêng lẻ bằng cách sử dụng kiến trúc mạng nơ-ron hình ảnh đến hình ảnh, để tạo ra một hình ảnh, Hình ảnh Splatter, làm đầu ra. Mạng nơ-ron cũng dự đoán hình dạng, độ trong suốt và màu sắc.

Bây giờ, có thể suy đoán làm thế nào khuôn khổ Hình ảnh Splatter có thể tái tạo biểu diễn 3D của một vật thể ngay cả khi nó chỉ có quyền truy cập vào một trong các góc nhìn của nó? Trong thời gian thực, khuôn khổ Hình ảnh Splatter học cách sử dụng một số Gaussian có sẵn để tái tạo góc nhìn, và sử dụng các Gaussian còn lại để tự động tái tạo các phần không nhìn thấy của hình ảnh. Để tối đa hóa hiệu quả của nó, khuôn khổ có thể tự động tắt bất kỳ Gaussian nào bằng cách dự đoán xem độ trong suốt có phải là zero hay không. Nếu độ trong suốt là zero, các Gaussian sẽ bị tắt, và khuôn khổ sẽ không渲染 các điểm này, và chúng sẽ bị loại bỏ trong quá trình hậu xử lý.

Thất thoát cấp hình ảnh

Một lợi thế lớn của việc khai thác tốc độ và hiệu quả được cung cấp bởi phương pháp Gaussian Splatting là nó cho phép khuôn khổ渲染 tất cả các hình ảnh tại mỗi lần lặp lại, thậm chí đối với các lô có kích thước lô tương đối lớn. Hơn nữa, nó ngụ ý rằng không chỉ khuôn khổ có thể sử dụng các tổn thất có thể phân hủy, mà nó cũng có thể sử dụng các tổn thất cấp hình ảnh không phân hủy thành các tổn thất mỗi pixel.

Bình thường hóa tỷ lệ

Điều khó khăn là ước tính kích thước của một vật thể bằng cách nhìn vào một góc nhìn duy nhất, và nó là một nhiệm vụ khó khăn để giải quyết sự không chắc chắn này khi nó được huấn luyện với một tổn thất. Vấn đề tương tự không được quan sát trong các tập dữ liệu tổng hợp vì tất cả các vật thể được渲染 với các tham số máy ảnh giống nhau và các vật thể ở một khoảng cách cố định từ máy ảnh, điều này cuối cùng giúp giải quyết sự không chắc chắn. Tuy nhiên, trong các tập dữ liệu có hình ảnh thực tế, sự không chắc chắn rất rõ ràng, và khuôn khổ Hình ảnh Splatter sử dụng một số phương pháp tiền xử lý để cố định tỷ lệ của tất cả các vật thể.

Màu sắc phụ thuộc vào góc nhìn

Để biểu diễn màu sắc phụ thuộc vào góc nhìn, khuôn khổ Hình ảnh Splatter sử dụng các hàm điều hòa cầu để tổng quát hóa màu sắc vượt ra ngoài mô hình màu Lambert. Đối với mỗi Gaussian cụ thể, mô hình định nghĩa các hệ số được dự đoán bởi mạng nơ-ron và các hàm điều hòa cầu. Sự thay đổi góc nhìn biến đổi một hướng nhìn trong nguồn máy ảnh thành hướng nhìn tương ứng trong khung tham chiếu. Mô hình sau đó tìm các hệ số tương ứng để tìm hàm màu sắc biến đổi. Mô hình có thể làm được điều này vì khi quay, các hàm điều hòa cầu là đóng, cùng với mọi thứ khác.

Kiến trúc mạng nơ-ron

Phần lớn kiến trúc của bộ ánh xạ dự đoán ánh xạ hình ảnh đầu vào đến hỗn hợp Gaussian là giống như quá trình được sử dụng trong khuôn khổ SongUNet. Lớp cuối cùng trong kiến trúc được thay thế bằng một lớp convolution 1×1 với mô hình màu sắc xác định chiều rộng của kênh đầu ra. Cho một hình ảnh đầu vào, mạng nơ-ron tạo ra một tensor kênh đầu ra làm đầu ra, và cho mỗi kênh pixel, mã hóa các tham số được biến đổi thành offset, độ trong suốt, quay, độ sâu và màu sắc. Khuôn khổ sau đó sử dụng các hàm kích hoạt phi tuyến tính để kích hoạt các tham số và nhận được các tham số Gaussian.

Để tái tạo các biểu diễn 3D với nhiều góc nhìn, khuôn khổ Hình ảnh Splatter áp dụng cùng mạng nơ-ron cho mỗi góc nhìn đầu vào, và sau đó sử dụng phương pháp góc nhìn để kết hợp các biểu diễn riêng lẻ. Hơn nữa, để tạo điều kiện cho sự phối hợp và trao đổi thông tin hiệu quả giữa các góc nhìn trong mạng nơ-ron, khuôn khổ Hình ảnh Splatter thực hiện hai sửa đổi trong mạng nơ-ron. Đầu tiên, khuôn khổ điều kiện hóa mô hình với tư thế máy ảnh tương ứng, và truyền các vectơ bằng cách mã hóa từng mục nhập bằng cách sử dụng một mã hóa vị trí sinusoidal, kết quả là nhiều chiều. Thứ hai, khuôn khổ thêm các lớp chú ý chéo để tạo điều kiện cho việc giao tiếp giữa các tính năng của các góc nhìn khác nhau.

Hình ảnh Splatter: Thử nghiệm và Kết quả

Khuôn khổ Hình ảnh Splatter đo lường chất lượng của các biểu diễn bằng cách đánh giá chất lượng tổng hợp góc nhìn mới vì khuôn khổ sử dụng góc nhìn nguồn và渲染 hình dạng 3D để thực hiện các biểu diễn. Khuôn khổ đánh giá hiệu suất của nó bằng cách đo lường SSIM hoặc Tương đồng Cấu trúc, Tỷ lệ Tín hiệu trên Nhiễu đỉnh hoặc PSNR, và Chất lượng Nhận thức hoặc LPIPS.

Hiệu suất xây dựng lại 3D từ một góc nhìn

Bảng sau minh họa hiệu suất của mô hình Hình ảnh Splatter trong nhiệm vụ xây dựng lại 3D từ một góc nhìn trên chuẩn mực ShapeNet.

Như có thể quan sát được, khuôn khổ Hình ảnh Splatter vượt trội tất cả các phương pháp xây dựng lại quyết định qua các điểm số LPIPS và SSIM. Các điểm số chỉ ra rằng mô hình Hình ảnh Splatter tạo ra các hình ảnh với các biểu diễn sắc nét hơn. Hơn nữa, mô hình Hình ảnh Splatter cũng vượt trội tất cả các phương pháp cơ sở quyết định về điểm số PSNR, điều này cho thấy rằng các biểu diễn được tạo ra cũng chính xác hơn. Hơn nữa, ngoài việc vượt trội tất cả các phương pháp quyết định, khuôn khổ Hình ảnh Splatter chỉ đòi hỏi các tư thế máy ảnh tương đối để tăng cường hiệu quả của nó trong cả quá trình huấn luyện và kiểm tra.

Hình ảnh sau minh họa khả năng định tính của khuôn khổ Hình ảnh Splatter, và như có thể thấy, mô hình tạo ra các biểu diễn với các hình học mỏng và thú vị, và nắm bắt các chi tiết của các góc nhìn điều kiện.

Hình ảnh sau cho thấy rằng các biểu diễn được tạo ra bởi khuôn khổ Hình ảnh Splatter không chỉ sắc nét hơn mà còn có độ chính xác tốt hơn so với các mô hình trước đó, đặc biệt là trong các điều kiện không thông thường với các cấu trúc mỏng và khả năng hiển thị hạn chế.

Xây dựng lại 3D từ nhiều góc nhìn

Để đánh giá khả năng xây dựng lại 3D từ nhiều góc nhìn, khuôn khổ Hình ảnh Splatter được huấn luyện trên tập dữ liệu SpaneNet-SRN Cars cho dự đoán hai góc nhìn. Các phương pháp hiện có sử dụng điều kiện tư thế máy ảnh tuyệt đối cho các nhiệm vụ xây dựng lại 3D từ nhiều góc nhìn, điều này có nghĩa là mô hình học cách dựa vào định hướng tiêu chuẩn của vật thể. Mặc dù nó thực hiện công việc, nhưng nó hạn chế khả năng áp dụng của các mô hình vì tư thế máy ảnh tuyệt đối thường không được biết đối với một hình ảnh mới của vật thể.

Lời kết

Trong bài viết này, chúng tôi đã nói về Hình ảnh Splatter, một phương pháp nhằm đạt được xây dựng lại hình dạng và ngoại hình 3D siêu nhanh của các vật thể. Tại trung tâm của khuôn khổ Hình ảnh Splatter là việc sử dụng phương pháp Gaussian Splatting để phân tích các biểu diễn 3D, tận dụng tốc độ và chất lượng mà nó mang lại. Khuôn khổ Hình ảnh Splatter xử lý hình ảnh bằng cách sử dụng một kiến trúc mạng nơ-ron hình ảnh đến hình ảnh 2D để dự đoán một hình ảnh giả chứa một Gaussian có màu sắc cho mỗi pixel. Bằng cách sử dụng phương pháp Gaussian Splatting, khuôn khổ Hình ảnh Splatter có thể kết hợp渲染 nhanh với suy luận nhanh, dẫn đến việc huấn luyện nhanh và đánh giá nhanh hơn trên các chuẩn mực thực tế và tổng hợp.

"Một kỹ sư theo nghề nghiệp, một nhà văn theo trái tim". Kunal là một nhà văn kỹ thuật với tình yêu và hiểu biết sâu sắc về AI và ML, dành để đơn giản hóa các khái niệm phức tạp trong các lĩnh vực này thông qua tài liệu hấp dẫn và thông tin của mình.