Mô hình và nền tảng AI
Các Bộ phận Neural: Phân chia Primitive để tạo Hình học Được suy luận có Ý nghĩa

Trong khi các hệ thống có khả năng tạo ra hình học 3D từ hình ảnh tĩnh đơn đã trở nên phổ biến trong những năm gần đây, các đối tượng mà chúng thu được thường được “nối” lại với nhau, mà không có bất kỳ sơ đồ ngữ nghĩa thực sự nào để phản ánh cách các bộ phận đóng góp vào toàn bộ.
Có một số lý do tốt để tạo ra các mô hình suy luận phân cấp với sự phân chia bộ phận có ý nghĩa, bao gồm phân tích công nghiệp, nghiên cứu y tế và ứng dụng hình ảnh, tạo tự động hình học cho trò chơi điện tử, mô拟 và môi trường VR/AR, và thiết kế hiệu ứng hình ảnh, среди những người khác.
Nhiều phương pháp được phát triển trong những năm gần đây, chẳng hạn như Superquadrics phân tích hình dạng, tạo ra kết quả không满意 và đã gặp khó khăn trong việc tiến bộ vượt qua trạng thái nghệ thuật hiện tại.

Phân khúc bằng Superquadrics và các phương pháp khác cung cấp các bộ phận con thô hoặc đại diện rộng rãi cho hình ảnh được suy luận. Nguồn: https://www.youtube.com/watch?v=6WK3B0IZJsw
Tuy nhiên, nghiên cứu mới nghiên cứu từ Viện Max Planck, với tựa đề Các Bộ phận Neural: Học biểu diễn hình dạng 3D với Mạng nơ-ron invertible, cung cấp một hệ thống biểu diễn primitive 3D mới tạo ra các phần có ý nghĩa.

Các phương pháp trước đây có thể phân chia các đối tượng lớn được suy luận, nhưng không theo cách có ý nghĩa. Ở bên phải, phương pháp Các Bộ phận Neural tạo ra các mảnh vỡ thực tế hơn. Nguồn: https://paschalidoud.github.io/neural_parts
Sự phân chia được thực hiện thông qua một Mạng nơ-ron invertible (INN), sử dụng homeomorphism có điều kiện để biến dạng một hình dạng hình học cơ bản thành các bộ phận, và ngược lại, tính toán thứ tự phân cấp topo trong cả hai hướng. Theo cách này, mỗi hình dạng bộ phận được liên kết với một biểu diễn bộ phận có thể học được để tạo ra biểu diễn hình dạng cho bộ phận đó.

Kiến trúc
Các Bộ phận Neural cần phải cân bằng giữa chất lượng tái tạo và tính toàn vẹn của bộ phận, vì các bộ phận phức tạp sẽ khiến hệ thống tiến tới các phân chia phức tạp. Do đó, kiến trúc của Các Bộ phận Neural đã được thiết kế để kết hợp các yếu tố này một cách hài hòa.
Kiến trúc của Các Bộ phận Neural bao gồm một bộ trích xuất tính năng ánh xạ đầu vào của một vector, và một thành phần homeomorphism có điều kiện học các ánh xạ homeomorphism được điều kiện bởi biểu diễn hình dạng.
Phần đầu tiên của bộ trích xuất tính năng sử dụng một thành phần ResNet-18 để trích xuất hình ảnh tính năng. Thành phần homeomorphism có điều kiện sử dụng một mô-đun biến đổi thực không bảo toàn thể tích (real NVP).
Đánh giá
Hệ thống đã được thử nghiệm trên ba bộ dữ liệu – Dynamic FAUST (2017), FreiHAND (2019) và ShapeNet (2015) của Đại học Stanford. D-FAUST chứa 38.640 lưới người, phù hợp cho so sánh, trong khi 5000 tư thế tay đầu tiên trong FreiHAND được sử dụng để tạo lưới. Đối với ShapeNet, các nhà nghiên cứu đã tuân theo hướng dẫn đào tạo cụ thể theo từng loại được các nhà nghiên cứu Stanford vào năm 2016.
Các thử nghiệm đã được chạy trên các phương pháp dựa trên bộ phận, bao gồm superquadrics, CvxNet và H-SQs.
Dưới ShapeNet, các nhà nghiên cứu đã tìm thấy rằng mô hình Các Bộ phận Neural dẫn đến tái tạo chính xác hơn so với CvxNet ở mức 5 và 25 bộ phận. Một số đối tượng đơn giản trong cơ sở dữ liệu, chẳng hạn như ghế, không chứa đủ hình học cho một phân chia có ý nghĩa.

Đối với FreiHAND, Các Bộ phận Neural dẫn đến tái tạo hình học chính xác hơn, với việc bắt捉 tốt hơn các chi tiết tinh tế như vị trí ngón tay. Các nhà nghiên cứu lưu ý rằng so với CvxNet và SQs, tập trung vào cấu trúc lõi chung và thiếu các chi tiết này.

Đối với Dynamic FAUST, CvxNet và SQs đã được so sánh với đầu ra của Các Bộ phận Neural sử dụng năm bộ phận để bắt捉 tính toàn vẹn của cơ thể người ban đầu được suy luận từ dữ liệu. Các Bộ phận Neural đã có thể đạt được phân khúc mịn hơn, mà không hy sinh các yếu tố cơ bản của topo.

Công việc Tương lai
Các nhà nghiên cứu dự định mở rộng Các Bộ phận Neural sang các nghiên cứu không cung cấp lưới mục tiêu trực tiếp, bằng cách sử dụng các kỹ thuật kết xuất khác biệt. Vì một hình cầu cơ bản hiện đang được sử dụng trong khuôn khổ Các Bộ phận Neural, các nhà nghiên cứu cũng đang xem xét việc sử dụng các nguyên tử hình học phức tạp và biểu cảm hơn.













