Mô hình và nền tảng AI

Sapiens: Cơ Sở Mới Cho Mô Hình Tầm Nhìn Con Người

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Sự thành công đáng kể của việc tiền huấn luyện quy mô lớn sau đó là tinh chỉnh nhiệm vụ cụ thể cho mô hình ngôn ngữ đã thiết lập phương pháp này như một thực hành tiêu chuẩn. Tương tự, các phương pháp tầm nhìn máy tính đang dần chấp nhận quy mô dữ liệu rộng lớn cho tiền huấn luyện. Sự xuất hiện của các tập dữ liệu lớn, chẳng hạn như LAION5B, Instagram-3.5B, JFT-300M, LVD142M, Visual Genome và YFCC100M, đã cho phép khám phá một tập dữ liệu vượt quá phạm vi của các chuẩn mực truyền thống. Các công việc nổi bật trong lĩnh vực này bao gồm DINOv2, MAWS và AIM. DINOv2 đạt được hiệu suất tốt nhất trong việc tạo ra các tính năng tự giám sát bằng cách mở rộng phương pháp iBot tương phản trên tập dữ liệu LDV-142M. MAWS nghiên cứu việc mở rộng các mã hóa tự động (MAE) trên tỷ tỷ hình ảnh. AIM khám phá khả năng mở rộng của việc tiền huấn luyện tự hồi quy tương tự như BERT cho các bộ chuyển đổi tầm nhìn. Ngược lại với những phương pháp này, chủ yếu tập trung vào tiền huấn luyện hình ảnh chung hoặc phân loại hình ảnh không có nhãn, Sapiens áp dụng một cách tiếp cận lấy con người làm trung tâm: Các mô hình Sapiens tận dụng một tập hợp lớn hình ảnh con người để tiền huấn luyện, sau đó tinh chỉnh cho một loạt các nhiệm vụ liên quan đến con người. Việc theo đuổi số hóa con người 3D quy mô lớn vẫn là một mục tiêu quan trọng trong tầm nhìn máy tính.

Đã có những tiến bộ đáng kể trong môi trường được kiểm soát hoặc trong phòng thu, nhưng vẫn còn những thách thức khi mở rộng các phương pháp này sang môi trường không bị giới hạn. Để giải quyết những thách thức này, việc phát triển các mô hình đa năng có thể thực hiện nhiều nhiệm vụ cơ bản, chẳng hạn như ước tính điểm then chốt, phân đoạn bộ phận cơ thể, ước tính độ sâu và dự đoán mặt phẳng normal từ hình ảnh trong môi trường tự nhiên, là rất quan trọng. Trong công việc này, Sapiens nhằm mục đích phát triển các mô hình cho những nhiệm vụ tầm nhìn con người thiết yếu này để tổng quát hóa sang các môi trường tự nhiên. Hiện tại, các mô hình ngôn ngữ công khai lớn nhất chứa hơn 100 tỷ tham số, trong khi các mô hình ngôn ngữ thường được sử dụng chứa khoảng 7 tỷ tham số. Ngược lại, Bộ chuyển đổi tầm nhìn (ViT), mặc dù chia sẻ kiến trúc tương tự, chưa được mở rộng đến mức này một cách thành công. Mặc dù có những nỗ lực đáng chú ý trong hướng này, bao gồm việc phát triển một ViT-4B dày được đào tạo trên cả văn bản và hình ảnh, và việc xây dựng các kỹ thuật để đào tạo ổn định một ViT-22B, nhưng các xương sống tầm nhìn thường được sử dụng vẫn nằm trong khoảng từ 300 triệu đến 600 triệu tham số và chủ yếu được tiền huấn luyện ở độ phân giải hình ảnh khoảng 224 pixel. Tương tự, các mô hình tạo hình ảnh dựa trên bộ chuyển đổi hiện có, chẳng hạn như DiT, sử dụng ít hơn 700 triệu tham số và hoạt động trên không gian ẩn bị nén cao. Để giải quyết khoảng trống này, Sapiens giới thiệu một tập hợp các mô hình ViT lớn, có độ phân giải cao, được tiền huấn luyện một cách bản địa ở độ phân giải hình ảnh 1024 pixel trên hàng triệu hình ảnh con người.

Sapiens trình bày một họ mô hình cho bốn nhiệm vụ tầm nhìn con người cơ bản: ước tính tư thế 2D, phân đoạn bộ phận cơ thể, ước tính độ sâu và dự đoán mặt phẳng normal. Các mô hình Sapiens hỗ trợ natively inference độ phân giải cao 1K và cực kỳ dễ dàng thích nghi với các nhiệm vụ riêng lẻ bằng cách tinh chỉnh các mô hình được tiền huấn luyện trên hơn 300 triệu hình ảnh con người trong tự nhiên. Sapiens quan sát thấy rằng, với cùng một ngân sách tính toán, tiền huấn luyện tự giám sát trên một tập dữ liệu được chăm sóc cẩn thận của hình ảnh con người đáng kể cải thiện hiệu suất cho một loạt các nhiệm vụ liên quan đến con người. Các mô hình kết quả thể hiện sự tổng quát hóa đáng kể sang dữ liệu trong tự nhiên, ngay cả khi dữ liệu được dán nhãn là khan hiếm hoặc hoàn toàn tổng hợp. Thiết kế mô hình đơn giản cũng mang lại khả năng mở rộng – hiệu suất mô hình trên các nhiệm vụ cải thiện khi số lượng tham số tăng từ 0,3 đến 2 tỷ. Sapiens liên tục vượt qua các đường cơ sở hiện có trên các chuẩn mực liên quan đến con người, đạt được những cải tiến đáng kể so với kết quả tốt nhất trước đó: 7,6 mAP trên Humans-5K (tư thế), 17,1 mIoU trên Humans-2K (phân đoạn bộ phận), 22,4% RMSE tương đối trên Hi4D (độ sâu) và 53,5% lỗi góc tương đối trên THuman2 (mặt phẳng normal).

Sapiens : Breakthrough in Human Vision Models

Những năm gần đây đã chứng kiến những bước tiến đáng kể trong việc tạo ra hình ảnh con người photorealistic ở 2D và 3D. Sự thành công của những phương pháp này chủ yếu là do ước tính mạnh mẽ của các tài sản như điểm then chốt 2D, phân đoạn bộ phận cơ thể chi tiết, độ sâu và mặt phẳng normal. Tuy nhiên, ước tính chính xác và mạnh mẽ của những tài sản này vẫn là một lĩnh vực nghiên cứu tích cực, và các hệ thống phức tạp để cải thiện hiệu suất cho từng nhiệm vụ thường cản trở việc áp dụng rộng rãi hơn. Hơn nữa, việc thu được chú thích chính xác và đáng tin cậy trong tự nhiên là rất khó để mở rộng quy mô. Mục tiêu của Sapiens là cung cấp một khuôn khổ thống nhất và các mô hình để suy luận những tài sản này trong tự nhiên, mở khóa một loạt các ứng dụng liên quan đến con người cho mọi người.

Sapiens cho rằng những mô hình lấy con người làm trung tâm như vậy nên đáp ứng ba tiêu chí: tổng quát hóa, khả năng áp dụng rộng rãi và độ trung thực cao. Tổng quát hóa đảm bảo độ mạnh mẽ đối với các điều kiện không nhìn thấy, cho phép mô hình hoạt động nhất quán trên các môi trường khác nhau. Khả năng áp dụng rộng rãi chỉ ra sự đa năng của mô hình, khiến nó phù hợp với một loạt các nhiệm vụ với sự điều chỉnh tối thiểu. Độ trung thực cao biểu thị khả năng của mô hình để tạo ra đầu ra chính xác, có độ phân giải cao, thiết yếu cho các nhiệm vụ tạo hình ảnh con người trung thành. Bài viết này chi tiết việc phát triển các mô hình thể hiện những thuộc tính này, được gọi chung là Sapiens.

Theo những hiểu biết này, Sapiens tận dụng các tập dữ liệu lớn và kiến trúc mô hình có thể mở rộng, điều then chốt cho tổng quát hóa. Đối với khả năng áp dụng rộng rãi hơn, Sapiens áp dụng phương pháp tiền huấn luyện rồi tinh chỉnh, cho phép thích nghi sau tiền huấn luyện với các nhiệm vụ cụ thể với sự điều chỉnh tối thiểu. Phương pháp này đặt ra một câu hỏi quan trọng: Loại dữ liệu nào là hiệu quả nhất cho tiền huấn luyện? Với những hạn chế tính toán, nên tập trung vào việc thu thập càng nhiều hình ảnh con người càng tốt, hay là nên tiền huấn luyện trên một tập dữ liệu ít được chăm sóc hơn để phản ánh sự đa dạng của thế giới thực? Các phương pháp hiện có thường bỏ qua phân phối dữ liệu tiền huấn luyện trong bối cảnh của các nhiệm vụ hạ nguồn. Để nghiên cứu ảnh hưởng của phân phối dữ liệu tiền huấn luyện đến các nhiệm vụ cụ thể của con người, Sapiens thu thập tập dữ liệu Humans-300M, bao gồm 300 triệu hình ảnh con người đa dạng. Những hình ảnh không được dán nhãn này được sử dụng để tiền huấn luyện một họ các bộ chuyển đổi tầm nhìn từ đầu, với số lượng tham số từ 300 triệu đến 2 tỷ.

Trong số các phương pháp tự giám sát để học các tính năng hình ảnh chung từ các tập dữ liệu lớn, Sapiens chọn phương pháp mã hóa tự động (MAE) vì sự đơn giản và hiệu quả của nó trong tiền huấn luyện. MAE, có mô hình suy luận một lần so với các chiến lược tương phản hoặc đa suy luận, cho phép xử lý một lượng lớn hình ảnh với cùng một tài nguyên tính toán. Để có độ trung thực cao hơn, trái ngược với các phương pháp trước đây, Sapiens tăng độ phân giải đầu vào bản địa của tiền huấn luyện lên 1024 pixel, dẫn đến tăng khoảng 4 lần FLOPs so với xương sống tầm nhìn lớn nhất hiện có. Mỗi mô hình được tiền huấn luyện trên 1,2 nghìn tỷ token. Đối với việc tinh chỉnh trên các nhiệm vụ liên quan đến con người, Sapiens sử dụng một kiến trúc mã hóa-decode nhất quán. Bộ mã hóa được khởi tạo với trọng số từ tiền huấn luyện, trong khi bộ decode, một đầu nhẹ và cụ thể cho nhiệm vụ, được khởi tạo một cách ngẫu nhiên. Cả hai thành phần sau đó được tinh chỉnh từ đầu đến cuối. Sapiens tập trung vào bốn nhiệm vụ chính: ước tính tư thế 2D, phân đoạn bộ phận cơ thể, độ sâu và ước tính mặt phẳng normal, như được chứng minh trong hình sau.

Thống nhất với các nghiên cứu trước, Sapiens khẳng định tác động quan trọng của chất lượng nhãn đối với hiệu suất trong tự nhiên của mô hình. Các chuẩn mực công khai thường chứa nhãn nhiễu, cung cấp tín hiệu giám sát không nhất quán trong quá trình tinh chỉnh mô hình. Đồng thời, việc sử dụng chú thích chính xác và chi tiết để phù hợp với mục tiêu chính của Sapiens về số hóa con người 3D là rất quan trọng. Để đạt được điều này, Sapiens đề xuất một tập hợp dày đặc hơn của các điểm then chốt 2D toàn thân cho ước tính tư thế và một từ vựng phân loại chi tiết cho phân đoạn bộ phận, vượt quá phạm vi của các tập dữ liệu trước. Cụ thể, Sapiens giới thiệu một tập hợp toàn diện gồm 308 điểm then chốt bao gồm cơ thể, tay, chân, bề mặt và khuôn mặt. Ngoài ra, Sapiens mở rộng từ vựng phân loại lên 28 lớp, bao gồm các bộ phận cơ thể như tóc, lưỡi, răng, môi trên/môi dưới và thân. Để đảm bảo chất lượng và tính nhất quán của chú thích và mức độ tự động hóa cao, Sapiens sử dụng một thiết lập thu thập đa góc để thu thập chú thích tư thế và phân đoạn. Sapiens cũng sử dụng dữ liệu tổng hợp lấy nét vào con người cho ước tính độ sâu và mặt phẳng normal, tận dụng 600 quét chi tiết từ RenderPeople để tạo ra các bản đồ độ sâu và mặt phẳng normal có độ phân giải cao. Sapiens chứng minh rằng sự kết hợp của tiền huấn luyện quy mô lớn theo lĩnh vực với chú thích chất lượng cao nhưng hạn chế dẫn đến tổng quát hóa mạnh mẽ trong tự nhiên. Tổng thể, phương pháp Sapiens cho thấy một chiến lược hiệu quả để phát triển các mô hình phân biệt chính xác có khả năng hoạt động trong các tình huống thế giới thực mà không cần thu thập một tập hợp đa dạng và tốn kém của chú thích.

Sapiens : Phương Pháp và Kiến Trúc

Sapiens tuân theo phương pháp mã hóa tự động (MAE) cho tiền huấn luyện. Mô hình được đào tạo để tái tạo hình ảnh con người ban đầu từ quan sát một phần của nó. Giống như tất cả các mã hóa tự động, mô hình Sapiens có một bộ mã hóa ánh xạ hình ảnh nhìn thấy vào một biểu diễn ẩn và một bộ decode tái tạo hình ảnh ban đầu từ biểu diễn ẩn này. Tập dữ liệu tiền huấn luyện bao gồm cả hình ảnh đơn và đa con người, với mỗi hình ảnh được thay đổi kích thước thành một kích thước cố định với tỷ lệ khung hình vuông. Tương tự như ViT, hình ảnh được chia thành các bản vá không chồng lấp cố định với một kích thước bản vá cố định. Một tập hợp con của các bản vá này được chọn một cách ngẫu nhiên và bị che, để lại phần còn lại nhìn thấy được. Tỷ lệ bản vá bị che so với bản vá nhìn thấy được, được gọi là tỷ lệ che, vẫn không thay đổi trong suốt quá trình đào tạo.

Các mô hình Sapiens thể hiện tổng quát hóa trên nhiều đặc điểm hình ảnh, bao gồm tỷ lệ, cắt, tuổi và chủng tộc của đối tượng, và số lượng đối tượng. Mỗi token bản vá trong mô hình chiếm 0,02% diện tích hình ảnh so với 0,4% trong các ViT tiêu chuẩn, một sự giảm 16 lần – cung cấp lý luận giữa các token tinh vi cho các mô hình. Thậm chí với tỷ lệ che tăng lên 95%, mô hình tiền huấn luyện của Sapiens đạt được một tái tạo hợp lý của giải phẫu con người trên các mẫu được giữ lại. Tái tạo của mô hình Sapien tiền huấn luyện trên hình ảnh con người không nhìn thấy được thể hiện trong hình sau.

Hơn nữa, Sapiens sử dụng một tập dữ liệu độc quyền lớn cho tiền huấn luyện, bao gồm khoảng 1 tỷ hình ảnh trong tự nhiên, tập trung độc quyền vào hình ảnh con người. Việc tiền xử lý bao gồm loại bỏ hình ảnh có watermark, văn bản, hình ảnh nghệ thuật hoặc các yếu tố không tự nhiên. Sapiens sau đó sử dụng một bộ phát hiện hộp giới hạn người sẵn có để lọc hình ảnh, giữ lại những hình ảnh có điểm phát hiện trên 0,9 và kích thước hộp giới hạn trên 300 pixel. Hơn 248 triệu hình ảnh trong tập dữ liệu chứa nhiều đối tượng.

Ước Tính Tư Thế 2D

Khung Sapien tinh chỉnh bộ mã hóa và bộ decode trong P trên nhiều khung xương, bao gồm K = 17 [67], K = 133 [55] và một khung xương chi tiết cao, với K = 308, như được hiển thị trong hình sau.

So với các định dạng hiện có với tối đa 68 điểm then chốt khuôn mặt, chú thích của Sapien bao gồm 243 điểm then chốt khuôn mặt, bao gồm các điểm đại diện xung quanh mắt, môi, mũi và tai. Thiết kế này được thiết kế để bắt chính xác các chi tiết tinh vi của biểu cảm khuôn mặt trong thế giới thực. Với những điểm then chốt này, khung Sapien chú thích thủ công 1 triệu hình ảnh ở độ phân giải 4K từ một thiết lập thu trong nhà. Tương tự như các nhiệm vụ trước, chúng tôi đặt kênh đầu ra của bộ ước tính mặt phẳng normal N là 3, tương ứng với các thành phần xyz của vector mặt phẳng normal tại mỗi pixel. Dữ liệu tổng hợp được tạo cũng được sử dụng làm giám sát cho ước tính mặt phẳng normal.

Sapien : Thử Nghiệm và Kết Quả

Sapiens-2B được tiền huấn luyện bằng 1024 GPU A100 trong 18 ngày với PyTorch. Sapiens sử dụng bộ tối ưu hóa AdamW cho tất cả các thí nghiệm. Lịch trình học tập bao gồm một giai đoạn khởi động tuyến tính ngắn, tiếp theo là giảm cosine cho tiền huấn luyện và giảm tuyến tính cho tinh chỉnh. Tất cả các mô hình được tiền huấn luyện từ đầu tại độ phân giải 1024 × 1024 với kích thước bản vá 16. Đối với tinh chỉnh, hình ảnh đầu vào được thay đổi kích thước thành tỷ lệ 4:3, tức là 1024 × 768. Sapiens áp dụng các tăng cường tiêu chuẩn như cắt, thay đổi kích thước, lật và biến dạng quang học. Một nền tảng ngẫu nhiên từ hình ảnh COCO không phải là con người được thêm vào cho các nhiệm vụ phân đoạn, độ sâu và dự đoán mặt phẳng normal. Quan trọng là, Sapiens sử dụng tốc độ học tập phân biệt để bảo tồn tổng quát hóa, với tốc độ học tập thấp hơn cho các lớp ban đầu và tốc độ học tập cao hơn cho các lớp tiếp theo. Sự giảm tốc độ học tập theo lớp được đặt thành 0,85 với sự giảm trọng số 0,1 cho bộ mã hóa.

Các thông số thiết kế của Sapiens được chi tiết trong bảng sau. Theo một cách tiếp cận cụ thể, Sapiens ưu tiên mở rộng mô hình theo chiều rộng hơn là chiều sâu. Đáng chú ý, mô hình Sapiens-0,3B, mặc dù kiến trúc tương tự như ViT-Large truyền thống, bao gồm 20 lần FLOPs hơn do độ phân giải cao hơn.

Sapiens được tinh chỉnh cho ước tính tư thế khuôn mặt, cơ thể, chân và tay (K = 308) sử dụng chú thích chất lượng cao. Đối với đào tạo, Sapiens sử dụng tập huấn luyện với 1 triệu hình ảnh, và đối với đánh giá, nó sử dụng tập kiểm tra, được gọi là Humans5K, với 5.000 hình ảnh. Đánh giá theo cách tiếp cận từ trên xuống, nơi Sapiens sử dụng một bộ phát hiện hộp giới hạn người sẵn có cho các hộp giới hạn và thực hiện suy luận tư thế con người đơn. Bảng 3 cho thấy so sánh giữa các mô hình Sapiens với các phương pháp hiện có cho ước tính tư thế toàn thân. Tất cả các phương pháp được đánh giá trên 114 điểm then chốt chung giữa từ vựng 308 điểm then chốt của Sapiens và từ vựng 133 điểm then chốt của COCO-WholeBody. Sapiens-0,6B vượt qua trạng thái tốt nhất hiện có, DWPose-l, với +2,8 AP. Không giống như DWPose, sử dụng một khuôn khổ giáo viên-học sinh phức tạp với sự khuếch tán tính năng được thiết kế riêng cho nhiệm vụ, Sapiens áp dụng một kiến trúc mã hóa-decode chung với tiền huấn luyện con người lớn.

Đáng chú ý, ngay cả với cùng số lượng tham số, các mô hình Sapiens thể hiện hiệu suất vượt trội so với các mô hình tương tự. Ví dụ, Sapiens-0,3B vượt qua VitPose+-L với +5,6 AP, và Sapiens-0,6B vượt qua VitPose+-H với +7,9 AP. Trong gia đình Sapiens, kết quả chỉ ra một mối tương quan trực tiếp giữa kích thước mô hình và hiệu suất. Sapiens-2B thiết lập một trạng thái tốt nhất mới với 61,1 AP, một cải tiến đáng kể +7,6 AP so với kết quả tốt nhất trước đó. Mặc dù được tinh chỉnh với chú thích từ một phòng thu trong nhà, Sapiens chứng minh sự tổng quát hóa mạnh mẽ sang các tình huống thế giới thực, như được hiển thị trong hình sau.

Sapiens được tinh chỉnh và đánh giá sử dụng một từ vựng phân đoạn 28 lớp. Tập huấn luyện bao gồm 100.000 hình ảnh, trong khi tập kiểm tra, Humans-2K, bao gồm 2.000 hình ảnh. Sapiens được so sánh với các phương pháp phân đoạn bộ phận cơ thể hiện có, được tinh chỉnh trên cùng một tập huấn luyện, sử dụng các điểm kiểm tra được đề xuất bởi mỗi phương pháp làm khởi tạo. Tương tự như ước tính tư thế, Sapiens thể hiện tổng quát hóa trong phân đoạn, như được chứng minh trong bảng sau.

Đáng chú ý, mô hình nhỏ nhất, Sapiens-0,3B, vượt qua các phương pháp phân đoạn bộ phận cơ thể tốt nhất hiện có như Mask2Former và DeepLabV3+ với 12,6 mIoU do độ phân giải cao hơn và tiền huấn luyện con người lớn. Hơn nữa, việc tăng kích thước mô hình cải thiện hiệu suất phân đoạn. Sapiens-2B đạt được hiệu suất tốt nhất, với 81,2 mIoU và 89,4 mAcc trên tập kiểm tra, như được hiển thị trong hình sau.

Kết Luận

Sapiens đại diện cho một bước tiến quan trọng trong việc phát triển các mô hình tầm nhìn con người thành các mô hình nền tảng. Các mô hình Sapiens thể hiện khả năng tổng quát hóa mạnh mẽ trên nhiều nhiệm vụ liên quan đến con người. Hiệu suất tốt nhất được quy cho: (i) tiền huấn luyện quy mô lớn trên một tập dữ liệu được chăm sóc cẩn thận dành riêng cho việc hiểu con người, (ii) xương sống tầm nhìn có khả năng mở rộng, độ phân giải cao và có khả năng chứa nhiều tham số, và (iii) chú thích chất lượng cao trên dữ liệu phòng thu tăng cường và dữ liệu tổng hợp. Các mô hình Sapiens có tiềm năng trở thành một khối xây dựng quan trọng cho nhiều nhiệm vụ hạ nguồn và cung cấp quyền truy cập vào các xương sống tầm nhìn chất lượng cao cho một phần lớn hơn của cộng đồng.

"Một kỹ sư theo nghề nghiệp, một nhà văn theo trái tim". Kunal là một nhà văn kỹ thuật với tình yêu và hiểu biết sâu sắc về AI và ML, dành để đơn giản hóa các khái niệm phức tạp trong các lĩnh vực này thông qua tài liệu hấp dẫn và thông tin của mình.