Góc nhìn Anderson
Phát trực tuyến Avatar AI giống như năm 1999

Nghiên cứu mới trình bày một cách để phát trực tuyến các avatar 3D giống như thật, xuất hiện gần như ngay lập tức và sắc nét theo thời gian thực, thay vì buộc người dùng phải chờ đợi các tải xuống lớn để hoàn thành.
Trong nhiều cách, nhu cầu tài nguyên khổng lồ của trí tuệ nhân tạo và hệ thống kết xuất hỗ trợ trí tuệ nhân tạo đã đưa khả năng sẵn sàng của người tiêu dùng trở lại hai mươi năm trước. Chỉ trong năm 2023, phân bổ 64GB RAM trong máy tính xách tay hoặc máy tính để bàn dường như là quá mức; nhưng bây giờ, với sự phổ biến ngày càng tăng của RAM và / hoặc xử lý CPU ngoài, 64GB là khá khiêm tốn cho nhu cầu trí tuệ nhân tạo địa phương; và những yếu tố từng bình thường và phải chăng của máy tính tiếp tục tăng giá khi các công ty đấu tranh để đáp ứng nhu cầu về dịch vụ trí tuệ nhân tạo.
Quy mô và tham lam của trí tuệ nhân tạo và các quy trình, môi trường của nó thường vượt quá phần cứng cấp người tiêu dùng, và thậm chí chạy các mô hình ‘được giảm bớt’ định hướng địa phương dưới dạng GGUF sẽ thường gây áp lực cho hệ thống trung bình.
Các dịch vụ trí tuệ nhân tạo dựa trên văn bản như ChatGPT cũng chịu áp lực đáng kể cả ở cấp độ khách hàng và máy chủ. Do đó, một khi trí tuệ nhân tạo được giao nhiệm vụ cung cấp trải nghiệm đa phương tiện trực tuyến theo thời gian thực, chúng ta có thể hợp lý mong đợi một số thỏa hiệp nghiêm trọng về độ trễ và / hoặc chất lượng – tương tự như những khó khăn ban đầu của internet khi phát trực tuyến phương tiện, và những biểu tượng ‘đang tải’ động bị ghét bỏ của RealPlayer và QuickTime.
Lần cuối cùng mà các vấn đề đa phương tiện và mạng tạo ra ma sát trong trải nghiệm người dùng, phần cứng cấp người tiêu dùng vẫn đang tiến hóa thông qua Luật Moore, trở nên tốt hơn gần như theo cấp số nhân mỗi năm, ngay cả khi các hệ điều hành, mạng và cơ sở hạ tầng hỗ trợ khác tiến hóa để đáp ứng nhu cầu; và trong mười năm qua, khả năng của công nghệ người tiêu dùng đã vượt quá nhu cầu đa phương tiện (có thể đến mức cần phải kích hoạt để duy trì doanh số).
Nhưng sự dư thừa về khả năng địa phương có thể sắp kết thúc, vì phần cứng địa phương trở nên thấp hơn và đắt hơn, và vì các dịch vụ dựa trên trí tuệ nhân tạo đòi hỏi nhiều tài nguyên máy chủ và địa phương hơn.
Lấy đầu
Trở lại thời kỳ trước băng thông rộng, ngay cả trước khi có video phát trực tuyến có thể sử dụng được, người dùng web đã quen với việc hình ảnh dần dần rõ ràng, vì JPEG tiến bộ cho phép người dùng băng thông thấp có thể xem hình ảnh đang tải, đôi khi rất chậm, khi nhiều dữ liệu hình ảnh được tải xuống địa phương.
Bây giờ, dường như chúng ta có thể trải qua một trải nghiệm tương tự với avatar Gaussian Splat được hỗ trợ bởi trí tuệ nhân tạo:
Click để phát. Từ dự án ProgressiveAvatars mới, một so sánh về phát trực tuyến avatar Gaussian. Nguồn
Trên đây, chúng ta thấy hai phiên bản của avatar Gaussian Splat – một hình đại diện con người được kích hoạt một phần bởi một kỹ thuật kết xuất không trí tuệ nhân tạo từ những năm 1990 và cũng bởi các phương pháp hiện đại hơn, chẳng hạn như mô hình parametric mặt người FLAME và các phương pháp đào tạo dựa trên trí tuệ nhân tạo:

Gaussian Splatting sử dụng một biểu diễn Gaussian của màu sắc và thông tin 3D thay cho một pixel hoặc voxel, và ánh xạ kết cấu siêu thực này lên một lưới CGI truyền thống, được hỗ trợ bởi một ‘mặt người tham số’, một khuôn mặt và / hoặc cơ thể CGI, trong các hệ thống như FLAME và STAR. Nguồn
Trên trái trong video trên, chúng ta có thể thấy rằng một triển khai truyền thống của avatar Gaussian Splat trông khá khủng khiếp khi chúng ta chờ đợi dữ liệu tải; trên phải, một triển khai mới từ Trung Quốc, được gọi là ProgressiveAvatars, có thể giải quyết một cách tinh tế hơn khi dữ liệu tải, trình bày một hình ảnh con người không gây khó chịu ngay từ đầu.
Các tác giả cho rằng phương pháp của họ là phương pháp đầu tiên thực sự ‘phát trực tuyến’ một avatar Gaussian, và chắc chắn là phương pháp đầu tiên làm như vậy theo cách tiến bộ, nơi hình ảnh được xây dựng một cách tinh tế, và các khu vực quan trọng nhất – chẳng hạn như mắt và môi – có thể được ưu tiên, để avatar có thể trở nên đối thoại ngay cả khi chỉ tải một phần:
Click để phát. Từ trang web dự án ProgressiveAvatars, một minh họa về việc tải có ý thức.
Trước đây, một cách tiếp cận ‘cấp độ chi tiết’ (LOD) đã được sử dụng trong các nỗ lực trước để giảm bớt ‘GSplat’ avatar, tương tự như tối ưu hóa trò chơi, nơi các phiên bản chi tiết hơn của một người được tải xuống tùy thuộc vào việc họ chiếm đủ phần viewport hoặc sự chú ý của người xem để xứng đáng với nỗ lực.
Tất nhiên, điều này đòi hỏi một lượng dư thừa đáng kể của các ‘bản sao’ avatar, và các tác giả đặt phương pháp của họ như một hệ thống hợp lý hơn. Bằng cách ngụ ý, một phương pháp như vậy cũng cho phép thay đổi được thực hiện trong một hình ảnh GSplat (tức là, tùy chỉnh) mà không cần phải truyền những thay đổi đó qua một chuỗi các ‘bản sao’ LOD khác nhau.
Một lĩnh vực mới nổi
Nếu điều này có vẻ như là một vấn đề hẹp, thì phát trực tuyến video cũng vậy, vào những ngày khi việc nhận được các plugin đầu tiên để làm việc được giao cho người dùng gần nhất. Hơn nữa, tiềm năng cho các đại diện phát trực tuyến dựa trên trí tuệ nhân tạo vượt ra ngoài avatar con người, mở rộng đến tạo thành phố, trò chơi, và các phiên bản 3D dựa trên hầu như bất kỳ lĩnh vực trực tuyến nào – chẳng hạn như Thử nghiệm ảo, cho việc mua sắm quần áo:
Click để phát. Từ một dự án năm 2024, một cái nhìn thô về tương lai của thử nghiệm trực tuyến. Các dự án khác tìm cách thêm chuyển động và tương tác – các khía cạnh đòi hỏi khắt khe để phát trực tuyến và quản lý. Nguồn
Giống như các cách tiếp cận dựa trên LOD đã được tận dụng chủ yếu bởi các trò chơi, nhiều vấn đề khác mà trước đây chỉ thuộc về phát triển trò chơi có thể sẽ ảnh hưởng đến các đại diện dựa trên Splat. Ví dụ, hầu hết các lần ra mắt GSplat đầu tiên mô tả một con người duy nhất nhai và nói, hoặc có thể nói; nhưng nhiều tình huống sẽ cần có nhiều người, cũng như các tính năng và âm cảnh – một kịch bản mà các hệ thống ‘tiêu chuẩn’ hiệu suất cao sẽ quyết định nơi dữ liệu phát trực tuyến cần được ưu tiên, để giữ cho người xem trong giây phút.
Bài báo mới có tiêu đề ProgressiveAvatars: Progressive Animatable 3D Gaussian Avatars, và đến từ ba nhà nghiên cứu tại Đại học Khoa học và Công nghệ Trung Quốc ở Hefei.
Phương pháp
Phương pháp này ban đầu tận dụng video của đầu người. Đối với mỗi khung hình, một mô hình mặt người tham số FLAME tiêu chuẩn được áp dụng, để hình dạng và biểu cảm thay đổi theo thời gian, trong khi cấu trúc lưới cơ bản vẫn giữ nguyên. Bởi vì cấu trúc cơ bản không thay đổi, một mẫu FLAME ổn định có thể được tái sử dụng và tinh chỉnh thay vì xây dựng lại từ đầu tại mỗi thời điểm, như trong các công việc trước đây:

Video đầu được áp dụng một lưới FLAME được theo dõi, sau đó các Gaussian 3D được gắn vào mỗi mặt và phát triển phân cấp khi các gradient không gian màn hình chỉ ra sự thiếu chi tiết. Trong quá trình đào tạo, sự phân chia này xây dựng một biểu diễn nhiều cấp dưới sự giám sát đa góc, và tại thời điểm suy luận, các điểm số quan trọng trên mỗi mặt xác định các Gaussian nào được phát trực tuyến trước, cho phép avatar xuất hiện nhanh và tinh chỉnh tiến bộ khi các cấp độ chi tiết cao hơn được thêm vào.
Trên cấu trúc cơ bản này, chi tiết được thêm vào từng lớp; bề mặt được chia nhỏ thành một phân cấp, và các Gaussian 3D nhỏ được gắn vào các mặt tại mỗi cấp độ chi tiết.
Mặc dù các lớp thô ban đầu nắm bắt hình dạng đầu và chuyển động tổng thể, các lớp mịn hơn tiếp theo cung cấp nếp nhăn, biến dạng tinh tế và kết cấu tần số cao. Các hình ảnh sau đó được kết xuất từ các Gaussian này bằng một bộ kết xuất Gaussian có thể phân biệt được và được đào tạo chống lại các hình ảnh đa góc thực, để avatar học cách tái tạo lại ngoại hình của người thật.
Trong quá trình đào tạo, phân cấp này tự động phát triển: các khu vực cần thêm chi tiết được chia nhỏ thêm, được hướng dẫn bởi các tín hiệu không gian màn hình, để nỗ lực tính toán tập trung vào nơi mà mắt người xem có khả năng nhận thấy lỗi nhất.
Trong quá trình suy luận, phân cấp này cho phép phát trực tuyến tiến bộ, trong đó một phiên bản thô của avatar có thể được hiển thị trước, và khi các lớp thêm vào, các Gaussian mới có thể được thêm vào mà không thay đổi những gì đã được hiển thị, cho phép một avatar đầu có thể hoạt hình xuất hiện nhanh và trở nên sắc nét và chi tiết hơn khi thêm dữ liệu.
Các tác giả quan sát rằng toàn bộ hệ thống phụ thuộc vào việc ưu tiên dữ liệu đến:

Khi tất cả các Gaussian ở một cấp độ nhất định có sẵn, mô hình được kết xuất với độ trung thực tối đa; nhưng trong khi phát trực tuyến, việc gửi các Gaussian có đóng góp cao nhất trước cho phép kết quả một phần sớm giống với hình ảnh cuối cùng, trong khi việc truyền các Gaussian có đóng góp thấp trước làm biến dạng sự cân bằng màu sắc và nhấn mạnh các thành phần nhỏ.
Dữ liệu và Kiểm tra
Để kiểm tra, phương pháp mới được đánh giá trên Bộ dữ liệu NeRSemble, bao gồm các video đa góc cho mỗi đối tượng được bao phủ, với các tham số được hiệu chỉnh trên tất cả các góc:

Ví dụ về các cách diễn giải đa dạng của các đối tượng được bao gồm trong Bộ dữ liệu NeRSemble được sử dụng trong các kiểm tra cho ProgressiveAvatars. Nguồn
Theo phương pháp GaussianAvatars ban đầu, các hình ảnh được giảm xuống 802x550px và một mặt nạ tiền cảnh được tạo, và sự chia cắt đào tạo / kiểm tra ban đầu của dự án được áp dụng.
Bộ tối ưu hóa Adam được sử dụng để cập nhật tham số, với tốc độ học là 1×10-2 trên tất cả các tọa độ barycentric. Việc đào tạo diễn ra trong 60.000 lần lặp, với phân cấp được mở rộng tự động mọi 2.000 lần lặp.
Ban đầu, các tác giả đã kiểm tra khôi phục và hoạt hình – nhiệm vụ chuyển đổi video phẳng thành một hệ thống 3D (x / y / z), sử dụng mô hình CGI tham số FLAME tiêu chuẩn làm lưới neo. Đối với điều này, tất cả các đường cơ sở đều được đào tạo từ đầu, và các khuôn khổ đối thủ được kiểm tra là GaussianAvatars và PointAvatar.
Đối với các kiểm tra này, các chỉ số được sử dụng là Tỷ lệ tín hiệu trên nhiễu đỉnh (PSNR), Chỉ số tương tự cấu trúc (SSIM) và Tương tự hình ảnh học được (LPIPS):

So sánh định lượng về tổng hợp mới và tổng hợp biểu thức mới sử dụng PSNR, SSIM và LPIPS. Tại truyền đầy đủ, phương pháp đề xuất đạt được PSNR cao nhất trên cả hai nhiệm vụ và vẫn cạnh tranh với GaussianAvatars trên các chỉ số nhận thức, trong khi cài đặt 5% minh họa sự đánh đổi chất lượng dưới các hạn chế băng thông cực đoan.
Về những kết quả này, các tác giả khẳng định:
‘[Phương pháp của chúng tôi] khôi phục các chi tiết sắc nét hơn trong một số khu vực, đặc biệt là quanh cổ, vai và quần áo. Những khu vực này được chia lưới thô hơn trong mẫu FLAME so với các khu vực mặt người có độ rõ nét cao (ví dụ, khu vực quanh mắt).
‘Do đó, các phương pháp trước đây thường phân bổ quá ít Gaussian 3D cho những khu vực này để bắt chính xác chi tiết nhỏ. Ngược lại, chiến lược phát triển thích ứng của chúng tôi tăng số lượng Gaussian và tinh chỉnh phân cấp chỉ khi cần, làm cho phân bổ không nhạy cảm với lưới không đều của FLAME.’
Các tác giả lưu ý thêm rằng phương pháp của họ tương đương với các phương pháp hiện đại, mang lại một avatar có thể hoạt động với một sự cho phép băng thông nhỏ 5%:

So sánh định lượng về tổng hợp mới và tổng hợp biểu thức mới sử dụng PSNR, SSIM và LPIPS. Tại truyền đầy đủ, phương pháp đề xuất đạt được PSNR cao nhất trên cả hai nhiệm vụ và vẫn cạnh tranh với GaussianAvatars trên các chỉ số nhận thức, trong khi cài đặt 5% minh họa sự đánh đổi chất lượng dưới các hạn chế băng thông cực đoan.
Tiếp theo, các nhà nghiên cứu đã kiểm tra chính kết xuất tiến bộ – được thực hiện trên một NVIDIA RTX 4090, với 24Gb VRAM, ở độ phân giải 550x802px. Trong kịch bản này, các tác giả chỉ ra rằng một ngân sách 25% sẽ sử dụng tất cả các Gaussian ‘cấp 1’, cũng như một tập hợp con của Gaussian cấp 2, điều này cho một cái nhìn tổng quan về cách các nhóm Gaussian tích lũy chi tiết trong các nhóm có số cao hơn, và các nhóm có số thấp hơn về cơ bản xây dựng nền tảng cơ bản:

Hiệu suất dưới các ngân sách truyền khác nhau cho tổng hợp mới và tổng hợp biểu thức mới, cho thấy chất lượng dần dần tiếp cận hoặc vượt quá GaussianAvatars khi nhiều Gaussian và dữ liệu hơn được truyền, trong khi tốc độ thời gian thực được duy trì, trên một RTX 4090.
Các tác giả nhận xét:
‘Với chỉ 2,60 MB được truyền (5% ngân sách), avatar đã đạt được chất lượng hợp lý. Khi các Gaussian cấp cao hơn được truyền, các cấu trúc tinh tế như nút áo, răng và tóc dần dần sắc nét trong khi vẫn duy trì sự ổn định thời gian.
‘Tại 100% truyền, phương pháp của chúng tôi đạt được chất lượng kết xuất tương đương với các phương pháp hiện đại. Đáng chú ý, tốc độ khung hình không giảm đáng kể, có lẽ vì khối lượng công việc 3DGS chưa bão hòa GPU.’
Tuy nhiên, các tác giả chỉ ra rằng trong các kịch bản thực tế nhiều người dùng, số lượng Gaussian 3D sẽ nhanh chóng tăng đến mức mà kết xuất GPU trở thành một nút thắt. Trong những kịch bản nặng hơn, phương pháp đề xuất cung cấp một lợi thế bằng cách cho phép hệ thống đánh đổi số lượng nguyên thủy với chất lượng hình ảnh, giảm tải mà không làm sụp đổ kết xuất.
Although bài báo không chi tiết, trang web dự án có các so sánh kiểm tra bổ sung, cũng có dự án avatar Gaussian lai MeGA:
Click để phát. Một trong một loạt video bổ sung từ trang web dự án đi kèm với bài báo, so sánh phương pháp mới về tổng hợp mới.
Kết luận
Gaussian Splatting có thể hoặc không thể tồn tại, hoặc thậm chí được nhớ đến nhiều hơn RealPlayer bây giờ, liên quan đến sự ra đời của phát trực tuyến tương tác: các trải nghiệm đại diện 3D dựa trên trí tuệ nhân tạo, bao gồm trò chuyện video, mua sắm ảo, điều hướng tuyến đường và các ứng dụng giải trí đa dạng. Có thể các công nghệ hoặc phương pháp thay thế khác sẽ chiếm ưu thế, hoặc GSplat chứng minh là đại diện video trí tuệ nhân tạo đáng tin cậy nhất.
Nếu không có gì khác, bài báo thú vị này báo trước một chút về phạm vi của lĩnh vực mới này, trong khi nhắc chúng ta, có thể là hoài niệm, về internet nghèo băng thông của ngày xưa.
* Bằng ‘3D’, tôi không có nghĩa là loại trải nghiệm đòi hỏi kính đặc biệt, mà là những trải nghiệm mà nội dung đa phương tiện có một số hiểu biết về tọa độ X / Y / Z.
Được xuất bản lần đầu vào thứ Tư, ngày 18 tháng 3 năm 2026










