Anderson의 관점
1999 년처럼 스트리밍 AI 아바타

새로운 연구는 거의 즉시 나타나고 실시간으로 선명해지는 것 같은 3D 아바타를 스트리밍하는 방법을 제시하며, 사용자가 대규모 다운로드가 완료될 때까지 기다릴 필요가 없습니다.
생성적 AI와 AI 지원 렌더링 시스템의 엄청난 자원需求은 소비자 준비도를 20년 이상 이전으로 되돌려 보냈습니다. 2023년까지 64GB RAM 할당은 랩톱이나 데스크톱 PC에서 과도한 것으로 보였습니다. 그러나 RAM과/또는 CPU 오프로딩의 인기가 증가함에 따라 64GB는 현지 AI需求에 대해 상당히 모자란 것으로 보입니다. 이러한曾經平凡하고 저렴한 PC 요소는 AI 서비스需求을 충족하기 위해 기업이 어려움을 겪고 있기 때문에 가격이 급등하고 있습니다.
AI와 그 프로세스 및 환경의 규모와 탐욕은 일반적으로 소비자 수준의 하드웨어를 압도하며, 심지어 ‘슬림’한 로컬 지향 모델을 실행하는 것조차 평균 시스템에 부담을 줄 수 있습니다.
텍스트 기반 AI 서비스인 ChatGPT도 클라이언트와 서버 수준에서 모두 상당한 부담을 받습니다. 따라서 AI가 온라인 멀티미디어 경험을 실시간으로 전달할 때 대기 시간과/또는 품질에서 매우 심각한妥協을 기대할 수 있습니다. 이것은 초기 스트리밍 미디어와의 인터넷의 어려움과 유사하며, RealPlayer와 QuickTime의 유명한 애니메이션 ‘버퍼링’ 아이콘이 그랬던 것처럼 마찬가지입니다.
멀티미디어와 네트워크 문제가 사용자 경험에서 마찰을 일으켰던 마지막 때, 소비자 수준의 하드웨어는 Moore의 법칙을 통해 거의 지수적으로 개선되었습니다. 그러나 지난 10년 동안 소비자 기술의 능력은 멀티미디어 요구를 초과했습니다. 이제 이 지역의 하드웨어가 더 저사양이고 더 비싼 것으로 바뀌면서 AI 기반 서비스가 더 높은 서버 측 및 로컬 리소스를 요구하기 때문에 이러한 지역의 하드웨어가 더 저사양이고 더 비싼 것으로 바뀌고 있습니다.
머리를 얻다
브로드밴드 이전 시대에, 초기 사용 가능한 스트리밍 비디오 이전에, 웹 사용자는 이미지가 초점을 맞추는 것을 볼 수 있었습니다. 진행중인 JPEG 이미지는 사용자에게 이미지를形成하는 것을 볼 수 있게 해주었습니다. 때때로 매우 느리게, 더 많은 이미지 데이터를 로드할 때, 사용자는 이미지를 볼 수 있었습니다.
이제, 우리는 AI 지원 Gaussian Splat 아바타와 같은 경험을 할 수 있을 것입니다.
재생을 클릭하세요. 새로운 ProgressiveAvatars 프로젝트에서 Gaussian 아바타의 스트리밍 비교입니다. 왼쪽에는 이전 GaussianAvatars 프로젝트가 느리게 새로운 데이터를 얻지만 데이터가 빌드업되면서 끔찍한 모습을 보입니다. 오른쪽에는 Progressive Avatars 버전도 자세를 빌드업하지만, 지능적으로 기본적인 인간의 모습을 ngay từ 시작부터 제공합니다. 소스
위에서 우리는 두 가지 버전의 Gaussian Splat 기반(GSplat) 아바타를 볼 수 있습니다. 이는 부분적으로 1990년대 초반의 비 AI 렌더링 기술과 더 현대적인 방법으로 가능합니다.

Gaussian Splatting은 색상과 3D 정보의 Gaussian 표현을 픽셀 또는 보クセ르 대신 사용하고, 더 전통적인 CGI 메시에 이 텍스처를 매핑합니다. 이는 FLAME와 STAR와 같은 ‘파라메트릭 인간’을 통해 가능합니다. 소스
위의 비디오에서 우리는 전통적인 Gaussian Splat 아바타 구현이 데이터를 로드하는 동안 끔찍한 모습을 보입니다. 새로운 중국의 구현인 ProgressiveAvatars는 데이터를 로드하는 동안 훨씬 더 우아하게 해결할 수 있습니다.
저자는 उनक의 방법이真正로 Gaussian 아바타를 ‘스트리밍’하는 첫 번째 방법이라고 주장하며, 진행중인 방식으로 이미지를 빌드업할 수 있습니다.
재생을 클릭하세요.ProgressiveAvatars 프로젝트 사이트에서 주의를 기반으로 하는 로딩을示す 일러스트입니다.
이전에는 ‘레벨 오브 디테일'(LOD) 접근 방식이 사용되었습니다. 이는 비디오 게임 최적화와 유사하며, 성공적으로 더 자세한 버전의 사람을 로드합니다.
새로운 영역
이것이 마치 니치 문제처럼 보일 수 있지만, 스트리밍 비디오도 그렇듯이, 초기 플러그인을 작동시키는 것은 가장 가까운 기술자에게 외주되었습니다. 또한 AI 기반 스트리밍 표현의 가능성은 인간 아바타를 넘어 도시 생성, 게임, 3D 기반의 온라인 도메인으로 확장됩니다.
재생을 클릭하세요. 2024년 프로젝트에서 온라인 ‘시도’의 미래를 간략하게 보여줍니다. 다른 프로젝트는 동작과 상호작용을 추가하려고 합니다. 소스
이러한 초기 GSplat 아웃팅은 대부분 단일 인간을描写하며, 많은 상황에서는 여러 인간과 환경 특징 및 분위기가 필요할 것입니다.
방법
접근 방식은 처음에 사람의 머리 비디오를 사용합니다. 각 프레임에 대해 표준 FLAME 파라메트릭 얼굴 모델을 맞추어 형태와 표현이 시간이 지남에 따라 변경되지만, 기본 메시 구조는 고정됩니다.

머리 비디오는 먼저 추적된 FLAME 메시로 맞춰지고, 3D 가우스는 각 얼굴에 연결되고, 화면 공간 그라데이션에서 누락된 세부 사항을 나타낼 때 계층적으로 성장합니다.
이 基本 구조 위에 세부 사항이 추가됩니다. 표면은 암시적으로 계층으로 나누어지고, 각 세부 수준의 얼굴에 작은 3차원 가우스가 연결됩니다.
초기에는 더 粗い 層が 전체 머리 모양과 동작을 捕获하지만, 이후의 더 세부적인 層는 주름, 미세한 변형, 고주파 수를 제공합니다.
이러한 가우스에서 렌더링된 이미지는 다이퍼런서블 가우스 래스터라이저를 사용하여 렌더링되며, 다중 뷰 그라운드 트루스 비디오에 대해 훈련됩니다.
데이터 및 테스트
테스트를 위해 새로운 방법은 NeRSemble 데이터셋에서 평가되었습니다. 이는 각 주제에 대한 다중 뷰 비디오로 구성되며, 모든 뷰에서 매개변수가 조정됩니다.

테스트에 사용된 NeRSemble 데이터셋의 예시 소스
원래 GaussianAvatars 방법론과 일치하도록, 이미지는 802x550px로 다운샘플링되었으며, 전경 마스크가 생성되었습니다.
Adam 옵티마이저를 사용하여 매개변수 업데이트를 수행했습니다. 학습률은 1×10^-2로 설정되었습니다. 훈련은 60,000 반복으로 실행되었습니다.
초기에는 저자들이 재구성과 애니메이션을 테스트했습니다. 이는 평면 비디오를 3D 인식 시스템으로 변환하는 작업입니다.
저자들은 또한 진행중인 렌더링을 테스트했습니다. 이는 NVIDIA RTX 4090에서 수행되었습니다.
결론
Gaussian Splatting은 지속할 수 있을지, 또는 AI 주도 또는 AI 지원 3D 인식 경험을 포함한 다양한 응용 프로그램에서 기억될지 모릅니다. 이것은 대체 기술이나 접근 방식이 승리할 수 있거나, GSplat이 가장 신뢰할 수 있는 AI 비디오 표현이 될 수 있습니다.
이 새로운 논문은 이 새로운 영역의 일부를 알립니다. 또한 과거의 대역폭이 부족한 인터넷을 생각나게 합니다.
* 3D라는 용어는 특별한 안경이 필요한 경험을 의미하지 않습니다. 다만 멀티미디어 콘텐츠가 X/Y/Z 좌표를 이해하는 경험을 의미합니다.
최초로 게시된 날: 2026년 3월 18일










