Взгляд Anderson

Потоковое вещание аватаров ИИ, как в 1999 году

mm
Добавьте Unite.AI в избранные источники в Google
Montage of images related to Gaussian Avatar streaming, featuring 3DGS faces. Source: https://ustc3dv.github.io/ProgressiveAvatars/

Новые исследования представляют способ потокового вещания похожих на жизнь 3D-аватаров, которые появляются почти сразу и уточняются в реальном времени, вместо того, чтобы заставлять пользователей ждать окончания огромных загрузок.

 

Во многих отношениях, огромные требования к ресурсам, генеративного ИИ и систем рендеринга с помощью ИИ, отбросили потребительскую готовность назад на двадцать или более лет. Только в 2023 году, 64 ГБ оперативной памяти в ноутбуке или настольном компьютере казались излишеством; теперь, с ростом популярности ИИ и/или отключения ЦП, 64 ГБ кажется довольно скромными для местных потребностей ИИ; и эти когда-то банальные и доступные элементы компьютеров продолжают rocket в цене из-за того, что корпорации борются за удовлетворение спроса на услуги ИИ.

Масштаб и жадность ИИ и его процессов и сред обычно превосходят потребительское оборудование, и даже запуск “урезанных” локальных моделей в качестве GGUF-версий обычно создает нагрузку на среднюю систему.

Даже текстовые услуги ИИ, такие как ChatGPT, подвержены значительной нагрузке как на клиентской, так и на серверной стороне. Следовательно, когда ИИ задействован в доставке онлайн-мультимедийных trải nghiệm в реальном времени, мы можем разумно ожидать некоторых очень серьезных компромиссов в задержке и/или качестве – подобно ранним трудностям интернета со стримингом мультимедиа и ненавистным анимированным иконкам “буферизации” RealPlayer и QuickTime.

В последний раз, когда мультимедийные и сетевые проблемы создавали трение в пользовательском опыте, потребительское оборудование все еще развивалось через закон Мура, становясь几乎 экспоненциально лучше каждый год, даже когда ОС, сети и другая поддерживающая инфраструктура эволюционировали, чтобы удовлетворить спрос; и в течение последних десяти лет, возможности потребительской технологии превосходили мультимедийные требования (может быть, даже до такой степени, что перемена нуждалась в том, чтобы быть запущенной, чтобы поддерживать продажи).

Но этот избыток локальной возможностей может скоро подойти к концу, поскольку локальное оборудование становится менее мощным и более дорогим, и поскольку услуги на основе ИИ требуют более высоких серверных и локальных ресурсов.

Получение головы

В до-бродбэнд-эру, даже до самых ранних пригодных для использования видеопотоков, веб-пользователи привыкли к тому, что изображения медленно приходили в фокус, поскольку прогрессивные JPEG позволяли пользователям с ограниченной полосой пропускания смотреть, как загружаемое изображение формируется, иногда болезненно медленно, поскольку загружалась больше данных об изображении.

Теперь, кажется, мы можем ожидать подобного опыта с аватарами ИИ, поддерживающими Gaussian Splat:

Нажмите, чтобы воспроизвести. Из нового проекта ProgressiveAvatars, сравнение потоковых аватаров Gaussian. Слева, старый проект GaussianAvatars медленно получает новые данные, но выглядит плохо, когда данные строятся; справа, версия Progressive Avatars также строит детали медленно, но делает это таким образом, что дает базовое человеческое подобие с самого начала. Источник

Выше мы видим две версии аватара Gaussian Splat – человеческое представление, частично обусловленное не-ИИ методом рендеринга, который восходит к началу 1990-х годов, и также более современными методами, такими как FLAME параметрическая модель человека, и подходы к обучению на основе ИИ:

Gaussian Splatting использует представление Гаусса цвета и 3D-информации вместо пикселя или вокселя и отображает это сверхреалистичное текстурирование на более традиционном виде CGI-сетки, которое само по себе облегчается 'параметрическим человеком', CGI-лицом и/или телом, в системах таких как FLAME и STARR. Источник - https://arxiv.org/pdf/2312.02069.pdf

Gaussian Splatting использует представление Гаусса цвета и 3D-информации вместо пикселя или вокселя и отображает это сверхреалистичное текстурирование на более традиционном виде CGI-сетки, которое само по себе облегчается ‘параметрическим человеком’, CGI-лицом и/или телом, в системах таких как FLAME и STAR. Источник

Слева в видео выше мы видим, что традиционная реализация аватара Gaussian Splat выглядит довольно плохо, когда мы ждем загрузки данных. Справа, новая реализация из Китая, называемая ProgressiveAvatars, может разрешиться гораздо более элегантно, когда данные загружаются, представляя неалармное человеческое изображение с самого начала.

Авторы утверждают, что их метод является первым, который действительно “потоковое вещание” аватара Gaussian, и, безусловно, первый, который делает это прогрессивным образом, где изображение строится элегантно, и наиболее важные области – такие как глаза и губы – могут быть приоритизированы, так что аватар может стать разговорчивым, даже когда только частично загружен:

Нажмите, чтобы воспроизвести. С сайта проекта ProgressiveAvatars, иллюстрация осведомленной о внимании загрузки.

До этого, подход “уровня детализации” (LOD) использовался в предыдущих попытках уменьшить ‘GSplat’ аватары, подобно оптимизациям видеоигр, где более подробные версии человека загружаются в зависимости от того, занимает ли он достаточно места в viewport или внимания пользователя, чтобы стоить усилий.

Эмерджентная область

Если это кажется нишевой проблемой, ну, так же было и со стриминг-видео, в дни, когда получение работы самых ранних плагинов было поручено ближайшему доступному нерду. Кроме того, потенциал для представлений на основе ИИ, распространяемых через сеть, выходит за рамки человеческих аватаров, распространяясь на генерацию городов, игры и 3D-версии практически любой онлайн-области – такие как Виртуальная примерка, для шопинга одежды:

Нажмите, чтобы воспроизвести. Из проекта 2024 года, грубый взгляд на будущее онлайн-“примерки”. Другие проекты стремятся добавить движение и интерактивность – требовательные аспекты для стриминга и управления. Источник

Как и подходы на основе LOD, были в основном использованы в видеоиграх, многие другие соображения, которые когда-то были исключительной прерогативой разработки игр, вероятно, постучатся в представления на основе сплатов. Например, большинство этих ранних выходов GSplat изображают одного человека гримасничающего и жестикулирующего, или, может быть, говорящего; но многие ситуации будут нуждаться в нескольких людях, а также в окружающих особенностях и атмосфере – сценарий, в котором высокопроизводительные “триажные” системы будут определять, где данные потоковой передачи должны быть приоритизированы, чтобы сохранить зрителя в моменте.

Метод

Подход изначально опирается на видео человека. Для каждого кадра стандартная FLAME параметрическая модель лица подгоняется, так что форма и выражение лица меняются со временем, в то время как базовая сетчатая структура остается фиксированной. Поскольку базовая топология не меняется, стабильный шаблон FLAME может быть повторно использован и уточнен вместо того, чтобы быть перестроенным с нуля каждый момент, как это происходит в аналогичных предыдущих работах:

Видео головы сначала подгоняется с отслеживаемой сеткой FLAME, после чего 3D-гауссы прикрепляются к каждому лицу и растут иерархически, где градиенты в пространстве экрана указывают на отсутствие деталей. Во время обучения, это адаптивное подразделение строит многоуровневое представление под многогранной надзор, и на момент вывода, оценки важности на лицо определяют, какие гауссы передаются первыми, позволяя аватару появиться быстро и уточниться прогрессивно, когда добавляются более подробные уровни.

Видео головы сначала подгоняется с отслеживаемой сеткой FLAME, после чего 3D-гауссы прикрепляются к каждому лицу и растут иерархически, где градиенты в пространстве экрана указывают на отсутствие деталей. Во время обучения, это адаптивное подразделение строит многоуровневое представление под многогранной надзор, и на момент вывода, оценки важности на лицо определяют, какие гауссы передаются первыми, позволяя аватару появиться быстро и уточниться прогрессивно, когда добавляются более подробные уровни.

Над этой базовой структурой добавляются детали слоями; поверхность подразделена на иерархию, и небольшие трехмерные гауссы прикрепляются к лицам на каждом уровне детализации.

Хотя первые, более грубые слои захватывают общую форму головы и движение, последующие более тонкие слои предоставляют морщины, тонкие деформации и высокочастотную текстуру. Изображения затем рендерятся из этих гауссов с помощью дифференцируемого гауссовского растеризатора и обучаются на многогранном основании, так что аватар учится воспроизводить внешний вид реального человека.

Во время обучения, эта иерархия растет автоматически: области, которым нужны более подробные детали, подразделяются дальше, руководствуясь сигналами пространства экрана, так что вычислительные усилия концентрируются там, где глаз зрителя наиболее вероятно заметит ошибки.

Во время вывода, эта иерархия позволяет прогрессивному потоковому вещанию, когда грубая версия аватара может быть отображена сначала, и, когда добавляются дополнительные слои, новые гауссы могут быть добавлены без изменения того, что уже показано, позволяя анимированному аватару головы появиться быстро и стать более подробным и детальным, когда поступает больше данных.

Авторы отмечают, что вся система зависит от приоритизации входящих данных:

Когда все гауссы на данном уровне доступны, полная модель рендерится с максимальной точностью; но во время потоковой передачи, передача гауссов с наибольшим вкладом сначала позволяет частичным результатам тесно соответствовать окончательному изображению, в то время как передача гауссов с низким вкладом сначала искажает баланс цвета и подчеркивает незначительные компоненты.

Когда все гауссы на данном уровне доступны, полная модель рендерится с максимальной точностью; но во время потоковой передачи, передача гауссов с наибольшим вкладом сначала позволяет частичным результатам тесно соответствовать окончательному изображению, в то время как передача гауссов с низким вкладом сначала искажает баланс цвета и подчеркивает незначительные компоненты.

Данные и тесты

Для тестов, новый метод был оценен на наборе данных NeRSemble, который состоит из многогранных видео для каждого субъекта, с откалиброванными параметрами во всех видах:

Примеры различных интерпретаций субъектов, включенных в набор данных NeRSemble, используемый в тестах для ProgressiveAvatars. Источник - https://tobias-kirschstein.github.io/nersemble/

Примеры различных интерпретаций субъектов, включенных в набор данных NeRSemble, используемый в тестах для ProgressiveAvatars. Источник

В соответствии с оригинальной методологией GaussianAvatars, изображения были понижены до 802x550px, сгенерирована маска фона, и принят исходный проектный раздел обучения/тестирования.

Был использован оптимизатор Adam для обновления параметров, с скоростью обучения 1×10-2 на всех барицентрических координатах. Обучение длилось 60 000 итераций, с иерархией, автоматически расширяющейся каждые 2000 итераций.

Сначала авторы протестировали на реконструкцию и анимацию – задачу преобразования плоского видео в 3D-осведомленную (x/y/x) систему, используя каноническое представление FLAME в качестве якорной сетки. Для этого все базовые модели были обучены с нуля, и соперничающие рамки были протестированы с вышеупомянутыми GaussianAvatars и PointAvatar.

Для этих тестов использовались метрики Пиковая отношение сигнала к шуму (PSNR), Индекс структурированного подобия (SSIM), и Обученная перцептивная подобия изображений (LPIPS):

Качественное сравнение на синтезе нового вида и нового выражения. Базовый GaussianAvatars испытывает трудности с мелкими деталями вокруг глаз, морщин и текстуры кожи, в то время как предложенный метод уже сохраняет ключевую структуру лица примерно на пять процентов переданных данных и сходится к основанию и справочным изображениям (основанию), когда передаются более гауссов, тесно соответствуя полной модели.

Качественное сравнение на синтезе нового вида и нового выражения. Базовый GaussianAvatars испытывает трудности с мелкими деталями вокруг глаз, морщин и текстуры кожи, в то время как предложенный метод уже сохраняет ключевую структуру лица примерно на пять процентов переданных данных и сходится к основанию и справочным изображениям (основанию), когда передаются более гауссов, тесно соответствуя полной модели.

Относительно этих результатов, авторы утверждают:

‘[Наш] метод реконструирует более резкие детали в нескольких областях, особенно вокруг шеи, плеч и одежды. Эти области относительно грубо разбиты в шаблоне FLAME по сравнению с зонами высокого выделения лица (например, периокулярной областью).

‘Следовательно, предыдущие методы часто выделяют слишком мало 3D-гауссов для этих областей, чтобы верно захватить их мелкомасштабные детали. Напротив, наша адаптивная стратегия роста увеличивает количество гауссов и уточняет иерархию только там, где это необходимо, что делает распределение нечувствительным к неоднородной сетке FLAME.’

Авторы также отмечают, что их подход находится на уровне с современными методами, обеспечивая рабочий аватар с тривиальной разрешающей способностью 5%:

Количественное сравнение на синтезе нового вида и нового выражения, используя PSNR, SSIM и LPIPS. При полной передаче, предложенный метод достигает наивысшего PSNR на обоих задачах и остается конкурентоспособным с GaussianAvatars на перцептивных метриках, в то время как настройка 5% иллюстрирует компромисс качества при экстремальных ограничениях на полосу пропускания.

Количественное сравнение на синтезе нового вида и нового выражения, используя PSNR, SSIM и LPIPS. При полной передаче, предложенный метод достигает наивысшего PSNR на обоих задачах и остается конкурентоспособным с GaussianAvatars на перцептивных метриках, в то время как настройка 5% иллюстрирует компромисс качества при экстремальных ограничениях на полосу пропускания.

Далее исследователи протестировали само прогрессивное рендеринг. Это было проведено на NVIDIA RTX 4090, с 24 ГБ видеопамяти, при разрешении 550x802px. В этом сценарии, авторы указывают, что бюджет в 25% будет использовать все ‘уровень 1’ гауссы, а также подмножество гауссов уровня 2, что дает грубый обзор того, как гауссовые группы накапливают детали в более высоких номерах групп, и что более низкие номера групп по сути строят базовую холст:

Производительность при разных бюджетах передачи для синтеза нового вида и нового выражения, показывающая, что качество постепенно приближается или превышает GaussianAvatars, когда передаются более гауссов и данных, в то время как поддерживаются скорости в реальном времени, на RTX 4090.

Производительность при разных бюджетах передачи для синтеза нового вида и нового выражения, показывающая, что качество постепенно приближается или превышает GaussianAvatars, когда передаются более гауссов и данных, в то время как поддерживаются скорости в реальном времени, на RTX 4090.

Авторы комментируют:

‘С передачей только 2,60 МБ (5% бюджета), аватар уже достигает разумного качества. Когда передаются более высокие уровни гауссов, мелкие структуры, такие как кнопки рубашки, зубы и волосы, постепенно уточняются, в то время как поддерживается временная стабильность.

‘При 100% передаче, наш подход достигает качества рендеринга, сравнимого с современными методами. Заметно, что частота кадров не падает значительно, вероятно, потому что рабочая нагрузка 3DGS еще не насытила GPU.’

Однако авторы указывают, что в много-пользовательских сценариях виртуальной реальности, количество 3D-гауссов быстро вырастет до точки, где растеризация GPU станет узким местом. В этих более тяжелых сценариях, предложенный подход предлагает преимущество, позволяя системе обменивать количество примитивов на визуальное качество, облегчая нагрузку без коллапса рендеринга.

Хотя статья не детализирует это, сайт проекта содержит дополнительные сравнительные тесты, также представляющие MeGA Hybrid mesh-Gaussian аватар проект:

Нажмите, чтобы воспроизвести. Одна из серии дополнительных видеороликов с сайта проекта, это сравнение нового подхода в плане синтеза нового вида.

Вывод

Gaussian Splatting может или не может продлиться, или даже быть запомнено больше, чем RealPlayer сейчас, в отношении зари интерактивного стриминга: ИИ-управляемые или ИИ-помощные 3D-осведомленные представительные trải nghiệm, включая видеочат, виртуальные покупки, навигацию по маршруту и различные развлекательные приложения. Это может быть так, что альтернативные технологии или подходы победят, или что GSplat окажется наиболее надежным ИИ-видео-представлением.

Если ничего больше, эта интересная новая статья возвещает немного о масштабе этой новой области, напоминая нам, может быть, ностальгически, о полосе пропускания, ограниченной интернетом прошлого.

 

* Под ‘3D’ я не имею в виду тот вид trải nghiệm, который требует специальных очков, а скорее trải nghiệm, где мультимедийный контент имеет некоторое понимание координат X/Y/Z.

Опубликовано впервые в среду, 18 марта 2026 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai