Ángulo de Anderson
Transmisión de Avatares de Inteligencia Artificial como en 1999

Nueva investigación presenta una forma de transmitir avatares 3D realistas que aparecen casi al instante y se afinan en tiempo real, en lugar de obligar a los usuarios a esperar a que se completen las descargas masivas.
En muchos sentidos, las enormes demandas de recursos de la inteligencia artificial generativa y los sistemas de renderizado asistidos por IA han retrocedido la capacidad de los consumidores veinte o más años. Solo en 2023, una asignación de 64 GB de RAM en una laptop o PC de escritorio parecía excesiva; ahora, con el creciente popularity de la descarga de RAM y/o CPU, 64 GB es bastante modesto para las necesidades locales de IA; y estos elementos una vez banales y asequibles de los PC continúan aumentando de precio a medida que las corporaciones luchan por satisfacer la demanda de servicios de IA.
La escala y la codicia de la IA y sus procesos y entornos suelen superar con creces el hardware de nivel de consumidor, y incluso ejecutar modelos “adelgazados” orientados localmente como versiones GGUF suele sobrecargar el sistema promedio.
Incluso los servicios de IA basados en texto, como ChatGPT, están sometidos a una gran presión tanto a nivel de cliente como de servidor. Por lo tanto, una vez que la IA se encarga de entregar experiencias multimedia en línea en tiempo real, podemos razonablemente esperar algunos compromisos muy serios en la latencia y/o la calidad – similares a las luchas tempranas de Internet con la transmisión de medios y los odiados íconos de “buffering” animados de RealPlayer y QuickTime.
La última vez que los problemas de multimedia y redes crearon fricción en la experiencia del usuario, el hardware de nivel de consumidor aún estaba evolucionando a través de la Ley de Moore, mejorando casi exponencialmente cada año, incluso mientras los sistemas operativos, las redes y otra infraestructura de soporte evolucionaban para satisfacer la demanda; y durante los últimos diez años, más o menos, las capacidades de la tecnología de consumo han superado las demandas de multimedia (quizás incluso hasta el punto en que se necesitaba reiniciar el ciclo de reemplazo para mantener las ventas).
Pero esa superabundancia de capacidad local puede estar llegando a su fin pronto, ya que el hardware local se vuelve menos potente y más caro, y los servicios basados en IA exigen más recursos tanto a nivel de servidor como local.
Obteniendo una Ventaja
En la era previa a la banda ancha, incluso antes de los primeros videos de transmisión utilizables, los usuarios web estaban acostumbrados a ver imágenes que se iban enfocando lentamente, ya que las JPEG progresivas permitían al usuario con poca banda ancha ver la imagen que se descargaba, a veces de manera dolorosamente lenta, a medida que se cargaba más datos localmente.
Ahora, parece que podríamos estar a punto de experimentar algo similar con los avatares de Gaussian Splat asistidos por IA:
Haga clic para reproducir. Del nuevo proyecto ProgressiveAvatars, una comparación de avatares Gaussian transmitidos. Fuente
Arriba vemos dos versiones de un avatar Gaussian Splat – una representación humana habilitada parcialmente por una técnica de renderizado no IA que se remonta a la década de 1990, y también por métodos más modernos, como el modelo paramétrico de rostro FLAME y enfoques de entrenamiento basados en IA:

Gaussian Splatting utiliza una representación gaussiana de color y información 3D en lugar de un píxel o voxel, y asigna esta textura ultrarrealista a una malla CGI más tradicional, que a su vez se facilita mediante un ‘humano paramétrico’, una cara y/o cuerpo CGI, en sistemas como FLAME y STAR. Fuente
En la versión de la izquierda del video anterior, podemos ver que una implementación tradicional de un avatar Gaussian Splat parece bastante horrible mientras esperamos a que se carguen los datos. En la derecha, una nueva implementación de China, llamada ProgressiveAvatars, puede resolver de manera mucho más elegante a medida que se cargan los datos, presentando una imagen humana no alarmante desde el principio.
Los autores afirman que su método es el primero en transmitir realmente un avatar Gaussian, y ciertamente el primero en hacerlo de manera progresiva, donde la imagen se construye elegantemente, y las áreas más importantes – como los ojos y los labios – pueden ser priorizadas, para que el avatar pueda ser conversacional incluso cuando solo está parcialmente cargado:
Haga clic para reproducir. Del sitio web del proyecto ProgressiveAvatars, una ilustración de la carga atenta.
Anteriormente, se ha utilizado un enfoque de “nivel de detalle” (LOD) en intentos anteriores de reducir los avatares “GSplat”, similar a las optimizaciones de los videojuegos, donde se cargan versiones cada vez más detalladas de una persona según si ocupa suficiente parte de la ventana del viewport o la atención del espectador para que valga la pena el esfuerzo.
De hecho, esto implica una cantidad severa de avatares “de repuesto” redundantes, y los autores enmarcan su enfoque como un sistema más racional. Al implicar, un método de este tipo también permite realizar cambios en una figura GSplat (es decir, personalización) sin necesidad de propagar dichos cambios a través de una cadena de “duplicados” LOD.
Un Dominio Emergente
Si esto parece un problema de nicho, bien, así era la transmisión de video, en los días en que obtener que los primeros complementos funcionaran se asignaba a la persona más cercana con habilidades técnicas. Además, el potencial para representaciones de transmisión basadas en IA va más allá de los avatares humanos, extendiéndose a la generación de ciudades, juegos y versiones basadas en 3D de prácticamente cualquier dominio en línea – como Virtual Try-On, para compras de ropa:
Haga clic para reproducir. De un proyecto de 2024, una mirada aproximada al futuro de la “prueba virtual” en línea. Otros proyectos buscan agregar movimiento e interactividad – facetas exigentes para transmitir y gestionar. Fuente
Tal como los enfoques basados en LOD se han utilizado principalmente en los videojuegos, muchos otros aspectos que antes eran exclusivos del desarrollo de juegos probablemente se trasladarán a las representaciones basadas en “splat”. Por ejemplo, la mayoría de estos primeros intentos de GSplat muestra a una sola persona haciendo muecas y hablando; pero muchos escenarios necesitarán múltiples personas, así como características ambientales y atmósfera – un escenario en el que los sistemas de “triage” de alto rendimiento determinarán dónde se deben priorizar los datos de transmisión, para mantener al espectador en el momento.
El nuevo documento se titula ProgressiveAvatars: Avatares Gaussian Animables 3D Progresivos, y proviene de tres investigadores de la Universidad de Ciencia y Tecnología de China en Hefei.
Método
El enfoque inicial aprovecha un video de la cabeza de una persona. Para cada cuadro, se ajusta un modelo de rostro paramétrico FLAME estándar, de modo que la forma y la expresión cambian con el tiempo, mientras que la estructura subyacente de la malla permanece fija. Debido a que la topología base no cambia, se puede volver a utilizar y refinar un modelo de plantilla FLAME estable en lugar de reconstruirlo desde cero en cada momento, como sucede en trabajos anteriores similares:

El video de la cabeza se ajusta primero con una malla FLAME rastreada, después de lo cual se adjuntan gaussianos 3D a cada cara y se crecen jerárquicamente donde los gradientes del espacio de pantalla indican detalles faltantes. Durante el entrenamiento, esta subdivisión adaptativa construye una representación de varios niveles bajo supervisión multi-ángulo, y en la inferencia, las puntuaciones de importancia por cara determinan qué gaussianos se transmiten primero, lo que permite que el avatar aparezca rápidamente y se afine progresivamente a medida que se agregan niveles de detalle más altos.
Sobre esta estructura base, se agregan detalles en capas; la superficie se subdivide implícitamente en una jerarquía, y se adjuntan pequeños gaussianos 3D a las caras en cada nivel de detalle.
Aunque las capas iniciales más gruesas capturan la forma general de la cabeza y el movimiento, las capas más finas posteriores proporcionan arrugas, deformaciones sutiles y textura de alta frecuencia. Las imágenes se renderizan a partir de estos gaussianos utilizando un rasterizador gaussiano diferenciable y se entrenan contra imágenes de referencia de vista múltiple, para que el avatar aprenda a reproducir la apariencia de la persona real.
Durante el entrenamiento, esta jerarquía crece automáticamente: las regiones que necesitan más detalles se subdividen aún más, guiadas por señales de espacio de pantalla, para que el esfuerzo computacional se concentre donde es más probable que el ojo del espectador note los errores.
Durante la inferencia, esta misma jerarquía permite la transmisión progresiva, donde una versión burda del avatar se puede mostrar primero, y, a medida que se cargan capas adicionales, se pueden agregar nuevos gaussianos sin alterar lo que ya se muestra, lo que permite un avatar de cabeza animable que aparece rápidamente y se vuelve más detallado a medida que llegan más datos:

Cuando todos los gaussianos de un nivel determinado están disponibles, el modelo completo se renderiza con fidelidad máxima; pero durante la transmisión, enviar los gaussianos de mayor contribución primero permite que los resultados parciales iniciales coincidan estrechamente con la imagen final, mientras que transmitir los gaussianos de baja contribución primero distorsiona el equilibrio de color y enfatiza los componentes menores.
Datos y Pruebas
Para las pruebas, el nuevo método se evaluó en el conjunto de datos NeRSemble, que consta de videos multi-ángulo para cada sujeto cubierto, con parámetros calibrados en todas las vistas:

Ejemplos de interpretaciones diversas de sujetos incluidos en el conjunto de datos NeRSemble utilizado en las pruebas para ProgressiveAvatars. Fuente
En línea con la metodología original de GaussianAvatars, las imágenes se redujeron a 802×550 píxeles, se generó una máscara de primer plano y se adoptó la división de entrenamiento/prueba original del proyecto.
Se utilizó el optimizador Adam para las actualizaciones de parámetros, con una tasa de aprendizaje de 1×10-2 en todas las coordenadas baricéntricas. El entrenamiento se ejecutó durante 60,000 iteraciones, con la jerarquía que se expandía automáticamente cada 2,000 iteraciones.
Inicialmente, los autores probaron la reconstrucción y animación – la tarea de convertir video plano en un sistema 3D consciente (x/y/z), utilizando la representación CGI canónica de FLAME como la malla de anclaje. Para esto, todas las líneas base se entrenaron desde cero, y los marcos de trabajo rivales probados fueron los mencionados GaussianAvatars y PointAvatar.
Para estas pruebas, se utilizaron las métricas Peak Signal-to-Noise Ratio (PSNR), Índice de Similitud Estructural (SSIM) y Similitud de Imagen Percibida Aprendida (LPIPS):

Comparación cualitativa en la síntesis de vista y expresión novedosas. La línea base GaussianAvatars lucha con los detalles finos alrededor de los ojos, las arrugas y la textura de la piel, mientras que el método propuesto ya preserva la estructura facial clave alrededor del cinco por ciento de los datos transmitidos y converge hacia la verdad de referencia a medida que se transmiten más gaussianos, coincidiendo estrechamente con el modelo completo y las imágenes de referencia (verdad de referencia).
En cuanto a estos resultados, los autores afirman:
‘[Nuestro] método reconstruye detalles más nítidos en varias regiones, particularmente alrededor del cuello, los hombros y la ropa. Estas áreas están relativamente teseladas de manera burda en la plantilla FLAME en comparación con las zonas faciales de alta saliencia (por ejemplo, la región periocular).
‘En consecuencia, los métodos anteriores a menudo asignan demasiados gaussianos 3D a estas regiones para capturar fielmente su detalle de escala fina. En contraste, nuestra estrategia de crecimiento adaptativo aumenta el número de gaussianos y refina la jerarquía solo donde es necesario, lo que hace que la asignación sea insensible a la teselación no uniforme de FLAME.’
Los autores también señalan que su enfoque es comparable a los métodos de estado del arte, lo que produce un avatar viable con una asignación de ancho de banda trivial del 5%:

Comparación cuantitativa en la síntesis de vista y expresión novedosas utilizando PSNR, SSIM y LPIPS. En la transmisión completa, el método propuesto logra el PSNR más alto en ambas tareas y remains competitivo con GaussianAvatars en métricas perceptuales, mientras que la configuración del 5% ilustra el compromiso de calidad bajo restricciones de ancho de banda extremas.
A continuación, los investigadores probaron la renderización progresiva en sí. Esto se llevó a cabo en una NVIDIA RTX 4090, con 24 GB de VRAM, a una resolución de 550×802 píxeles. En este escenario, los autores señalan que un presupuesto del 25% utilizaría todos los gaussianos de “nivel 1”, así como un subconjunto de gaussianos de nivel 2, lo que da una idea aproximada de la forma en que los grupos gaussianos acumulan detalles en los grupos de números más altos, y de que los grupos de números más bajos esencialmente construyen la base de la imagen:

Rendimiento bajo diferentes presupuestos de transmisión para la síntesis de vista y expresión novedosas, mostrando que la calidad se acerca o supera a GaussianAvatars a medida que se transmiten más gaussianos y datos, mientras que se mantienen las velocidades en tiempo real en una RTX 4090.
Los autores comentan:
‘Con solo 2,60 MB transmitidos (5% de presupuesto), el avatar ya alcanza una calidad razonable. A medida que se transmiten gaussianos de nivel superior, las estructuras finas como los botones de la camisa, los dientes y el cabello se afinan gradualmente, mientras se mantiene la estabilidad temporal.
‘En la transmisión al 100%, nuestro enfoque logra una calidad de renderizado comparable a los métodos de estado del arte. Notablemente, las tasas de cuadros no disminuyen significativamente, probablemente porque la carga de trabajo de 3DGS aún no ha saturado la GPU.’
Sin embargo, los autores señalan que en escenarios de realidad virtual multiusuario, la cantidad de gaussianos 3D crecería rápidamente hasta el punto en que la rasterización de la GPU se convertiría en un cuello de botella. En esos escenarios más pesados, el enfoque propuesto ofrece una ventaja al permitir que el sistema intercambie la cantidad de primitivas por calidad visual, lo que reduce la carga sin colapsar el render.
Si bien el documento no lo detalla, el sitio web del proyecto presenta comparaciones de pruebas adicionales, que también presentan el proyecto de avatar híbrido de malla-Gaussian MeGA:
Haga clic para reproducir. Una de una serie de videos suplementarios del sitio web del proyecto, esta compara el nuevo enfoque en términos de síntesis de vista novedosa.
Conclusión
Gaussian Splatting puede o no perdurar, o incluso ser recordado mucho más que RealPlayer ahora lo es, en cuanto al amanecer de las experiencias interactivas de transmisión: experiencias representativas de 3D conscientes impulsadas por IA o asistidas por IA, incluyendo videoconferencia, compras virtuales, navegación de rutas y diversas aplicaciones de entretenimiento. Puede que las tecnologías o enfoques alternativos ganen terreno, o que GSplat demuestre ser la representación de video de IA más confiable.
Si nada más, este interesante nuevo documento anuncia un poco el alcance de este nuevo dominio, mientras nos recuerda, quizás con nostalgia, la Internet con escasez de ancho de banda de antaño.
* Al decir ‘3D’, no me refiero al tipo de experiencia que requiere gafas especiales, sino más bien experiencias donde el contenido multimedia tiene algún tipo de comprensión de las coordenadas X/Y/Z.
Publicado por primera vez el miércoles 18 de marzo de 2026










