Ángulo de Anderson
NeRFocus: Llevando el Control de Enfoque Ligero a los Campos de Radiancia Neural

Nueva investigación de China ofrece un método para lograr un control asequible sobre los efectos de profundidad de campo para Campos de Radiancia Neural (NeRF), lo que permite al usuario final cambiar el enfoque y cambiar dinámicamente la configuración de la lente virtual en el espacio de renderizado.
Titulado NeRFocus, la técnica implementa un enfoque novedoso de “imágenes de lente delgada” para la travesía del enfoque, e innova P-training, una estrategia de entrenamiento probabilística que elimina la necesidad de conjuntos de datos dedicados de profundidad de campo, y simplifica un flujo de trabajo de entrenamiento habilitado para el enfoque.

El artículo se titula NeRFocus: Campo de Radiancia Neural para Desenfoque Sintético 3D, y proviene de cuatro investigadores de la Escuela de Graduados de Shenzhen en la Universidad de Pekín, y el Laboratorio Peng Cheng en Shenzhen, un instituto financiado por el gobierno provincial de Guangdong.
Abordando el Locus de Atención Foveado en NeRF
Si NeRF ha de ocupar su lugar como una tecnología de conducción válida para la realidad virtual y aumentada, necesitará un método ligero para permitir un renderizado foveado realista, donde la mayoría de los recursos de renderizado se acumulen alrededor de la mirada del usuario, en lugar de distribuirse indiscriminadamente a baja resolución en todo el espacio visual disponible.

Del artículo de 2021 Campos de Radiancia Neural Foveados para Realidad Virtual en Tiempo Real y Egocéntrica, vemos el locus de atención en un esquema de renderizado foveado novedoso para NeRF. Fuente: https://arxiv.org/pdf/2103.16365.pdf
Una parte esencial de la autenticidad de las futuras implementaciones de NeRF egocéntrico será la capacidad del sistema para reflejar la capacidad del ojo humano para cambiar el enfoque a través de un plano de perspectiva que se aleja (ver la primera imagen de arriba).
Este gradiente de enfoque también es un indicador perceptual de la escala de la escena; la vista desde un helicóptero que vuela sobre una ciudad tendrá cero campos de enfoque navegables, porque toda la escena existe más allá de la capacidad de enfoque exterior del espectador, mientras que la inspección de una escena en miniatura o “cercana” no solo permitirá “cambiar el enfoque”, sino que también debería contener, por razones de realismo, una profundidad de campo estrecha por defecto.
A continuación se muestra un video que demuestra las capacidades iniciales de NeRFocus, proporcionado por el autor correspondiente del artículo:
Más allá de los Planos Focales Restringidos
Conscientes de los requisitos para el control del enfoque, varios proyectos NeRF en los últimos años han hecho provisiones para ello, aunque todos los intentos hasta la fecha son básicamente soluciones de trabajo en torno o implican rutinas de postprocesamiento notables que los hacen poco contribuyentes a los entornos en tiempo real finalmente previstos para las tecnologías de Campos de Radiancia Neural.
El control de enfoque sintético en marcos de renderizado neural se ha intentado mediante varios métodos en los últimos 5-6 años, por ejemplo, utilizando una red de segmentación para cercar los datos del primer plano y el fondo, y luego desenfocar genéricamente el fondo, una solución común para efectos de enfoque de dos planos simples.

Del artículo ‘Segmentación automática de retratos para estilización de imágenes’, una separación de planos de enfoque mundana y de estilo de animación. Fuente: https://jiaya.me/papers/portrait_eg16.pdf
Las representaciones multiplanas agregan algunos “cels de animación” virtuales a este paradigma, por ejemplo, utilizando la estimación de profundidad para cortar la escena en un gradiente de planos de enfoque distintos, y luego orquestar kernels dependientes de la profundidad para sintetizar desenfoque.
Además, y muy relevante para entornos potenciales de AR/VR, la disparidad entre las dos vistas de una configuración de cámara estéreo se puede utilizar como un proxy de profundidad, un método propuesto por Google Research en 2015.

Del artículo liderado por Google Fast Bilateral-Space Stereo for Synthetic Defocus, la diferencia entre las dos vistas proporciona un mapa de profundidad que puede facilitar el desenfoque. Sin embargo, este enfoque es inauténtico en la situación prevista anteriormente, donde la foto se toma claramente con una lente de 35-50mm (estándar SLR), pero el desenfoque extremo del fondo solo ocurriría con una lente que exceda los 200mm, que tiene el tipo de plano focal muy restringido que produce una profundidad de campo estrecha en entornos humanos normales. Fuente
Enfoques de este tipo tienden a demostrar artefactos de borde, ya que intentan representar dos esferas de enfoque distintas y limitadas por bordes como un gradiente de enfoque continuo.
En 2021, la iniciativa RawNeRF ofreció funcionalidad de Alta Gama Dinámica (HDR), con un mayor control sobre situaciones de poca luz, y una capacidad aparentemente impresionante para cambiar el enfoque:

RawNeRF cambia el enfoque de manera hermosa (aunque, en este caso, de manera inauténtica, debido a planos de enfoque poco realistas), pero conlleva un alto costo computacional. Fuente: https://bmild.github.io/rawnerf/
Sin embargo, RawNeRF requiere una precomputación onerosa para sus representaciones multiplanas del NeRF entrenado, lo que resulta en un flujo de trabajo que no se puede adaptar fácilmente a implementaciones más ligeras o de menor latencia de NeRF.
Modelando una Lente Virtual
NeRF en sí se basa en el modelo de imagen de agujero de alfiler, que renderiza toda la escena de manera nítida de una manera similar a una escena de CGI predeterminada (antes de los varios enfoques que renderizan el desenfoque como un efecto postprocesamiento o innato basado en la profundidad de campo).
NeRFocus crea una lente virtual “delgada” (en lugar de una abertura “sin cristal”) que calcula la trayectoria del haz de cada píxel entrante y lo renderiza directamente, invirtiendo efectivamente el proceso estándar de captura de imágenes, que opera post facto en la luz de entrada que ya ha sido afectada por las propiedades refractivas del diseño de la lente.

Este modelo introduce una serie de posibilidades para el renderizado de contenido dentro del frustum (el círculo más grande de influencia representado en la imagen de arriba).
Calcular el color y la densidad correctos para cada perceptrón multicapa (MLP) en este rango más amplio de posibilidades es una tarea adicional. Esto ha sido resuelto antes aplicando un entrenamiento supervisado a un gran número de imágenes DLSR, lo que implica la creación de conjuntos de datos adicionales para un flujo de trabajo de entrenamiento probabilístico, efectivamente involucrando la laboriosa preparación y almacenamiento de recursos computados múltiples que pueden o no ser necesarios.
NeRFocus supera esto mediante P-training, donde los conjuntos de datos de entrenamiento se generan en función de operaciones de desenfoque básicas. Así, el modelo se forma con operaciones de desenfoque innatas y navegables.

El diámetro de la abertura se establece en cero durante el entrenamiento, y se utilizan probabilidades predefinidas para elegir un kernel de desenfoque al azar. Este diámetro obtenido se utiliza para escalar los diámetros de cada cono compuesto, lo que permite al MLP predecir con precisión la radiancia y la densidad de los frustums (los círculos anchos en las imágenes de arriba, que representan la zona de transformación para cada píxel)
Los autores del nuevo artículo observan que NeRFocus es potencialmente compatible con el enfoque impulsado por HDR de RawNeRF, lo que podría ayudar potencialmente en el renderizado de ciertas secciones desafiantes, como los highlights desenfocados especulares, y muchos de los otros efectos computacionalmente intensivos que han desafiado a los flujos de trabajo de CGI durante treinta o más años.
El proceso no implica requisitos adicionales de tiempo y/o parámetros en comparación con los enfoques anteriores como NeRF central y Mip-NeRF (y, presumiblemente Mip-NeRF 360, aunque esto no se aborda en el artículo), y es aplicable como una extensión general a la metodología central de los campos de radiancia neural.
Publicado por primera vez el 12 de marzo de 2022.












