Ángulo de Anderson

Restaurar lo que capturó su cámara antes de que el AI lo cambiara

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated image (GPT-2). A photographer examines an open DSLR as a stream of colorful fantasy creatures and glowing imagery bursts out, while he reacts with focused, subdued surprise in a studio setting.

¿Cómo puede proteger la santidad de una fotografía cruda de la interferencia del AI cuando ya ha sido procesada automáticamente por el AI dentro de la cámara? Una nueva investigación busca restaurar los datos ‘verdaderos’ del sensor – también con el AI.

 

El aumento en la autenticidad de las imágenes del AI en el último año o así ha llevado a muchos grupos y personas a movilizarse en contra de la erosión resultante de la confianza en la fotografía.

En el mismo período, la Coalición para la Proveniencia y Autenticidad de Contenido (C2PA) ha intentado difundir un estándar semi-cryptográfico que adjunta información de proveniencia basada en metadatos a una imagen, desde el momento en que es capturada por una cámara o dispositivo compatible, con la esperanza de desenmascarar cualquier uso posterior de AI generativa en estas ‘imágenes originales’:

Esquema de la proveniencia en el sistema C2PA, donde los metadatos escritos en el momento de la captura se pueden agregar como un diario, permitiendo ajustes habituales como brillo y contraste, pero registrando ajustes importantes para que una imagen alterada por el AI se muestre como tal en los medios que admiten este sistema. Fuente - https://spec.c2pa.org/specifications/specifications/1.2/specs/

Esquema de la proveniencia en el sistema C2PA, donde los metadatos escritos en el momento de la captura se pueden agregar como un diario, permitiendo ajustes habituales como brillo y contraste, pero registrando ajustes importantes, para que una imagen alterada por el AI se muestre como tal en los medios que admiten este sistema. Fuente

La adopción del estándar no ha sido tan amplia como la coalición había esperado, y actualmente solo 14 cámaras admiten la impresión de la información de autenticidad en la cámara.

Lo interesante sobre la idea de la C2PA de dar a una foto un ‘pasaporte’ en el momento de su creación es que, para entonces, ya puede ser demasiado tarde – porque los fabricantes de cámaras ahora rutinariamente incorporan el procesamiento del AI en la creación misma de la imagen:

Del artículo de 2024 'Advocating Pixel-Level Authentication of Camera-Captured Images': una ilustración de cómo las tuberías modernas de cámara introducen contenido alucinado en el momento de la captura y cómo la autenticación de metadatos a nivel de píxel lo expone. En (A), una imagen de sensor de teléfono inteligente se procesa por el ISP, donde los módulos del AI pueden inventar detalles durante el zoom digital o la corrección de exposición, produciendo imágenes realistas con errores como dígitos de matrícula mal leídos. En (B), una máscara de autenticación se incorpora como metadatos y se superpone más tarde para revelar regiones no auténticas, lo que permite a los usuarios distinguir los datos originales de los píxeles alterados por el AI. Fuente – https://ieeexplore.ieee.org/ielx7/6287639/10380310/10478521.pdf?tp=&arnumber=10478521&isnumber=10380310&ref=aHR0cHM6Ly9zY2hvbGFyLmdvb2dsZS5jb20ucHkv

Del artículo de 2024 ‘Advocating Pixel-Level Authentication of Camera-Captured Images’: una ilustración de cómo las tuberías modernas de cámara introducen contenido alucinado en el momento de la captura y cómo la autenticación de metadatos a nivel de píxel lo expone. En (A), una imagen de sensor de teléfono inteligente se procesa por el ISP, donde los módulos del AI pueden inventar detalles durante el zoom digital o la corrección de exposición, produciendo imágenes realistas con errores como dígitos de matrícula mal leídos. En (B), una máscara de autenticación se incorpora como metadatos y se superpone más tarde para revelar regiones no auténticas, lo que permite a los usuarios distinguir los datos originales de los píxeles alterados por el AI. Fuente

De hecho, esta interferencia del AI en la captura de datos crudos de los sensores de la cámara podría eventualmente convertirse en el proceso gobernante.

Este tipo de post-procesamiento no es lo mismo que la tendencia actual de alterar fotos en la cámara, en la que una aplicación de teléfono o una aplicación de cámara permite al usuario reconsiderar una foto en su tiempo libre antes de que se descargue del dispositivo.

Más bien, el procesamiento ocurre en una rutina ‘caja negra’ en el procesador de señal de imagen (ISP) de la cámara, generalmente en un tiempo de ejecución propietario que no expone ni hace disponible los datos del sensor crudos (y considere que el formato de cámara RAW supuestamente ‘puro’ no es tan ‘crudo’).

Por lo tanto, para cuando puedes ver la foto en absoluto, puede haber sido objeto de mejoras asistidas por el AI como mejora de baja luz, escalado o incluso reemplazo de luna.

En muchos casos, esto puede llevar a reconstrucciones inexactas, por ejemplo, de texto, que podrían invalidar el uso de dicha imagen como evidencia, ya que una imagen ‘cruda’ real no estaría disponible:

Del nuevo artículo - una imagen de sensor RAW se procesa por un ISP habilitado para GenAI para producir una salida final sRGB que parece más clara pero puede contener detalles alucinados, como se muestra en el ejemplo de la matrícula donde los caracteres son inferidos incorrectamente durante el zoom digital. La escena real, que no es accesible en la práctica, difiere de ambos la salida mejorada por el AI y la imagen auténtica intermedia antes de la alucinación. El enfoque propuesto permite recuperar esta imagen pre-alucinación, restaurando lo que la óptica de la cámara capturó originalmente antes de que las mejoras basadas en el AI modificaran el contenido. Fuente - https://arxiv.org/pdf/2604.21879

Del nuevo artículo – una imagen de sensor RAW se procesa por un ISP habilitado para GenAI para producir una salida final sRGB que parece más clara pero puede contener detalles alucinados, como se muestra en el ejemplo de la matrícula donde los caracteres son inferidos incorrectamente durante el zoom digital. La escena real, que no es accesible en la práctica, difiere de ambos la salida mejorada por el AI y la imagen auténtica intermedia antes de la alucinación. El enfoque propuesto permite recuperar esta imagen pre-alucinación, restaurando lo que la óptica de la cámara capturó originalmente antes de que las mejoras basadas en el AI modificaran el contenido. Fuente

Los ejemplos anteriores provienen de un nuevo artículo de investigación que ofrece una solución a las ‘fotos nativas del AI’, utilizando procesos del AI alternativos para reconstruir la imagen cruda y no adulterada estimada a partir de la imagen procesada.

Los autores afirman:

‘Cuando los modelos del AI entrenados con pérdidas generativas o perceptuales se utilizan en los ISP, están propensos a alucinar contenido, potencialmente alterando el significado de la imagen. La implicación es que las imágenes directamente salidas de la cámara pueden contener ahora contenido ‘falso’, especialmente en cámaras de teléfonos inteligentes donde los módulos del AI-ISP están viendo una adopción creciente.

‘El uso del GenAI en el hardware de la cámara marca un cambio de paradigma en cómo vemos las imágenes de la cámara y desafía la visión forense tradicional de las imágenes capturadas por la cámara como inherentemente confiables.’

El nuevo trabajo utiliza un codificador muy ligero y MLP decodificador, que se puede incluir dentro de la imagen con una penalización de peso de solo 180kb. El objetivo es el desarrollo de sistemas de codificación lo suficientemente rápidos como para reextraer la imagen original en tiempo real.

Del nuevo artículo: la super-resolución basada en GenAI dentro del ISP de la cámara puede alterar sutilesmente las características faciales, cambiando la apariencia o la identidad percibida a través de cambios en la mirada y la forma de la boca. La mejora de baja luz puede modificar de manera similar el contenido de la imagen, afectando la interpretación a pesar de mejorar la calidad visual. En el ejemplo del código QR, la mejora hace que la imagen sea más atractiva pero hace que el código sea ilegible. El método permite recuperar la imagen auténtica antes de estas alucinaciones, restaurando los detalles faciales originales y un código QR legible.

Del nuevo artículo: la super-resolución basada en GenAI dentro del ISP de la cámara puede alterar sutilesmente las características faciales, cambiando la apariencia o la identidad percibida a través de cambios en la mirada y la forma de la boca. La mejora de baja luz puede modificar de manera similar el contenido de la imagen, afectando la interpretación a pesar de mejorar la calidad visual. En el ejemplo del código QR, la mejora hace que la imagen sea más atractiva pero hace que el código sea ilegible. El método permite recuperar la imagen auténtica antes de estas alucinaciones, restaurando los detalles faciales originales y un código QR legible.

Alternativamente, los fabricantes de cámaras podrían dar a los usuarios acceso a los volcados de sensores no manipulados; sin embargo, esto parece probable que se restrinja a equipos de alta gama. En el espacio de consumo móvil y popular, lamentablemente, el acceso a fotos no procesadas puede considerarse una búsqueda ‘de nicho’ o marginal.

Mientras que las cámaras de consumo siempre han aplicado algún nivel de post-procesamiento, antes del advenimiento del AI de borde, los algoritmos utilizados eran mínimamente ‘interpretativos’ y no probablemente alterarían el contenido de una foto de la misma manera significativa que los métodos del AI actuales pueden.

Interesantemente, considerando la medida en que la política de ‘reemplazo de luna’ de Samsung fue sometida a críticas públicas hace algunos años, el Centro de Inteligencia Artificial de Samsung en Toronto es uno de los participantes en el nuevo trabajo, que se titula Abordar la autenticidad de la imagen cuando las cámaras utilizan el AI generativo, y está liderado por contribuciones de cinco investigadores de la Universidad de Toronto.

Método

Los autores utilizan el único otro proyecto que parece haber abordado directamente el problema de la perturbación por diseño: el artículo de 2024 Advocating Pixel-Level Authentication of Camera-Captured Images, que propuso una ‘máscara de autenticidad binaria’ que delimita las áreas cambiadas por los procesos del AI en la cámara:

A la derecha, la 'máscara de autenticidad' del artículo de 2024 revela las áreas del cielo afectadas por los procesos de 'suavizado' del AI en una cámara.

A la derecha, la ‘máscara de autenticidad’ del artículo de 2024 revela las áreas del cielo afectadas por los procesos de ‘suavizado’ del AI en una cámara.

Sin embargo, el sistema no ofreció un método para recuperar una ‘imagen verdadera’, lo que el nuevo trabajo aborda, mientras reconoce una deuda con la salida anterior.

El objetivo del nuevo trabajo es permitir a los usuarios recuperar una imagen lo más cercana posible a lo que realmente golpeó el sensor antes de que se realizara el procesamiento:

Visión general del método propuesto. En (A), en el momento de la captura, la imagen de salida del ISP que contiene alucinaciones se pasa a través de un codificador preentrenado congelado, y sus características latentes se combinan con coordenadas espaciales y se alimentan a un MLP que opera por píxel para predecir la imagen no alucinada, con entrenamiento guiado por una pérdida contra la imagen auténtica. Los pesos del codificador y del MLP se guardan como metadatos junto con la imagen. En (B), en la inferencia, estos pesos se recuperan de los metadatos y se utilizan con el codificador y el MLP para reconstruir la imagen no alucinada.

Visión general del método propuesto. En (A), en el momento de la captura, la imagen de salida del ISP que contiene alucinaciones se pasa a través de un codificador preentrenado congelado, y sus características latentes se combinan con coordenadas espaciales y se alimentan a un MLP que opera por píxel para predecir la imagen no alucinada, con entrenamiento guiado por una pérdida contra la imagen auténtica. Los pesos del codificador y del MLP se guardan como metadatos junto con la imagen. En (B), en la inferencia, estos pesos se recuperan de los metadatos y se utilizan con el codificador y el MLP para reconstruir la imagen no alucinada.

En el momento de la captura, en el nuevo método, la imagen procesada se pasa a través de un codificador congelado que la convierte en una representación latente compacta. Posteriormente, las coordenadas espaciales relevantes se combinan con estas características y se alimentan a un MLP ligero que opera por píxel, para predecir el contenido de la imagen original – aprendiendo, efectivamente, a restar los elementos alucinados a través de una pérdida de reconstrucción, contra objetivos auténticos.

El codificador y el decodificador se preentrenan en imágenes auténticas y alucinadas emparejadas, luego se ajustan rápidamente para cada imagen capturada, con sus pesos almacenados como metadatos junto con la foto en sí, agregando solo una pequeña sobrecarga de tamaño.

En el momento de visualización, estos pesos almacenados se extraen y se reutilizan para ejecutar el mismo codificador y MLP, lo que permite recuperar una imagen que se aproxima mucho a lo que el sensor de la cámara capturó originalmente, sin introducir nuevo contenido sintético.

Datos y pruebas

Los autores probaron el nuevo método utilizando dos de las tareas de post-procesamiento del ISP más comúnmente implementadas: super-resolución (SR, incluyendo para áreas de zoom); y fotografía de baja luz.

Para la sección de SR de ‘imágenes naturales’ de las pruebas, se incluyeron muchos ejemplos de texto, ya que las rutinas de SR del ISP son conocidas por alterar el texto (por ejemplo, el número de matrícula de un coche, pero véase los ejemplos anteriores en el artículo). Dado que la distorsión del texto es un problema discreto en sí mismo, se trató como un subconjunto de las pruebas de SR, con datos dedicados.

El codificador mencionado anteriormente se entrenó para cada una de las dos modalidades probadas, y cada uno se seleccionó en función de qué módulo del AI del ISP probablemente se activaría durante la captura (es decir, un módulo de ‘baja luz’, en condiciones oscuras).

Los autores utilizaron el conjunto de datos DIV2K para el entrenamiento de super-resolución, impulsado por la red RealESRGAN popular. En línea con el trabajo de 2024 sobre la interferencia del ISP, los investigadores generaron datos emparejados que presentaban contenido no afectado y afectado por alucinaciones.

Para la sección de SR de texto, los autores utilizaron el modelo de SR de texto MARCONet de 2023:

Del artículo de MARCONet de 2023, ejemplos de textos de baja resolución y textos equivalentes escalados. Fuente - https://arxiv.org/pdf/2303.14726

Del artículo de MARCONet de 2023, ejemplos de textos de baja resolución y textos equivalentes escalados. Fuente

Para crear datos emparejados en este caso, los investigadores ejecutaron imágenes no alucinadas a través de MARCONet. Se generaron 2000 imágenes a partir del código original del proyecto, con 200 apartados para validación, junto con otros 200 para pruebas.

Para las pruebas de baja luz, se adoptó el conjunto de datos LOw-Light (LOL) del artículo chino de 2018:

Del conjunto de datos LOL chino de 2018, ejemplos entre paréntesis de las mismas imágenes a diferentes exposiciones y niveles de oscuridad y degradación. Fuente - https://arxiv.org/pdf/1808.04560

Del conjunto de datos LOL chino de 2018, ejemplos entre paréntesis de las mismas imágenes a diferentes exposiciones y niveles de oscuridad y degradación. Fuente

Marcos rivales

Para evaluar el método, se realizaron comparaciones con tres líneas base específicas entrenadas en condiciones emparejadas. En primer lugar, SIREN y NeRF se preentrenaron en imágenes auténticas y alucinadas emparejadas y luego se ajustaron en el momento de la captura durante el mismo período que el enfoque propuesto, ofreciendo una comparación directa con NeRF.

En segundo lugar, un MLP con una codificación aprendida basada en el método hashgrid de Instant-NGP se utilizó, con las entradas de la tabla hash y el MLP optimizadas conjuntamente.

El tamaño de la incrustación y la capacidad de la red se emparejaron con el codificador y el MLP objetivo, con experimentos que cubrían tanto la optimización por imagen desde cero como el preentrenamiento seguido de ajuste fino.

En tercer lugar, se implementó una línea base de traducción de imagen a imagen ciega utilizando un modelo NAFNet de 64MB, entrenado como un sistema de regresión píxel a píxel sin acceso a metadatos.

En el entrenamiento, se utilizó el optimizador Adam sobre PyTorch, tanto para el preentrenamiento como para el ajuste fino. El codificador y el MLP se entrenaron durante 50,000 épocas con un tamaño de lote de 32, con codificadores modales específicos entrenados para cada tarea (es decir, SR, SR de texto, baja luz).

El ajuste fino tuvo lugar durante unos tres segundos en una GPU NVIDIA V100 con 32GB de VRAM. Los autores señalan que, si bien la optimización en el dispositivo es el entorno y escenario objetivo, no fue realista implementar esto para todos los marcos, y por lo tanto todas las pruebas se realizaron en un entorno de escritorio:

Comparación de rendimiento contra líneas base de MLP asistidas por metadatos, incluyendo SIREN, NeRF y el método hash-grid, junto con la recuperación ciega utilizando NAFNet. Los resultados se informan como PSNR en decibelios en tres tareas: super-resolución de imagen natural en DIV2K; super-resolución de texto en MARCONet; y mejora de baja luz en LOL, con el método propuesto logrando las puntuaciones más altas en cada caso.

Comparación de rendimiento contra líneas base de MLP asistidas por metadatos, incluyendo SIREN, NeRF y el método hash-grid, junto con la recuperación ciega utilizando NAFNet. Los resultados se informan como PSNR en decibelios en tres tareas: super-resolución de imagen natural en DIV2K; super-resolución de texto en MARCONet; y mejora de baja luz en LOL, con el método de los autores logrando las puntuaciones más altas en cada caso.

Para los enfoques basados en MLP, el rendimiento dependió en gran medida de la representación de entrada, donde los modelos entrenados utilizando solo coordenadas espaciales lucharon durante el preentrenamiento y no mejoraron durante la etapa de ajuste fino limitada. Agregar información de color condujo a resultados más sólidos.

La recuperación ciega utilizando NAFNet funcionó bien en DIV2K, donde el mapeo de imágenes degradadas a limpias era relativamente estable, pero se derrumbó en MARCONet y LOL, donde existían varias reconstrucciones plausibles y el modelo carecía de la información necesaria para resolver esta ambigüedad.

Este efecto se pronunció más en la mejora de baja luz, donde la luminosidad original de la escena no se podía inferir de manera confiable a partir de la imagen procesada sola.

Los autores afirman:

‘[En] los datos sintéticos de MARCONet, las imágenes con diferentes fuerzas de desenfoque se asignan a la misma imagen alucinada. Se puede ver en los resultados que nuestro enfoque propuesto supera a los competidores en todos los conjuntos de datos.’

En la comparación anterior, podemos ver cómo diferentes métodos funcionan dependiendo del tiempo que se les da para ejecutar en el momento en que se toma una foto. Entrenar un modelo desde cero para cada imagen puede producir resultados sólidos, como se ve con SIREN, NeRF y hash-grid – pero esto lleva demasiado tiempo para ser práctico dentro de una cámara.

En cambio, el método de los autores realiza la mayor parte del trabajo con anticipación, con un ajuste rápido en el momento de la captura, lo que le permite entregar mejores resultados dentro de límites de tiempo ajustados (3, 5 o diez segundos).

Comparación de rendimiento contra líneas base de MLP asistidas por metadatos, incluyendo SIREN, NeRF y el método hash-grid, junto con la recuperación ciega utilizando NAFNet. Los resultados se informan como PSNR en decibelios en tres tareas: super-resolución de imagen natural en DIV2K; super-resolución de texto en MARCONet; y mejora de baja luz en LOL, con el método propuesto logrando las puntuaciones más altas en cada caso.

Comparación de rendimiento contra líneas base de MLP asistidas por metadatos, incluyendo SIREN, NeRF y el método hash-grid, junto con la recuperación ciega utilizando NAFNet. Los resultados se informan como PSNR en decibelios en tres tareas: super-resolución de imagen natural en DIV2K; super-resolución de texto en MARCONet; y mejora de baja luz en LOL, con el método de los autores logrando las puntuaciones más altas en cada caso. Consulte el artículo de fuente para (ligeramente) mejor resolución.

Arriba se muestran resultados cualitativos en DIV2K, donde los métodos de mejora introdujeron alucinaciones visibles. Un modelo de super-resolución basado en GAN alteró el color de los ojos, y la recuperación ciega luchó por reconstruir la imagen original. NeRF y hash-grid produjeron artefactos en regiones estructuradas como ventanas y texto, mientras que el método propuesto se ajustó más estrechamente a la imagen auténtica.

Finalmente, en la figura anterior, vemos resultados en el conjunto de datos LOL, con la luminosidad escalada para visualización.

La recuperación ciega no pudo resolver la escala de luminosidad desconocida, mientras que el método propuesto reconstruyó mejor las texturas y restauró los caracteres alterados, como corregir un ‘1’ de regreso a ‘i’, sin agregar artefactos.

Conclusión

Probablemente no sea discutible, ni nunca lo fue, que ‘la cámara nunca miente’. Cada decisión sobre qué fotografiar y cuándo fotografiarlo, junto con cómo presentarlo y contextualizarlo, es en efecto una decisión política o social.

Incluso los métodos más antiguos de post-procesamiento, como dodge y burn (llevados desde hace mucho tiempo a las herramientas de Photoshop) son actos altamente subjetivos de decisión y preferencia artística.

Sin embargo, eso no es razón para renunciar al objetivo de capturas de imágenes ‘objetivas’; y sí parece razonable que el consumidor promedio deba ser permitido, incluso con alguna dificultad, a acceder a los ‘volcados de sensores crudos’ no manipulados de las fotos que toman, si así lo desean; o al menos, que se les permita restringir el post-procesamiento del ISP a algoritmos no basados en el AI, como podrían preferir.

 

Publicado por primera vez el viernes 24 de abril de 2026

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]