Modelos y plataformas de IA

¿Qué son los modelos de difusión? Cómo funciona la generación de imágenes con IA

mm
Añade Unite.AI a tus fuentes preferidas en Google

Un modelo de difusión es un modelo generativo que aprende a invertir un proceso gradual de ruido. Durante el entrenamiento, los ejemplos se corrompen a diferentes niveles de ruido y una red neuronal aprende la información necesaria para mover una muestra ruidosa hacia la distribución de datos.

En el momento de la generación, el sistema parte del ruido y aplica una secuencia de actualizaciones de desruido. El condicionamiento de texto, la guía, las representaciones latentes y el muestreador determinan cómo el modelo conecta un prompt con una imagen, clip de audio, video u otro tipo de salida.

Conclusiones clave

  • El entrenamiento aprende una función de desruido o de puntuación a través de muchos niveles de ruido.
  • El muestreo es iterativo, por lo que la calidad, velocidad y reproducibilidad dependen del solucionador y del programa.
  • La difusión latente reduce el costo al desruidar una representación comprimida en lugar de los píxeles.
  • Los medios generados heredan datos, consentimiento, procedencia, sesgos y riesgos de uso indebido que la arquitectura por sí sola no puede resolver.
What Are Diffusion Models? How AI Image Generation Works workflow diagram
La difusión aprende una ruta controlada desde el ruido hacia los patrones representados en los datos de entrenamiento.

Ruido hacia adelante y reversión aprendida

El proceso hacia adelante añade progresivamente ruido gaussiano conocido hasta que la muestra es casi indistinguible del ruido aleatorio. El entrenamiento selecciona un paso de tiempo, corrompe un ejemplo real y solicita a una red neuronal que prediga el ruido, una muestra limpia o una parametrización relacionada.

Debido a que el proceso de corrupción es conocido, se pueden generar pares automáticamente a partir de los datos de entrenamiento. La dinámica inversa aprendida conecta la difusión con la IA generativa sin el discriminador adversarial utilizado por una GAN.

Condicionamiento y guía

Un codificador de texto convierte un prompt en incrustaciones que condicionan el desruido, a menudo mediante atención cruzada. Condiciones de imagen, máscara, profundidad, postura o audio pueden restringir la composición. La guía sin clasificador combina predicciones condicionales e incondicionales para ajustar la adherencia.

Una mayor guía no siempre es mejor: puede reducir la diversidad o introducir artefactos. Las semillas reproducen el ruido inicial solo cuando el modelo, el muestreador, la precisión, el software y la configuración también están controlados. La ingeniería de prompts afecta los resultados pero no revela todos los factores aprendidos.

Espacio de píxeles, espacio latente y muestreo

Los modelos de espacio de píxeles operan directamente sobre la matriz de salida. La difusión latente primero comprime una imagen con un autoencoder, ejecuta la difusión en ese espacio de menor dimensión y luego la decodifica. La compresión hace que la generación de alta resolución sea más práctica, pero puede descartar detalles.

Los muestreadores al estilo DDPM pueden usar muchos pasos estocásticos; DDIM y los solucionadores modernos pueden usar menos. La destilación puede comprimir la generación en aún menos pasadas. Cada aceleración debe evaluarse en términos de fidelidad al prompt, diversidad, artefactos y calidad específica de la tarea.

Evaluación y despliegue responsable

Métricas de distribución como el FID estiman la similitud agregada, pero no miden la factualidad, la fidelidad al prompt, la anatomía, la tipografía o el impacto social. La evaluación humana necesita criterios claros y comparaciones a ciegas. Las pruebas de seguridad deben cubrir la memorización, la identidad, contenido dañino y la representación demográfica.

Rastree los derechos de origen, el consentimiento, el etiquetado y la procedencia. Los controles de medios sintéticos deben combinar salvaguardas del modelo, revisión, credenciales de contenido, respuesta a incidentes y un medio para que las personas afectadas busquen remedio.

El objetivo de aprendizaje con más detalle

Un programa de difusión define cuánto ruido se añade en cada paso de tiempo. En lugar de simular cada paso hacia adelante durante el entrenamiento, una muestra limpia puede transformarse directamente a un nivel de ruido seleccionado mediante una expresión en forma cerrada. La red recibe la muestra ruidosa, el paso de tiempo y una condición opcional, y predice un objetivo relacionado con el ruido o los datos limpios.

La pérdida de entrenamiento suele ser un error cuadrático medio ponderado, pero ponderar los pasos de tiempo cambia qué regiones señal‑ruido reciben énfasis. Parametrizaciones como epsilon, x₀ y velocidad tienen comportamientos numéricos diferentes. La interpretación variacional conecta el proceso con límites de verosimilitud, mientras que el emparejamiento de puntuaciones interpreta la red como una estimación del gradiente del logaritmo de la densidad.

La arquitectura sigue la modalidad. Los sistemas de imagen suelen usar U‑Nets o desruidores basados en transformadores con características multiescala; los modelos de audio y video deben representar el tiempo y la consistencia a largo plazo. El condicionamiento de texto puede estar congelado o entrenarse conjuntamente. Un codificador de texto potente puede mejorar la coincidencia con el prompt, aunque añade sus propios sesgos y modos de falla.

Muestreadores, edición y control

El muestreo discretiza el proceso inverso. Los muestreadores ancestrales estocásticos preservan la aleatoriedad, los solucionadores deterministas o parcialmente estocásticos pueden reducir los pasos, y la destilación entrena a un estudiante para aproximar varias actualizaciones a la vez. Compare los métodos con el mismo modelo, resolución, conjunto de prompts y fuerza de guía.

La generación de imagen a imagen comienza a partir de una codificación ruidosa de una entrada; el nivel de ruido controla cuán fuertemente se preserva la estructura. El inpainting usa una máscara para regenerar regiones seleccionadas. Los adaptadores estructurales pueden condicionar en bordes, profundidad, postura o segmentación. Estos controles guían la muestra pero no garantizan la corrección geométrica o semántica.

La edición introduce riesgos de identidad y procedencia. Un sistema puede preservar suficiente estructura facial para suplantar a alguien o alterar el significado documental. Las interfaces deben distinguir la transformación creativa de las afirmaciones sobre eventos reales y añadir fricción o revisión para identidades y contextos sensibles.

Datos de entrenamiento, evaluación y despliegue

Las canalizaciones de datos recopilan, filtran, desduplican, etiquetan y ponderan los medios. Los errores en los subtítulos debilitan la alineación de texto; los duplicados pueden exagerar la memorización; los filtros pueden eliminar comunidades legítimas mientras dejan asociaciones dañinas. Los derechos y el consentimiento deben abordarse independientemente de la calidad técnica.

La evaluación necesita varias capas: medidas de reconstrucción o relacionadas con la verosimilitud, métricas de distribución, alineación prompt‑imagen, preferencia humana, diversidad, pruebas de memorización y pruebas de seguridad (red‑teaming). Mida categorías de fallos como conteo, relaciones espaciales, renderizado de texto, identidad y consistencia de video a largo plazo por separado.

El costo de despliegue incluye los pesos del modelo, el codificador de texto, el autoencoder, los pasos del muestreador, los modelos de seguridad y el escalado. El tamaño de lote y la resolución modifican la latencia de forma drástica. Registre las semillas y la configuración completa, adjunte la procedencia cuando sea posible y conserve el prompt y las decisiones de moderación necesarias para investigar un incidente.

Una canalización de generación de imágenes por difusión en la práctica

En un sistema de difusión latente, un codificador mapea una imagen a una representación latente compacta. El entrenamiento añade ruido en pasos de tiempo seleccionados y enseña a una red de desruido —comúnmente un U‑Net o transformador— a predecir ruido, velocidad u otro objetivo condicionado a las incrustaciones de texto. Un programador define el proceso de ruido hacia adelante y los pasos de muestreo inverso. El decodificador convierte el latente final de nuevo a píxeles; cada componente puede introducir sus propios artefactos y sesgos.

En la inferencia, el mismo prompt puede variar según la semilla, el muestreador, la cantidad de pasos, la escala de guía, la resolución, el condicionamiento negativo y la versión del modelo. Más pasos no siempre mejoran la calidad, y una guía excesiva puede reducir la diversidad o distorsionar las imágenes. Evalúe la adherencia al prompt, composición, anatomía, renderizado de texto, diversidad, latencia y seguridad usando tanto revisión humana como métricas específicas de la tarea. Conserve las semillas y la configuración para que los resultados puedan reproducirse.

El despliegue requiere procedencia, derechos y controles de abuso junto con la calidad del modelo. Registre la documentación del modelo y del conjunto de datos, respete las licencias, filtre contenido ilegal, proteja contra la suplantación no consensuada y etiquete o firme las salidas cuando corresponda. La edición de imágenes, el inpainting y los adaptadores personalizados crean riesgos adicionales de identidad. Un sistema de producción debe preservar los metadatos de generación, soportar flujos de reporte y eliminación, y evitar insinuar que una imagen es evidencia documental solo porque parece fotorrealista.

Lista de verificación para implementación práctica

Convierta el concepto en un flujo de trabajo delimitado y comprobable: muestra real → añadir ruido → aprender desruidor → iniciar ruido → iterar → decodificar. Asigne un responsable, documente los datos y dependencias, establezca una línea base sencilla, defina criterios de aceptación y de detención, pruebe fallos representativos y defina monitoreo, reversión y revisión antes de ampliar el alcance. Registre versiones y suposiciones para que otro equipo pueda reproducir el resultado y entender qué cambió.

Antes del lanzamiento, realice una revisión de preparación documentada con las personas que construyen, operan, aseguran y se ven afectadas por el sistema. Pruebe casos normales, condiciones límite, fallos de dependencias y usos indebidos; conserve la evidencia y los riesgos no resueltos. Defina quién puede aprobar el lanzamiento, cambiar un umbral, sobrescribir una salida o detener la operación. Revise la decisión una vez que lleguen datos del mundo real, porque un piloto técnicamente exitoso no garantiza un rendimiento fiable a mayor escala.

  • ENTRENAMIENTO: predecir información de desruido.
  • CONDICIONAMIENTO: guiar con texto, imagen o estructura.
  • MUESTREO: equilibrar pasos, velocidad y calidad.

Preguntas frecuentes

¿Los modelos de difusión son solo para imágenes?

No. La misma familia de ideas se utiliza para audio, video, estructuras moleculares, acciones y otros datos continuos o discretizados.

¿Por qué la generación requiere varios pasos?

El muestreo sigue numéricamente una ruta aprendida desde el ruido hacia una muestra. Los solucionadores de menos pasos y los modelos destilados intercambian cómputo por calidad y estabilidad.

Referencias principales

Haziqa es una científica de datos con amplia experiencia en la escritura de contenido técnico para empresas de inteligencia artificial y SaaS.