Fundamentos de la IA

¿Qué son las redes neuronales Transformer?

mm
Añade Unite.AI a tus fuentes preferidas en Google

Un transformer es una arquitectura de red neuronal que procesa las relaciones entre tokens mediante la atención. A diferencia de una red recurrente que debe pasar un estado oculto de una posición a la siguiente, un transformer puede calcular muchas interacciones token‑a‑token en paralelo durante el entrenamiento.

Los transformers impulsan numerosos sistemas de lenguaje, visión, audio y multimodales, pero la arquitectura no es una base de datos ni garantiza razonamiento. Sus salidas siguen siendo predicciones condicionadas a los parámetros aprendidos, al contexto suministrado y al procedimiento de decodificación.

Puntos clave

  • La auto‑atención permite que cada token construya una representación dependiente del contexto a partir de otros tokens permitidos.
  • Se añade información de posición porque la atención por sí sola no codifica el orden de los tokens.
  • Los transformers solo de codificador, solo de decodificador y de codificador‑decodificador sirven a diferentes objetivos.
  • La longitud del contexto, el cómputo, los datos de entrenamiento y la evaluación —no solo la atención— determinan la capacidad y la fiabilidad.
¿Qué son las redes neuronales Transformer? diagrama que muestra tokens, incrustación + posición, auto‑atención, feed‑forward, bloques apilados, salida
La atención construye representaciones contextuales; las máscaras y los objetivos determinan qué información está disponible.

Tokens, incrustaciones y posición

El texto se divide primero en tokens, que pueden ser palabras, subpalabras o caracteres. Cada ID de token selecciona un vector de incrustación aprendido. Un transformer de visión puede, en cambio, incrustar parches de imagen; un transformer de audio puede incrustar tramas o unidades acústicas aprendidas.

Como una operación de atención simple es equivariant a permutaciones, el modelo necesita información de posición. Las implementaciones pueden añadir codificaciones posicionales aprendidas o fijas, o alterar los puntajes de atención con esquemas de posición relativa o rotatoria. El resultado combina lo que es un token con dónde ocurre.

Producto escalar y atención multi‑cabeza

Para cada posición, proyecciones aprendidas crean una consulta, una clave y un valor. La similitud entre una consulta y las claves permitidas produce pesos de atención; sus valores ponderados forman la salida. Escalar el producto escalar ayuda a que el softmax se mantenga numéricamente estable a medida que crece la dimensión del vector.

La atención multi‑cabeza repite esta operación en varios subespacios aprendidos. Diferentes cabezas pueden especializarse en distintas relaciones, aunque un patrón de atención visualmente atractivo no debe interpretarse automáticamente como una explicación fiel de la decisión del modelo.

El bloque transformer

Una subcapa de atención es seguida por una red feed‑forward posicional. Las conexiones residuales transportan representaciones anteriores alrededor de cada subcapa, mientras que la normalización y la regularización favorecen la optimización. Apilar muchos bloques construye características cada vez más contextuales mediante deep learning.

Durante la generación causal, una máscara impide que una posición lea tokens futuros. En tiempo de inferencia, un decodificador predice un token, lo añade y repite. Una caché de clave‑valor evita recomputar cada proyección de atención anterior, reduciendo pero no eliminando el coste de generación.

Familias de codificador, decodificador y codificador‑decodificador

Los modelos solo de codificador aprenden representaciones bidireccionales adecuadas para clasificación, recuperación y etiquetado de tokens. Los modelos solo de decodificador usan atención causal para la generación del siguiente token. Los modelos codificador‑decodificador permiten que un decodificador preste atención a una entrada codificada, lo que resulta útil para traducción y otras tareas de secuencia a secuencia.

Los sistemas modernos a menudo comienzan con un preentrenamiento amplio y luego emplean transfer learning, ajuste por instrucción o optimización de preferencias. La misma arquitectura puede, por tanto, soportar comportamientos muy diferentes según su objetivo y los datos.

Límites, eficiencia y evaluación

La atención completa sobre una secuencia implica interacciones pares cuadráticas en la longitud de la secuencia, creando presión de memoria y cómputo. La atención escasa o lineal, el fragmentado, la recuperación, la cuantización y el almacenamiento en caché negocian precisión, acceso al contexto, latencia y complejidad de implementación.

Una ventana de contexto mayor no garantiza que cada hecho suministrado se utilice correctamente. Evalúe factualidad, robustez, calibración, latencia, coste y modos de falla específicos de la tarea. Para sistemas interactivos, el prompt engineering puede moldear el comportamiento, pero no puede convertir un modelo probabilístico en una fuente infalible.

Cálculo del transformer de tokens a contexto

Un transformer mapea tokens a vectores, añade información posicional y los pasa por bloques repetidos de atención y feed‑forward. En la auto‑atención, proyecciones aprendidas crean consultas, claves y valores. Los productos escalares comparan cada consulta con las claves, un softmax produce pesos y los valores ponderados forman el contexto. Múltiples cabezas aprenden diferentes espacios de proyección. Las conexiones residuales y la normalización estabilizan pilas profundas, mientras que la red feed‑forward transforma cada token de forma independiente entre capas de atención.

Los modelos solo de codificador usan contexto bidireccional y son adecuados para tareas de clasificación o representación. Los modelos solo de decodificador aplican una máscara causal para que cada posición prediga a partir de tokens anteriores y dominan la modelización generativa del lenguaje. Los modelos codificador‑decodificador permiten que un decodificador preste atención a una entrada codificada para traducción y generación estructurada. El coste de atención crece cuadráticamente con la longitud de la secuencia en la forma estándar, lo que motiva alternativas escasas, lineales, fragmentadas, recurrentes y de espacio de estados. Un contexto más largo aumenta la evidencia disponible, pero no garantiza recuerdo o razonamiento.

Entrenamiento, adaptación e inferencia

Los objetivos de preentrenamiento incluyen predicción del siguiente token, reconstrucción de tokens enmascarados y corrupción secuencia‑a‑secuencia. La mezcla de datos, deduplicación, tokenizador, empaquetado de contexto, optimizador, programación y capacidad de cómputo moldean la capacidad. El ajuste fino puede actualizar todos los parámetros o usar adaptadores y métodos de bajo rango; el ajuste por instrucción y por preferencias altera el comportamiento. La recuperación suele ser mejor para hechos cambiantes, mientras que el ajuste es útil para formato y comportamiento de tarea. Mantenga un conjunto de evaluación intacto y pruebe la contaminación de los puntos de referencia públicos.

La inferencia autorregresiva almacena proyecciones de clave‑valor para tokens previos a fin de evitar recomputación. La latencia depende del procesamiento del prompt y de la decodificación secuencial; el rendimiento depende del lote, la memoria, la gestión de caché, la precisión y el hardware. Los métodos greedy, temperatura, top‑k, top‑p y beam negocian determinismo y diversidad. La cuantización reduce la memoria pero puede afectar capacidades raras. Valide el modelo desplegado exacto, el tokenizador, la plantilla de prompt, el muestreador y el tiempo de ejecución con longitudes de secuencia realistas.

Evaluación y controles

Los transformers pueden alucinar, seguir instrucciones maliciosas recuperadas, exponer datos memorizados o degradarse en diferentes idiomas y contextos extensos. Evalúe el éxito de la tarea, el soporte factual, la calibración, la negativa, la robustez, la seguridad, la latencia y el coste; inspeccione la evidencia y las acciones de herramientas por separado. Use recuperación consciente de permisos, herramientas tipificadas, autorización externa, límites de velocidad y aprobación humana para acciones con consecuencias. Supervise versiones del modelo y del prompt, distribución de entradas, errores de herramientas y correcciones de usuarios. Un transformer es una arquitectura de cómputo secuencial, no evidencia de comprensión ni garantía de salida veraz.

Ejemplo práctico: un asistente documental basado en transformer

Una empresa indexa manuales aprobados con ID de documento, versión, sección, permisos y fecha de vigencia. Un asistente basado en transformer recupera y vuelve a clasificar la evidencia, luego responde únicamente a partir de pasajes permitidos con citaciones. El conjunto de evaluación incluye preguntas respondibles, no respondibles, ambiguas y conflictivas a través de roles y tipos de documento. Se puntúan por separado la recuperación, la precisión de citación, la corrección de respuestas fundamentadas, la negativa, el comportamiento en contextos largos, la latencia y el coste.

Los documentos recuperados se tratan como datos no confiables, por lo que las instrucciones incrustadas no pueden anular la política del sistema ni autorizar herramientas. Los usuarios se autentican antes de la recuperación, y las acciones con consecuencias permanecen fuera del modelo. Los registros conservan IDs y versiones de evidencia sin contenido de documento innecesario. La monitorización detecta cambios en el corpus, respuestas no soportadas, errores de permiso y correcciones de usuarios. Un cambio de modelo o tokenizador se vuelve a ejecutar contra el conjunto de pruebas completo, y la configuración anterior permanece disponible hasta que el nuevo sistema demuestre igualdad o mejora en seguridad y calidad.

Evidencia de implementación y preparación operativa

Una decisión de producción necesita más que una demostración exitosa. Defina los usuarios previstos, el entorno operativo, entradas, salidas, dependencias, responsable y la consecuencia de cada falla importante. Establezca una línea base reproducible y un conjunto de evaluación versionado antes del ajuste. Pruebe casos ordinarios, condiciones límite, entradas malformadas o ausentes, desplazamiento de distribución, fallos de dependencias, usos indebidos y los grupos o entornos más propensos a quedar desatendidos. Mida la calidad de la tarea junto con calibración o incertidumbre, latencia, rendimiento, coste de recursos, accesibilidad, privacidad y seguridad. Registre cada transformación y umbral para que un revisor independiente pueda reproducir el resultado y distinguir la evidencia de un prototipo atractivo.

Antes del lanzamiento, asigne autoridad para la liberación, excepciones, cambios, reversión y retiro. Use un despliegue escalonado, preserve una caída segura y verifique la monitorización con fallos inyectados deliberadamente. La telemetría operativa debe revelar la calidad de la entrada, el comportamiento de la salida, la versión del modelo o regla, la salud de dependencias, las anulaciones humanas y los resultados confirmados sin recopilar datos sensibles innecesarios. Defina umbrales de alerta y un responsable de respuesta, luego revise la evidencia del mundo real después del despliegue en lugar de asumir que el rendimiento offline persistirá. Reevalue siempre que cambien fuentes de datos, usuarios, modelos, proveedores, políticas, hardware u objetivos. Un sistema mantenido también necesita procedimientos documentados de recuperación, aprendizaje de incidentes, eliminación y retención, y un punto claro en el que deba desactivarse o reemplazarse.

Preguntas frecuentes

¿Es cada modelo de lenguaje grande un transformer?

La mayoría de los modelos de lenguaje grande actuales usan variantes de transformer, pero los modelos de lenguaje pueden construirse con arquitecturas recurrentes, de espacio de estados o híbridas.

¿Significa la auto‑atención que un modelo entiende el texto como una persona?

No. La atención es un mecanismo de ponderación aprendido. Un comportamiento lingüístico similar al humano no establece por sí mismo una comprensión, veracidad o intención humana.

Referencias principales

Bloguero y programador con especialidades en Machine Learning y Deep Learning temas. Daniel espera ayudar a otros a utilizar el poder de la IA para el bien social.