Ángulo de Anderson

El Código de Vibraiones Sufre Cuando el Papel de la IA se Expande

mm
Añade Unite.AI a tus fuentes preferidas en Google
An AI-generated stock-style image depicting a human Caucasian male and a larger glossy humanoid robot attempting to collaborate on a document; but the aggressive robot is causing the annoyed man to be sidelined. GPT-5 Image + Photoshop enhancement.

Un nuevo estudio encuentra que la codificación de vibraiones mejora cuando los humanos dan las instrucciones, pero disminuye cuando la IA lo hace, con el mejor conjunto híbrido que mantiene a los humanos en primer lugar, con la IA como árbitro o juez.

 

Una nueva investigación de los Estados Unidos, que examina qué sucede cuando los sistemas de IA se permiten dirigir la codificación de vibraiones, en lugar de simplemente ejecutar instrucciones humanas, ha encontrado que cuando los Modelos de Lenguaje Grande (LLM) asumen un papel direccional más grande, los resultados son casi siempre peores.

Aunque los investigadores utilizaron el GPT-5 de OpenAI como marco para sus experimentos de colaboración humano-IA, más tarde confirmaron que tanto el Claude Opus 4.5 de Anthropic como el Gemini 3 Pro de Google estaban sujetos a la misma curva de deterioro a medida que crecían las responsabilidades, afirmando que ‘incluso la participación humana limitada mejora constantemente el rendimiento’:

‘[Los humanos] proporcionan una orientación de alto nivel única y efectiva en iteraciones, [mientras que] la orientación de la IA a menudo conduce a un colapso del rendimiento. Además, encontramos que una asignación de roles cuidadosa que mantiene a los humanos a cargo de la dirección mientras se descarga la evaluación a la IA puede mejorar el rendimiento híbrido.’

Con el fin de proporcionar un test consistente que pudiera ser evaluado igualmente por humanos y por IA, se construyó un marco experimental controlado alrededor de una tarea de codificación iterativa en la que una imagen de referencia – que presentaba una foto de un gato, perro, tigre, pájaro, elefante, pingüino, tiburón, cebra, jirafa o panda – debía ser recreada utilizando gráficos vectoriales escalables (SVG), y que la recreación fuera juzgada en comparación con la fuente de la foto de la que se derivó:

Tanto los participantes humanos como los de IA fueron mostrados una imagen de referencia fotográfica junto con una reconstrucción de SVG generada por IA, y se les pidió que calificaran cuán similares eran las dos en una escala de siete puntos. Fuente - https://arxiv.org/pdf/2602.10473

Tanto los participantes humanos como los de IA fueron mostrados una imagen de referencia fotográfica junto con una reconstrucción de SVG generada por IA, y se les pidió que calificaran cuán similares eran las dos en una escala de siete puntos. Fuente

En cada ronda, un agente proporcionaba instrucciones de alto nivel en lenguaje natural para guiar a un generador de código, y otro decidía si mantener la nueva versión o revertir a la anterior – un bucle estructurado que refleja flujos de trabajo colaborativos reales.

A lo largo de 16 experimentos que involucraron a 604 participantes y miles de llamadas a la API, se compararon directamente rondas de prueba dirigidas completamente por humanos con rondas dirigidas completamente por IA, en condiciones idénticas.

Algunas de las soluciones variadas que se llegaron a través de diferentes combinaciones de porcentajes y tipos de colaboración humano-IA (tomadas de una ilustración más grande en el documento fuente, al que remitimos al lector).

Algunas de las soluciones variadas que se llegaron a través de diferentes combinaciones de porcentajes y tipos de colaboración humano-IA (tomadas de una ilustración más grande en el documento fuente, al que remitimos al lector).

Aunque los humanos y la IA realizaron al mismo nivel al comienzo de las pruebas, con el tiempo sus trayectorias divergieron: cuando los humanos proporcionaron las instrucciones y tomaron las decisiones de selección, las calificaciones de similitud aumentaron a lo largo de las iteraciones, con una mejora acumulativa constante; pero cuando los sistemas de IA llenaron ambos roles, el rendimiento no mostró ganancias consistentes y a menudo disminuyó en las rondas – a pesar de que se utilizó el mismo modelo subyacente para la generación de código y la IA tuvo acceso a la misma información que los participantes humanos.

El Efecto de la Prolixidad

Los resultados también mostraron que las instrucciones humanas eran típicamente cortas y orientadas a la acción, centradas en qué cambiar a continuación en la imagen actual; por el contrario, las instrucciones de la IA eran mucho más largas y densamente descriptivas (un factor que se parametrizó para GPT-5), detallando atributos visuales en lugar de priorizar la corrección incremental.

Pero, como se ve en el gráfico a continuación, imponer límites estrictos de palabras en las instrucciones de la IA no invirtió el patrón; incluso cuando se limitó a 10, 20 o 30 palabras, las cadenas dirigidas por la IA todavía no mejoraron con el tiempo:

Calificaciones de similitud a lo largo de las iteraciones para cadenas dirigidas por humanos en comparación con cadenas dirigidas completamente por IA y cadenas dirigidas por IA limitadas a 10, 20 o 30 palabras de instrucción, mostrando que acortar las instrucciones de la IA no evita la disminución del rendimiento observada cuando la IA dirige tanto la instrucción como la selección.

Calificaciones de similitud a lo largo de las iteraciones para rondas dirigidas por humanos en comparación con rondas dirigidas completamente por IA y cadenas dirigidas por IA limitadas a 10, 20 o 30 palabras de instrucción. Evidentemente, acortar las instrucciones de la IA no evita la disminución del rendimiento observada cuando la IA dirige tanto la instrucción como la selección.

Los experimentos híbridos hicieron que el patrón fuera más claro, mostrando que agregar incluso un poco de participación humana mejoraba los resultados, en comparación con los conjuntos dirigidos completamente por IA; sin embargo, el rendimiento generalmente disminuía a medida que aumentaba la participación de la IA.

Cuando se separaron los roles, la evaluación y la selección podían ser delegadas a la IA con una pérdida de calidad relativamente pequeña; pero reemplazar la instrucción de alto nivel humana con la orientación de la IA llevó a disminuciones notables en el rendimiento, lo que sugiere que lo que más importaba no era quién generaba el código, sino quién establecía y sostenía la dirección a lo largo de las iteraciones.

Los autores concluyen:

‘A lo largo de múltiples experimentos, la codificación dirigida por humanos mejoró consistentemente con el tiempo, mientras que la codificación dirigida por IA a menudo colapsó a pesar de tener acceso a la misma información y capacidades de ejecución similares.

‘Esto señala las luchas clave de los sistemas de IA actuales para mantener una dirección de alto nivel coherente a lo largo de interacciones repetidas, del tipo necesario para una codificación de vibraiones exitosa’

El nuevo documento se titula Por qué la orientación humana es importante en la codificación de vibraiones colaborativa, y proviene de siete investigadores de la Universidad de Cornell, la Universidad de Princeton, el Instituto de Tecnología de Massachusetts y la Universidad de Nueva York.

Método

Para los experimentos, un instructor humano miró una imagen de referencia generada por GPT-5, junto con el intento de imitación de SVG más reciente asociado. Luego, escribió instrucciones en lenguaje natural para guiar al generador de código hacia una coincidencia más cercana.

Así, el generador produciría un nuevo SVG en cada ronda, proporcionando un bucle iterativo para probar cómo se acumula el efecto de la orientación con el tiempo. Los objetivos eran diez imágenes de animales generadas por GPT-5, que cubrían una variedad de formas y texturas para que las mejoras o errores fueran fáciles de detectar:

Esquema del flujo de trabajo de codificación de vibraiones utilizado en el estudio. En A), un instructor humano ve una imagen de referencia fotográfica junto con el SVG producido hasta ahora y escribe instrucciones en lenguaje natural para el generador de código para que siga cuando produzca el próximo SVG; en B), un selector humano compara el nuevo SVG con el anterior y elige cuál versión coincide mejor con la imagen de referencia, antes de pasar el SVG seleccionado hacia adelante para la próxima ronda de instrucción. En C), evaluadores humanos independientes califican cuán similares son cada SVG generado a su imagen de referencia, suministrando las calificaciones utilizadas para evaluar el rendimiento general.

Esquema del flujo de trabajo de codificación de vibraiones utilizado en el estudio. En A), un instructor humano ve una imagen de referencia fotográfica junto con el SVG producido hasta ahora y escribe instrucciones en lenguaje natural para el generador de código para que siga cuando produzca el próximo SVG; en B), un selector humano compara el nuevo SVG con el anterior y elige cuál versión coincide mejor con la imagen de referencia, antes de pasar el SVG seleccionado hacia adelante para la próxima ronda de instrucción; y en C), evaluadores humanos independientes califican cuán similares son cada SVG generado a su imagen de referencia, suministrando las calificaciones utilizadas para evaluar el rendimiento general.

Un selector humano comparó cada nuevo SVG generado con el anterior y lo aceptó o rechazó, lo que mantuvo el proceso alineado con la imagen de referencia a lo largo de las rondas. En este conjunto básico, el mismo humano realizó ambos roles.

Para medir la calidad, evaluadores humanos independientes calificaron cuán similares eran cada SVG generado a su imagen de referencia. A lo largo de dieciséis experimentos, 120 personas produjeron 4,800 calificaciones. Todos los experimentos se ejecutaron en el marco PsyNet, un portal diseñado para acomodar interacciones estructuradas entre humanos y sistemas de IA.

El estudio reclutó a 604 hablantes nativos de inglés, en pruebas que consumirían 4,800 llamadas a la API para la generación de código, y 5,327 llamadas a la API para la instrucción. Aunque GPT-5 fue el modelo principal utilizado, se realizaron lotes de comparación más pequeños con Claude Opus 4.5 y Gemini 3 Pro, que cada uno manejó 280 consultas.

Resultados

Se realizaron treinta rondas de codificación de vibraiones, cada una compuesta por quince ediciones de las diez imágenes de referencia básicas. Para estas, se eligieron 45 participantes humanos, cada uno sirviendo como selector y instructor a lo largo de diez iteraciones, en las rondas “dirigidas por humanos”.

Dentro de cada turno, el mismo participante primero eligió entre el SVG actual y el anterior, y luego escribió la próxima ronda de instrucciones. Una segunda versión de la prueba reemplazó esas decisiones humanas con llamadas a la API de GPT 5, mientras mantenía el resto del conjunto sin cambios. En todos los casos, los roles de instructor y selector promovieron al generador de código con lenguaje plano.

Un ejemplo representativo de codificación de vibraiones de varias rondas muestra cómo el proceso diverge con el tiempo; cuando los humanos actuaron como selector e instructor, la salida de SVG mejoró constantemente a lo largo de las iteraciones, acercándose a la imagen de referencia con cada ronda:

Ejemplos de progresión para una imagen de referencia bajo codificación de vibraiones dirigida por humanos (arriba) y dirigida por IA (abajo), mostrando una mejora constante a lo largo de las iteraciones con humanos en ambos roles, y estancamiento o deriva cuando ambos roles son manejados por IA.

Ejemplos de progresión para una imagen de referencia bajo codificación de vibraiones dirigida por humanos (arriba) y dirigida por IA (abajo), mostrando una mejora constante a lo largo de las iteraciones con humanos en ambos roles, y estancamiento o deriva cuando ambos roles son manejados por IA.

Por el contrario, en la versión dirigida por IA, las primeras rondas a veces capturaron características visuales clave, pero los intentos posteriores no lograron mejorar sobre esas ganancias, y en algunos casos se alejaron del objetivo:

Resultados finales de la iteración final, comparando giros dirigidos por humanos (fila superior) con cadenas dirigidas por IA (fila inferior), a lo largo del mismo conjunto de imágenes de referencia. Los resultados dirigidos por humanos coinciden más estrechamente con los animales originales, y los resultados dirigidos por IA demuestran distorsiones visibles o pérdida de características clave.

Resultados finales de la iteración final, comparando giros dirigidos por humanos (fila superior) con cadenas dirigidas por IA (fila inferior), a lo largo del mismo conjunto de imágenes de referencia. Los resultados dirigidos por humanos coinciden más estrechamente con los animales originales, y los resultados dirigidos por IA demuestran distorsiones visibles o pérdida de características clave.

Para medir las tendencias emergentes cuantitativamente, se mostraron las imágenes finales a calificadores humanos independientes y se calificaron por similitud con las imágenes de referencia. En las primeras rondas, las rondas dirigidas por humanos y las dirigidas por IA obtuvieron calificaciones similares; pero hacia la ronda número quince, la diferencia era clara, con las imágenes elegidas por humanos calificadas mucho más cerca de los objetivos. Con el tiempo, las calificaciones humanas aumentaron constantemente, con la mayor ganancia relativa sobre la IA alcanzando el 27.1%.

Calificaciones de similitud promedio a lo largo de las iteraciones para codificación de vibraiones dirigida por humanos y dirigida por IA, mostrando ganancias constantes cuando los humanos actúan como selector e instructor, y una disminución gradual cuando ambos roles son manejados por GPT 5.

Calificaciones de similitud promedio a lo largo de las iteraciones para codificación de vibraiones dirigida por humanos y dirigida por IA, mostrando ganancias constantes cuando los humanos actúan como selector e instructor, y una disminución gradual cuando ambos roles son manejados por GPT 5.

Para asegurarse de que las tendencias emergentes no se debieran al poder colectivo de múltiples participantes humanos simultáneos, los investigadores reclutaron a diez personas adicionales para trabajar solas, cada una ejecutando tres rondas por sí misma – y los resultados mejoraron de la misma manera constante, demostrando que las ganancias no fueron un efecto casual del esfuerzo colectivo.

La Gran Imagen

Sin embargo, si GPT-5 juzgara los resultados por sí mismo, ¿admitiría que los resultados humanos eran mejores? Las calificaciones humanas y de IA generalmente se movieron en la misma dirección, así que el modelo podría distinguir entre bueno y malo, pero calificó consistentemente las imágenes generadas por IA más altas que las calificaciones humanas.

‘Específicamente, preguntamos si los agentes de IA reconocerían que sus propias salidas son inferiores a las producidas por humanos, o si en cambio mostrarían una preferencia por sus propias creaciones, lo que indicaría un posible problema de alineación.’

Como resultó, hay un problema de alineación*:

‘Los evaluadores de IA asignaron calificaciones más altas a las salidas generadas por IA. Estos hallazgos sugieren que las diferencias de rendimiento observadas pueden deberse a una desalineación en las representaciones entre humanos y IA.’

Al examinar cómo los humanos y la IA frasesan su orientación, se hicieron evidentes las discrepancias en las pruebas. Como se ve en la figura a continuación, tanto el enfoque como la longitud son temas de divergencia entre la IA y los humanos:

Una comparación de cómo los humanos y la IA dieron instrucciones durante la tarea de codificación. 'A' muestra que los humanos escriben instrucciones cortas y directas, mientras que la IA escribe descripciones largas y detalladas. 'B' mapea las instrucciones, revelando que los prompts humanos se agrupan juntos, mientras que los prompts de la IA se dividen por animal. 'C' rastrea cómo limitar la longitud de la instrucción de la IA no arregla sus malos resultados con el tiempo; y 'D' ilustra que los humanos brindan una orientación más variada y equilibrada que la IA, incluso cuando se imponen límites de palabras.

Una comparación de cómo los humanos y la IA dieron instrucciones durante la tarea de codificación. ‘A’ muestra que los humanos escriben instrucciones cortas y directas, mientras que la IA escribe descripciones largas y detalladas. ‘B’ mapea las instrucciones, revelando que los prompts humanos se agrupan juntos, mientras que los prompts de la IA se dividen por animal. ‘C’ rastrea cómo limitar la longitud de la instrucción de la IA no arregla sus malos resultados con el tiempo; y ‘D’ ilustra que los humanos brindan una orientación más variada y equilibrada que la IA, incluso cuando se imponen límites de palabras.

Las instrucciones humanas tendían a ser cortas y directas, ofreciendo ediciones claras que se podían aplicar generalmente en los objetivos. Las instrucciones de la IA, por otro lado, estaban densamente llenas de detalles descriptivos y a menudo estaban infladas con descripciones específicas sobre sombreado, texturas, iluminación o minucias anatómicas – descripciones que pueden tener sentido en aislamiento, pero que no proporcionan pasos útiles siguientes para el modelo (y que serán familiares para aquellos que están al tanto de los problemas de los LLM con la longitud del contexto, es decir, ser capaces de retener ‘la gran imagen’ a medida que un proyecto se desarrolla y crece).

Para ver si la reducción de la verbosidad mejoraría el rendimiento, se limitó a GPT-5 a 10, 20 o 30 palabras por instrucción; pero incluso estas instrucciones comprimidas no mostraron ninguna mejora (ver la parte inferior derecha del gráfico anterior).

Emprendimientos Conjuntos

Para probar qué sucede cuando los humanos y la IA comparten el control, los investigadores ejecutaron tareas de codificación con diferentes mezclas de entrada humana y de IA, que iban desde mayormente humanos hasta mayormente IA.

Cada mezcla híbrida superó el control total de la IA, así que incluso una pequeña cantidad de orientación humana mejoró los resultados:

Configuraciones de codificación híbridas con diferentes mezclas de humanos y IA. (A) Muestra cómo los humanos y la IA se turnaron como instructores y selectores para cada paso de codificación; (B) muestra que una mayor participación humana condujo a resultados de mayor calidad, mientras que una mayor entrada de IA redujo las calificaciones; y (C) describe una disminución constante en la calidad de la salida final a medida que disminuye la participación humana, confirmando que una dirección humana más consistente produjo mejores resultados.

Configuraciones de codificación híbridas con diferentes mezclas de humanos y IA. (A) Muestra cómo los humanos y la IA se turnaron como instructores y selectores para cada paso de codificación; (B) muestra que una mayor participación humana condujo a resultados de mayor calidad, mientras que una mayor entrada de IA redujo las calificaciones; y (C) describe una disminución constante en la calidad de la salida final a medida que disminuye la participación humana, confirmando que una dirección humana más consistente produjo mejores resultados.

A medida que la IA asumía más del proceso, el rendimiento disminuía, con los mejores resultados vistos cuando los humanos lideraban la mayoría de las rondas, y los más débiles cuando la IA lideraba la mayoría de las rondas. Ninguno de estos conjuntos híbridos logró mejorar con cada nueva ronda, lo que sugiere que la dirección humana funciona mejor cuando es constante y consistente, en lugar de ocasional.

Inversión de Roles

El estudio también exploró si importa quién hace qué en este tipo de tareas, y lo probó. La tarea revisada involucró dos tareas: un participante dictaría cómo cambiar la imagen, y otro elegiría una versión preferible.

Cuando ambos trabajos los realizaron personas, la calidad se mantuvo; pero cuando un humano dio las instrucciones y nadie eligió entre versiones, la calidad empeoró:

Pruebas para la división de roles en la codificación de vibraiones: en (A), eliminar el rol de selector condujo a un peor rendimiento, incluso cuando un humano proporcionó instrucciones; en (B), reemplazar al selector humano con una IA redujo ligeramente la calidad, pero no tan severamente como saltarse la selección por completo.

Pruebas para la división de roles en la codificación de vibraiones: en (A), eliminar el rol de selector condujo a un peor rendimiento, incluso cuando un humano proporcionó instrucciones; en (B), reemplazar al selector humano con una IA redujo ligeramente la calidad, pero no tan severamente como saltarse la selección por completo.

Cuando la IA estaba a cargo, saltarse el paso de elección no importaba, ya que sus salidas permanecieron consistentes de cualquier manera; pero cuando los humanos dieron las instrucciones y la IA eligió entre los resultados, la calidad se mantuvo cerca del conjunto dirigido completamente por humanos.

Lo contrario no funcionó: tener a la IA dar instrucciones mientras los humanos elegían salidas condujo a resultados más débiles, lo que sugiere que la orientación creativa humana sigue siendo esencial, mientras que el trabajo de elegir entre opciones puede ser delegado a la IA sin mucha pérdida.

El documento concluye:

‘La generación de ideas y la instrucción de alto nivel son las contribuciones críticas de los humanos, mientras que la evaluación y la selección pueden ser delegadas a la IA sin pérdida de rendimiento.

‘Esto sugiere un principio de diseño práctico para sistemas híbridos: los humanos deben establecer la dirección, mientras que la IA puede apoyar la evaluación y la ejecución.’

Conclusión

Aún queda por ver hasta qué punto ventanas de contexto mejoradas y/o aumentadas afectarán el rendimiento de los LLM en tareas de este tipo. El día en que la ‘amnesia de LLM’ deje de ser un problema diario de la colaboración humano-IA puede ser una causa tanto para celebración como para alarma, ya que el problema que la IA está tratando de resolver, argumentablemente, es la gente.

No obstante, el trabajo de los autores también hace claro que hay desacuerdos innatos y críticos entre la IA y los humanos con respecto a la calidad, que pueden ser determinados aún por los consumidores como un concepto irremplazablemente humano.

 

* Mi conversión de las citas en línea de los autores a enlaces.

Publicado por primera vez el viernes 13 de febrero de 2026

Redactor de aprendizaje automático, especialista en síntesis de imágenes humanas. Anterior jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en Brahma.ai de DNEG.
Sitio web: martinanderson.ai
Contacto: martin@martinanderson.ai