Ángulo de Anderson

La salida “creativa” de los modelos de IA se vuelve similar entre los proveedores

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-Generated article illustration (GPT Image 2): three overlapping white envelopes carry Shakespeare stamps labeled 'CLAUDE', 'CHATGPT' and 'GEMINI' in pink, green and blue, resting on a wooden surface. A yellow-and-black warning-style border surrounds the scene, reading 'AI FANTASY INSIDE' and 'REALITY OUTSIDE', with black arrows and striped corner markings.

Nueva investigación sugiere que los modelos de IA de compañías rivales están volviéndose más parecidos en sus respuestas creativas, lo que podría reducir la variedad de ideas que los usuarios encuentran.

 

Una nueva investigación de EE. UU. ha descubierto que la producción “creativa” en una amplia gama de los principales modelos de IA se está volviéndose más similar con el tiempo.

Los autores, de la Universidad de Duke, probaron 69 modelos de 12 familias de proveedores, abarcando lanzamientos de 2023 a 2026, y encontraron una disminución estadísticamente significativa en la diversidad de salida tanto en preguntas abiertas del mundo real como en una prueba estándar de creatividad, lo que sugiere que ideas similares pueden ofrecerse en respuesta a solicitudes “creativas”, cada vez más, entre todos los principales proveedores de LLM.

Las familias de proveedores probadas fueron Anthropic; Cohere; DeepSeek; Google; Meta; MiniMax; Mistral AI; Moonshot AI; OpenAI; Qwen; xAI; y Z.ai*:

From the new paper - model releases used in the study, from marzo de 2023 to julio de 2026. The chart covers 68 mode versions across 12 AI providers, demonstrating how the models tested were distributed across the three-year period, and showing increasingly frequent release schedules for some providers, which has to be accounted for in the authors' reckonings. Source - https://arxiv.org/pdf/2608.19437

Del nuevo artículo: versiones de modelos usadas en el estudio, de marzo 2023 a julio 2026. El gráfico cubre 69 versiones de modelos de 12 proveedores de IA, mostrando cómo los modelos probados se distribuyeron a lo largo del período de tres años y revelando calendarios de lanzamiento cada vez más frecuentes para algunos proveedores, lo que debe tenerse en cuenta en los cálculos de los autores. Fuente

Los autores del nuevo artículo afirman**:

‘Encontramos que las respuestas de los LLM a los prompts abiertos que [probamos] se han vuelto cada vez más similares con el tiempo.’

‘Esto sugiere que los LLM están volviéndose menos creativos en tareas que implican generar respuestas abiertas, lo que exige un escrutinio de su utilidad a largo plazo como asistentes creativos.’

Aunque la monocultura algorítmica se ha convertido en una línea de estudio establecida, un examen de las tendencias hacia la homogeneidad en salidas creativas generadas por IA no se había llevado a cabo hasta ahora, afirman los autores.

Sin embargo, incidentes aislados han apuntado a esta convergencia desde hace tiempo, incluido el extraño caso descrito en el estudio de mayo de 20026 de la Universidad de Cornell, donde se demostró que una diversa gama de proveedores de LLM mostraba obsesiones extrañas y colisionantes sobre “guardianes de faros”, y un conjunto particular de nombres anacrónicos, como “Mara” y “Elias”:

In May, Cornell University's new paper found strange similarities across LLM providers when given 'open prompts' – though no clues as to why have yet become apparent in the diverse training data fueling these models.

En mayo, el nuevo artículo de la Universidad de Cornell encontró extrañas similitudes entre proveedores de LLM cuando se les dieron “prompts abiertos”, aunque aún no se han encontrado pistas en los diversos datos de entrenamiento que alimentan estos modelos.

El nuevo estudio es más sistemático: los autores probaron tres años de modelos tanto con prompts creativos del mundo real como con una prueba clásica de psicología que solicita usos inusuales para objetos cotidianos. Luego midieron cuán alejadas estaban las respuestas de los modelos en significado, rastreando si esas distancias se reducían a lo largo de generaciones sucesivas.

Los autores del nuevo trabajo, titulado Are LLMs becoming similarly creative? Evidence from three years of models, afirman:

‘Nuestros hallazgos, aunque preliminares, generan preocupación sobre la utilidad a largo plazo de los LLM como socios creativos. Incluso si los modelos rinden bien en tareas creativas, la convergencia de salidas podría limitar el rango de posibilidades al que los usuarios de LLM están expuestos, y con ello, la amplitud de su propio pensamiento.’

‘Si usar un LLM para tareas creativas como redactar ensayos disminuye la actividad cerebral, ¿podría el uso de LLM cada vez menos creativos –la tendencia sugerida por nuestro estudio– empeorar aún más los efectos de los LLM sobre la creatividad humana, como se observa en este y otros estudios?’

Ya, las características diversas de la salida de texto de los LLM se han convertido en material para memes; y, como informamos en mayo de este año, al menos un autor ya ha autopublicado un libro aparentemente con la fijación de “faros” mencionada, común a los principales modelos.

Así, en un clima donde los editores están retirando cada vez más libros que sospechan que fueron escritos o asistidos por IA, la nueva investigación parecería indicar que podemos esperar un crecimiento de “coincidencias de trama” emergentes de obras aparentemente escritas por humanos, incluidos trabajos académicos presentados por estudiantes.

En cuanto al origen de esta convergencia, los autores hipotetizan que datos de entrenamiento superpuestos y objetivos de optimización cada vez más similares pueden estar empujando a los modelos hacia representaciones internas comparables de conceptos y relaciones semánticas –produciendo, en última instancia, respuestas más parecidas:

‘[Todavía] no está claro si esta homogeneidad es un subproducto temporal de una tecnología aún en desarrollo o una característica inevitable –potencialmente acumulativa– de los modelos estadísticos de lenguaje.’

‘Fuerzas plausibles apuntan en ambas direcciones. Un creciente cuerpo de trabajo académico sugiere que los modelos generativos entrenados con datos superpuestos y optimizados hacia objetivos similares organizarán conceptos y relaciones semánticas de manera cada vez más similar, lo que resulta en salidas similares.’

Sin embargo, los autores también citan trabajos que indican que, a medida que los modelos evolucionan, podrían volver a diverger en sus propios conjuntos de características respecto a la salida creativa.

Método

Para rastrear si los modelos de IA se están volviendo más parecidos, los investigadores comenzaron con preguntas abiertas, recopilando respuestas de generaciones sucesivas de modelos. Cada respuesta se convirtió en una representación numérica de su significado, lo que permitió medir cuán similares o diferentes eran las respuestas.

Regresión se utilizó luego para determinar si esas diferencias se estaban reduciendo a medida que se lanzaban modelos más nuevos:

The authors' schema for measuring whether AI outputs become more similar over time. Open-ended creative prompts are run across different model families, their answers mapped by meaning to measure the distance between them, with regression analysis tracking how those distances change across successive model generations.

Esquema de los autores para medir si las salidas de IA se vuelven más similares con el tiempo. Los prompts creativos abiertos se ejecutan en diferentes familias de modelos, sus respuestas se mapean por significado para medir la distancia entre ellas, y el análisis de regresión rastrea cómo esas distancias cambian a lo largo de generaciones sucesivas de modelos.

Se seleccionaron dos conjuntos de prompts para probar la creatividad desde diferentes ángulos. Primero, la Tarea de Usos Alternativos (AUT), una prueba psicológica estándar de pensamiento divergente, solicita usos poco convencionales para objetos ordinarios; el estudio utilizó objetos como un libro, zapato y martillo. Su formato fijo proporcionó una manera controlada de comparar las ideas producidas por diferentes modelos.

Se destilaron 100 prompts adicionales de Infinity-Chat100, una colección derivada de conversaciones reales con modelos de lenguaje. Estos cubrían tareas creativas menos restringidas que involucraban generación de contenido, resolución de problemas, lluvia de ideas e ideación; tareas que permitían mayor libertad respecto a las respuestas producidas y los enfoques adoptados.

Los conjuntos completos de prompts AUT e Infinity-Chat100 se enviaron a los modelos lanzados entre marzo 2023 y julio 2026, abarcando 12 proveedores y sistemas de Anthropic, Google, Meta, OpenAI, DeepSeek y Mistral AI. Todas las respuestas se recopilaron mediante la API de OpenRouter bajo los mismos ajustes de muestreo, con temperatura (libertad para responder creativamente) y top-p ambos configurados en uno.

Los modelos se ordenaron por mes de lanzamiento para examinar si las generaciones más nuevas producían respuestas más similares.

Dado que las fechas de lanzamiento no capturan realmente cambios en los datos de entrenamiento, la arquitectura o el post‑entrenamiento, los autores trataron la tendencia resultante como una asociación con el desarrollo del modelo, más que como evidencia de que el paso del tiempo en sí cause la convergencia.

Las respuestas de los modelos se convirtieron luego en embeddings usando el all-MiniLM-L6-v2 sentence‑transformer. Cada respuesta se representó como un vector numérico, permitiendo que respuestas con significados similares se ubicaran en direcciones parecidas y que su distancia semántica se midiera.

Para el AUT, todos los usos sugeridos para cada objeto se trataron como una única respuesta, produciendo diez embeddings por modelo. Para Infinity-Chat100, cada respuesta se embebió por separado, produciendo 100 embeddings por modelo.

Los 27 meses de lanzamiento se agruparon en nueve periodos temporales, y solo se compararon modelos de diferentes proveedores. Las distancias semánticas entre sus respuestas se midieron dentro del alcance de cada periodo, con distancias menores indicando mayor similitud.

Para evitar que los proveedores con más modelos dominaran los resultados, el análisis se repitió 1 000 veces, usando muestras equilibradas de cada proveedor.

Resultados

Se utilizó regresión lineal para rastrear esas distancias a lo largo del tiempo, observándose una pendiente negativa constante que indica que los modelos de diferentes proveedores se estaban volviendo más similares:

Initial test results, showing whether creative responses from different AI providers became more similar over time. Semantic distances declined for both the Alternate Uses Task and Infinity-Chat100 prompts, while repeated balanced sampling produced consistently negative trends, indicating increasing similarity across model generations.

Resultados iniciales de la prueba, mostrando si las respuestas creativas de diferentes proveedores de IA se volvieron más similares con el tiempo. Las distancias semánticas disminuyeron tanto para la Tarea de Usos Alternativos como para los prompts de Infinity-Chat100, mientras que el muestreo equilibrado repetido produjo tendencias consistentemente negativas, indicando una creciente similitud a través de generaciones de modelos.

De estos resultados los autores enfatizan:

‘Para ambos conjuntos de respuestas, AUT e Infinity-Chat, observamos una disminución en las distancias de salida entre proveedores a lo largo del período de observación.’

‘Esto sugiere una disminución de la diversidad –o un aumento de la homogeneidad– de las salidas creativas de los LLM con el tiempo.’

La diferencia entre modelos antiguos y nuevos fue más clara en la Tarea de Usos Alternativos. La distancia promedio entre respuestas de diferentes proveedores cayó de alrededor de 0,50 en los modelos más antiguos a menos de 0,40 en los más recientes, lo que indica que sus respuestas se volvieron sustancialmente más parecidas. El mismo patrón se observó con Infinity-Chat100, aunque el cambio fue menor, con la distancia promedio descendiendo de aproximadamente 0,34 a poco más de 0,32.

Test results measuring how quickly answers from the different AI providers became more similar over time. The 'Alternate Uses' Task showed a much stronger decline in differences between models than Infinity-Chat, with both results remaining consistent across the researchers’ repeated sampling tests.

Resultados de la prueba que miden cuán rápido las respuestas de los diferentes proveedores de IA se volvieron más similares con el tiempo. La ‘Tarea de Usos Alternativos’ mostró una disminución mucho más marcada en las diferencias entre modelos que Infinity-Chat, con ambos resultados permaneciendo consistentes en los tests de muestreo repetido de los investigadores.

El hallazgo también sobrevivió a las 1 000 rondas de remuestreo equilibrado. En cada caso, los modelos más nuevos produjeron respuestas más cercanas entre sí que las de los modelos más antiguos. El tamaño de estas disminuciones, junto con los intervalos de confianza del 95 % de los investigadores, se representan arriba.

Respecto a esto, el artículo afirma:

‘La magnitud de la disminución en la AUT es particularmente notable dado el propósito de la tarea. La AUT prueba explícitamente el pensamiento divergente al instruir a los modelos a producir usos que sean lo más originales e inesperados posible, lo que la convierte precisamente en el escenario donde se esperaría que las salidas difirieran.’

Los resultados de Infinity-Chat demuestran que la misma tendencia también apareció en una gama mucho más amplia de tareas creativas. Sus 100 prompts pedían a los modelos producir muchos tipos diferentes de respuestas abiertas, y estas respuestas se volvieron más similares con el tiempo.

El cambio fue menor que en la Tarea de Usos Alternativos, pero se hizo más evidente entre los modelos lanzados a partir de 2025. Los autores sugieren que esto podría ser una señal temprana de que las salidas creativas de diferentes proveedores de IA se están volviendo más parecidas en general, y no solo en un tipo particular de prueba.

Conclusión

Los problemas de convergencia entre LLM y VLM son una fuente de preocupación creciente tanto en la comunidad investigadora como entre los consumidores de los modelos derivados. Estamos llegando al final de la primera y única generación “pura” de datos a la que la escena investigadora tendrá acceso; y la determinación de los proveedores de modelos de exfiltrar los datos de sus rivales inevitablemente arriesga la convergencia, ya que los datos se están volviendo idénticos y los principios de entrenamiento de los modelos son similares, si no idénticos, entre los proveedores.

Por lo tanto, nada tan simple como reemplazar guiones largos probablemente surgirá para combatir la creciente similitud de la salida creativa entre las familias de modelos, y los casos de duplicación, en cambio, probablemente saldrán a la luz de maneras mucho más públicas y embarazosas.

 

* The complete model list is Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; and GLM-5.2

** Énfasis de los autores, no míos.

Mi conversión de las citas en línea de los autores a hipervínculos.

Primera publicación viernes, 21 de agosto de 2026

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai