Ángulo de Anderson
Los modelos de IA prefieren la escritura humana a la escritura generada por IA

Según una nueva investigación, ChatGPT y modelos similares ahora muestran un sesgo claro hacia el texto que creen que fue escrito por humanos, incluso cuando esa creencia es incorrecta. Simplemente llamar al texto “hecho por humanos” dispone a los modelos de IA a favorarlo, e irónicamente, pueden estar aprendiendo este prejuicio de nosotros.
Las nociones de autenticidad, procedencia y experiencia humana compartida pueden tener un papel más importante en el asalto de la IA al sector de la escritura creativa de lo que se había pensado hasta ahora: las pruebas realizadas para un nuevo estudio en Princeton han encontrado que una serie de modelos de lenguaje importantes, tanto de código abierto como cerrado, incluyendo ChatGPT, prefieren lo que creen que son textos “generados por humanos”.
Incluso cuando las etiquetas de las muestras de escritura se invirtieron, tanto los modelos de IA como los participantes humanos continuaron encontrando fallos en el texto escrito por la IA, repitiendo las mismas críticas que habían hecho cuando estaba etiquetado correctamente.
Los investigadores creen que parte de la razón puede ser que la creciente hostilidad humana hacia la IA generativa, que parece manifestarse en nuevos y interesantes eventos todos los días, podría estar alimentando a los sistemas de IA en sí mismos. Notando la medida en que la IA desprecia la escritura de la IA aún más que los humanos, afirman*:
‘Los 13 modelos de IA que probamos demostraron un sesgo del 34,3 por ciento en comparación con los 13,7 por ciento de los humanos, lo que los hace 2,5 veces más susceptibles a las señales de atribución que nuestros evaluadores humanos.
‘Esta amplificación tiene sentido una vez que reconocemos que los modelos contemporáneos están entrenados para evaluar preferencias. El entrenamiento de alineación a través de Aprendizaje de Refuerzo de Retroalimentación Humana (RLHF) enseña explícitamente a los modelos a tratar los juicios humanos como su estándar de oro, instalando efectivamente una prioridad de confiabilidad aprendida.
‘Los modelos aprenden que deferir a las preferencias humanas es recompensado, creando una especie de adulación donde repiten las actitudes esperadas por el usuario en lugar de proporcionar una evaluación independiente.’
Los hallazgos se aplican al dominio de la escritura creativa, con los investigadores utilizando historias de un autor francés distinguido como muestras de datos; e indican que el prejuicio humano contra la IA puede, en el balance, superar cualquier mejora cuantitativa en la construcción del lenguaje que los grandes modelos de lenguaje (LLM) pueden producir a medida que evolucionan, y que la etiqueta “IA” puede estar llegando a significar “inauténtico”, “sustituto” y hasta “de segunda clase” en este dominio.
Muchas de las razones se centran en la práctica y el uso cultural: el papel indica que la creatividad a menudo se describe en términos de novedad, valor y tipicidad, es decir, cuán nuevo parece algo; cuánto es apreciado por expertos; y cuán bien se ajusta a su categoría. Cuando un pasaje se etiqueta como escrito por humanos, los rasgos de género familiares se recompensan como valiosos; cuando se etiqueta como generado por IA, los mismos rasgos se desestiman como no originales.
En efecto, revelar la fuente provoca una reevaluación del mérito de la obra, moldeada por suposiciones sobre cómo se hizo. Una vez que se revela la autoría de la IA, los lectores rechazan instintivamente la posibilidad de descubrimiento individual o intención detrás de la salida.
El papel establece*:
‘En la mayoría de las artes, no hay un estándar de oro para “lo suficientemente creativo”, lo que hace que las señales de procedencia sean primas poderosas que pueden cambiar qué criterio siente más relevante: disciplina artística o novedad conspicua, accesibilidad o dificultad.
‘Dado que los observadores a menudo infieren el proceso del producto, las señales de procedencia empujan los juicios sobre cómo se hizo algo, así como sobre qué es: los movimientos conservadores pueden ser acreditados como artesanía desde un ser humano, pero desestimados como “mera generación” desde un modelo’.
Trece modelos, incluyendo variantes de ChatGPT, Claude, Gemini y Mistral, participaron junto con lectores humanos, con todos calificando las historias más favorablemente cuando se les dijo que eran hechas por humanos, con los LLM mostrando más sesgo que los humanos.
La idea de que los modelos de IA pueden haber absorbido un prejuicio contra su propia salida plantea preguntas sobre dónde se origina ese sesgo. Dado que la escritura de IA no siempre es fácil de identificar, cualquier asociación negativa formada durante el entrenamiento probablemente proviene de ejemplos que están explícitamente etiquetados, ya sea a través de cobertura de noticias de contenido de IA, o artículos auto declarados generados por IA en publicaciones principales.
El nuevo papel se titula Todos prefieren a los escritores humanos, incluyendo a la IA, y proviene de dos escritores del Centro de Humanidades Digitales de Princeton. El trabajo viene acompañado de una liberación de datos relacionada en Zenodo (con una liberación de GitHub citada en el papel, pero el repositorio no estaba activo en el momento de la escritura).
Método
Para explorar cómo la atribución afecta y forma las percepciones de estilo y creatividad, los autores utilizaron Exercices de style, una obra excéntrica de 1947 de Raymond Queneau que reescribe una anécdota simple en 99 estilos diferentes. La historia sigue a un hombre que sube a un autobús, discute con otro pasajero y luego recibe consejos de moda de un amigo.
Aunque es de origen literario, esta estructura anticipa las transformaciones basadas en prompts en los modelos de lenguaje modernos, donde los usuarios solicitan reescrituras en tonos, voces o registros específicos. Este proceso fue llamado una vez transestilización – un marco ahora ecoado en la investigación de IA en el contexto de Style Transfer. Mientras que la mayoría de los métodos computacionales apuntan a cambios funcionales como cambios de sentimiento o desintoxicación, las reescrituras de Queneau apuntan a un contraste estilístico notable.
De una traducción inglesa popular del trabajo de Queneau, se seleccionaron treinta ejercicios que preservaban la narrativa mientras cubrían una amplia gama de estilos. Estos incluyeron formas restringidas como alexandrinos y lipogramas, cambios de registro como noble o abusivo, cambios narrativos como retrogrado y hesitación, y distorsiones juguetonas que involucran spoonerismos, onomatopeyas o latín de perro:

Ejemplos del estudio que muestran cómo GPT-4 reescribió las historias de Queneau en diferentes estilos literarios, emparejados con las descripciones de estilo que los evaluadores humanos y de IA vieron durante las pruebas. Fuente: https://arxiv.org/pdf/2510.08831
Dado que los experimentos de Queneau son difíciles de clasificar, estas categorías son solo agrupaciones aproximadas, con la intención no de probar la recognoscibilidad o el cumplimiento de género, sino de crear condiciones diversas bajo las cuales los lectores humanos y los modelos puedan revelar sus sesgos.
Para producir contrapartes de IA para cada estilo seleccionado, los investigadores utilizaron instrucciones intencionalmente mínimas. Cada modelo recibió la versión más simple de la anécdota de Queneau (el ejercicio de apertura, Notación), junto con una instrucción breve para reescribirla en un estilo específico, como Reescribe la historia como una versión de ciencia ficción. Este enfoque permitió instrucciones que reflejaban el espíritu de las transformaciones originales de Queneau, mientras aún permitían que el modelo interpretara el estilo libremente.
Doble visión
El primer estudio realizado por los autores utilizó GPT-4o para generar todas las variantes de estilo, ya que era el modelo más avanzado disponible en ese momento. Al utilizar un solo modelo, se garantizó que las salidas fueran consistentes, lo que ayudó a aislar el efecto de las etiquetas de atribución, que el estudio buscaba probar.
Las salidas no se editaron para estilo o tono, aparte de los restos de enmarcado como Aquí está la versión reescrita.
En el segundo estudio, el proceso de generación se repitió en trece grandes modelos de lenguaje: Qwen 2.5 72B Instruct, Mistral Nemo, Mistral Medium 3, Llama 4 Maverick, Llama 3.3 70B Instruct, Gemini 2.5 Flash, GPT-4o Mini, GPT-4o, GPT-3.5 Turbo Instruct, DeepSeek RI (0528), DeepSeek Chat v3 (0324), Cohere Command R (08-2024), Claude Sonnet 4, y Claude 3.5 Haiku.
Cada modelo recibió las mismas instrucciones y produjo sus propias versiones de los treinta ejercicios, lo que permitió a los investigadores probar si los efectos de atribución se mantenían en diferentes autores de IA, en lugar de estar vinculados a un solo modelo.
Datos y pruebas
Los investigadores mostraron las mismas parejas de historias a diferentes grupos de personas, pero cambiaron las etiquetas para ver cuánto influía el nombre del autor en las opiniones:
Un grupo vio no nombres de autor en absoluto, solo etiquetas ‘A’ y ‘B’. El segundo grupo vio los nombres correctos, con una versión marcada como escrita por un humano y la otra marcada como escrita por GPT-4o.
Un tercer grupo vio los nombres intercambiados, con la historia ‘IA’ marcada como ‘humana’ y la versión ‘humana’ marcada como ‘IA’:

Visión general del Estudio 1. Los jueces humanos y de IA compararon 30 pares de historias, cada uno conteniendo una versión escrita por Queneau y una por GPT-4. Los jueces se dividieron en tres grupos: uno vio no etiquetas de autor; uno vio las etiquetas correctas; y uno vio las etiquetas intercambiadas – un diseño destinado a probar hasta qué punto los nombres de los autores influyen en las opiniones sobre el estilo de escritura.
Estudio 1
Los investigadores dividieron los 30 estilos creados en conjuntos más pequeños, con cada participante del estudio viendo solo cinco estilos, y cada estilo se probó bajo los tres diseños de etiquetado.
Cada participante vio solo un diseño de etiquetado: el grupo ciego vio no mención de IA, mientras que los otros grupos vieron etiquetas de autor correctas o revertidas. La asignación de grupo, el orden de la historia y la colocación izquierda-derecha se randomizaron.
Los modelos de IA pasaron por el mismo proceso, recibiendo la misma mezcla de estilos y la misma aleatorización. Cada prueba se ejecutó tres veces por modelo para asegurarse de que los resultados fueran consistentes, lo que permitió comparar las reacciones humanas y de IA a las etiquetas de autor.
El Estudio 2 utilizó los mismos tres diseños de etiquetado que antes, pero amplió la prueba para incluir las 420 historias generadas a partir de los 14 diferentes modelos de LLM mencionados anteriormente. Cada modelo juzgó cada historia bajo cada condición de etiquetado, produciendo 1,260 decisiones por modelo, y resultando en 17,596 evaluaciones válidas:

Resultados del Estudio 1. Los jueces humanos y de IA mostraron sesgo basado en las etiquetas de autor. Cuando no se mostraron etiquetas (Ciego), las preferencias estuvieron cerca de ser iguales; cuando se mostraron las etiquetas correctas (Etiqueta abierta), ambos grupos favorecieron el texto escrito por humanos; y cuando las etiquetas se invirtieron (Contrafactual), ambos grupos cambiaron para favorecer el texto que creían que era humano – y este efecto fue mucho más fuerte en los modelos de IA que en los humanos. Las barras de error muestran intervalos de confianza del 95%.
A través de todos los trece modelos, el patrón coincidió con el sesgo humano, pero fue mucho más fuerte: sin etiquetas, los sistemas de IA calificaron los textos humanos y de IA casi igualmente, eligiendo el texto de IA el 49,4% de las veces; cuando la etiqueta de IA era visible, esa preferencia cayó bruscamente al 29,8%, mostrando una clara devaluación del trabajo de IA reconocido; y cuando el mismo texto se etiquetó como humano, la preferencia subió al 64,1%.
La diferencia entre las dos condiciones de etiquetado fue del 34,3%, lo que significa que los modelos de IA cambiaron su preferencia mucho más que los humanos cuando las etiquetas se invirtieron. Además, los modelos fueron muy consistentes en ejecuciones repetidas, confirmando que el sesgo era estable en lugar de aleatorio.
Para comprobar si el sesgo se debía a la redacción de las etiquetas en lugar de a quién escribió el texto, los investigadores realizaron dos pruebas más: una utilizó etiquetas que hacían que la IA sonara más impresionante; y la otra utilizó términos neutrales como ‘autoria de IA’ y ‘autoria humana’.
Ambas pruebas mostraron el mismo sesgo, e incluso cuando los modelos de IA produjeron la misma respuesta cada vez, el sesgo persistió, lo que indica que el sesgo se debe al tipo de etiqueta (‘humano’ o ‘IA’), en lugar de a las palabras exactas utilizadas.
Estudio 2
El segundo estudio encontró el mismo sesgo prohumano en todos los 13 modelos de IA, independientemente de la arquitectura o el proveedor:

Sesgo de atribución para cada uno de los 13 modelos de IA: las barras muestran los tamaños del efecto con intervalos de confianza del 95%, y la línea roja marca la línea base humana. Todos los modelos mostraron un sesgo más fuerte que los humanos, con solo pequeñas diferencias entre ellos.
Cada modelo prefirió las historias etiquetadas como escritas por humanos, con efectos más fuertes que los vistos en las personas. Incluso después de eliminar el caso más extremo, el sesgo promedio permaneció más del doble que la versión humana, lo que sugiere que el efecto no es un error en un modelo, sino un rasgo compartido de los LLM en general.
Conclusión
Aunque, como señala el papel, los estudios anteriores han demostrado que la IA puede producir escritura igual o incluso mejor que la humana, los autores enfatizan que en la literatura, el valor que se le da a la autoría y la autenticidad es una convención antigua y profundamente arraigada:
‘Cuando GPT-4o Mini desestima el enfoque “creativo y humorístico” de Queneau como “exagerado” bajo la etiqueta de atribución de IA, mientras que alaba características idénticas bajo la etiqueta de autoría humana, implícitamente revela cómo estas etiquetas desencadenan suposiciones de que no se produjo un proceso psicológico auténtico.
‘Las señales de procedencia introducen el proceso en lo que de otro modo podría ser un juicio basado solo en el producto: “mera generación” se siente aceptable desde un artesano humano (juzgado como artesanía habilidosa), pero sospechoso desde un modelo (juzgado como recombinación algorítmica).’
Los LLM no son lo suficientemente confiables para la investigación basada en hechos sin supervisión, aunque una supervisión cuidadosa todavía puede hacer que sean productivos; pero la escritura creativa basada en LLM puede enfrentar un futuro más incierto, si las obras creativas generadas por IA se estigmatizan a través de una desaprobación pública más amplia de la invasión de la IA en los dominios humanos, en lugar de basarse en el mérito literario.
Las implicaciones de los hallazgos de estudios de este tipo se ven afectadas considerablemente por la disposición de las empresas y los usuarios individuales a ser honestos sobre si la IA contribuyó o no a su salida. En algunos casos, la falta de voluntad para admitir tal uso puede tener más que ver con piratería de derechos de autor corporativa que con la preocupación de si el público aceptará obras creativas generadas por IA.
Sin embargo, las soluciones legales, financieras y políticas son posibles (aunque muy desafiantes) en cuanto a los derechos de autor. Si se puede hacer que la gente disfrute de obras creativas de IA que no tienen una sola mente humana relatable detrás – eso puede ser un prospecto aún más difícil.
* Por favor, consulte el papel de la fuente para las citas en línea eliminadas. Según sea necesario, estas se incluirán en el artículo.
Publicado por primera vez el lunes 13 de octubre de 2025












