Ángulo de Anderson

Incluso el AI básico puede escribir noticias que pasan como humanas

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated illustration: a stylized orthographic illustration depicting a woman seated at her home office desk reading a laptop, and a cut-away diagram depicting 'Schrodinger's news source' - a box with a robot writing an article, partitioned from a human writing an article. Each has a stylized journalist appearance. The idea being conveyed is that until you actually know who wrote the piece the woman is reading, it could have been a human or a robot. GPT-1.5

Una nueva investigación indica que incluso los modelos de AI locales pequeños pueden escribir noticias que la gente no puede distinguir de la verdadera labor periodística, igualando a los sistemas de alta gama, y dejando a los lectores incapaces de determinar quién escribió qué.

 

Según una nueva colaboración de investigación entre Alemania y Francia, los humanos no pueden determinar si un artículo de noticias es escrito por un AI o un humano, incluso cuando es escrito por modelos de código abierto que se pueden descargar y ejecutar en ordenadores de escritorio de nivel de consumo relativamente promedio.

En otra indicación de que el pequeño AI está en ascenso, una encuesta de 2.318 juicios recopilados de 1.054 participantes en un portal de estudio académico dedicado encontró que los lectores humanos no podían identificar el origen de un artículo a un nivel superior al azar, incluso cuando era generado por modelos relativamente modestos con tan solo siete mil millones de parámetros, incluyendo Mistral y Llama variantes:

Puntuaciones de fuente y autenticidad promedio para LLMs probados. Los 200 mil millones de parámetros de GPT-4o no superan significativamente los 7B parámetros de los modelos más pequeños. Fuente - https://arxiv.org/pdf/2604.03755

Puntuaciones de fuente y autenticidad promedio para LLMs probados. Los 200 mil millones de parámetros de GPT-4o no superan significativamente los 7B parámetros de los modelos más pequeños. Los probados para el estudio fueron Gemma 7B, Phi-3 Mini, LLaMA-2 13B, Mistral 7B, GPT-4o y GPT-3.5. Fuente

Los autores regresan a un tema que examinaron por primera vez en la publicación de 2024 Bendición o maldición? Una encuesta sobre el impacto de la IA generativa en las noticias falsas. Los hallazgos en sí son resultados recién publicados de un proyecto más grande inicialmente anunciado en enero, y hacen uso del marco de participación en línea de los autores JudgeGPT.

Poder ligero

Titulado ¿Pueden los humanos distinguir? Un estudio de doble eje de la percepción humana de las noticias generadas por LLM, y proveniente de tres investigadores en la Universidad de Ciencias Aplicadas de Frankfurt y la unidad de investigación IRISA en Nantes, la nueva investigación hace una importante distinción entre ‘noticias falsas’ y ‘noticias escritas por AI’ (ya que las noticias falsas pueden ser escritas por personas o por AI, y los dos aspectos no son necesariamente sinónimos).

Sin embargo, quizás el aspecto más interesante es la conclusión del documento de que los modelos pequeños, incluyendo Mistral 7B y Gemma 7B, pueden, con solo siete mil millones de parámetros, igualar con aplomo a los likes de un modelo ChatGPT (4o) con 200 mil millones de parámetros:

‘Los modelos de peso abierto con tan solo 7B parámetros producen texto calificado de la misma manera que la salida de GPT-4o, lo que indica que la capacidad de generar texto indistinguible del humano ya no se limita a los modelos de vanguardia.’

Sin embargo, ‘las noticias generadas por AI’ pueden representar muchos tipos diferentes de colaboración humano/AI, desde la corrección ortográfica hasta la deferencia total de esfuerzo, y el estudio no aclara exactamente qué tipo de contenido de AI se produjo para las pruebas (aunque describe la metodología para producirla – véase abajo).

Método

Para los participantes comprometidos con la plataforma JudgeGPT, cada fragmento de noticias se evaluó utilizando un marco de doble eje en el que proporcionaron tres calificaciones independientes en controles deslizantes continuos de 0-100:

La interfaz de usuario del portal JudgeGPT, donde los calificadores evalúan el material en atribución de fuente; autenticidad; y familiaridad con el tema.

La interfaz de usuario del portal JudgeGPT, donde los calificadores evalúan el material en atribución de fuente; autenticidad; y familiaridad con el tema. Por favor, refiérase al documento de origen para una mejor resolución.

El juicio de la fuente capturó si un pasaje parecía escrito por máquina o por un humano; el juicio de autenticidad, si se percibía como falso o legítimo; y la familiaridad con el tema, cuánto conocía el lector el tema.

Se utilizaron escalas continuas en lugar de una escala de Likert, para capturar grados de certeza con más precisión, y para respaldar el análisis estadístico, incluyendo correlación de Pearson y agrupación.

Los fragmentos de texto generados por máquina se produjeron mediante el marco RogueGPT de los autores, la arquitectura de alimentación para JudgeGPT. RogueGPT orquesta contribuciones de seis grandes modelos de lenguaje (LLM): ChatGPT-4; ChatGPT-3.5; ChatGPT-4o; LLaMA-2 13B; Gemma 7B; y Mistral 7B.

Se utilizó una llamada basada en personalidad para generar los textos, y las generaciones de AI se basaron en temas de noticias reales y se verificaron con hechos por humanos.

Por el contrario, los fragmentos escritos por humanos se extrajeron de ‘medios de comunicación establecidos’ y ‘bases de datos de información’ no especificadas.

Los autores observan:

‘El conjunto de estímulos está intencionalmente sesgado hacia fragmentos de origen de máquina (98%), con elementos de origen humano que sirven como anclajes de calibración.

‘Esta elección de diseño refleja el enfoque del estudio en la variación dentro de la IA (a través de modelos) en lugar de la comparación humano-AI; a los participantes no se les informa de la tasa base, y los resultados de detección casi aleatorios [resultados] se mantienen cuando se analizan en el subconjunto de origen humano solo.’

Los participantes primero dieron su consentimiento informado y completaron un cuestionario demográfico que cubría la edad, la educación, la orientación política y la familiaridad con la IA, después de lo cual evaluaron la secuencia de fragmentos de noticias.

Cada persona revisó entre 5-87 elementos, con una mediana de 12, mientras que el orden de presentación se aleatorizó, y la asignación de modelo se equilibró entre los participantes, para reducir el sesgo. La plataforma grabó las tres calificaciones de los controles deslizantes junto con el tiempo de respuesta y un identificador anónimo, lo que permitió vincular los juicios individuales con factores de fondo.

Los autores se esfuerzan por señalar que la muestra se inclinó hacia participantes europeos educados, con el 68% con educación universitaria, y el 74% con sede en Europa – un sesgo que el documento señala como una limitación para una generalización más amplia.

Pruebas

Las pruebas se dividen en cinco tipos de hallazgos: distinguir el texto generado por máquina del escrito por humanos; comparar la detección a través de diferentes LLM; examinar el efecto de la experiencia en el dominio versus la orientación política en la precisión; identificar estrategias de respuesta distintas entre los participantes; y rastrear cómo la precisión cambia con las evaluaciones repetidas, debido a la fatiga:

Resumen de los cinco hallazgos principales de 2.318 juicios a través de 1.054 participantes, que muestra que la detección humana de texto escrito por AI permaneció en niveles de azar en todos los modelos, que la precisión se vinculó a la experiencia en el dominio en lugar de la orientación política, que los participantes se agruparon en perfiles de confianza distintos, y que el rendimiento disminuyó después de aproximadamente 30 evaluaciones, debido a la fatiga cognitiva.

Resumen de los cinco hallazgos principales de 2.318 juicios a través de 1.054 participantes, que muestra que la detección humana de texto escrito por AI permaneció en niveles de azar en todos los modelos, que la precisión se vinculó a la experiencia en el dominio en lugar de la orientación política, que los participantes se agruparon en perfiles de confianza distintos, y que el rendimiento disminuyó después de aproximadamente 30 evaluaciones, debido a la fatiga cognitiva.

La prueba mostró que no había una diferencia significativa por encima del azar en las puntuaciones de fuente entre las condiciones, lo que aparentemente indica que los participantes no pueden distinguir el texto generado por AI del contenido humano:

Distribuciones de puntuaciones de fuente y autenticidad para fragmentos de origen de máquina y humano muestran una superposición sustancial, sin una separación significativa entre las dos condiciones, y pruebas estadísticas – que indican que los participantes no pudieron distinguir de manera confiable el texto generado por AI del contenido escrito por humanos.

Distribuciones de puntuaciones de fuente y autenticidad para fragmentos de origen de máquina y humano muestran una superposición sustancial, sin una separación significativa entre las dos condiciones, y pruebas estadísticas – que indican que los participantes no pudieron distinguir de manera confiable el texto generado por AI del contenido escrito por humanos.

En cuanto al segundo aspecto, como se muestra en el gráfico al comienzo del artículo, el fracaso de la detección no varió según el modelo, ya que las salidas de todos los LLM se agruparon alrededor de juicios de nivel de azar, sin diferencias significativas entre ellos. Incluso los sistemas de peso abierto más pequeños, como Mistral 7B y Gemma 7B, se calificaron de la misma manera que GPT-4o, lo que indica que el texto indistinguible del humano ya no se limita a los modelos más grandes.

En cuanto al tercer aspecto, la precisión se vinculó más fuertemente a la experiencia en el dominio que a la orientación política, ya que la familiaridad con las noticias falsas se correlacionó con mejores juicios, mientras que las vistas políticas no mostraron un efecto significativo, lo que sugiere que las habilidades analíticas aprendidas pueden ser más importantes que la ideología:

Resultados relacionados con la tercera línea de investigación: las correlaciones a nivel de participante entre los rasgos de fondo y la precisión de los juicios demostraron que la orientación política no tuvo un efecto significativo en la atribución de fuente o la puntuación de autenticidad, con solo tendencias débiles y no significativas en ambas medidas. Al mismo tiempo, la familiaridad autoinformada con las noticias falsas se asoció consistentemente con una mayor precisión en ambos ejes, como se refleja en correlaciones positivas moderadas y pendientes de regresión ascendentes. Los autores afirman que esto significa que la habilidad analítica basada en la experiencia (en lugar de la posición ideológica) fue el predictor más fuerte del rendimiento en la evaluación de las noticias generadas por AI y humanas. Por favor, refiérase al documento de origen para una mejor resolución.

Los resultados de la tercera línea de investigación mostraron que la orientación política no tuvo un efecto significativo en la atribución de fuente o la puntuación de autenticidad, con solo tendencias débiles y no significativas, mientras que la familiaridad autoinformada con las noticias falsas se asoció con una mayor precisión en ambos ejes. Esto sugiere que la habilidad analítica basada en la experiencia fue un predictor más fuerte del rendimiento que la posición ideológica. Por favor, refiérase al documento de origen para una mejor resolución.

El cuarto hallazgo mostró que los participantes se agruparon en dos estilos de respuesta distintos identificados como ‘Escépticos’ – que asignaron una confianza baja en todo el contenido, independientemente de su origen – y ‘Creyentes’ – que mantuvieron un nivel de confianza más alto.

Finalmente, en cuanto al quinto objetivo, un análisis de juicios secuenciales mostró que los participantes inicialmente se volvieron mejores en la tarea, con la precisión que mejoraba durante las primeras 15-20 evaluaciones, a medida que se adaptaban al formato:

Promedios móviles de puntuaciones de atribución de fuente y autenticidad a través de la secuencia de evaluaciones de los participantes muestran una fase de mejora inicial, a medida que los usuarios parecen adaptarse a la tarea durante las primeras 15-20 entradas, seguida de una disminución constante en ambas medidas después de aproximadamente 30 evaluaciones. Las puntuaciones caen hacia las respuestas predeterminadas – un patrón interpretado en el estudio como fatiga cognitiva. Por favor, refiérase al documento de origen para una mejor resolución.

Promedios móviles de puntuaciones de atribución de fuente y autenticidad a través de la secuencia de evaluaciones de los participantes muestran una fase de mejora inicial, a medida que los usuarios parecen adaptarse a la tarea durante las primeras 15-20 entradas, seguida de una disminución constante en ambas medidas después de aproximadamente 30 evaluaciones. Por favor, refiérase al documento de origen para una mejor resolución.

Sin embargo, este efecto fue de corta duración, ya que el rendimiento comenzó a disminuir después de alrededor de 30 elementos, con los participantes que cada vez más etiquetaban el contenido como falso – un cambio interpretado como fatiga cognitiva, y que sugiere límites claros sobre cuánto tiempo pueden permanecer efectivos los enfoques basados en la detección, en la práctica.

Esto puede representar algunas pruebas empíricas de que, agotados por la perspectiva de distinguir las noticias falsas de las reales, las noticias de AI de las humanas, podemos tender a default a asumir que las noticias son de AI y/o falsas (no necesariamente lo mismo), para estar ‘en el lado seguro’. Aquellos que consideran esto ‘perezoso’, y consideran que la gente debería hacer su propia investigación para verificar una posible noticia falsa, podrían estar interesados en saber que un estudio de 2024 indicó que esto solo empeora el problema.

Los autores sugieren que el fracaso del juicio humano que se manifiesta en los resultados indica que podemos necesitar delegar estos asuntos a tecnologías de procedencia criptográfica, como la iniciativa C2PA liderada por Adobe. Otras posibles soluciones mencionadas son el marco OriginLens de los autores, y otro proyecto involucrado llamado CRED-1.

Los autores concluyen:

‘¿Pueden los humanos distinguir? Nuestro estudio de doble eje de 2.318 juicios a través de seis familias de LLM proporciona una respuesta empírica clara: no pueden.

‘El texto generado por máquina es indistinguible del escrito por humanos, independientemente del tamaño o la familia del modelo, la experiencia en el dominio predice la precisión de la detección más que la orientación política, los participantes adoptan estrategias de confianza distintas, y la fatiga cognitiva limita la detección sostenida.

‘Estos hallazgos respaldan un cambio desde la detección a nivel de usuario hacia contramedidas a nivel de sistema, incluyendo la procedencia del contenido, indicadores de confianza adaptativos y intervenciones de inmunización limitadas.’

Conclusión

El aspecto preocupante de este documento es la red de apoyo de proyectos y documentos que los autores – o algunos de los autores, dependiendo del trabajo – han originado o en los que han participado; y ciertamente habría sido iluminador poder estudiar muestras de texto de AI y humano que produjeron estos resultados, para poder entender mejor el tipo de salida que produce la metodología de generación descrita.

No obstante, es intrigante saber que los modelos de peso abierto y de código abierto pueden compararse con gigantes de la API como la serie ChatGPT – ¿puede ser que la tarea en cuestión no sea tan difícil, y que un modelo de 200 mil millones de parámetros sea un exceso para tales tareas? Necesitaríamos saber un poco más sobre las muestras de texto de AI y humano presentadas en las pruebas para responder a esa pregunta.

Mientras tanto, según el sitio web canirun.ai, Mistral 7B (que estuvo más o menos al mismo nivel que ChatGPT-4o en las pruebas) ‘funciona bien’ en una NVIDIA RTX 3080 con 16GB de VRAM, y funciona ‘decentemente’ en una 3060 con 6GB de VRAM – apenas las tarjetas gráficas más nuevas o mejores en juego*. Así que cualquiera que desee desarrollar su propia metodología para la presentación de muestras puede aparentemente participar en estos experimentos también.

 

* Gemma 7B no está enlistada en el sitio.

Publicado por primera vez el jueves 9 de abril de 2026

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]