Ángulo de Anderson

La IA puede ayudar a identificar noticias de “carne rosa”

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated illustration featuring two 'perfect' and typical US-style newsreaders in a news anchor room – an older male and younger blonde female both Caucasian, with robots and technicians in the background. Z-Image, Firefly 3, et al.

Las fábricas de opinión con agendas, diseñadas más para influir en la opinión pública que para servir al público, pueden ser más difíciles de detectar si se utilizan IA para hacer que suenen más originales y racionales. Así que la carrera está en marcha para mantenerse por delante en el juego de la detección de “carne rosa”.

 

La desfinanciación de los medios de comunicación locales tradicionales en los últimos veinte años, tanto debido a las tendencias de los medios en evolución como a la política del gobierno de EE. UU., ha dejado un vacío en la cobertura regional que ha sido ansiosamente ocupada por organizaciones partidistas que utilizan IA para impulsar sus agendas.

Para poner el término “partidista” en contexto (dado que ninguna organización de noticias está exenta de tendencias políticas de algún tipo), estamos hablando de empresas petroleras que operan sitios de noticias regionales desde ubicaciones distantes, sin recursos locales reales, pero con el objetivo de defender la reputación pública de la empresa; sitios de noticias políticamente motivados privados de cualquier flujo de ingresos que se preparan para las elecciones; y redes enteras de sitios de noticias pro-republicanos que aparecen de la nada, cerca del momento de la votación.

En 2024, se estimó que las noticias de “carne rosa” impulsadas por IA finalmente habían superado a los medios de comunicación genuinos; en ese momento, una encuesta australiana encontró que el 41% de los consumidores preferían fuentes de “carne rosa” sobre fuentes “reales”.

Este tipo de electoralismo encubierto, podría argumentarse, ha evolucionado de un simple arte oscuro a una amenaza existencial para la democracia (en cuanto a los medios políticamente motivados) y para la confianza del público en los estándares razonables de equidad en la cobertura.

Por lo tanto, los métodos para distinguir la salida característica de los editores y emisores de “carne rosa” de las organizaciones de medios tradicionales serían de gran ayuda, al menos para entender quiénes son los jugadores y las fuerzas impulsoras en el clima de la información actual.

Como está, los tópicos y plantillas de las organizaciones de noticias reales son muy fáciles de imitar, y la IA hace que la publicación escalable sea una realidad actual y asequible, utilizando muchos de los mismos trucos que están siendo adoptados por los editores y emisores de “viejos medios” con presupuestos ajustados.

Señal y ruido

Un nuevo estudio de EE. UU. aborda este problema, investigando el uso creciente de los Grandes Modelos de Lenguaje para hacer que los sitios web de “carne rosa” suenen menos genéricos y fáciles de detectar, y creando un marco de aprendizaje diseñado para mantenerse al día con los cambios evolutivos en la salida de “carne rosa” (PS).

Titulado Exponiendo el periodismo de “carne rosa”: firmas lingüísticas y detección robusta contra amenazas generadas por LLM, el nuevo trabajo proviene de cinco investigadores de la Universidad de Texas.

El nuevo trabajo investiga cómo difieren los artículos de noticias locales producidos en masa de la cobertura legítima, centrándose en su dependencia de estructuras cortas y repetitivas y frases templadas con mínima variación; y los autores señalan que los artículos de “carne rosa” tienden a reutilizar plantillas idénticas diseñadas para manipular la opinión pública, con apelaciones a la emoción en lo más alto del contenido:

De la nueva investigación - múltiples sitios publican artículos casi idénticos con solo los detalles de la ubicación cambiados, lo que revela una estrategia de copia y pega utilizada para producir en masa contenido que imita a las noticias locales legítimas. Fuente - https://arxiv.org/pdf/2512.05331

De la nueva investigación – múltiples sitios publican artículos casi idénticos con solo los detalles de la ubicación cambiados, lo que revela una estrategia de copia y pega utilizada para producir en masa contenido que imita a las noticias locales legítimas. Fuente

Los modelos de detección tradicionales entrenados en estos rasgos funcionan bien contra este contenido, pero fallan cuando los artículos se reescriben utilizando chatbots de IA para parecer más naturales o sofisticados.

Los propios tests de los autores indican que incluso los cambios estilísticos menores introducidos por los grandes modelos de lenguaje pueden reducir la precisión de la detección en hasta un 40%. Para mitigar esto, proponen un marco de aprendizaje continuo que entrena incrementalmente los modelos de detección en artículos originales y reescritos por IA, para adaptarse a los patrones lingüísticos cambiantes.

Método

Para establecer datos para el proyecto, los autores utilizaron el Conjunto de datos de “carne rosa”, que cuenta con 7,9 millones de artículos que cubren 1.093 medios durante 2021-2023, de los cuales obtuvieron 9.472 artículos de “carne rosa” después de filtrar. También utilizaron el conjunto de datos LIAR, que contiene noticias falsas anotadas, así como el conjunto de datos NELA-GT-2021, que contiene solo artículos de EE. UU.

Para preparar sus conjuntos de entrenamiento y prueba, los autores utilizaron primero el algoritmo de T-distributed Stochastic Neighbor Embedding (t-SNE) para reducir las incrustaciones de los artículos a dos dimensiones. Luego aplicaron el algoritmo de agrupación de datos DBSCAN para aislar clusters de artículos de “carne rosa” similares.

Cada cluster se trató como un grupo de historias relacionadas, muchas de las cuales seguían la misma plantilla, a pesar de un esfuerzo concertado para abordar los duplicados.

Para evitar que artículos similares aparecieran en ambos conjuntos de entrenamiento y prueba, se seleccionaron clusters enteros de forma aleatoria, con el 80% utilizado para entrenamiento y el 20% para prueba. Dado que los artículos de noticias legítimas no formaban clusters claros, se aplicó una división aleatoria en su lugar.

Este proceso se repitió tres veces, para asegurar la consistencia, y para reducir el sesgo de muestreo.

Características de la “carne rosa”

Comentando sobre los rasgos distintivos de la “carne rosa” frente a las noticias regulares, los investigadores afirman que los artículos de noticias locales de “carne rosa” son significativamente más cortos y simples que la cobertura legítima, con un promedio de menos de nueve oraciones por artículo.

Una mayor proporción de oraciones simples y una mayor dependencia de adjetivos son otras características de la “carne rosa”, según el documento, e indican una tendencia a un lenguaje repetitivo y emocionalmente cargado.

La riqueza léxica se midió utilizando la Relación de Raíz-Tipo-Token (RTTR), y se encontró que era notablemente más baja en los artículos de “carne rosa”, que también exhibían muchas menos frases nominales únicas.

Estos patrones denotan un vocabulario limitado y un estilo formulaico, en contraste con las noticias locales legítimas, que se caracterizan por patrones de partes del habla complejos construidos alrededor de verbos auxiliares, pronombres y conjunciones. En cambio, los artículos falsos favorecen estructuras básicas de sustantivo-preposición, con un uso frecuente de trigramas basados en puntuación, lo que sugiere un estilo de escritura menos formal y más fragmentado.

Pruebas

Para examinar las asociaciones entre diferentes tipos de artículos de noticias, basadas en características lingüísticas y estructurales, se generaron incrustaciones utilizando el modelo stella_en_400M_v5 de 435 millones de parámetros, y se redujeron con Análisis de Componentes Principales (PCA) y t-SNE para visualización.

Cuando se proyectaron en dos dimensiones, los artículos de noticias locales falsos formaron pequeños clusters densos, cada uno correspondiente a temas estrechamente enfocados como estadísticas de delincuencia, actualizaciones de acciones o donaciones benéficas:

Patrones de agrupación de una proyección t-SNE revelan que los artículos de “carne rosa” forman grupos repetitivos y apretados, mientras que las noticias legítimas muestran distribuciones más amplias y variadas alineadas con la diversidad de temas y estilo.

Como se puede ver, en cierta medida, en la visualización anterior, este patrón sugiere un formato rígido y dirigido por plantillas, con mínima variación entre artículos.

Resulta interesante que los artículos etiquetados como “noticias falsas” se desviaron del contenido local falso, mostrando una distribución más en línea con las noticias reales, lo que indica que la producción en masa de noticias locales falsas puede no ser simplemente menos veraz, sino también mecánicamente distinta en forma y composición.

Por contraste, las noticias locales legítimas forman menos clusters y más espaciados, consistentes con un lenguaje y materia más diversos, mientras que los artículos de noticias nacionales muestran una dispersión aún mayor, reflejando un rango de temas más amplio y una consistencia estilística más suelta.

Comparaciones de características entre noticias locales legítimas y contenido de “carne rosa”, que indican que los artículos de “carne rosa” son más cortos, utilizan estructuras de oraciones más simples, contienen más adjetivos, exhiben una menor riqueza léxica, favorecen trigramas básicos de partes del habla y contienen menos frases nominales únicas.

Detección

Los investigadores evaluaron dos enfoques principales para detectar contenido de “carne rosa”: clasificación, basada en características lingüísticas elaboradas a mano; y ajuste fino basado en transformadores.

Para el enfoque elaborado a mano, se enfatizaron las características estructurales en lugar de las semánticas, utilizando el recuento de oraciones; riqueza léxica; profundidad sintáctica; probabilidades de co-ocurrencia de partes del habla; probabilidades de co-ocurrencia de etiquetas de dependencia; legibilidad; y recuento de partes del habla.

Se probaron tres modelos en este conjunto de características: XGBoost; Random Forest; y Máquina de Vectores de Soporte (SVM) – con Random Forest mostrando resultados ligeramente más fuertes en general.

El XGBoost y el Random Forest asignaron una gran importancia predictiva a características como el recuento de oraciones y el número de frases nominales únicas. La legibilidad y las medidas de riqueza léxica también influyeron en la clasificación con fuerza, aunque los modelos ponderaron estas de manera diferente, con XGBoost favoreciendo Flesch y RTTR, mientras que Random Forest se inclinó hacia CTTR:

Puntuaciones de importancia de características basadas en SHAP (SHapley Additive exPlanations) resaltan cómo cada característica de entrada influye en la salida del modelo a través de las muestras. En este caso, los valores de SHAP revelan que tanto XGBoost como Random Forest se basaron en gran medida en el recuento de oraciones y las frases nominales únicas para distinguir la “carne rosa” de las noticias reales, mientras que asignaban diferentes pesos a las medidas de riqueza léxica y legibilidad.

Como se ve en las comparaciones de características anteriores, los artículos de “carne rosa” favorecen el sensacionalismo sobre el detalle, con una menor riqueza léxica y con menos frases nominales distintas – lo que refuerza la conclusión de que este tipo de contenido es altamente templado y repetitivo.

Los patrones de trigramas de partes del habla confirman que las noticias locales legítimas tienden a utilizar formas estructuralmente más complejas, que involucran auxiliares, pronombres y conjunciones, mientras que la “carne rosa” favorece la sintaxis mínima o fragmentada. Estos patrones sugieren una base confiable para distinguir el contenido sintético local de la verdadera labor periodística.

Una segunda ronda de pruebas involucró el ajuste fino de modelos de transformadores en texto de artículos completos, para capturar tanto el contenido semántico como la estructura sintáctica.

BERT, XLNet y Flan-T5 se probaron, con BERT logrando la puntuación F1 más alta con un 89,31% – aunque el documento señala que las diferencias en el rendimiento no fueron estadísticamente significativas. A diferencia de los clasificadores elaborados a mano, estos modelos actualizan todos los pesos durante el entrenamiento, lo que les permite aprender representaciones específicas de la tarea directamente a partir de los datos.

Un método adicional basado en incrustaciones utilizó un clasificador completamente conectado aguas abajo que funcionó mejor que los modelos elaborados a mano, pero no igualó la precisión del ajuste fino completo.

Estos enfoques se beneficiaron de un contexto lingüístico más amplio – lo que es ventajoso, dado que los artículos de “carne rosa” a menudo reciclan contenido a través de varios medios. Las características elaboradas a mano, por otro lado, dependen solo de la sintaxis de superficie, lo que limita su capacidad para generalizar a través de las fuentes.

Mejorando la “carne rosa” con LLM

Para probar si los artículos de “carne rosa” podían hacerse más difíciles de detectar, los investigadores los reescribieron utilizando grandes modelos de lenguaje. Se diseñaron instrucciones para mejorar el estilo de escritura expandiendo el contenido, agregando complejidad a las oraciones, reduciendo el uso excesivo de adjetivos, imponiendo un tono neutral, utilizando un vocabulario más variado y aumentando el número de frases nominales únicas, con el objetivo de ocultar los rasgos de superficie en los que se basan la mayoría de los sistemas de detección.

Los modelos probados fueron Gemma-2B; Mistral-7B; Llama-1B; Llama-3B; Llama-8B; Qwen-7B; GPT-4o mini; y Claude-3.5-Haiku.

Rendimiento de detección (F1) de un clasificador BERT ajustado cuando los artículos de “carne rosa” se reescriben con diferentes LLM. Las puntuaciones más bajas indican una ocultación más exitosa.

De estos resultados, los autores comentan:

‘[Entre] los modelos de código abierto, Qwen fue el más efectivo para evadir la detección: cuando se probó contra un clasificador BERT previamente ajustado (puntuación F1 de referencia: 89%), provocó una caída del 28,34% en el rendimiento de detección.

‘Los modelos de código cerrado fueron significativamente más potentes, con GPT-4o-mini y Claude-3.5-Haiku reduciendo la puntuación F1 en un promedio del 40%, lo que destaca el desafío planteado por la ocultación generada por LLM de alta calidad.’

Estos resultados, según los autores, muestran cuán fácilmente los LLM pueden disfrazar el contenido de “carne rosa”, lo que hace que sea mucho más difícil para las herramientas actuales detectarlo**.

Conclusión

Opinión Esta línea de investigación contiene algunas cuestiones interesantes, no la menor de las cuales es que muchas personas (según al menos una encuesta mencionada anteriormente) apoyan el contenido de “carne rosa”, sabiendo lo que es, lo que pone en cuestión el contexto peyorativo. Es como si la gente supiera que “Soylent Green es personas”, pero se encogieran de hombros y siguieran comiendo; o así puede parecer, desde una sensibilidad liberal.

Esta indiferencia pública hacia las noticias algorítmicas puede evolucionar e incluso dar marcha atrás – pero por ahora, parece que se está profundizando.

Otra cosa que me llamó la atención al leer el documento fue la forma en que la prosa más simple y la reducción del contenido de “carne rosa” se trataron como una deficiencia con una posible solución tecnológica, cuando el minimalismo, el emocionalismo y el vocabulario limitado son, en gran medida, intencionales.

Si los diversos grupos de interés detrás de la “carne rosa” quieren extender su alcance a una audiencia más intelectual o liberal (aunque esto podría no jugar a sus fortalezas), parece más probable que establezcan un campamento más cerca de su audiencia objetivo (aunque esto podría no ser su punto fuerte), en lugar de cambiar un estilo de lenguaje y un tono que ya parecen estar logrando sus objetivos en las plataformas existentes.

 

* Debido a un formato desafortunado en el documento, la fuente adicional de artículos de noticias locales no tiene una atribución clara. Por favor, consulte el documento de origen y adivine qué referencia de “Horne” se aplica.

** Aquí nos referimos al lector al documento de origen para obtener detalles de los experimentos secundarios y suplementarios que cierran la sección de resultados del nuevo documento.

Publicado por primera vez el viernes 12 de diciembre de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai