Ángulo de Anderson
Combatiendo la chatarra de IA en los artículos científicos

La IA hace todo a gran escala, desde raspado web a nivel de ataque DOS hasta producir, o habilitar, volúmenes tan vastos de presentaciones de investigación científica que el resultado se está convirtiendo tanto en una crisis logística como en una crisis de calidad, a medida que la relación señal‑ruido sigue volviéndose intransitable.
La semana pasada, el servidor de preimpresiones arXiv anunció que implementará una nueva política de limitación de velocidad para los remitentes, que ahora estarán limitados a dos envíos por mes. La medida se ha tomado, sugiere el anuncio, ante un vertiginoso aumento en las tasas de envío en un corto período de tiempo:

Envíos mensuales a la categoría cs.AI de arXiv desde enero de 2024 hasta septiembre de 2026, mostrando un aumento de más de seis veces durante el período. Fuente
El artículo del blog de Kat Boboris anunciando la medida, que generó comentarios en Hacker News el pasado jueves, declaró que arXiv recibió 40,363 envíos en septiembre de 2026 – casi el doble de los 20,569 recibidos en septiembre de 2024, y más de cuatro veces los 9,869 recibidos en septiembre de 2016.
Las presentaciones del último mes, observó Boboris, también generaron casi 9,000 tickets de soporte para el personal y los moderadores de arXiv:
‘Nuestros moderadores están observando un aumento de artículos escasos de alcance limitado, así como artículos ‘salami’, donde un único trabajo se divide y se envía como un conjunto de artículos más pequeños. ‘
‘También hay un aumento notable de artículos densos escritos por IA. Las herramientas de IA están facilitando que los autores inunden arXiv y otros repositorios con estos artículos de bajo valor.’
Ya, en mayo de este año, arXiv tomó la medida de implementar una prohibición de un año para contenido de IA sin control; y en octubre del año pasado, indicó a los remitentes de artículos de encuesta y de posición (ambos pueden generarse con menos esfuerzo que un estudio académico completo) que necesitarían respaldo de pares para ser publicados en arXiv.
Por el momento, la limitación a menudo obstructiva de solicitudes http del dominio arXiv no es muy evidente, y solo se puede esperar que sus muy útiles feeds RSS sobrevivan a este continuo recorte. La semana pasada Reddit anunció la temida eliminación total de sus feeds RSS, que tendrá lugar a partir de mediados del próximo mes. Sin embargo, el carácter sin fines de lucro de arXiv significa que hay poco capital similar que se pueda obtener al dirigir a los lectores a visitas obligatorias al sitio, o inicios de sesión forzados – al menos, por ahora.
Contra la marea creciente
Ante tales problemas graves y crecientes sobre el efecto negativo del uso de IA en la investigación científica – especialmente en lo que respecta a la investigación relacionada con IA, que ha eclipsado a todas las demás categorías, y ha pasado de la oscuridad a convertirse en un signo político y económico recientemente – ha surgido una corriente de investigación que examina formas de contrarrestar la disminución en la calidad de los envíos de artículos relacionados con IA.
Lo último para abordar el problema surge en forma de una colaboración entre la Universidad Nacional de Seúl de Corea y la Universidad de Minnesota en EE. UU. El artículo, titulado Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers, propone medir la ‘chatarra científica’ mediante fallas en las conexiones entre las afirmaciones, evidencias, citas y la estructura de un artículo:

Del nuevo artículo, una visión general del enfoque del trabajo sobre la ‘chatarra científica’, mostrando cómo las fallas en la estructura, el argumento y los artefactos de apoyo pueden revelar debilidades que los detectores convencionales de texto IA pasan por alto. Fuente
A diferencia de los enfoques anteriores, el nuevo sistema mira más allá del texto mismo para evaluar si las afirmaciones del artículo están adecuadamente respaldadas por sus argumentos, evidencias y citas. Los autores afirman*:
‘Cada parte de un artículo puede parecer plausible de forma aislada, por lo que esas fallas son invisibles para los detectores a nivel de token y solo pueden identificarse o repararse a nivel del artículo completo. Para medir y mitigar la chatarra científica, este artículo aborda tres desafíos.
‘Primero, las métricas a nivel de token no capturan cómo el razonamiento científico se conecta a lo largo de un artículo. Las secciones, afirmaciones, citas, evidencias y artefactos pueden parecer plausibles mientras que las relaciones entre ellos se desintegran. Observamos repetidamente tales fallas en artículos generados de extremo a extremo por IA, y los revisores de ICLR ya los penalizan incluso en presentaciones escritas por humanos.
‘En segundo lugar, la detección de estos patrones sigue sin medirse. Los conjuntos de prueba existentes etiquetan solo el texto, por lo que la medida en que los detectores, incluidos los LLM que leen todo el documento, identifican estos patrones nunca se ha medido.
‘En tercer lugar, estos patrones son difíciles de mitigar de manera fiable. Mientras que las señales a nivel de token puede eliminarse mediante la paráfrasis, reparar estos patrones requiere restaurar las relaciones faltantes sin cambiar la ciencia subyacente.’
El nuevo benchmark de los autores, llamado SciSlopBench, se ha incorporado en SciSlopHarness, un marco diseñado para detectar y reparar fallas en el razonamiento científico de un artículo, mientras se preserva la evidencia científica subyacente:

Ejemplos que comparan pasajes defectuosos con revisiones realizadas por SciSlopHarness. Las adiciones no respaldadas son rechazadas, mientras que las afirmaciones se reordenan o reescriben donde sea necesario para reflejar mejor la evidencia disponible en el artículo.
El benchmark SciSlopBench en sí se construyó a partir de 390 artículos generados por IA, cada uno emparejado con un artículo escrito por humanos que aborda un problema de investigación similar y un tipo de contribución comparable.
En pruebas, SciSlopBench se utilizó para distinguir entre 390 pares de artículos, cada par compuesto por el mencionado artículo generado por IA y un artículo escrito por humanos emparejado por problema de investigación y tipo de contribución. El benchmark identificó correctamente el artículo generado por IA en el 85,9 % de estas comparaciones, superando sustancialmente a los detectores convencionales de texto IA.
Los autores afirman:
‘Mientras que las revisiones estándar dejan slop residual y los prompts conscientes de slop desencadenan manipulación de recompensas, SciSlopHarness reduce la brecha AI–humano restante en un 63 % respecto a la línea base de revisión más fuerte sin requerir objetivos de referencia humanos.’
‘En general, demostramos que los artículos científicos generados por IA dejan rastros fundamentales en su razonamiento global, y que una mitigación responsable exige una base de evidencia estricta en lugar de una mera refinación del estilo.’
Además de las contribuciones realizadas por el propio artículo, los autores han puesto en práctica los principios de su nuevo trabajo en forma de una demostración en vivo donde los usuarios pueden enviar artículos científicos para analizar la cantidad de slop de IA que contienen.
Curiosamente, el propio artículo nuevo, analizado por la demostración, obtiene una puntuación de ‘slop’ moderada de 40/100†:

El nuevo artículo, analizado por su propio algoritmo, marca áreas de ‘slop’ mediante el nuevo proceso de los autores. Fuente
Método y Enfoque de Datos
La colaboración 2025 Por qué el Slop Importa describió la ‘competencia superficial’ como una característica definitoria del slop de IA, donde la calidad aparente oculta una falta de sustancia. El nuevo trabajo aplica esta idea más específicamente a los artículos científicos, definiendo ‘slop científico’ como fallas que dificultan seguir cómo se organiza un estudio; cómo se respaldan sus afirmaciones; y cómo pueden examinarse sus métodos y evidencia, agrupando las fallas en estructura; argumento; y artefactos:

Reglas de medición para los seis tipos de slop científico utilizados en el benchmark. La tabla muestra lo que se examina para cada medida, cómo se calcula la puntuación y qué representa la puntuación máxima de 1, siendo puntuaciones más altas indicativas de fallas más extensas.
Las seis medidas de slop científico definidas en el artículo son referencias entre secciones (si las secciones se refieren de manera significativa a material en otra parte del artículo); macro redundancia (si secciones posteriores repiten material anterior); grafo de argumentos (si las afirmaciones están adecuadamente respaldadas por razonamiento previo); aislamiento de citas (si las citas se usan superficialmente, sin explicar cómo los trabajos citados se relacionan con el artículo o entre sí); exposición de figuras (si las figuras de método realmente explican el método); y brecha de evidencia (si los resultados reportados están respaldados por ejemplos concretos).
El benchmark se construyó emparejando artículos generados por IA con artículos escritos por humanos comparables/equivalentes, con los artículos de IA curados a partir de FARS y la competencia 2025 Agents4Science.
Para cada artículo generado por máquina de FARS, los investigadores buscaron en sus citas un artículo escrito por humanos del mismo tipo que hubiera sido aceptado en un recinto de primer nivel, y luego seleccionaron la coincidencia más cercana por tema de investigación, produciendo 143 pares. Los artículos de Agents4Science se emparejaron de manera similar con contrapartes escritas por humanos, generando 247 pares adicionales y llevando el benchmark a un total de 390 pares IA‑humano. Los artículos abarcan las ciencias de la vida, sociales y naturales, aunque el conjunto de datos está sesgado fuertemente hacia la informática.
Para las métricas, el rendimiento se evaluó usando PairAcc, que mide con qué frecuencia el artículo humano se clasifica por encima de su contraparte IA; y AUROC, que mide la separación general entre artículos humanos e IA a través de diferentes umbrales. Los autores también informan el rendimiento de detección cuando la tasa de falsos positivos para los artículos humanos se fija en un 5 %.
Pruebas
Las pruebas iniciales compararon SciSlop con los detectores de texto IA Binoculars; DetectGPT; y NTS††, así como con los sistemas de revisión automatizada AI Scientist Reviewer y CycleReviewer.
Para las pruebas de revisión posteriores, se utilizaron cuatro líneas base: base prompting; Claude Code; reviewer-based refinement; y slop-aware revision. Los tres primeros recibieron solo instrucciones generales para mejorar el artículo, mientras que a la revisión consciente del slop se le proporcionaron adicionalmente las definiciones y ubicaciones del slop detectado. Todos se compararon con SciSlopHarness bajo condiciones de revisión equivalentes.
Para la implementación, a los detectores de texto se les proporcionó la prosa del artículo, mientras que los demás métodos recibieron el código fuente del artículo y, cuando fue necesario, acceso a su código. Binoculars utilizó Falcon-7B base y modelos instruct; DetectGPT utilizó T5-3B para generar 100 perturbaciones; AI Scientist utilizó Qwen2.5-32B-Instruct; y CycleReviewer utilizó su checkpoint de 8 B publicado. Para los artículos que superan el límite de 2 048 tokens de Falcon, se puntuaron ventanas no superpuestas por separado y se promediaron.
Los resultados iniciales de detección se detallan en las dos tablas siguientes: SciSlop alcanzó un 85,9 % de PairAcc, comparado con un 68,7 % para Binoculars y un 68,5 % para el revisor automatizado más fuerte, reduciendo la tasa de error a menos de la mitad:

Resultados de detección comparando SciSlop con detectores de texto IA y revisores automatizados, junto con los resultados de sus seis medidas individuales de slop. SciSlop logra el PairAcc global más alto, mientras que las referencias de sección cruzada proporcionan el mejor resultado individual.
Las referencias de sección cruzada tuvieron un desempeño particularmente fuerte por sí solas, alcanzando un 90,5 % de PairAcc sin requerir un modelo, y detectando el 65 % de los artículos generados por IA con una tasa de falsos positivos del 5 %, frente al 24 % de Binoculars.
Los autores sostienen que estos resultados indican que las relaciones a lo largo del artículo proporcionan una señal más fuerte de generación por IA que la detección convencional a nivel de texto en este conjunto de datos, al tiempo que identifican debilidades específicas que podrían ser posteriormente abordadas mediante revisión.
La relación entre el slop científico y las evaluaciones humanas de la calidad del artículo se examinó a continuación. Como se muestra en la primera columna a continuación, un mayor slop se asoció con puntuaciones ICLR más bajas en la valoración global, solidez, presentación y contribución:

Comparación de SciSlop con detectores de texto IA y revisores automatizados frente a los resultados de revisión de ICLR. El panel izquierdo muestra la similitud con IA frente a las puntuaciones de revisión; el centro compara dimensiones individuales de la revisión; el derecho muestra el desempeño al distinguir artículos rechazados de aceptados a lo largo de nueve años.
Los artículos rechazados y aceptados también se distinguieron por encima del azar en los nueve años examinados, mientras que los detectores convencionales quedaron por debajo del azar en la mayoría de las comparaciones.
Por lo tanto, se encontró que el slop científico refleja debilidades ya penalizadas por los revisores humanos, en lugar de funcionar únicamente como una señal de autoría IA.
Las pruebas finales examinaron si SciSlopHarness podía eliminar el slop que permanecía después de una revisión más general. Como se muestra a continuación, el harness terminó más cercano al promedio humano en las seis medidas, mientras que la revisión general a menudo dejaba un slop sustancial y la revisión consciente del slop a veces sobrecorrigía:

Resultados de la revisión comparando SciSlopHarness con cuatro métodos de referencia a través de las seis medidas de slop. Los valores más cercanos a cero están más próximos al promedio de artículos humanos, con SciSlopHarness generalmente acercándose a este nivel mientras la revisión consciente del slop a menudo lo supera.
Cada cambio propuesto se verificó contra el razonamiento científico del artículo y la evidencia de apoyo, rechazándose las ediciones no respaldadas. En las seis medidas, la brecha restante respecto a los artículos escritos por humanos se redujo en un 63 % en comparación con Claude Code, la referencia de revisión más fuerte.
Conclusión
Resultó interesante, durante la redacción de este artículo, observar no solo lo bajo que puntuó este trabajo en su propio sitio de demostración, sino también identificar al menos un ejemplo de una cita ‘perezosa’ o ‘cosmética’††, que últimamente se ha convertido en una maldición menor pero creciente en los artículos de investigación.
En tales casos, más allá de este artículo en particular, los investigadores parecen basarse en su propio conocimiento en lugar de involucrarse de manera significativa con la literatura existente. Sin embargo, limitados por la convención de ‘mostrar su trabajo’, las citas a menudo se suministran con lo que parece impaciencia, incluso desprecio por el proceso, y a menudo dependen aparentemente del lector para aceptar una avalancha de referencias como una ‘pátina’ suficiente de procedencia, aunque una que no sobreviviría a un escrutinio exhaustivo.
Arxiv está contraatacando la industrialización impulsada por IA de las presentaciones; si habrá restricciones similares a la participación directa de la IA en la investigación, sin algún desastre relacionado de magnitud suficiente, queda por ver.
* Los énfasis de los autores, no los míos, pero mi conversión donde sea necesario de las citas en línea de los autores a hipervínculos.
† Los autores no afirman cero uso de IA en su propio artículo, y detallan tal uso.
†† Puede interesar al lector saber que tuve que buscar yo mismo un enlace correcto para el marco NTS, porque el enlace proporcionado por los autores no era relevante – ¡una de las métricas en las que SciSlop se basa!
Primera publicación domingo, 4 de octubre de 2026












