Modelos y plataformas de IA

Ai2 publica con código abierto AstaBrief 8B para la generación rápida de informes científicos

mm
Añade Unite.AI a tus fuentes preferidas en Google

El Allen Institute for AI (Ai2) dijo el 2 de octubre de 2026 que está publicando con código abierto AstaBrief 8B, un modelo que convierte una pregunta de investigación y fragmentos de literatura recuperados en un informe con citas, liberando los pesos del modelo y los datos de entrenamiento mientras el sistema se activa como modo Rápido en Asta, su plataforma agente para trabajo científico.

Modo rápido en la generación de informes de Asta

AstaBrief está disponible en la función Generar un informe de Asta como modo Rápido, funcionando junto al modo de Pensamiento impulsado por Claude, según el anuncio de Ai2. Ai2 dice que su objetivo era probar si un modelo pequeño y abierto, entrenado específicamente para la generación de informes científicos, podría igualar la calidad de los informes de los modelos propietarios que había estado usando, al mismo tiempo que reducía el tiempo de generación y los costos de servicio. Ai2 informa que, en todo el pipeline de Asta, el modo Rápido promedia 51.1 segundos por informe en comparación con 178.5 segundos para el modo de Pensamiento, una diferencia que describe como aproximadamente 3.5 veces más rápido y como casi una reducción de un orden de magnitud en el tiempo de generación respecto a los modelos propietarios que se monitorearon.

La hoja de modelo AstaBrief 8B indica que el modelo tiene licencia Apache 2.0, se basa en Qwen3-8B y está destinado a uso investigativo y educativo bajo las Directrices de Uso Responsable de Ai2. Debido a que los pesos son abiertos, Ai2 dice que las instituciones pueden ejecutar el modelo en su propio hardware, incluso detrás de su propio firewall, lo que describe como necesario cuando las preguntas de investigación tocan trabajos sensibles o no publicados. Junto a los pesos, Ai2 lanzó un flujo de trabajo de ejemplo en su repositorio ai2-scholarqa-lib GitHub que los investigadores pueden adaptar para generar informes a partir de sus propios PDFs.

Datos de entrenamiento y filtrado

Ai2 partió de Qwen3-8B y construyó AstaBrief con ajuste fino supervisado seguido de optimización directa de preferencias (DPO). El anuncio indica que el equipo consideró un entrenamiento basado en aprendizaje por refuerzo, que su trabajo anterior DR Tulu había demostrado que puede mejorar la generación de informes extensos para modelos de pesos abiertos, pero optó por la receta más simple porque el entrenamiento por refuerzo puede ser inestable y costoso, y el equipo quería una configuración que fuera más barata y más fácil de depurar e iterar.

Para mayor velocidad, AstaBrief se entrenó para redactar el informe completo en una sola pasada a partir de la consulta del usuario y los fragmentos recuperados, evitando las etapas de resumen y agrupamiento de fragmentos que utiliza el modo de Pensamiento basado en Claude y omitiendo la escritura sección por sección. Ai2 dice que descubrió que esto era posible sin sacrificar el rendimiento.

El pipeline de entrenamiento comenzó con consultas reales de usuarios enviadas a través del sistema detrás del marco ScholarQA de Ai2, que sustenta la generación de informes de Asta. El equipo filtró los registros por calidad, relevancia y privacidad, eliminando el tráfico de beta‑testers y bots, descartando consultas demasiado cortas para ser significativas, y utilizando una pasada basada en LLM para detectar consultas no inglesas, solicitudes no científicas y prompts que contenían información personal. Eso dejó un conjunto de 90K consultas centradas en la investigación.

Para la etapa supervisada, los objetivos de informes completos se generaron con el pipeline multi‑paso ScholarQA respaldado por una combinación de sistemas propietarios: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini y GPT-4.1. El filtrado de calidad dejó 47K ejemplos utilizables. Para DPO, los pares provinieron de un subconjunto separado de consultas no usadas durante la generación de datos SFT: un informe del pipeline ScholarQA, típicamente respaldado por Claude 3.5 o 3.7 Sonnet, contra un informe generado por o3, o4-mini, DeepSeek-V3 o DeepSeek-R1. Dos modelos de juicio, GPT-4.1 y DeepSeek-R1, seleccionaron un ganador para cada par. Ai2 dice que los jueces coincidieron con las preferencias humanas el 95 por ciento de las veces, y solo se mantuvieron los pares en los que ambos jueces estuvieron de acuerdo, produciendo alrededor de 6K ejemplos finales. Según la hoja de modelo, el modelo liberado se inicializó a partir del checkpoint AstaBrief-8B-SFT y se afinó en el conjunto de datos AstaBriefDPOMix, con el entrenamiento DPO realizado en el marco open‑instruct de Ai2 en 8xH100 GPUs.

Resultados de la evaluación

El objetivo principal de desarrollo de Ai2 fue SQABench‑CS2, que el anuncio describe como un conjunto de 200 preguntas de investigación en informática redactadas por usuarios. El equipo siguió cuatro métricas: puntuación de rúbrica, que mide cuánta contenido necesario cubre un informe; precisión de respuesta, que mide si cada párrafo es relevante para la pregunta; precisión de citación, que mide si cada cita respalda la afirmación a la que está vinculada; y recuperación de citas, que mide si las afirmaciones de un informe están completamente respaldadas por las citas proporcionadas. Las evaluaciones secundarias usaron DeepScholarBench, un benchmark de 63 consultas para la síntesis de investigación de formato largo construido a partir de artículos recientes de arXiv, más comparaciones por pares contra informes del pipeline impulsado por Claude.

El anuncio informa que el equipo probó cuatro filtros basados en estadísticas sobre informes de entrenamiento sintéticos: relación de tokens de salida a entrada, relevancia de citación, densidad de citación y diversidad de citación. Ai2 dice que los mayores avances provinieron de filtrar los informes con baja densidad de citación, mientras que un filtrado más agresivo, combinaciones de filtros y barridos de tasa de aprendizaje no aportaron mejoras significativas. Describe la lección más amplia como evidencia de que la especialización científica no es necesariamente una cuestión de añadir más texto científico al preentrenamiento, y que la composición y calidad de los datos posteriores al entrenamiento pueden cambiar materialmente el desempeño del modelo resultante.

Ai2 dice que los puntos de control tempranos de SFT mejoraron la calidad general del contenido, pero aún se quedaban atrás del pipeline impulsado por Claude en precisión de respuestas y calidad de citas, y que la etapa DPO acercó a AstaBrief al rango del pipeline de Claude y DR Tulu en la generación de informes. La tarjeta del modelo informa que, en el conjunto de pruebas ScholarQA‑CS2, AstaBrief‑8B promedió 87 en las métricas rastreadas, frente a 83,7 para el punto de control SFT y 77,3 para el Qwen3‑8B base, con AstaBrief‑8B obteniendo 90,2 en recuperación de ingredientes, 89 en precisión de respuestas, 90,5 en precisión de citas y 78,2 en recuperación de citas. La tarjeta también reporta tasas de victoria juzgadas por LLM para AstaBrief‑8B contra el pipeline Asta ScholarQA del 55 % en la división de desarrollo y del 72 % en la división de prueba, y enumera puntuaciones de DeepScholarBench de 53,50 para AstaBrief‑8B, 60,25 para Asta ScholarQA y 56,26 para DR‑Tulu‑8B.

En un estudio humano separado descrito en el anuncio, tres investigadores científicos aportaron de cuatro a cinco preguntas cada uno dentro de un conjunto de 14 preguntas y clasificaron los informes de los tres sistemas según preferencia general, exhaustividad, relevancia, organización y precisión de citas, permitiendo empates. Ai2 informa que DR Tulu ganó en preferencia general, mientras que dos de los tres investigadores prefirieron AstaBrief sobre los demás sistemas en precisión de citas.

Ai2 advierte que la mayor parte del entrenamiento y la evaluación se completó en 2025, que los modelos propietarios utilizados para generar los datos de entrenamiento y servir como puntos de comparación reflejan el estado del arte de esa época, y que no ha vuelto a ejecutar la evaluación completa contra los modelos de frontera actuales.

Uso temprano y próximos pasos declarados

Ai2 informa que, entre los 374 usuarios de Asta que han probado el modo Rápido, el 29,1 % lo utilizó en dos o más días, los usuarios generaron un promedio de 3,67 hilos de informe, el 23 % nunca volvió al modo Pensamiento para hilos futuros, y otro 18 % alternó entre modos según sus objetivos, usando el modo Rápido para aproximadamente el 40 % de sus hilos. La retroalimentación positiva fue del 84,2 % para el modo Rápido frente al 85,2 % para el modo Pensamiento, lo que Ai2 caracteriza como una tasa similar, aunque señala que la retroalimentación suele ser demasiado escasa para respaldar conclusiones firmes.

Ai2 dice que está explorando un aprendizaje de preferencias más granular, enfoques RAG‑plus‑RL más robustos, capacidades de múltiples turnos y múltiples herramientas, fuentes de datos científicos adicionales y descomposición de consultas, junto con evaluaciones que prueben si un modelo preserva el alcance probatorio de sus fuentes en lugar de ampliar lo que los estudios subyacentes establecieron. El anuncio sitúa el trabajo dentro de los esfuerzos más amplios de Ai2 en modelos científicos, incluido NSF OMAI, una iniciativa nacional de EE. UU. liderada por Ai2 para construir infraestructura e IA totalmente abiertas para el descubrimiento científico, y describe AstaBrief como un experimento dentro de una línea de trabajo que va desde ScholarQA y DR Tulu hasta futuras versiones de Olmo.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en IA cognitiva, inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de máquinas. Su trabajo explora cómo el aprendizaje, el razonamiento, la memoria y la abstracción emergen tanto en sistemas biológicos como artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas históricas de la ciencia cognitiva y la filosofía de la mente.

Con un enfoque conceptual y reflexivo, Jonas examina marcos como modelos de razonamiento, sistemas agente, cognición emergente y teoría de alineación, con el objetivo de aclarar lo que realmente significa el progreso hacia la AGI —y lo que no significa. En lugar de perseguir cronogramas o exageraciones, él enfatiza los principios fundamentales, el rigor conceptual y los límites de los modelos actuales.

Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar precisión, claridad y una discusión responsable de conceptos avanzados de IA.