Modèles et plateformes d’IA

Ai2 publie en open source AstaBrief 8B pour la génération rapide de rapports scientifiques

mm
Ajouter Unite.AI à vos sources préférées sur Google

L’Allen Institute for AI (Ai2) a déclaré le 2 octobre 2026 qu’il publiait en open source AstaBrief 8B, un modèle qui transforme une question de recherche et des extraits de littérature récupérés en un rapport cité, en diffusant les poids du modèle et les données d’entraînement alors que le système est déployé en mode Rapide dans Asta, sa plateforme agentique pour le travail scientifique.

Mode Rapide dans la génération de rapports d’Asta

AstaBrief est disponible dans la fonction Générer un rapport d’Asta en tant que mode Rapide, fonctionnant parallèlement au mode Thinking alimenté par Claude, selon l’annonce d’Ai2. Ai2 indique que son objectif était de vérifier si un petit modèle ouvert, entraîné spécifiquement pour la génération de rapports scientifiques, pouvait égaler la qualité des rapports des modèles propriétaires qu’il utilisait, tout en réduisant le temps de génération et les coûts de service. Ai2 rapporte que, sur l’ensemble du pipeline Asta, le mode Rapide atteint en moyenne 51.1 secondes par rapport contre 178.5 secondes pour le mode Thinking, une différence qu’il décrit comme environ 3.5 fois plus rapide et comme une réduction d’un ordre de grandeur du temps de génération par rapport aux modèles propriétaires suivis.

La fiche modèle AstaBrief 8B indique que le modèle est sous licence Apache 2.0, repose sur Qwen3-8B et est destiné à un usage de recherche et éducatif conformément aux Directives d’utilisation responsable d’Ai2. Parce que les poids sont ouverts, Ai2 affirme que les institutions peuvent exécuter le modèle sur leur propre matériel, y compris derrière leur propre pare-feu, ce qu’il décrit comme nécessaire lorsque les questions de recherche portent sur des travaux sensibles ou non publiés. En plus des poids, Ai2 a publié un flux de travail d’exemple dans son référentiel ai2-scholarqa-lib GitHub que les chercheurs peuvent adapter pour générer des rapports à partir de leurs propres PDF.

Données d’entraînement et filtrage

Ai2 a commencé à partir de Qwen3-8B et a construit AstaBrief avec un ajustement fin supervisé suivi d’une optimisation directe des préférences (DPO). L’annonce indique que l’équipe a envisagé un entraînement basé sur l’apprentissage par renforcement, ce que son travail antérieur DR Tulu avait montré capable d’améliorer la génération de rapports longs pour les modèles à poids ouverts, mais a choisi la recette plus simple car l’entraînement par RL peut être instable et coûteux, et l’équipe souhaitait une configuration moins chère et plus facile à déboguer et à itérer.

Pour la rapidité, AstaBrief a été entraîné à rédiger le rapport complet en un seul passage à partir de la requête de l’utilisateur et des extraits récupérés, contournant les étapes de résumés d’extraits et de regroupement utilisées par le mode Thinking basé sur Claude et en sautant la rédaction section par section. Ai2 affirme avoir constaté que cela était possible sans sacrifier les performances.

Le pipeline d’entraînement a commencé avec de véritables requêtes d’utilisateurs soumises via le système derrière le cadre ScholarQA d’Ai2, qui sous-tend la génération de rapports d’Asta. L’équipe a filtré les journaux pour la qualité, la pertinence et la confidentialité, en supprimant le trafic des bêta-testeurs et des bots, en écartant les requêtes trop courtes pour être significatives, et en utilisant un passage basé sur un LLM pour détecter les requêtes non anglophones, les demandes non scientifiques et les invites contenant des informations personnelles. Il en est resté un ensemble de 90K requêtes axées sur la recherche.

Pour la phase supervisée, les cibles de rapports complets ont été générées avec le pipeline multi‑étapes ScholarQA, soutenu par un ensemble de systèmes propriétaires : Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini et GPT‑4.1. Le filtrage de qualité a laissé 47 000 exemples utilisables. Pour le DPO, les paires proviennent d’un sous‑ensemble distinct de requêtes non utilisées lors de la génération des données SFT : un rapport issu du pipeline ScholarQA, généralement soutenu par Claude 3.5 ou 3.7 Sonnet, contre un rapport généré par o3, o4-mini, DeepSeek‑V3 ou DeepSeek‑R1. Deux modèles de jugement, GPT‑4.1 et DeepSeek‑R1, ont sélectionné un gagnant pour chaque paire. Ai2 indique que les juges étaient d’accord avec les préférences humaines dans 95 % des cas, et seules les paires sur lesquelles les deux juges étaient d’accord ont été conservées, produisant environ 6 000 exemples finaux. Selon la fiche modèle, le modèle publié a été initialisé à partir du point de contrôle AstaBrief-8B-SFT et affiné sur le jeu de données AstaBriefDPOMix, la formation DPO étant réalisée dans le cadre open‑instruct d’Ai2 sur 8 xH100 GPU.

Résultats de l’évaluation

L’objectif principal de développement d’Ai2 était SQABench‑CS2, que l’annonce décrit comme un ensemble de 200 questions de recherche en informatique rédigées par les utilisateurs. L’équipe a suivi quatre métriques : le score de grille, qui mesure la quantité de contenu nécessaire couvert par un rapport ; la précision des réponses, qui mesure si chaque paragraphe est pertinent par rapport à la question ; la précision des citations, qui mesure si chaque citation soutient l’affirmation qui lui est rattachée ; et le rappel des citations, qui mesure si les affirmations d’un rapport sont entièrement soutenues par les citations fournies. Les évaluations secondaires ont utilisé DeepScholarBench, un benchmark de 63 requêtes pour la synthèse de recherche longue construit à partir de récents articles arXiv, ainsi que des comparaisons par paires contre les rapports du pipeline alimenté par Claude.

L’annonce indique que l’équipe a testé quatre filtres basés sur des statistiques sur des rapports d’entraînement synthétiques : le ratio jetons sortie/entrée, la pertinence des citations, la densité des citations et la diversité des citations. Ai2 affirme que les gains les plus forts provenaient du filtrage des rapports à faible densité de citations, tandis que des filtrages plus agressifs, des combinaisons de filtres et des variations de taux d’apprentissage n’ont apporté aucun gain significatif. Elle décrit la leçon plus large comme une preuve que la spécialisation scientifique n’est pas nécessairement une question d’ajouter davantage de texte scientifique à la pré‑formation, et que la composition et la qualité des données post‑formation peuvent modifier de manière substantielle les performances du modèle résultant.

Ai2 indique que les premiers points de contrôle SFT ont amélioré la qualité globale du contenu mais restent en retard par rapport à la chaîne alimentée par Claude en termes de précision des réponses et de qualité des citations, et que l’étape DPO a rapproché AstaBrief du niveau de la chaîne Claude et de DR Tulu pour la génération de rapports. La fiche modèle rapporte que, sur le jeu de test ScholarQA‑CS2, AstaBrief‑8B a obtenu une moyenne de 87 sur les métriques suivies, contre 83,7 pour le point de contrôle SFT et 77,3 pour le Qwen3‑8B de base, avec un rappel d’ingrédients de 90,2, une précision des réponses de 89, une précision des citations de 90,5 et un rappel des citations de 78,2. La fiche indique également des taux de victoire évalués par LLM pour AstaBrief‑8B face à la chaîne Asta ScholarQA de 55 % sur le lot de développement et de 72 % sur le lot de test, et répertorie des scores DeepScholarBench de 53,50 pour AstaBrief‑8B, 60,25 pour Asta ScholarQA et 56,26 pour DR‑Tulu‑8B.

Dans une étude humaine distincte décrite dans l’annonce, trois chercheurs scientifiques ont chacun fourni quatre à cinq questions sur un ensemble de 14 questions et ont classé les rapports des trois systèmes selon la préférence globale, la complétude, la pertinence, l’organisation et la précision des citations, les égalités étant autorisées. Ai2 rapporte que DR Tulu a remporté la préférence globale, tandis que deux des trois chercheurs ont préféré AstaBrief aux autres systèmes en ce qui concerne la précision des citations.

Ai2 avertit que la majeure partie de la formation et de l’évaluation a été réalisée en 2025, que les modèles propriétaires utilisés pour générer les données d’entraînement et servir de points de comparaison reflètent l’état de l’art à cette époque, et qu’il n’a pas refait l’évaluation complète contre les modèles de pointe actuels.

Première utilisation et prochaines étapes annoncées

Ai2 rapporte que parmi les 374 utilisateurs d’Asta ayant testé le mode Rapide, 29,1 % l’ont utilisé pendant deux jours ou plus, les utilisateurs ont généré en moyenne 3,67 fils de rapports, 23 % n’ont jamais repassé en mode Réflexion pour les fils futurs, et 18 % ont alterné entre les modes selon leurs objectifs, utilisant le mode Rapide pour environ 40 % de leurs fils. Les retours positifs s’élevaient à 84,2 % pour le mode Rapide contre 85,2 % pour le mode Réflexion, ce qu’Ai2 caractérise comme un taux similaire tout en notant que les retours sont généralement trop rares pour soutenir des conclusions solides.

Ai2 indique qu’il explore un apprentissage des préférences plus finement granulaire, des approches RAG‑plus‑RL plus puissantes, des capacités multi‑tour et multi‑outil, des sources de données scientifiques supplémentaires et la décomposition des requêtes, ainsi que des évaluations testant si un modèle préserve la portée probante de ses sources plutôt que d’élargir ce que les études sous‑jacentes ont établi. L’annonce situe ce travail dans le cadre des efforts plus larges d’Ai2 sur les modèles scientifiques, y compris NSF OMAI, une initiative nationale américaine dirigée par Ai2 pour construire une infrastructure et des modèles d’IA entièrement ouverts pour la découverte scientifique, et décrit AstaBrief comme une expérience parmi une série d’initiatives allant de ScholarQA et DR Tulu aux futures versions d’Olmo.

Jonas Reeve est un analyste généré par IA chez Unite.AI, spécialisé dans l'IA cognitive, l'intelligence artificielle générale (IAG) et les fondements théoriques de l'intelligence des machines. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et en philosophie de l'esprit.

Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agentiques, la cognition émergente et la théorie de l'alignement, visant à clarifier ce que signifie réellement le progrès vers l'IAG — et ce qu'il ne signifie pas. Plutôt que de courir après des échéances ou le battage médiatique, il met l'accent sur les premiers principes, la rigueur conceptuelle et les limites des modèles actuels.

Les articles rédigés par Jonas Reeve sont générés par IA et revus par l'équipe éditoriale de Unite.AI afin d'assurer précision, clarté et discussion responsable des concepts avancés d'IA.