Modelos e plataformas de IA

Ai2 disponibiliza código aberto do AstaBrief 8B para geração rápida de relatórios científicos

mm
Adicione Unite.AI às suas fontes preferidas no Google

O Allen Institute for AI (Ai2) disse em 2 de outubro de 2026 que está disponibilizando como código aberto o AstaBrief 8B, um modelo que transforma uma pergunta de pesquisa e trechos de literatura recuperados em um relatório com citações, lançando os pesos do modelo e os dados de treinamento à medida que o sistema entra em operação no modo Rápido no Asta, sua plataforma agente para trabalho científico.

Modo Rápido na geração de relatórios do Asta

AstaBrief está disponível no recurso Gerar um relatório do Asta como modo Rápido, funcionando ao lado do modo de Pensamento alimentado por Claude existente, de acordo com anúncio da Ai2. Ai2 afirma que seu objetivo era testar se um modelo pequeno e aberto, treinado especificamente para geração de relatórios científicos, poderia igualar a qualidade de relatório dos modelos proprietários que vinha usando, ao mesmo tempo reduzindo o tempo de geração e os custos de serviço. Ai2 relata que, em todo o pipeline do Asta, o modo Rápido tem média de 51,1 segundos por relatório, comparado com 178,5 segundos para o modo de Pensamento, diferença que descreve como cerca de 3,5 vezes mais rápido e quase uma ordem de magnitude menor no tempo de geração em relação aos modelos proprietários monitorados.

O cartão de modelo AstaBrief 8B indica que o modelo está licenciado sob Apache 2.0, baseia‑se no Qwen3-8B e destina‑se ao uso em pesquisa e educação de acordo com as Diretrizes de Uso Responsável da Ai2. Como os pesos são abertos, a Ai2 afirma que instituições podem executar o modelo em seu próprio hardware, inclusive atrás de seu próprio firewall, o que descreve como necessário quando perguntas de pesquisa envolvem trabalho sensível ou não publicado. Juntamente com os pesos, a Ai2 lançou um fluxo de trabalho de exemplo em seu repositório ai2-scholarqa-lib no GitHub, que os pesquisadores podem adaptar para gerar relatórios a partir de seus próprios PDFs.

Dados de treinamento e filtragem

Ai2 começou a partir do Qwen3-8B e construiu o AstaBrief com ajuste fino supervisionado seguido de otimização direta de preferência (DPO). O anúncio afirma que a equipe considerou treinamento baseado em aprendizado por reforço, que seu trabalho anterior DR Tulu havia demonstrado poder melhorar a geração de relatórios extensos para modelos de pesos abertos, mas optou pela receita mais simples porque o treinamento por RL pode ser instável e caro, e a equipe desejava uma configuração mais barata e mais fácil de depurar e iterar.

Para velocidade, o AstaBrief foi treinado para escrever o relatório completo em uma única passagem a partir da consulta do usuário e dos trechos recuperados, contornando as etapas de sumarização de trechos e de agrupamento que o modo de Pensamento baseado em Claude utiliza e pulando a escrita seção por seção. Ai2 afirma que descobriu que isso era possível sem sacrificar o desempenho.

O pipeline de treinamento começou com consultas reais de usuários enviadas através do sistema por trás da estrutura ScholarQA da Ai2, que sustenta a geração de relatórios do Asta. A equipe filtrou os registros quanto à qualidade, relevância e privacidade, removendo tráfego de beta‑testers e bots, descartando consultas muito curtas para serem significativas e usando uma passagem baseada em LLM para capturar consultas não‑inglês, solicitações não científicas e prompts contendo informações pessoais. Isso resultou em um conjunto de 90 mil consultas focadas em pesquisa.

Na fase supervisionada, os alvos de relatório completo foram gerados com o pipeline multi‑etapa ScholarQA apoiado por uma combinação de sistemas proprietários: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini e GPT‑4.1. A filtragem de qualidade deixou 47 mil exemplos utilizáveis. Para DPO, os pares vieram de um subconjunto separado de consultas não usadas durante a geração de dados SFT: um relatório do pipeline ScholarQA, tipicamente apoiado por Claude 3.5 ou 3.7 Sonnet, contra um relatório gerado por o3, o4-mini, DeepSeek‑V3 ou DeepSeek‑R1. Dois modelos de julgamento, GPT‑4.1 e DeepSeek‑R1, escolheram um vencedor para cada par. Ai2 afirma que os juízes concordaram com as preferências humanas 95 % das vezes, e somente os pares nos quais ambos os juízes concordaram foram mantidos, produzindo cerca de 6 mil exemplos finais. Segundo o cartão de modelo, o modelo lançado foi inicializado a partir do checkpoint AstaBrief-8B-SFT e ajustado finamente no conjunto de dados AstaBriefDPOMix, com o treinamento DPO realizado na estrutura open‑instruct da Ai2 em 8 GPUs H100.

Resultados da avaliação

O principal objetivo de desenvolvimento da Ai2 era o SQABench‑CS2, que o anúncio descreve como um conjunto de 200 questões de pesquisa em ciência da computação escritas por usuários. A equipe acompanhou quatro métricas: pontuação de rubrica, que mede quanto conteúdo necessário um relatório cobre; precisão de resposta, que avalia se cada parágrafo é relevante para a questão; precisão de citação, que verifica se cada citação sustenta a afirmação a que está vinculada; e recall de citação, que mede se as afirmações do relatório são totalmente sustentadas pelas citações fornecidas. Avaliações secundárias usaram o DeepScholarBench, um benchmark de 63 consultas para síntese de pesquisa de longo prazo construído a partir de artigos recentes do arXiv, além de comparações pareadas contra relatórios do pipeline alimentado por Claude.

O anúncio relata que a equipe testou quatro filtros baseados em estatísticas em relatórios de treinamento sintéticos: razão de tokens de saída para entrada, relevância de citação, densidade de citação e diversidade de citação. Ai2 afirma que os maiores ganhos vieram da filtragem de relatórios com baixa densidade de citação, enquanto filtragens mais agressivas, combinações de filtros e variações de taxa de aprendizado não trouxeram ganhos significativos. Descreve a lição mais ampla como evidência de que a especialização científica não é necessariamente uma questão de adicionar mais texto científico ao pré‑treinamento, e que a composição e qualidade dos dados pós‑treinamento podem mudar materialmente o desempenho do modelo resultante.

Ai2 afirma que os checkpoints iniciais de SFT melhoraram a qualidade geral do conteúdo, mas ainda ficaram atrás da pipeline alimentada por Claude em termos de precisão das respostas e qualidade das citações, e que a fase DPO trouxe o AstaBrief para um nível comparável à pipeline Claude e ao DR Tulu na geração de relatórios. O cartão do modelo relata que, no conjunto de teste ScholarQA‑CS2, o AstaBrief‑8B obteve média de 87 nas métricas acompanhadas, comparado a 83,7 para o checkpoint de SFT e 77,3 para o Qwen3‑8B base, com o AstaBrief‑8B alcançando 90,2 em recall de ingredientes, 89 em precisão de respostas, 90,5 em precisão de citações e 78,2 em recall de citações. O cartão também informa as taxas de vitória avaliadas por LLM para o AstaBrief‑8B contra a pipeline Asta ScholarQA de 55 % na divisão de desenvolvimento e 72 % na divisão de teste, e lista pontuações do DeepScholarBench de 53,50 para o AstaBrief‑8B, 60,25 para o Asta ScholarQA e 56,26 para o DR‑Tulu‑8B.

Em um estudo humano separado descrito no anúncio, três pesquisadores científicos contribuíram com quatro a cinco perguntas cada em um conjunto de 14 questões e classificaram os relatórios dos três sistemas quanto à preferência geral, completude, relevância, organização e precisão das citações, permitindo empates. Ai2 relata que o DR Tulu venceu em preferência geral, enquanto dois dos três pesquisadores preferiram o AstaBrief em relação aos outros sistemas quanto à precisão das citações.

Ai2 alerta que a maior parte do treinamento e da avaliação foi concluída em 2025, que os modelos proprietários usados para gerar os dados de treinamento e servir como pontos de comparação refletem o estado da arte da época, e que não foi realizada uma nova avaliação completa contra os modelos de ponta atuais.

Uso Inicial e Próximos Passos Declarados

Ai2 relata que, entre 374 usuários do Asta que experimentaram o modo Rápido, 29,1 % o utilizaram em dois ou mais dias, os usuários geraram uma média de 3,67 cadeias de relatórios, 23 % nunca retornaram ao modo Pensamento para cadeias futuras, e outros 18 % alternaram entre os modos conforme seus objetivos, usando o modo Rápido em cerca de 40 % de suas cadeias. O feedback positivo foi de 84,2 % para o modo Rápido versus 85,2 % para o modo Pensamento, o que a Ai2 caracteriza como taxa semelhante, embora observe que o feedback geralmente é escasso demais para sustentar conclusões robustas.

Ai2 afirma que está explorando aprendizado de preferência mais granular, abordagens RAG‑plus‑RL mais robustas, capacidades de múltiplas interações e múltiplas ferramentas, fontes de dados científicos adicionais e decomposição de consultas, juntamente com avaliações que testam se um modelo preserva o escopo evidencial de suas fontes em vez de ampliar o que os estudos subjacentes estabeleceram. O anúncio enquadra o trabalho dentro dos esforços mais amplos da Ai2 em modelos científicos, incluindo o NSF OMAI, uma iniciativa nacional dos EUA liderada pela Ai2 para construir infraestrutura e modelos de IA totalmente abertos para a descoberta científica, e descreve o AstaBrief como um experimento em uma linha de trabalho mais longa que vai de ScholarQA e DR Tulu a versões futuras do Olmo.

Jonas Reeve é um analista gerado por IA na Unite.AI, focado em IA cognitiva, inteligência geral artificial (AGI) e nas fundações teóricas da inteligência de máquinas. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem tanto em sistemas biológicos quanto artificiais, estabelecendo conexões entre arquiteturas modernas de IA e questões de longa data na ciência cognitiva e na filosofia da mente.

Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agentes, cognição emergente e teoria de alinhamento, visando esclarecer o que realmente significa o progresso rumo à AGI — e o que não significa. Em vez de perseguir cronogramas ou exageros, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.

Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos avançados de IA.