AI 모델 및 플랫폼

Ai2, 빠른 과학 보고서 생성을 위해 AstaBrief 8B를 오픈소스화

mm
Unite.AI를 Google의 선호 소스에 추가

Allen Institute for AI (Ai2)는 2026년 10월 2일, 연구 질문과 검색된 문헌 발췌를 인용된 보고서로 전환하는 모델인 AstaBrief 8B를 오픈소스화한다고 발표했으며, 모델 가중치와 학습 데이터를 공개하고 이 시스템을 Asta의 Fast 모드로 실시간 제공할 예정이라고 밝혔습니다. Asta는 과학 작업을 위한 에이전트형 플랫폼입니다.

Asta 보고서 생성의 Fast 모드

AstaBrief는 Asta의 ‘보고서 생성’ 기능에서 Fast 모드로 제공되며, 기존의 Claude 기반 Thinking 모드와 함께 작동한다고 Ai2의 발표에 밝혔습니다. Ai2는 과학 보고서 생성을 위해 특별히 훈련된 소규모 오픈 모델이 기존에 사용하던 독점 모델의 보고서 품질에 버금갈 수 있는지, 그리고 생성 시간과 서비스 비용을 줄일 수 있는지를 테스트하는 것이 목표였다고 말했습니다. Ai2는 전체 Asta 파이프라인에서 Fast 모드가 보고서당 평균 51.1초를 기록한 반면, Thinking 모드는 178.5초였으며, 이는 약 3.5배 빠르고 독점 모델 대비 생성 시간이 거의 한 자릿수 감소한 수준이라고 설명했습니다.

AstaBrief 8B 모델 카드에 따르면, 이 모델은 Apache 2.0 라이선스를 가지고 있으며 Qwen3-8B를 기반으로 하고, Ai2의 책임 있는 사용 가이드라인에 따라 연구 및 교육 목적으로 사용하도록 설계되었습니다. 가중치가 오픈되어 있기 때문에 Ai2는 기관들이 자체 하드웨어, 심지어 자체 방화벽 뒤에서도 모델을 실행할 수 있다고 말했으며, 이는 연구 질문이 민감하거나 아직 공개되지 않은 작업과 관련될 때 필요하다고 설명했습니다. 가중치와 함께 Ai2는 연구자들이 자체 PDF에서 보고서를 생성하도록 활용할 수 있는 예시 워크플로를 ai2-scholarqa-lib GitHub 저장소에 공개했습니다.

학습 데이터 및 필터링

Ai2는 Qwen3-8B를 기반으로 시작하여, 감독 학습 미세조정 후 직접 선호 최적화 (DPO)를 적용해 AstaBrief를 구축했습니다. 발표에 따르면 팀은 강화학습 기반 훈련을 검토했으며, 이전 DR Tulu 작업에서 오픈 가중치 모델의 장문 보고서 생성이 향상될 수 있음을 보여주었지만, 강화학습 훈련이 불안정하고 비용이 많이 들며 디버깅 및 반복이 어려워 더 저렴하고 디버깅이 쉬운 간단한 방식을 선택했다고 합니다.

속도를 위해 AstaBrief는 사용자 질의와 검색된 스니펫을 한 번에 처리하여 전체 보고서를 작성하도록 훈련되었으며, Claude 기반 Thinking 모드가 사용하는 스니펫 요약 및 클러스터링 단계와 섹션별 작성 과정을 생략했습니다. Ai2는 성능을 희생하지 않고도 이것이 가능했음을 발견했다고 밝혔습니다.

학습 파이프라인은 Asta의 보고서 생성을 뒷받침하는 Ai2의 ScholarQA 프레임워크를 통해 제출된 실제 사용자 질의에서 시작되었습니다. 팀은 로그를 품질, 관련성 및 프라이버시 기준으로 필터링하여 베타 테스터 및 봇 트래픽을 제거하고 의미가 부족한 짧은 질의를 배제했으며, LLM 기반 검사를 사용해 비영어 질의, 비과학적 요청 및 개인 정보를 포함한 프롬프트를 걸러냈습니다. 결과적으로 90K개의 연구 중심 질의가 남았습니다.

감독 단계에서는 다단계 ScholarQA 파이프라인을 사용해 전체 보고서 타깃을 생성했으며, 이 파이프라인은 Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini, 그리고 GPT-4.1 등 여러 독점 시스템을 결합했습니다. 품질 필터링 결과 47K개의 사용 가능한 예제가 남았습니다. DPO 단계에서는 SFT 데이터 생성에 사용되지 않은 별도의 질의 하위 집합에서 쌍을 만들었으며, 하나는 일반적으로 Claude 3.5 또는 3.7 Sonnet을 기반으로 하는 ScholarQA 파이프라인에서 생성된 보고서이고, 다른 하나는 o3, o4-mini, DeepSeek-V3 또는 DeepSeek-R1이 생성한 보고서였습니다. 두 평가 모델인 GPT-4.1과 DeepSeek-R1이 각 쌍에서 승자를 선택했습니다. Ai2에 따르면 평가자들은 95%의 경우 인간 선호와 일치했으며, 두 평가자가 모두 동의한 쌍만을 유지해 약 6K개의 최종 예제가 생성되었습니다. 모델 카드에 따르면, 공개된 모델은 AstaBrief-8B-SFT 체크포인트에서 초기화된 후 AstaBriefDPOMix 데이터셋으로 미세조정되었으며, DPO 훈련은 Ai2의 open-instruct 프레임워크에서 8xH100 GPU를 사용해 수행되었습니다.

평가 결과

Ai2의 주요 개발 목표는 SQABench-CS2였으며, 발표에 따르면 이는 200개의 사용자가 직접 작성한 컴퓨터 과학 연구 질문 집합이라고 설명합니다. 팀은 네 가지 지표를 추적했습니다: 보고서가 다루는 필수 내용의 양을 측정하는 루브릭 점수, 각 단락이 질문과 관련 있는지를 측정하는 답변 정밀도, 각 인용이 해당 주장을 뒷받침하는지를 측정하는 인용 정밀도, 그리고 보고서의 주장들이 제공된 인용으로 완전히 뒷받침되는지를 측정하는 인용 재현율. 보조 평가로는 최근 arXiv 논문을 기반으로 만든 장문 연구 종합을 위한 63개 질의 벤치마크인 DeepScholarBench와 Claude 기반 파이프라인의 보고서와의 쌍별 비교를 사용했습니다.

발표에 따르면 팀은 합성 학습 보고서에 대해 네 가지 통계 기반 필터를 테스트했습니다: 출력 대비 입력 토큰 비율, 인용 관련성, 인용 밀도, 인용 다양성. Ai2는 가장 큰 향상이 낮은 인용 밀도를 가진 보고서를 필터링함으로써 얻어졌으며, 보다 공격적인 필터링, 필터 조합 및 학습률 스위프는 의미 있는 향상을 가져오지 못했다고 밝혔습니다. 이는 과학적 전문화가 반드시 사전 학습에 더 많은 과학 텍스트를 추가하는 것만으로 이루어지는 것이 아니며, 사후 학습 데이터의 구성과 품질이 최종 모델 성능에 실질적인 변화를 줄 수 있다는 교훈이라고 설명합니다.

Ai2는 초기 SFT 체크포인트가 전체 콘텐츠 품질을 개선했지만 답변 정확도와 인용 품질 면에서 Claude 기반 파이프라인에 여전히 뒤처졌으며, DPO 단계가 AstaBrief을 Claude 파이프라인 및 DR Tulu와 보고서 생성 측면에서 비슷한 수준으로 끌어올렸다고 밝혔습니다. 모델 카드에 따르면 ScholarQA‑CS2 테스트 세트에서 AstaBrief‑8B는 추적된 메트릭 전반에 걸쳐 평균 87점을 기록했으며, 이는 SFT 체크포인트의 83.7점과 기본 Qwen3‑8B의 77.3점에 비해 높은 수치입니다. AstaBrief‑8B는 성분 회수율 90.2점, 답변 정확도 89점, 인용 정확도 90.5점, 인용 회수율 78.2점을 기록했습니다. 카드에는 또한 AstaBrief‑8B가 Asta ScholarQA 파이프라인에 대해 개발 분할에서는 55%, 테스트 분할에서는 72%의 LLM 판단 승률을 보였으며, DeepScholarBench 점수는 AstaBrief‑8B 53.50점, Asta ScholarQA 60.25점, DR‑Tulu‑8B 56.26점으로 나타났다고 보고되었습니다.

발표에서 별도로 진행된 인간 연구에 따르면, 세 명의 과학 연구자가 각각 14문항 중 4~5개의 질문을 기여하고 세 시스템의 보고서를 전체 선호도, 완전성, 관련성, 조직력 및 인용 정확도 측면에서 평가했으며, 동점도 허용되었습니다. Ai2는 DR Tulu가 전체 선호도에서 우승했으며, 세 연구자 중 두 명은 인용 정확도 측면에서 다른 시스템보다 AstaBrief를 선호했다고 보고했습니다.

Ai2는 대부분의 학습 및 평가가 2025년에 완료되었으며, 학습 데이터를 생성하고 비교 대상으로 사용된 독점 모델들이 당시 최첨단을 반영하고 있었고, 현재 최첨단 모델에 대해 전체 평가를 다시 수행하지 않았다고 주의했습니다.

초기 사용 및 향후 계획

Ai2는 Fast 모드를 사용해 본 374명의 Asta 사용자 중 29.1%가 두 번 이상 사용했으며, 사용자는 평균 3.67개의 보고서 스레드를 생성했고, 23%는 향후 스레드에서 Thinking 모드로 전환하지 않았으며, 또 다른 18%는 목표에 따라 모드를 전환해 Fast 모드를 전체 스레드의 약 40%에 활용했다고 보고했습니다. Fast 모드에 대한 긍정적 피드백은 84.2%였으며 Thinking 모드는 85.2%였는데, Ai2는 두 비율이 비슷하다고 평가하면서도 피드백이 전반적으로 너무 적어 강력한 결론을 내리기엔 부족하다고 언급했습니다.

Ai2는 보다 세분화된 선호 학습, 강화된 RAG‑plus‑RL 접근법, 다중 턴 및 다중 도구 기능, 추가 과학 데이터 소스, 질의 분해 등을 탐색하고 있으며, 모델이 근거 범위를 유지하는지 여부를 테스트하는 평가도 진행 중이라고 밝혔습니다. 이번 발표는 Ai2의 광범위한 과학 모델 노력의 일환으로, NSF OMAI와 같은 미국 국가 차원의 완전 개방형 AI 인프라 및 과학 발견을 위한 모델 구축 이니셔티브와 연결되며, AstaBrief를 ScholarQA와 DR Tulu에서 향후 Olmo 버전까지 이어지는 긴 작업 라인 중 하나의 실험으로 설명했습니다.

Jonas Reeve는 Unite.AI에서 AI 생성 분석가로 활동하며 인지 AI, 인공 일반 지능(AGI) 및 기계 지능의 이론적 기반에 집중합니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 시스템과 인공 시스템 모두에서 어떻게 나타나는지를 탐구하고, 현대 AI 아키텍처와 인지 과학 및 마음 철학의 오랜 질문들 사이의 연결을 제시합니다.

개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 발생 인지, 정렬 이론과 같은 프레임워크를 검토하며, AGI에 대한 진전이 실제로 의미하는 바와 의미하지 않는 바를 명확히 하고자 합니다. 일정이나 과대광고를 쫓기보다 그는 기본 원칙, 개념적 엄밀성, 그리고 현재 모델의 한계를 강조합니다.

Jonas Reeve가 작성한 기사들은 AI 생성이며, 정확성, 명확성 및 고급 AI 개념에 대한 책임 있는 논의를 보장하기 위해 Unite.AI 편집팀이 검토합니다.