Mô hình và nền tảng AI

Ai2 công khai mã nguồn AstaBrief 8B để tạo báo cáo khoa học nhanh

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Viện Allen cho Trí tuệ Nhân tạo (Ai2) cho biết vào ngày 2 tháng 10 năm 2026 rằng họ đang công khai mã nguồn AstaBrief 8B, một mô hình chuyển câu hỏi nghiên cứu và các trích đoạn tài liệu được truy xuất thành một báo cáo có trích dẫn, đồng thời phát hành trọng số mô hình và dữ liệu huấn luyện khi hệ thống được đưa vào hoạt động dưới dạng Chế độ Nhanh trong Asta, nền tảng đại lý của họ cho công việc khoa học.

Chế độ Nhanh trong việc tạo báo cáo của Asta

AstaBrief có sẵn trong tính năng Tạo báo cáo của Asta dưới dạng Chế độ Nhanh, chạy song song với Chế độ Tư duy hiện có được hỗ trợ bởi Claude, theo thông báo của Ai2. Ai2 cho biết mục tiêu của họ là kiểm tra xem một mô hình nhỏ, mở, được huấn luyện đặc biệt cho việc tạo báo cáo khoa học có thể đạt chất lượng báo cáo tương đương với các mô hình sở hữu mà họ đã sử dụng, đồng thời giảm thời gian tạo và chi phí phục vụ. Ai2 báo cáo rằng trên toàn bộ quy trình Asta, Chế độ Nhanh trung bình mất 51.1 giây cho mỗi báo cáo so với 178.5 giây cho Chế độ Tư duy, một chênh lệch mà họ mô tả là nhanh hơn khoảng 3.5 lần và gần một mức giảm hàng chục lần về thời gian tạo so với các mô hình sở hữu mà họ theo dõi.

thẻ mô hình AstaBrief 8B cho biết mô hình được cấp phép theo Apache 2.0, dựa trên Qwen3-8B, và được dự định cho mục đích nghiên cứu và giáo dục theo Hướng dẫn Sử dụng Có Trách Nhiệm của Ai2. Vì trọng số được mở, Ai2 cho rằng các tổ chức có thể chạy mô hình trên phần cứng của riêng mình, bao gồm cả phía sau tường lửa của họ, điều mà họ mô tả là cần thiết khi các câu hỏi nghiên cứu liên quan đến công việc nhạy cảm hoặc chưa công bố. Cùng với trọng số, Ai2 đã phát hành một quy trình làm việc mẫu trong kho lưu trữ GitHub ai2-scholarqa-lib của họ, mà các nhà nghiên cứu có thể điều chỉnh để tạo báo cáo từ các PDF của riêng họ.

Dữ liệu Đào tạo và Lọc

Ai2 bắt đầu từ Qwen3-8B và xây dựng AstaBrief bằng việc tinh chỉnh có giám sát, sau đó thực hiện tối ưu hoá sở thích trực tiếp (DPO). Thông báo cho biết nhóm đã cân nhắc việc đào tạo dựa trên học tăng cường, mà công trình DR Tulu trước đây của họ đã chứng minh có thể cải thiện việc tạo báo cáo dạng dài cho các mô hình trọng số mở, nhưng họ chọn phương pháp đơn giản hơn vì đào tạo học tăng cường có thể không ổn định và tốn kém, và nhóm muốn một thiết lập rẻ hơn, dễ dàng gỡ lỗi và lặp lại.

Để tăng tốc, AstaBrief được huấn luyện để viết toàn bộ báo cáo trong một lần duy nhất từ câu hỏi của người dùng và các đoạn trích được truy xuất, bỏ qua các giai đoạn tóm tắt đoạn trích và phân cụm mà Chế độ Tư duy dựa trên Claude sử dụng và không thực hiện việc viết từng phần một. Ai2 cho biết họ đã phát hiện điều này có thể thực hiện được mà không làm giảm hiệu suất.

Quy trình đào tạo bắt đầu với các câu hỏi thực tế của người dùng được gửi qua hệ thống phía sau khung làm việc ScholarQA của Ai2, nền tảng cho việc tạo báo cáo của Asta. Nhóm đã lọc các nhật ký để đảm bảo chất lượng, tính liên quan và quyền riêng tư, loại bỏ lưu lượng từ người thử nghiệm beta và bot, bỏ các câu hỏi quá ngắn để không có ý nghĩa, và sử dụng một bước dựa trên LLM để phát hiện các câu hỏi không phải tiếng Anh, yêu cầu không khoa học, và các lời nhắc chứa thông tin cá nhân. Kết quả còn lại là một kho gồm 90.000 câu hỏi tập trung vào nghiên cứu.

Đối với giai đoạn có giám sát, các mục tiêu báo cáo đầy đủ đã được tạo ra bằng quy trình ScholarQA đa bước, được hỗ trợ bởi một loạt các hệ thống độc quyền: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini và GPT-4.1. Việc lọc chất lượng đã để lại 47 000 ví dụ có thể sử dụng. Đối với DPO, các cặp được lấy từ một tập hợp phụ các truy vấn không được dùng trong quá trình tạo dữ liệu SFT: một báo cáo từ quy trình ScholarQA, thường được hỗ trợ bởi Claude 3.5 hoặc 3.7 Sonnet, so sánh với một báo cáo được tạo bởi o3, o4-mini, DeepSeek-V3 hoặc DeepSeek-R1. Hai mô hình đánh giá, GPT-4.1 và DeepSeek-R1, đã chọn người thắng cho mỗi cặp. Ai2 cho biết các đánh giá viên đồng ý với sở thích của con người 95 % thời gian, và chỉ những cặp mà cả hai đánh giá viên đều đồng ý mới được giữ lại, tạo ra khoảng 6 000 ví dụ cuối cùng. Theo thẻ mô hình, mô hình đã phát hành được khởi tạo từ checkpoint AstaBrief-8B-SFT và được tinh chỉnh trên tập dữ liệu AstaBriefDPOMix, với việc đào tạo DPO được thực hiện trong khung open‑instruct của Ai2 trên 8 GPU H100.

Kết quả Đánh giá

Mục tiêu phát triển chính của Ai2 là SQABench-CS2, mà thông báo mô tả là một tập hợp gồm 200 câu hỏi nghiên cứu khoa học máy tính do người dùng viết. Nhóm đã theo dõi bốn chỉ số: điểm rubric, đo lường mức độ nội dung cần thiết mà một báo cáo bao phủ; độ chính xác câu trả lời, đo lường mỗi đoạn có liên quan đến câu hỏi hay không; độ chính xác trích dẫn, đo lường mỗi trích dẫn có hỗ trợ cho tuyên bố kèm theo hay không; và độ thu hồi trích dẫn, đo lường liệu các tuyên bố của báo cáo có được hỗ trợ đầy đủ bởi các trích dẫn được cung cấp. Các đánh giá phụ trợ sử dụng DeepScholarBench, một bộ chuẩn 63 câu hỏi cho việc tổng hợp nghiên cứu dạng dài được xây dựng từ các bài báo arXiv gần đây, cùng với các so sánh cặp đôi so với các báo cáo từ quy trình dựa trên Claude.

Thông báo cho biết nhóm đã thử nghiệm bốn bộ lọc dựa trên thống kê trên các báo cáo huấn luyện tổng hợp: tỷ lệ token đầu ra so với đầu vào, tính liên quan của trích dẫn, mật độ trích dẫn và đa dạng trích dẫn. Ai2 cho biết những cải thiện mạnh nhất đến từ việc lọc bỏ các báo cáo có mật độ trích dẫn thấp, trong khi việc lọc mạnh hơn, kết hợp các bộ lọc và thay đổi tốc độ học không mang lại lợi ích đáng kể. Họ mô tả bài học rộng hơn như bằng chứng cho thấy chuyên môn khoa học không nhất thiết là việc thêm nhiều văn bản khoa học vào quá trình tiền huấn luyện, và rằng thành phần và chất lượng của dữ liệu sau huấn luyện có thể thay đổi đáng kể cách mô hình cuối cùng hoạt động.

Ai2 cho biết các checkpoint SFT sớm đã cải thiện chất lượng nội dung tổng thể nhưng vẫn tụt lại so với pipeline do Claude hỗ trợ về độ chính xác câu trả lời và chất lượng trích dẫn, và giai đoạn DPO đã đưa AstaBrief vào mức tương đương với pipeline Claude và DR Tulu trong việc tạo báo cáo. Thẻ mô hình báo cáo rằng trên bộ test ScholarQA‑CS2, AstaBrief‑8B đạt trung bình 87 trên các chỉ số được theo dõi, so với 83.7 cho checkpoint SFT và 77.3 cho Qwen3‑8B gốc, với AstaBrief‑8B ghi điểm 90.2 về khả năng nhớ thành phần, 89 về độ chính xác câu trả lời, 90.5 về độ chính xác trích dẫn và 78.2 về độ nhớ trích dẫn. Thẻ cũng báo cáo tỷ lệ thắng do LLM đánh giá cho AstaBrief‑8B so với pipeline Asta ScholarQA là 55 % trên tập phát triển và 72 % trên tập kiểm tra, và liệt kê các điểm DeepScholarBench là 53.50 cho AstaBrief‑8B, 60.25 cho Asta ScholarQA và 56.26 cho DR‑Tulu‑8B.

Trong một nghiên cứu người dùng riêng được mô tả trong thông báo, ba nhà nghiên cứu khoa học mỗi người đóng góp bốn đến năm câu hỏi trong một bộ 14 câu hỏi và xếp hạng các báo cáo từ ba hệ thống dựa trên sở thích tổng thể, độ đầy đủ, tính liên quan, tổ chức và độ chính xác trích dẫn, cho phép có kết quả hòa. Ai2 báo cáo rằng DR Tulu thắng về sở thích tổng thể, trong khi hai trong ba nhà nghiên cứu ưu tiên AstaBrief hơn các hệ thống khác về độ chính xác trích dẫn.

Ai2 cảnh báo rằng phần lớn quá trình đào tạo và đánh giá đã được hoàn thành vào năm 2025, các mô hình độc quyền được sử dụng để tạo dữ liệu đào tạo và làm điểm so sánh phản ánh mức độ tiên tiến tại thời điểm đó, và công ty chưa thực hiện lại toàn bộ đánh giá đối chiếu với các mô hình tiên tiến hiện tại.

Sử dụng ban đầu và các bước tiếp theo đã nêu

Ai2 báo cáo rằng trong số 374 người dùng Asta đã thử chế độ Fast, 29.1 % đã sử dụng nó trong hai ngày trở lên, người dùng tạo trung bình 3.67 chuỗi báo cáo, 23 % không bao giờ chuyển lại sang chế độ Thinking cho các chuỗi sau, và thêm 18 % xen kẽ giữa các chế độ tùy theo mục tiêu, sử dụng chế độ Fast cho khoảng 40 % các chuỗi của họ. Phản hồi tích cực đạt 84.2 % cho chế độ Fast so với 85.2 % cho chế độ Thinking, mà Ai2 mô tả là tỷ lệ tương đương đồng thời lưu ý rằng phản hồi thường quá ít để hỗ trợ các kết luận mạnh mẽ.

Ai2 cho biết đang khám phá việc học sở thích chi tiết hơn, các phương pháp RAG‑plus‑RL mạnh mẽ hơn, khả năng đa vòng và đa công cụ, các nguồn dữ liệu khoa học bổ sung, và phân tách truy vấn, cùng với các đánh giá kiểm tra xem mô hình có duy trì phạm vi bằng chứng của các nguồn tham chiếu hay mở rộng những gì các nghiên cứu nền tảng đã thiết lập. Thông báo đặt công việc này trong bối cảnh nỗ lực mô hình khoa học rộng hơn của Ai2, bao gồm NSF OMAI, một sáng kiến quốc gia của Hoa Kỳ do Ai2 dẫn đầu nhằm xây dựng hạ tầng AI mở hoàn toàn và các mô hình cho khám phá khoa học, và mô tả AstaBrief như một thí nghiệm trong chuỗi công việc dài hơn, bắt đầu từ ScholarQA và DR Tulu đến các phiên bản tương lai của Olmo.

Jonas Reeve là một nhà phân tích được tạo ra bằng AI tại Unite.AI, tập trung vào AI nhận thức, trí tuệ nhân tạo chung (AGI), và các nền tảng lý thuyết của trí thông minh máy móc. Công việc của ông khám phá cách mà học tập, suy luận, trí nhớ và trừu tượng xuất hiện trong cả hệ thống sinh học và nhân tạo, tạo ra các mối liên kết giữa kiến trúc AI hiện đại và những câu hỏi lâu đời trong khoa học nhận thức và triết học tâm trí.

Với cách tiếp cận khái niệm và suy ngẫm, Jonas xem xét các khung như mô hình suy luận, hệ thống đại lý, nhận thức nổi lên, và lý thuyết cân chỉnh, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì — và không phải là gì. Thay vì chạy theo các thời gian biểu hay sự thổi phồng, ông nhấn mạnh các nguyên tắc nền tảng, tính chặt chẽ khái niệm, và giới hạn của các mô hình hiện tại.

Các bài viết do Jonas Reeve viết được tạo ra bằng AI và được đội ngũ biên tập của Unite.AI xem xét để đảm bảo độ chính xác, rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.