Μοντέλα και πλατφόρμες AI

Η Ai2 δημοσιεύει ανοιχτά το AstaBrief 8B για γρήγορη δημιουργία επιστημονικών αναφορών

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Το Allen Institute for AI (Ai2) δήλωσε στις 2 Οκτωβρίου 2026 ότι δημοσιοποιεί ανοιχτά το AstaBrief 8B, ένα μοντέλο που μετατρέπει μια ερευνητική ερώτηση και αποσπάσματα λογοτεχνίας σε μια αναφορά με παραπομπές, απελευθερώνοντας τα βάρη του μοντέλου και τα δεδομένα εκπαίδευσης καθώς το σύστημα ενεργοποιείται ως Fast mode στο Asta, την πλατφόρμα του για επιστημονική εργασία.

Fast Mode στη δημιουργία αναφορών του Asta

AstaBrief είναι διαθέσιμο στη λειτουργία «Generate a report» του Asta ως Fast mode, λειτουργώντας παράλληλα με την υπάρχουσα Claude‑powered Thinking mode, σύμφωνα με την ανακοίνωση του Ai2. Το Ai2 λέει ότι ο στόχος του ήταν να δοκιμάσει αν ένα μικρό, ανοιχτό μοντέλο που εκπαιδεύτηκε ειδικά για δημιουργία επιστημονικών αναφορών μπορεί να ταιριάξει στην ποιότητα των αναφορών των ιδιόκτητων μοντέλων που χρησιμοποιούσε, ενώ μειώνει τον χρόνο δημιουργίας και το κόστος εξυπηρέτησης. Το Ai2 αναφέρει ότι σε ολόκληρο τον αγωγό Asta, το Fast mode έχει μέσο χρόνο 51.1 δευτερόλεπτα ανά αναφορά, σε σύγκριση με 178.5 δευτερόλεπτα για τη Thinking mode, μια διαφορά που περιγράφεται ως περίπου 3.5 φορές πιο γρήγορο και σχεδόν μείωση κατά μια τάξη μεγέθους στον χρόνο δημιουργίας σε σχέση με τα ιδιότητα μοντέλα που παρακολουθήθηκαν.

Η κάρτα μοντέλου AstaBrief 8B δηλώνει ότι το μοντέλο αδειοδοτείται υπό την Apache 2.0, βασίζεται στο Qwen3-8B και προορίζεται για ερευνητική και εκπαιδευτική χρήση σύμφωνα με τις Οδηγίες Υπεύθυνης Χρήσης του Ai2. Επειδή τα βάρη είναι ανοιχτά, το Ai2 λέει ότι τα ιδρύματα μπορούν να εκτελέσουν το μοντέλο στο δικό τους υλικό, συμπεριλαμβανομένου του τείχους προστασίας τους, κάτι που περιγράφεται ως απαραίτητο όταν οι ερευνητικές ερωτήσεις αφορούν ευαίσθητη ή αδημοσίευτη εργασία. Παράλληλα με τα βάρη, το Ai2 κυκλοφόρησε ένα παράδειγμα ροής εργασίας στο αποθετήριο ai2-scholarqa-lib GitHub, το οποίο οι ερευνητές μπορούν να προσαρμόσουν για να δημιουργούν αναφορές από τα δικά τους PDF.

Δεδομένα Εκπαίδευσης και Φιλτράρισμα

Το Ai2 ξεκίνησε από το Qwen3-8B και δημιούργησε το AstaBrief με επιβλεπόμενη λεπτοεξατομίκευση, ακολουθούμενη από άμεση βελτιστοποίηση προτίμησης (DPO). Η ανακοίνωση λέει ότι η ομάδα σκέφτηκε εκπαίδευση βασισμένη στην ενίσχυση μάθησης, η οποία σε προηγούμενη εργασία DR Tulu είχε δείξει ότι μπορεί να βελτιώσει τη δημιουργία εκτενών αναφορών για μοντέλα ανοιχτών βαρών, αλλά επέλεξε τη πιο απλή προσέγγιση επειδή η εκπαίδευση RL μπορεί να είναι ασταθής και δαπανηρή, και η ομάδα ήθελε μια ρύθμιση που να είναι φθηνότερη και πιο εύκολη στην αποσφαλμάτωση και την επανάληψη.

Για ταχύτητα, το AstaBrief εκπαιδεύτηκε να γράφει ολόκληρη την αναφορά σε μία μόνο διέλευση από το ερώτημα του χρήστη και τα ανακτημένα αποσπάσματα, παρακάμπτοντας τα στάδια περίληψης αποσπασμάτων και ομαδοποίησης που χρησιμοποιεί η Claude‑based Thinking mode και παραλείποντας τη γραφή τμήμα προς τμήμα. Το Ai2 λέει ότι διαπίστωσε ότι αυτό ήταν εφικτό χωρίς να θυσιάσει την απόδοση.

Η αλυσίδα εκπαίδευσης ξεκίνησε με πραγματικά ερωτήματα χρηστών που υποβλήθηκαν μέσω του συστήματος πίσω από το ScholarQA framework του Ai2, το οποίο υποστηρίζει τη δημιουργία αναφορών του Asta. Η ομάδα φιλτράρισε τα αρχεία καταγραφής για ποιότητα, συνάφεια και ιδιωτικότητα, αφαιρώντας κίνηση βήτα‑τεστών και bot, απορρίπτοντας ερωτήματα που ήταν πολύ σύντομα για να είναι ουσιαστικά, και χρησιμοποιώντας μια διεργασία βασισμένη σε LLM για να εντοπίσει ερωτήματα μη‑αγγλικής γλώσσας, μη‑επιστημονικά αιτήματα και προτροπές που περιείχαν προσωπικές πληροφορίες. Αυτό άφησε μια δεξαμενή 90 000 ερωτημάτων με έμφαση στην έρευνα.

Για το εποπτευόμενο στάδιο, οι στόχοι πλήρους αναφοράς δημιουργήθηκαν με την πολυ-βηματική διαδικασία ScholarQA, υποστηριζόμενη από ένα μείγμα ιδιόκτητων συστημάτων: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini και GPT-4.1. Η φιλτράρισμα ποιότητας άφησε 47 000 χρήσιμα παραδείγματα. Για το DPO, τα ζεύγη προήλθαν από ένα ξεχωριστό υποσύνολο ερωτημάτων που δεν χρησιμοποιήθηκαν κατά τη δημιουργία δεδομένων SFT: μια αναφορά από τη διαδικασία ScholarQA, συνήθως υποστηριζόμενη από Claude 3.5 ή 3.7 Sonnet, έναντι μιας αναφοράς που δημιουργήθηκε από o3, o4-mini, DeepSeek-V3 ή DeepSeek-R1. Δύο μοντέλα κριτών, GPT-4.1 και DeepSeek-R1, επέλεξαν νικητή για κάθε ζεύγος. Η Ai2 αναφέρει ότι οι κριτές συμφώνησαν με τις ανθρώπινες προτιμήσεις στο 95 % των περιπτώσεων, και μόνο τα ζεύγη στα οποία συμφώνησαν και οι δύο κριτές διατηρήθηκαν, παράγοντας περίπου 6 000 τελικά παραδείγματα. Σύμφωνα με την κάρτα μοντέλου, το κυκλοφορημένο μοντέλο αρχικοποιήθηκε από το σημείο ελέγχου AstaBrief-8B-SFT και βελτιώθηκε με το σύνολο δεδομένων AstaBriefDPOMix, με την εκπαίδευση DPO να διεξάγεται στο πλαίσιο open‑instruct της Ai2 σε 8 xH100 GPUs.

Αποτελέσματα Αξιολόγησης

Ο κύριος στόχος ανάπτυξης του Ai2 ήταν το SQABench-CS2, το οποίο η ανακοίνωση περιγράφει ως ένα σύνολο 200 ερωτήσεων έρευνας πληροφορικής που γράφτηκαν από χρήστες. Η ομάδα παρακολούθησε τέσσερις μετρικές: το σκορ ρυθμιστικού πίνακα, που μετρά πόσο απαραίτητο περιεχόμενο καλύπτει μια αναφορά· την ακρίβεια απάντησης, που μετρά αν κάθε παράγραφος είναι σχετική με την ερώτηση· την ακρίβεια παραπομπής, που μετρά αν κάθε παραπομπή υποστηρίζει τον ισχυρισμό που της συνδέεται· και την ανάκληση παραπομπής, που μετρά αν οι ισχυρισμοί μιας αναφοράς υποστηρίζονται πλήρως από τις παρεχόμενες παραπομπές. Δευτερεύουσες αξιολογήσεις χρησιμοποίησαν το DeepScholarBench, ένα benchmark με 63 ερωτήματα για μακροπρόθεσμη σύνθεση έρευνας, χτισμένο από πρόσφατα άρθρα arXiv, καθώς και συγκρίσεις ζεύγους έναντι αναφορών από την Claude‑powered αλυσίδα.

Η ανακοίνωση αναφέρει ότι η ομάδα δοκίμασε τέσσερα φίλτρα βασισμένα σε στατιστικές σε συνθετικές αναφορές εκπαίδευσης: λόγο token εξόδου προς είσοδο, συνάφεια παραπομπής, πυκνότητα παραπομπής και ποικιλία παραπομπής. Το Ai2 λέει ότι τα πιο ισχυρά κέρδη προέκυψαν από το φιλτράρισμα αναφορών με χαμηλή πυκνότητα παραπομπής, ενώ πιο επιθετικό φιλτράρισμα, συνδυασμοί φίλτρων και διακυμάνσεις του ρυθμού εκμάθησης δεν πρόσθεσαν ουσιαστικά κέρδη. Περιγράφει το ευρύτερο μάθημα ως απόδειξη ότι η επιστημονική εξειδίκευση δεν είναι απαραίτητα θέμα προσθήκης περισσότερου επιστημονικού κειμένου στην προεκπαίδευση, και ότι η σύνθεση και η ποιότητα των δεδομένων μετά την εκπαίδευση μπορούν να αλλάξουν ουσιαστικά την απόδοση του τελικού μοντέλου.

Το Ai2 αναφέρει ότι τα πρώτα σημεία ελέγχου SFT βελτίωσαν τη συνολική ποιότητα του περιεχομένου, αλλά παρέμειναν πίσω από τη γραμμή παραγωγής Claude όσον αφορά την ακρίβεια των απαντήσεων και την ποιότητα των παραπομπών, και ότι το στάδιο DPO έφερε το AstaBrief σε απόσταση από τη γραμμή Claude και το DR Tulu στην παραγωγή αναφορών. Η κάρτα μοντέλου αναφέρει ότι στο σύνολο δοκιμών ScholarQA‑CS2, το AstaBrief‑8B σημείωσε μέσο όρο 87 στα παρακολουθούμενα μετρικά, σε σύγκριση με 83,7 για το σημείο ελέγχου SFT και 77,3 για το βασικό Qwen3‑8B, με το AstaBrief‑8B να καταγράφει 90,2 στην ανάκληση συστατικών, 89 στην ακρίβεια απάντησης, 90,5 στην ακρίβεια παραπομπής και 78,2 στην ανάκληση παραπομπής. Η κάρτα αναφέρει επίσης ποσοστά νίκης που αξιολογήθηκαν από LLM για το AstaBrief‑8B έναντι της γραμμής Asta ScholarQA, 55 % στο σύνολο ανάπτυξης και 72 % στο σύνολο δοκιμής, και παραθέτει βαθμολογίες DeepScholarBench 53,50 για το AstaBrief‑8B, 60,25 για το Asta ScholarQA και 56,26 για το DR‑Tulu‑8B.

Σε ξεχωριστή ανθρώπινη μελέτη που περιγράφεται στην ανακοίνωση, τρεις επιστημονικοί ερευνητές συνέβαλαν καθένας με τέσσερις έως πέντε ερωτήσεις σε ένα σύνολο 14 ερωτήσεων και αξιολόγησαν τις αναφορές των τριών συστημάτων βάσει συνολικής προτίμησης, πληρότητας, συνάφειας, οργάνωσης και ακρίβειας παραπομπών, με δυνατότητα ισοπαλιών. Το Ai2 αναφέρει ότι το DR Tulu κέρδισε στη συνολική προτίμηση, ενώ δύο από τους τρεις ερευνητές προτιμούσαν το AstaBrief έναντι των άλλων συστημάτων στην ακρίβεια παραπομπών.

Το Ai2 προειδοποιεί ότι η πλειονότητα της εκπαίδευσης και της αξιολόγησης ολοκληρώθηκε το 2025, ότι τα ιδιόκτητα μοντέλα που χρησιμοποιήθηκαν για τη δημιουργία δεδομένων εκπαίδευσης και ως σημεία σύγκρισης αντανακλούν το επίπεδο της τεχνολογίας εκείνη τη στιγμή, και ότι δεν έχει επανεκτελέσει την πλήρη αξιολόγηση έναντι των τρεχουσών κορυφαίων μοντέλων.

Πρώιμη Χρήση και Ανακοινωμένα Επόμενα Βήματα

Το Ai2 αναφέρει ότι μεταξύ των 374 χρηστών του Asta που έχουν δοκιμάσει τη λειτουργία Fast, το 29,1 % την χρησιμοποίησε δύο ή περισσότερες ημέρες, οι χρήστες δημιούργησαν κατά μέσο όρο 3,67 νήματα αναφορών, το 23 % δεν επέστρεψε ποτέ στη λειτουργία Thinking για μελλοντικά νήματα, και άλλα 18 % εναλλάχτηκαν μεταξύ των λειτουργιών ανάλογα με τους στόχους τους, χρησιμοποιώντας τη λειτουργία Fast για περίπου το 40 % των νημάτων τους. Η θετική ανταπόκριση έφτασε το 84,2 % για τη λειτουργία Fast έναντι 85,2 % για τη λειτουργία Thinking, κάτι που το Ai2 χαρακτηρίζει ως παρόμοιο ποσοστό, ενώ σημειώνει ότι τα σχόλια είναι γενικά πολύ σπάνια για να υποστηρίξουν ισχυρά συμπεράσματα.

Το Ai2 δηλώνει ότι εξερευνά πιο λεπτομερή εκμάθηση προτιμήσεων, ισχυρότερες προσεγγίσεις RAG‑plus‑RL, δυνατότητες πολλαπλών γύρων και πολλαπλών εργαλείων, πρόσθετες πηγές επιστημονικών δεδομένων και αποσύνθεση ερωτημάτων, μαζί με αξιολογήσεις που ελέγχουν εάν ένα μοντέλο διατηρεί το αποδεικτικό εύρος των πηγών του αντί να επεκτείνει όσα είχαν καθορίσει οι υποκείμενες μελέτες. Η ανακοίνωση εντάσσει το έργο στο ευρύτερο πλαίσιο επιστημονικών μοντέλων του Ai2, συμπεριλαμβανομένου του NSF OMAI, μιας εθνικής πρωτοβουλίας των ΗΠΑ που ηγείται το Ai2 για την κατασκευή πλήρως ανοιχτής υποδομής AI και μοντέλων για την επιστημονική ανακάλυψη, και περιγράφει το AstaBrief ως ένα πείραμα σε μια μακρύτερη σειρά εργασιών που εκτείνεται από το ScholarQA και το DR Tulu έως μελλοντικές εκδόσεις του Olmo.

Jonas Reeve είναι ένας αναλυτής που δημιουργείται από AI στην Unite.AI, εστιάζοντας στην γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τα θεωρητικά θεμέλια της μηχανικής νοημοσύνης. Η δουλειά του διερευνά πώς η μάθηση, η λογική, η μνήμη και η αφαίρεση εμφανίζονται τόσο σε βιολογικά όσο και σε τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ των σύγχρονων αρχιτεκτονικών AI και των μακροχρόνιων ερωτήσεων στην γνωστική επιστήμη και τη φιλοσοφία του νου.

Με μια εννοιολογική και στοχαστική προσέγγιση, ο Jonas εξετάζει πλαίσια όπως μοντέλα λογικής, συστήματα πράκτορα, αναδυόμενη γνωστική λειτουργία και θεωρία ευθυγράμμισης, με στόχο να διευκρινίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI — και τι δεν σημαίνει. Αντί να κυνηγά χρονοδιαγράμματα ή υπερβολές, δίνει έμφαση στις πρώτες αρχές, στην εννοιολογική αυστηρότητα και στα όρια των τρεχουσών μοντέλων.

Τα άρθρα που συντάσσει ο Jonas Reeve δημιουργούνται από AI και ελέγχονται από την ομάδα συντακτών της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση των προχωρημένων εννοιών AI.