Μοντέλα και πλατφόρμες AI

Η Tülu 3 της Allen AI έγινε ο απροσδόκητος αντίπαλός της DeepSeek

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Οι العناوινες συνεχίζουν να έρχονται. Τα μοντέλα της DeepSeek έχουν προκαλέσει προκλήσεις, έχουν θέσει νέα πρότυπα και έχουν κάνει πολύ θόρυβο. Nhưng κάτι ενδιαφέρον μόλις συνέβη στη σκηνή της έρευνας AI που αξίζει επίσης την προσοχή σας.

Allen AI κυκλοφόρησε ήσυχα το νέο μοντέλο Tülu 3, και η έκδοση των 405B παραμέτρων δεν ανταγωνίζεται μόνο την DeepSeek – τη ξεπερνά ή την ισοφαρίζει σε βασικά benchmarκs.

Ας τοποθετήσουμε αυτό σε προοπτική.

Το μοντέλο Tülu 3 405B ανταγωνίζεται κορυφαίους performers όπως το DeepSeek V3 σε eine σειρά από εργασίες. Βλέπουμε συγκρίσιμη ή ανώτερη απόδοση σε περιοχές όπως μαθηματικά προβλήματα, προκλήσεις κωδικοποίησης και ακριβή ακολουθία οδηγιών. Και το κάνουν αυτό με μια πλήρως ανοιχτή προσέγγιση.

Έχουν κυκλοφορήσει την πλήρη διαδικασία εκπαίδευσης, τον κώδικα και ακόμη και τη νέα μέθοδο ενίσχυσης μάθησης που ονομάζεται Reinforcement Learning με Verifiable Rewards (RLVR) που έκανε αυτό δυνατό.

Αναπτύξεις όπως αυτές τις τελευταίες εβδομάδες αλλάζουν πραγματικά τον τρόπο με τον οποίο συμβαίνει η ανάπτυξη AI υψηλού επιπέδου. Όταν ένα πλήρως ανοιχτό μοντέλο μπορεί να ανταγωνιστεί τα καλύτερα κλειστά μοντέλα εκεί έξω, ανοίγει δυνατότητες που προηγουμένως ήταν κλειδωμένες πίσω από ιδιωτικά εταιρικά τοίχους.

Η Τεχνική Μάχη

Τι έκανε το Tülu 3 να ξεχωρίσει; Κατάγεται σε μια μοναδική τετραβάθμια διαδικασία εκπαίδευσης που υπερβαίνει τις παραδοσιακές προσεγγίσεις.

Ας δούμε πώς η Allen AI κατασκεύασε αυτό το μοντέλο:

Στάδιο 1: Στρατηγική Επιλογή Δεδομένων

Η ομάδα ήξερε ότι η ποιότητα του μοντέλου αρχίζει με την ποιότητα των δεδομένων. Συνδύασε καθιερωμένα σύνολα δεδομένων όπως WildChat και Open Assistant με εξατομικευμένο περιεχόμενο. Αλλά εδώ είναι η κλειδί εικόνα: δεν συναρμολόγησαν απλώς δεδομένα – δημιούργησαν στοχευμένα σύνολα δεδομένων για συγκεκριμένες δεξιότητες όπως μαθηματική συλλογιστική και ικανότητα κωδικοποίησης.

Στάδιο 2: Κατασκευή Καλύτερων Απαντήσεων

Στο δεύτερο στάδιο, η Allen AI εστιάστηκε στην διδασκαλία του μοντέλου συγκεκριμένων δεξιοτήτων. Δημιούργησαν διαφορετικά σύνολα δεδομένων εκπαίδευσης – κάποια για μαθηματικά, άλλα για κωδικοποίηση και περισσότερα για γενικές εργασίες. Με τον επαναλαμβανόμενο έλεγχο αυτών των συνδυασμών, μπορούσαν να δουν ακριβώς哪里 το μοντέλο εξέχουν και哪里 χρειάζεται δουλειά. Αυτή η επαναλαμβανόμενη διαδικασία αποκάλυψε το πραγματικό δυναμικό του Tülu 3 σε κάθε περιοχή.

Στάδιο 3: Μάθηση από Συγκρίσεις

Εδώ η Allen AI έγινε δημιουργική. Κατασκεύασαν ένα σύστημα που μπορούσε να συγκρίνει άμεσα τις απαντήσεις του Tülu 3 με άλλα κορυφαία μοντέλα. Αλλά επίσης λύσαν ένα επίμονο πρόβλημα στην AI – την τάση των μοντέλων να γράφουν μακρές απαντήσεις μόνο για το χάρη του μήκους. Η προσέγγισή τους, χρησιμοποιώντας length-normalized Direct Preference Optimization (DPO), σήμαινε ότι το μοντέλο έμαθε να αξιολογεί την ποιότητα πάνω από την ποσότητα. Το αποτέλεσμα; Απαντήσεις που είναι και ακριβείς και σκοπιμές.

Όταν τα μοντέλα AI μαθαίνουν από προτιμήσεις (ποια απάντηση είναι καλύτερη, Α ή Β;), έχουν την τάση να αναπτύσσουν μια εύκολη προκατάληψη: αρχίζουν να πιστεύουν ότι οι μακρές απαντήσεις είναι πάντα καλύτερες. Είναι σαν να προσπαθούν να κερδίσουν λέγοντας περισσότερα αντί να λέγουν τα πράγματα καλά.

Η length-normalized DPO διορθώνει αυτό το πρόβλημα,調整οντας τον τρόπο με τον οποίο το μοντέλο μαθαίνει από προτιμήσεις. Αντί να κοιτάζει μόνο ποια απάντηση προτιμήθηκε, λαμβάνει υπόψη το μήκος κάθε απάντησης. Σκεφτείτε το ως κρίση των απαντήσεων με βάση την ποιότητα ανά λέξη, όχι μόνο την συνολική επίδραση.

Γιατί αυτό έχει σημασία; Επειδή βοηθά το Tülu 3 να μάθει να είναι ακριβές και αποτελεσματικό. Αντί να γεμίζει τις απαντήσεις με επιπλέον λέξεις για να φαίνονται πιο ολοκληρωμένες, μαθαίνει να παρέχει αξία σε όποιο μήκος είναι πραγματικά απαραίτητο.

Αυτό μπορεί να φαίνεται như μια μικρή λεπτομέρεια, αλλά είναι κρίσιμο για την κατασκευή AI που επικοινωνεί φυσικά. Οι καλύτεροι ανθρώπινοι εμπειρογνώμονες ξέρουν πότε να είναι συντομότεροι και πότε να επεκτείνουν – και αυτό είναι ακριβώς αυτό που η length-normalized DPO βοηθά το μοντέλο να μάθει.

Στάδιο 4: Η καινοτομία του RLVR

Αυτή είναι η τεχνική επέκταση που αξίζει προσοχής. Το RLVR αντικαθιστά τους υποκειμενικούς μοντέλους ανταμοιβής με συγκεκριμένες επαλήθευσεις.

Τα περισσότερα μοντέλα AI μαθαίνουν μέσω ενός σύνθετου συστήματος μοντέλων ανταμοιβής – ουσιαστικά εκπαιδευμένες εκτιμήσεις για το τι κάνει μια καλή απάντηση. Αλλά η Allen AI ακολούθησε einen διαφορετικό δρόμο με το RLVR.

Σκεφτείτε πώς εκπαιδεύουμε τώρα τα μοντέλα AI. Συνήθως χρειαζόμαστε άλλα μοντέλα AI (τα λεγόμενα μοντέλα ανταμοιβής) για να κρίνουν αν μια απάντηση είναι καλή ή όχι. Είναι υποκειμενικό, σύνθετο και συχνά ασυνεπές. Ορισμένες απαντήσεις μπορεί να φαίνονται καλές αλλά να περιέχουν λεπτές λάθη που διαφεύγουν.

Το RLVR αναστρέφει αυτήν την προσέγγιση. Αντί να βασίζεται σε υποκειμενικές κρίσεις, χρησιμοποιεί συγκεκριμένες, επαλήθευσιμες αποτελέσματα. Όταν το μοντέλο προσπαθεί να λύσει ένα μαθηματικό πρόβλημα, δεν υπάρχει γκρίζα ζώνη – η απάντηση είναι είτε σωστή είτε λάθος. Όταν γράφει κώδικα, ο κώδικας είτε εκτελείται σωστά είτε όχι.

Εδώ γίνεται πιο ενδιαφέρον:

  • Το μοντέλο λαμβάνει άμεση, δυαδική ανατροφοδότηση: 10 πόντους για σωστές απαντήσεις, 0 για λάθος
  • Δεν υπάρχει χώρος για μερική πίστωση ή ασαφή αξιολόγηση
  • Η μάθηση γίνεται εστιασμένη και ακριβής
  • Το μοντέλο μαθαίνει να προτιμά την ακρίβεια από τις πιθανές αλλά λανθασμένες απαντήσεις

RLVR Training (Allen AI)

Τα αποτελέσματα; Το Tülu 3 έδειξε σημαντικές βελτιώσεις σε εργασίες όπου η ορθότητα έχει σημασία. Η απόδοσή του σε μαθηματική συλλογιστική (GSM8K benchmark) και προκλήσεις κωδικοποίησης αυξήθηκε σημαντικά. Ακόμη και η ακολουθία οδηγιών του έγινε πιο ακριβής επειδή το μοντέλο έμαθε να αξιολογεί την συγκεκριμένη ακρίβεια πάνω από τις προσεγγιστικές απαντήσεις.

Τι κάνει αυτό ιδιαίτερα ενθουσιαστικό είναι το πώς αλλάζει το παιχνίδι για την ανοιχτή πηγή AI. Προηγούμενες προσεγγίσεις συχνά αγωνίζονταν να ταιριάσουν με την ακρίβεια των κλειστών μοντέλων στις τεχνικές εργασίες. Το RLVR δείχνει ότι με την σωστή προσέγγιση εκπαίδευσης, τα ανοιχτά μοντέλα μπορούν να επιτύχουν το ίδιο επίπεδο αξιοπιστίας.

Μια Ματιά στα Νούμερα

Η έκδοση των 405B παραμέτρων του Tülu 3 ανταγωνίζεται άμεσα τα κορυφαία μοντέλα στο πεδίο. Ας εξετάσουμε όπου ξεχωρίζει και τι σημαίνει αυτό για την ανοιχτή πηγή AI.

Μαθηματικά

Το Tülu 3 ξεχωρίζει στα σύνθετα μαθηματικά. Σε benchmarκs όπως το GSM8K και το MATH, ταιριάζει με την απόδοση της DeepSeek. Το μοντέλο χειρίζεται προβλήματα πολλαπλών βημάτων και δείχνει ισχυρές μαθηματικές ικανότητες.

Κωδικοποίηση

Τα αποτελέσματα κωδικοποίησης είναι εξίσου εντυπωσιακά. Χάρη στην εκπαίδευση RLVR, το Tülu 3 γράφει κώδικα που λύνει προβλήματα αποτελεσματικά. Η δύναμή του лежει στην κατανόηση οδηγιών κωδικοποίησης και την παραγωγή λειτουργικών λύσεων.

Ακριβής Ακολουθία Οδηγιών

Η ικανότητα του μοντέλου να ακολουθεί οδηγίες ξεχωρίζει ως μια βασική δύναμη. Ενώ πολλά μοντέλα προσεγγίζουν ή γενικεύουν τις οδηγίες, το Tülu 3 δείχνει αξιοσημείωτη ακρίβεια στην εκτέλεση ακριβώς того που ζητείται.

Ανοίγοντας το Μαύρο Κουτί της Ανάπτυξης AI

Η Allen AI κυκλοφόρησε ένα ισχυρό μοντέλο και την πλήρη διαδικασία ανάπτυξής του.

Κάθε аспект της διαδικασίας εκπαίδευσης είναι τεκμηριωμένος και προσπελάσιμος. Από την τετραβάθμια προσέγγιση μέχρι τις μεθόδους προετοιμασίας δεδομένων και την υλοποίηση του RLVR – η πλήρη διαδικασία βρίσκεται ανοιχτή για μελέτη και αναπαραγωγή. Αυτή η διαφάνεια θέτει ένα νέο πρότυπο στην ανάπτυξη AI υψηλού επιπέδου.

Οι dévelopπεurs λαμβάνουν πλήρεις πόρους:

  • Πλήρεις διαδικασίες εκπαίδευσης
  • Εργαλεία επεξεργασίας δεδομένων
  • Πλαίσια αξιολόγησης
  • Προδιαγραφές υλοποίησης

Αυτό τους επιτρέπει:

  • Να τροποποιήσουν τις διαδικασίες εκπαίδευσης
  • Να προσαρμόσουν μεθόδους για συγκεκριμένες ανάγκες
  • Να χτίσουν πάνω σε αποδεδειγμένες προσεγγίσεις
  • Να δημιουργήσουν εξειδικευμένες υλοποιήσεις

Αυτή η ανοιχτή προσέγγιση επιταχύνει την καινοτομία σε όλο το πεδίο. Οι ερευνητές μπορούν να χτίσουν πάνω σε επικυρωμένες μεθόδους, ενώ οι dévelopπεurs μπορούν να επικεντρωθούν στις βελτιώσεις αντί να ξεκινούν από το μηδέν.

Η Άνοδος της Ανοιχτής Πηγής

Η επιτυχία του Tülu 3 είναι ένα μεγάλο γεγονός για την ανάπτυξη ανοιχτής πηγής AI. Όταν τα ανοιχτά μοντέλα ισοφαρίζουν ή υπερβαίνουν τις ιδιωτικές εναλλακτικές, αυτό αλλάζει ουσιαστικά τη βιομηχανία. Οι ερευνητικές ομάδες σε όλο τον κόσμο λαμβάνουν πρόσβαση σε αποδεδειγμένες μεθόδους, επιταχύνοντας την εργασία τους και γεννώντας νέες καινοτομίες. Τα ιδιωτικά εργαστήρια AI θα πρέπει να προσαρμοστούν – είτε αυξάνοντας τη διαφάνεια είτε ωθώντας τα τεχνικά όρια ακόμη παραπέρα.

Κοιτάζοντας μπροστά, οι καινοτομίες του Tülu 3 στις επαλήθευσιμες ανταμοιβές και την πολυβάθμια εκπαίδευση δείχνουν τι έρχεται. Οι ομάδες μπορούν να χτίσουν πάνω σε αυτές τις βάσεις, потенτικά ωθώντας την απόδοση ακόμη υψηλότερα. Ο κώδικας υπάρχει, οι μέθοδοι είναι τεκμηριωμένες και μια νέα κυματική ανάπτυξη AI έχει ξεκινήσει. Για τους développeurs και ερευνητές, η ευκαιρία να πειραματιστούν και να βελτιώσουν αυτές τις μεθόδους σηματοδοτεί την αρχή ενός ενθουσιαστικού κεφαλαίου στην ανάπτυξη AI.

Συχνές Ερωτήσεις (FAQ) για το Tülu 3

Τι είναι το Tülu 3 και ποίες είναι οι βασικές του λειτουργίες;

Το Tülu 3 είναι μια οικογένεια ανοιχτών μοντέλων LLMs που αναπτύχθηκε από την Allen AI, βασισμένο στην αρχιτεκτονική Llama 3.1. Διατίθεται σε διάφορους μεγέθους (8B, 70B και 405B παραμέτρων). Το Tülu 3 σχεδιάστηκε για βελτιωμένη απόδοση σε διάφορες εργασίες, συμπεριλαμβανομένης της γνώσης, της συλλογιστικής, των μαθηματικών, της κωδικοποίησης, της ακολουθίας οδηγιών και της ασφάλειας.

Τι είναι η διαδικασία εκπαίδευσης του Tülu 3 και ποια δεδομένα χρησιμοποιούνται;

Η εκπαίδευση του Tülu 3 περιλαμβάνει αρκετά βασικά στάδια. Πρώτα, η ομάδα επιλέγει μια ποικιλία από προτροπές από δημόσια σύνολα δεδομένων και συνθετικά δεδομένα που στοχεύουν σε συγκεκριμένες δεξιότητες, διασφαλίζοντας ότι τα δεδομένα είναι απαλλαγμένα από τα benchmarκs. Δεύτερον, πραγματοποιείται η επιμέρους εκπαίδευση (SFT) σε ένα μείγμα δεδομένων ακολουθίας οδηγιών, μαθηματικών και κωδικοποίησης. Τρίτον, χρησιμοποιείται η άμεση προτίμηση βελτιστοποίησης (DPO) με δεδομένα προτίμησης που παράγονται μέσω ανθρώπινης και LLM ανατροφοδότησης. Τέλος, χρησιμοποιείται η Ενίσχυση Μάθησης με Επαλήθευσιμες Ανταμοιβές (RLVR) για εργασίες με μετρήσιμη ορθότητα. Το Tülu 3 χρησιμοποιεί επιμελημένα σύνολα δεδομένων για κάθε στάδιο, συμπεριλαμβανομένων οδηγιών που οδηγούνται από προσωπικότητες, μαθηματικά και δεδομένα κωδικοποίησης.

Πώς αντιμετωπίζει το Tülu 3 την ασφάλεια και ποια μετρικά χρησιμοποιούνται για την αξιολόγησή της;

Η ασφάλεια είναι ένα βασικό στοιχείο της ανάπτυξης του Tülu 3, που αντιμετωπίζεται καθ’ όλη τη διάρκεια της διαδικασίας εκπαίδευσης. Χρησιμοποιείται ένα σύνολο δεδομένων ασφαλείας κατά την επιμέρους εκπαίδευση (SFT), το οποίο είναι σε μεγάλο βαθμό ορθογώνιο σε άλλα δεδομένα που προσανατολίζονται σε εργασίες.

Τι είναι το RLVR;

Το RLVR είναι μια τεχνική όπου το μοντέλο εκπαιδεύεται να βελτιστοποιεί έναν επαλήθευσιμο ανταγωνισμό, όπως η ορθότητα μιας απάντησης. Αυτό διαφέρει από την παραδοσιακή RLHF, η οποία χρησιμοποιεί ένα μοντέλο ανταμοιβής.

Ο Alex ηγείται των λειτουργιών ειδήσεων με τεχνητή νοημοσύνη της Unite.AI, συνδυάζοντας δημοσιογραφία, έρευνα και αυτοματοποίηση για να υποστηρίξει έγκαιρη και κλιμακώσιμη κάλυψη της τεχνητής νοημοσύνης. Η δουλειά του βοηθά να διασφαλιστεί ότι οι αναδυόμενες εξελίξεις στην AI προβάλλονται αποτελεσματικά, διατηρώντας τα δημοσιογραφικά πρότυπα της έκδοσης.