Μοντέλα και πλατφόρμες AI

Μέσα στο Microsoft’s Phi-3 Mini: Ένα Ελαφρύ Μοντέλο AI που Ξεπερνά τις Προσδοκίες του

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η Microsoft (MSFT ) έχει πρόσφατα παρουσιάσει το τελευταίο ελαφρύ μοντέλο γλώσσας που ονομάζεται Phi-3 Mini, ξεκινώντας μια τριάδα συμπαγών μοντέλων AI που σχεδιάστηκαν για να παρέχουν κορυφαίες επιδόσεις ενώ είναι αρκετά μικρά για να τρέχουν αποτελεσματικά σε συσκευές με περιορισμένες υπολογιστικές πηγές. Με μόνο 3,8 δισεκατομμύρια παραμέτρους, το Phi-3 Mini είναι μια μικρή ποσότητα σε σύγκριση με γίγαντες του AI όπως το GPT-4, ωστόσο υπόσχεται να ταιριάζει με τις ικανότητές τους σε πολλές βασικές περιοχές.

Η ανάπτυξη του Phi-3 Mini αντιπροσωπεύει einen σημαντικό ορό σε την προσπάθεια να δημοκρατικοποιηθούν οι προηγμένες ικανότητες του AI, καθιστώντας τες προσβάσιμες σε ένα ευρύτερο φάσμα υλικού. Η μικρή του αποτύπωση του επιτρέπει να αναπτυχθεί τοπικά σε smartphones, tablets και άλλες συσκευές περιφέρειας, υπερβαίνοντας την καθυστέρηση και τις ανησυχίες για την ιδιωτικότητα που συνδέονται με τα μοντέλα βασισμένα στο cloud. Αυτό ανοίγει νέες δυνατότητες για έξυπνες εμπειρίες σε συσκευές σε διάφορους τομείς, από εικονικούς βοηθούς και διαλογική AI μέχρι βοηθούς κωδικοποίησης και εργασίες κατανόησης γλώσσας.

4-bit quantized phi-3-mini που εκτελείται εγγενώς σε iPhone
4-bit quantized phi-3-mini που εκτελείται εγγενώς σε iPhone

Υπό την Καλύπτρα: Αρχιτεκτονική και Εκπαίδευση

Στην καρδιά του, το Phi-3 Mini είναι ένα μοντέλο αποκωδικοποιητή μετασχηματιστή που βασίζεται σε μια παρόμοια αρχιτεκτονική με το ανοιχτό μοντέλο Llama-2. Διαθέτει 32 στρώματα, 3072 κρυφές διαστάσεις και 32 κεφαλές προσοχής, με μια προεπιλεγμένη μήκος контекστού 4.000 συμβόλων. Η Microsoft έχει επίσης εισαγάγει μια εκδοχή μεγάλου контекστού που ονομάζεται Phi-3 Mini-128K, η οποία επεκτείνει το μήκος контекστού σε ένα εντυπωσιακό 128.000 συμβόλων χρησιμοποιώντας τεχνικές όπως το LongRope.

Τι διακρίνει το Phi-3 Mini, ωστόσο, είναι η μεθοδολογία εκπαίδευσής του. Αντί να βασίζεται αποκλειστικά στη βία των τεράστιων συνόλων δεδομένων και της υπολογιστικής δύναμης, η Microsoft έχει επικεντρωθεί στην επιμέρους επιλογή ενός υψηλής ποιότητας, πυκνού συνόλου δεδομένων για την εκπαίδευση. Αυτά τα δεδομένα αποτελούνται από nặngα φιλτραρισμένα δεδομένα ιστού, καθώς και συνθετικά δεδομένα που παράγονται από μεγαλύτερα μοντέλα γλώσσας.

Η διαδικασία εκπαίδευσης ακολουθεί μια διφασική προσέγγιση. Στην πρώτη φάση, το μοντέλο εκτίθεται σε eine ποικιλία πηγών ιστού που στοχεύουν στην διδασκαλία γενικών γνώσεων και κατανόησης γλώσσας. Η δεύτερη φάση συνδυάζει ακόμη περισσότερα φιλτραρισμένα δεδομένα ιστού με συνθετικά δεδομένα που σχεδιάζονται για να παρέχουν δεξιότητες λογικής σκέψης και εξειδίκευση σε συγκεκριμένους τομείς.

Η Microsoft αναφέρεται σε αυτήν την προσέγγιση ως “καταλληλότητα δεδομένων”, μια απόκλιση από την παραδοσιακή “καταλληλότητα υπολογισμού” ή “περίεργη εκπαίδευση” που χρησιμοποιείται από πολλά μεγάλα μοντέλα γλώσσας. Ο στόχος είναι να ρυθμίσει τα δεδομένα εκπαίδευσης για να ταιριάζουν με το μέγεθος του μοντέλου, παρέχοντας το σωστό επίπεδο γνώσεων και ικανοτήτων λογικής ενώ αφήνει αρκετή ικανότητα για άλλες ικανότητες.

Ποιότητα των νέων μοντέλων Phi-3, όπως μετράται από την απόδοση στο Massive Multitask Language Understanding (MMLU) benchmark
Ποιότητα των νέων μοντέλων Phi-3, όπως μετράται από την απόδοση στο Massive Multitask Language Understanding (MMLU) benchmark

Αυτή η προσεγγιστική μεθοδολογία έχει αποδώσει, καθώς το Phi-3 Mini επιτυγχάνει εξαιρετικές επιδόσεις σε eine ποικιλία ακαδημαϊκών benchmarκ, συχνά ισάξιο ή υπερβαίνοντας πολύ μεγαλύτερα μοντέλα. Για παράδειγμα, σημειώνει 69% στο benchmark MMLU για πολυ-εργασίες και κατανόηση και 8,38 στο MT-bench για μαθηματική σκέψη – αποτελέσματα που είναι παρόμοια με μοντέλα όπως το Mixtral 8x7B και το GPT-3.5.

Ασφάλεια και Ρομποτική

Παράλληλα με τις εντυπωσιακές επιδόσεις του, η Microsoft έχει τοποθετήσει μια ισχυρή έμφαση στην ασφάλεια και την ρομποτική στην ανάπτυξη του Phi-3 Mini. Το μοντέλο έχει υποβληθεί σε μια αυστηρή διαδικασία εκπαίδευσης μετά την ολοκλήρωση, που περιλαμβάνει επιτηρούμενη εκπαίδευση (SFT) και άμεση βελτιστοποίηση προτίμησης (DPO).

Το στάδιο SFT αξιοποιεί nặngα επιμελημένα δεδομένα σε διάφορους τομείς, συμπεριλαμβανομένων μαθηματικών, κωδικοποίησης, σκέψης, διαλόγου, ταυτοποίησης μοντέλου και ασφάλειας. Αυτό βοηθά στην ενίσχυση των ικανοτήτων του μοντέλου σε αυτές τις περιοχές ενώ του παρέχει μια ισχυρή αίσθηση ταυτότητας και ηθικής συμπεριφοράς.

Το στάδιο DPO, από την άλλη πλευρά, επικεντρώνεται στην κατεύθυνση του μοντέλου μακριά από ακατάλληλη συμπεριφορά χρησιμοποιώντας απορριφθείσες απαντήσεις ως αρνητικά παραδείγματα. Αυτή η διαδικασία καλύπτει δεδομένα σε μορφή chat, εργασίες σκέψης και προσπάθειες υπεύθυνης AI (RAI), διασφαλίζοντας ότι το Phi-3 Mini συμμορφώνεται με τις αρχές της Microsoft για την ηθική και αξιοπιστία του AI.

Για να ενισχύσει περαιτέρω το προφίλ ασφάλειας του, το Phi-3 Mini έχει υποβληθεί σε εκτεταμένα red teaming και αυτόματο έλεγχο σε δεκάδες κατηγορίες RAI. Một ανεξάρτητο red team στη Microsoft εξέτασε επανειλημμένα το μοντέλο, αναγνωρίζοντας περιοχές για βελτίωση, οι οποίες διευθετήθηκαν μέσω επιπλέον επιμελημένων συνόλων δεδομένων και επανεκπαίδευσης.

Αυτή η πολυσχιδής προσέγγιση έχει μειώσει σημαντικά την εμφάνιση επικίνδυνων απαντήσεων, фактических ανακρίβειων και προκαταλήψεων, όπως φαίνεται από τις εσωτερικές RAI benchmarκ της Microsoft. Για παράδειγμα, το μοντέλο παρουσιάζει χαμηλά ποσοστά ελαττωμάτων για επικίνδυνο περιεχόμενο (0,75%) και περίληψη (10%), καθώς και ένα χαμηλό ποσοστό αδικαιολόγητου (0,603), υποδεικνύοντας ότι οι απαντήσεις του είναι στενά συνδεδεμένες με το δεδομένο контекστο.

Εφαρμογές και Περιπτώσεις Χρήσης

Με τις εντυπωσιακές επιδόσεις και τα ρομποτικά μέτρα ασφαλείας του, το Phi-3 Mini είναι ιδιαίτερα κατάλληλο για eine ποικιλία εφαρμογών, ιδιαίτερα σε περιβάλλοντα με περιορισμένες πηγές και σε σενάρια που εξαρτώνται από την καθυστέρηση.

Μια από τις πιο ενθουσιώδεις προοπτικές είναι η ανάπτυξη έξυπνων εικονικών βοηθών και διαλογικής AI přímo σε κινητές συσκευές. Εκτελώντας τοπικά, αυτοί οι βοηθοί μπορούν να παρέχουν άμεσες απαντήσεις χωρίς την ανάγκη για σύνδεση στο δίκτυο, ενώ επίσης διασφαλίζουν ότι τα ευαίσθητα δεδομένα παραμένουν στη συσκευή, αντιμετωπίζοντας τις ανησυχίες για την ιδιωτικότητα.

Οι ισχυρές ικανότητες σκέψης του Phi-3 Mini το καθιστούν également một πολύτιμο εργαλείο για βοήθεια κωδικοποίησης και μαθηματικών προβλημάτων. Οι développers και οι μαθητές μπορούν να επωφεληθούν από την ολοκλήρωση κώδικα, την ανίχνευση σφαλμάτων και τις εξηγήσεις στην συσκευή, διευκολύνοντας τις διαδικασίες ανάπτυξης και μάθησης.

Πέρα από αυτές τις εφαρμογές, η πολυμορφία του μοντέλου ανοίγει возможности σε περιοχές όπως η κατανόηση γλώσσας, η περίληψη κειμένου και η απάντηση σε ερωτήσεις. Η μικρή του αποτύπωση και η αποτελεσματικότητά του το καθιστούν μια ελκυστική επιλογή για την ενσωμάτωση ικανοτήτων AI σε eine ποικιλία συσκευών και συστημάτων, από έξυπνες οικιακές συσκευές μέχρι βιομηχανικά αυτόματα συστήματα.

Ματιά στο Μέλλον: Phi-3 Small και Phi-3 Medium

Ενώ το Phi-3 Mini είναι ένα αξιοσημείωτο επίτευγμα με τις δικές του ικανότητες, η Microsoft έχει ακόμη μεγαλύτερα σχέδια για την οικογένεια Phi-3. Η εταιρεία έχει ήδη προβάλλει δύο μεγαλύτερα μοντέλα, το Phi-3 Small (7 δισεκατομμύρια παραμέτρους) και το Phi-3 Medium (14 δισεκατομμύρια παραμέτρους), και τα δύο από τα οποία αναμένεται να推 τις επιδόσεις των συμπαγών μοντέλων γλώσσας.

Το Phi-3 Small, για παράδειγμα, αξιοποιεί einen πιο προηγμένο tokenizer (tiktoken) και einen механиσμό προσοχής ομάδων-ερωτήσεων, μαζί με einen καινούριο στρώμα προσοχής blocksparse, για να βελτιστοποιήσει την αποτύπωση μνήμης ενώ διατηρεί την απόδοση ανάκτησης контекστού. Επίσης, ενσωματώνει ένα επιπλέον 10% πολυγλωσσικών δεδομένων, ενισχύοντας τις ικανότητές του στην κατανόηση και γεννήτρια γλώσσας σε πολλές γλώσσες.

Το Phi-3 Medium, από την άλλη πλευρά, αντιπροσωπεύει einen σημαντικό βήμα στην κλίμακα, με 40 στρώματα, 40 κεφαλές προσοχής και eine διάσταση ενσωμάτωσης 5.120. Αν και η Microsoft σημειώνει ότι κάποια benchmarκ μπορεί να απαιτούν περαιτέρω βελτίωση του μείγματος δεδομένων εκπαίδευσης για να εκμεταλλευτούν πλήρως αυτήν την αυξημένη ικανότητα, τα αρχικά αποτελέσματα είναι υποσχόμενα, με σημαντικές βελτιώσεις sobre το Phi-3 Small σε εργασίες όπως το MMLU, το TriviaQA και το HumanEval.

Περιορισμοί και Μελλοντικές Κατευθύνσεις

Παρά τις εντυπωσιακές ικανότητές του, το Phi-3 Mini, όπως όλα τα μοντέλα γλώσσας, δεν είναι χωρίς περιορισμούς. Ένας από τους πιο αξιοσημείωτους αδυναμίες είναι η σχετικά περιορισμένη ικανότητά του για αποθήκευση фактиτικών γνώσεων, όπως φαίνεται από την χαμηλότερη απόδοση του σε benchmarκ όπως το TriviaQA.

Ωστόσο, η Microsoft πιστεύει ότι αυτή η αδυναμία μπορεί να μετριαστεί με την ενίσχυση του μοντέλου με ικανότητες αναζήτησης, επιτρέποντας του να ανακτά και να συλλογιστεί σχετικές πληροφορίες κατόπιν ζήτησης. Αυτή η προσέγγιση φαίνεται στο Hugging Face Chat-UI, όπου το Phi-3 Mini μπορεί να αξιοποιήσει την αναζήτηση για να βελτιστοποιήσει τις απαντήσεις του.

Μια άλλη περιοχή για βελτίωση είναι οι πολυγλωσσικές ικανότητες του μοντέλου. Αν και το Phi-3 Small έχει κάνει αρχικές βήματα με την ενσωμάτωση επιπλέον πολυγλωσσικών δεδομένων, περαιτέρω εργασία είναι απαραίτητη για να ξεκλειδώσει πλήρως το δυναμικό αυτών των συμπαγών μοντέλων για διαγλωσσικές εφαρμογές.

Η Microsoft είναι δεσμευμένη να συνεχίσει να προωθεί την οικογένεια μοντέλων Phi, αντιμετωπίζοντας τους περιορισμούς τους και επεκτείνοντας τις ικανότητές τους. Αυτό μπορεί να περιλαμβάνει περαιτέρω βελτιώσεις στα δεδομένα εκπαίδευσης και τη μεθοδολογία, καθώς και την εξερεύνηση νέων αρχιτεκτονικών και τεχνικών που είναι ειδικά σχεδιασμένες για συμπαγή, υψηλής απόδοσης μοντέλα γλώσσας.

Συμπέρασμα

Το Phi-3 Mini της Microsoft αντιπροσωπεύει einen σημαντικό βήμα στην δημοκρατικοποίηση των προηγμένων ικανοτήτων του AI. Παρέχοντας κορυφαίες επιδόσεις σε eine συμπαγή, αποτελεσματική συσκευασία, ανοίγει νέες δυνατότητες για έξυπνες εμπειρίες σε συσκευές σε eine ποικιλία εφαρμογών.

Η καινοτόμος προσέγγιση εκπαίδευσης του μοντέλου, που τάσσεται υπέρ των υψηλής ποιότητας, πυκνών δεδομένων πάνω από την απλή υπολογιστική δύναμη, έχει αποδείξει ότι είναι ένας game-changer, επιτρέποντας στο Phi-3 Mini να ξεπεράσει τις προσδοκίες του. Σε συνδυασμό με τα ρομποτικά μέτρα ασφαλείας του και τις συνεχείς προσπάθειες ανάπτυξης, η οικογένεια μοντέλων Phi είναι σε θέση να διαδραματίσει einen κρίσιμο ρόλο στη διαμόρφωση του μέλλοντος των έξυπνων συστημάτων, καθιστώντας το AI πιο προσβάσιμο, αποτελεσματικό και αξιοπιστό από ποτέ.

Καθώς η βιομηχανία της τεχνολογίας συνεχίζει να推 τα όρια του τι είναι δυνατό με το AI, η δέσμευση της Microsoft για ελαφριά, υψηλής απόδοσης μοντέλα όπως το Phi-3 Mini αντιπροσωπεύει einen αναζωογονητικό αποχρωματισμό από την παραδοσιακή σοφία ότι “μεγαλύτερο είναι καλύτερο”. Βάσει του γεγονότος ότι το μέγεθος δεν είναι όλα, το Phi-3 Mini έχει το δυναμικό να εμπνεύσει eine νέα κυματική καινοτομίας που επικεντρώνεται στην μεγιστοποίηση της αξίας και του αντικτύπου του AI μέσω έξυπνης επιμέρους επιλογής δεδομένων, προσεκτικής σχεδίασης μοντέλων και υπεύθυνων πρακτικών ανάπτυξης.

Έχω περάσει τα τελευταία πέντε χρόνια βυθισμένος στον συναρπαστικό κόσμο της Μηχανικής Μάθησης και του Βαθιάς Μάθησης. Η δέσμευσή μου και η εξειδίκευσή μου με οδήγησαν να συμβάλλω σε πάνω από 50 διαφορετικά projects μηχανικής λογισμικού, με ιδιαίτερη έμφαση στο AI/ML. Η συνεχής περιέργειά μου με έχει οδηγήσει επίσης προς την Επεξεργασία Φυσικής Γλώσσας, ένα πεδίο που είμαι πρόθυμος να εξερευνήσω περαιτέρω.