Μοντέλα και πλατφόρμες AI

Από την Πρόθεση στην Εκτέλεση: Πώς η Microsoft Μεταμορφώνει τα Μεγάλα Μοντέλα Γλώσσας σε Δράση-Προσανατολισμένα AI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Τα Μεγάλα Μοντέλα Γλώσσας (LLMs) έχουν αλλάξει τον τρόπο με τον οποίο αντιμετωπίζουμε την επεξεργασία φυσικής γλώσσας. Μπορούν να απαντήσουν σε ερωτήσεις, να γράψουν κώδικα και να συμμετέχουν σε συνομιλίες. Ωστόσο, δεν είναι ικανά να εκτελέσουν πραγματικές εργασίες. Για παράδειγμα, ένα LLM μπορεί να σας οδηγήσει στην αγορά ενός παλτού, αλλά δεν μπορεί να το αγοράσει για σας. Αυτό το χάσμα μεταξύ σκέψης και δράσης είναι một σημαντική limitation. Οι άνθρωποι δεν χρειάζονται μόνο πληροφορίες, αλλά και αποτελέσματα.

Για να γεφυρώσουν αυτό το χάσμα, η Microsoft (MSFT ) μετατρέπεται τα LLMs σε δράση-προσανατολισμένα AI agents. Ενεργοποιώντας τους να σχεδιάσουν, να αναλύσουν εργασίες και να αλληλεπιδράσουν με πραγματικές συνθήκες, τους δίνουν τη δυνατότητα να διαχειριστούν αποτελεσματικά πρακτικές εργασίες. Αυτή η αλλαγή έχει τη δυνατότητα να αναedefinει τι μπορούν να κάνουν τα LLMs, μετατρέποντάς τα σε εργαλεία που αυτοματοποιούν σύνθετες εργασίες και απλοποιούν τις καθημερινές εργασίες. Ας δούμε τι χρειάζεται για να συμβεί αυτό και πώς η Microsoft αντιμετωπίζει το πρόβλημα.

Τι Χρειάζονται τα LLMs για να Δράσουν

Για τα LLMs να εκτελέσουν εργασίες στον πραγματικό κόσμο, πρέπει να πάνε πέρα από την κατανόηση του κειμένου. Πρέπει να αλληλεπιδράσουν με ψηφιακούς και φυσικούς περιβάλλοντες και να προσαρμοστούν σε αλλαγμένες συνθήκες. Αυτές είναι μερικές από τις ικανότητες που χρειάζονται:

  1. Κατανόηση της Πρόθεσης του Χρήστη

Για να δράσουν αποτελεσματικά, τα LLMs πρέπει να κατανοήσουν τις αιτήσεις του χρήστη. Οι εισαγωγές όπως το κείμενο ή οι φωνητικές εντολές είναι συχνά αόριστες ή ελλιπείς. Το σύστημα πρέπει να συμπληρώσει τα κενά χρησιμοποιώντας τις γνώσεις του και το контекστ της αίτησης. Οι πολυ-βήματες συνομιλίες μπορούν να βοηθήσουν στην εξευρένηση αυτών των προθέσεων, εξασφαλίζοντας ότι το AI κατανοεί πριν από την εκτέλεση της δράσης.

  1. Μετατροπή των Προθέσεων σε Δράσεις

Μετά την κατανόηση μιας εργασίας, τα LLMs πρέπει να τη μετατρέψουν σε εκτελέσιμες βήματα. Αυτό μπορεί να περιλαμβάνει το κλικ σε κουμπιά, την κλήση API ή τον έλεγχο φυσικών συσκευών. Τα LLMs πρέπει να τροποποιήσουν τις δράσεις τους ανάλογα με την εργασία, προσαρμοζόμενα στο περιβάλλον και λύνοντας προβλήματα καθώς αυτά εμφανίζονται.

  1. Προσαρμογή στις Αλλαγές

Οι πραγματικές εργασίες δεν πάνε πάντα όπως σχεδιαζόταν. Τα LLMs πρέπει να προβλέψουν προβλήματα, να τροποποιήσουν τα βήματα και να βρουν εναλλακτικές λύσεις όταν προκύψουν ζητήματα. Για παράδειγμα, αν ένα απαραίτητο ресурс δεν είναι διαθέσιμο, το σύστημα πρέπει να βρει έναν άλλο τρόπο για την ολοκλήρωση της εργασίας. Αυτή η ευελιξία εξασφαλίζει ότι η διαδικασία δεν σταματά όταν τα πράγματα αλλάζουν.

  1. Ειδίκευση σε Συγκεκριμένες Εργασίες

Ενώ τα LLMs σχεδιάζονται για γενική χρήση, η ειδίκευση τους τα κάνει πιο αποτελεσματικά. Με την εστίαση σε συγκεκριμένες εργασίες, αυτά τα συστήματα μπορούν να παράσχουν καλύτερα αποτελέσματα με λιγότερους πόρους. Αυτό είναι ιδιαίτερα σημαντικό για συσκευές με περιορισμένη υπολογιστική ισχύ, όπως τα smartphones ή τα ενσωματωμένα συστήματα.

Με την ανάπτυξη αυτών των ικανοτήτων, τα LLMs μπορούν να πάνε πέρα από την απλή επεξεργασία πληροφοριών. Μπορούν να λάβουν σημαντικές δράσεις, ανοίγοντας τον δρόμο για την AI να ενσωματωθεί ομαλά στις καθημερινές εργασίες.

Πώς η Microsoft Μεταμορφώνει τα LLMs

Η προσέγγιση της Microsoft για τη δημιουργία δράση-προσανατολισμένης AI ακολουθεί μια δομημένη διαδικασία. Ο κύριος στόχος είναι να ενεργοποιήσει τα LLMs να κατανοήσουν τις εντολές, να σχεδιάσουν αποτελεσματικά και να λάβουν δράση. Αυτός είναι ο τρόπος με τον οποίο το κάνουν:

Βήμα 1: Συλλογή και Προετοιμασία Δεδομένων

Στην πρώτη φάση, συλλέγουν δεδομένα σχετικά με τις συγκεκριμένες περιπτώσεις χρήσης: UFO Agent (περιγράφεται παρακάτω). Τα δεδομένα περιλαμβάνουν αιτήσεις χρηστών, λεπτομέρειες περιβάλλοντος και εργασίες-ειδικές ενέργειες. Δύο διαφορετικά είδη δεδομένων συλλέγονται σε αυτή τη φάση: πρώτα, συλλέγουν δεδομένα σχεδιασμού εργασιών που βοηθούν τα LLMs να περιγράψουν τα υψηλά βήματα που απαιτούνται για την ολοκλήρωση μιας εργασίας. Για παράδειγμα, “Αλλαγή μεγέθους γραμματοσειράς στο Word” μπορεί να περιλαμβάνει βήματα όπως την επιλογή κειμένου και την προσαρμογή των ρυθμίσεων της γραμματοσειράς. Δεύτερον, συλλέγουν δεδομένα εργασιών-ενεργειών, επιτρέποντας στα LLMs να μετατρέψουν αυτά τα βήματα σε ακριβείς οδηγίες, όπως το κλικ σε συγκεκριμένα κουμπιά ή η χρήση συντομεύσεων πληκτρολογίου.

Αυτή η συνδυασμένη προσέγγιση δίνει στο μοντέλο και την ευρύτερη εικόνα και τις λεπτομέρειες που χρειάζονται για να εκτελέσει εργασίες αποτελεσματικά.

Βήμα 2: Εκπαίδευση του Μοντέλου

Μόλις συλλεγούν τα δεδομένα, τα LLMs υποβάλλονται σε πολλαπλά στάδια εκπαίδευσης. Στο πρώτο στάδιο, τα LLMs εκπαιδεύονται για την σχεδίαση εργασιών, διδάσκοντάς τους πώς να αναλύσουν τις αιτήσεις του χρήστη σε εκτελέσιμα βήματα. Δεδομένα με ετικέτα από εμπειρογνώμονες χρησιμοποιούνται για να διδάξουν τα LLMs πώς να μετατρέψουν αυτά τα σχέδια σε συγκεκριμένες ενέργειες. Για να ενισχύσουν thêm τις ικανότητες λύσης προβλημάτων, τα LLMs έχουν συμμετάσχει σε μια διαδικασία αυτο-ενίσχυσης εξερεύνησης που τους δίνει τη δυνατότητα να αντιμετωπίσουν ανεπίλυτα προβλήματα και να γεννήσουν νέα παραδείγματα για συνεχή μάθηση. Τέλος, εφαρμόζεται η ενίσχυση μάθησης, χρησιμοποιώντας την ανατροφοδότηση από επιτυχίες και αποτυχίες για να βελτιώσουνさらに τις αποφάσεις τους.

Βήμα 3: Εκτός-Γραμμική Δοκιμή

Μετά την εκπαίδευση, το μοντέλο δοκιμάζεται σε ελεγχόμενα περιβάλλοντα για να εξασφαλιστεί η αξιοπιστία. Μετρήσεις όπως ο Οριακός Ρυθμός Επιτυχίας (TSR) και ο Ρυθμός Επιτυχίας Βήματος (SSR) χρησιμοποιούνται για να μετρήσουν την απόδοση. Για παράδειγμα, η δοκιμή ενός calendar management agent μπορεί να περιλαμβάνει την επιβεβαίωση της ικανότητάς του να προγραμματίζει συναντήσεις και να στέλνει προσκλήσεις χωρίς λάθη.

Βήμα 4: Ενοποίηση σε Πραγματικά Συστήματα

Μόλις επικυρωθεί, το μοντέλο ενσωματώνεται σε ένα πλαίσιο agent. Αυτό του επέτρεψε να αλληλεπιδράσει με πραγματικά περιβάλλοντα, όπως το κλικ σε κουμπιά ή την πλοήγηση σε μενού. Εργαλεία όπως η API Αυτοματοποίησης UI βοήθησαν το σύστημα να αναγνωρίσει και να χειριστεί στοιχεία διεπαφής χρήστη δυναμικά.

Για παράδειγμα, αν του ζητηθεί να υπογραμμίσει κείμενο στο Word, ο agent αναγνωρίζει το κουμπί υπογράμμισης, επιλέγει το κείμενο και εφαρμόζει τη μορφοποίηση. Ένα στοιχείο μνήμης θα μπορούσε να βοηθήσει τα LLM να θυμάται τις προηγούμενες ενέργειες, επιτρέποντάς τους να προσαρμοστούν σε νέες συνθήκες.

Βήμα 5: Πραγματική Δοκιμή

Το τελικό βήμα είναι η διαδικασία online αξιολόγησης. Εδώ, το σύστημα δοκιμάζεται σε πραγματικές συνθήκες για να εξασφαλιστεί ότι μπορεί να αντιμετωπίσει απροσδόκητες αλλαγές και λάθη. Για παράδειγμα, ένας bot υποστήριξης πελατών μπορεί να οδηγήσει τους χρήστες στη διαδικασία επαναφοράς του κωδικού πρόσβασης ενώ προσαρμόζεται σε λάθη εισαγωγής ή λείποντα στοιχεία. Αυτή η δοκιμή εξασφαλίζει ότι η AI είναι ανθεκτική και έτοιμη για καθημερινή χρήση.

Πρακτικό Παράδειγμα: Ο Πράκτορας UFO

Για να δείξουν πώς λειτουργεί η δράση-προσανατολισμένη AI, η Microsoft ανέπτυξε τον Πράκτορα UFO. Αυτό το σύστημα σχεδιάστηκε για να εκτελέσει πραγματικές εργασίες σε περιβάλλοντα Windows, μετατρέποντας τις αιτήσεις του χρήστη σε ολοκληρωμένες ενέργειες.

Στην καρδιά του, ο Πράκτορας UFO χρησιμοποιεί ένα LLM για να ερμηνεύσει αιτήσεις και να σχεδιάσει ενέργειες. Για παράδειγμα, αν ένας χρήστης πει, “Υπογραμμίστε τη λέξη ‘σπουδαίο’ σε αυτό το έγγραφο”, ο agent αλληλεπιδρά με το Word για να ολοκληρώσει την εργασία. Συλλέγει πληροφορίες контекστού, όπως τις θέσεις των στοιχείων διεπαφής χρήστη, και τις χρησιμοποιεί για να σχεδιάσει και να εκτελέσει ενέργειες.

Ο Πράκτορας UFO βασίζεται σε εργαλεία όπως η Αυτοματοποίηση UI των Windows (UIA) API. Αυτή η API σκανάρει τις εφαρμογές για στοιχεία ελέγχου, όπως κουμπιά ή μενού. Για μια εργασία όπως “Αποθήκευση του εγγράφου ως PDF”, ο agent χρησιμοποιεί την UIA για να αναγνωρίσει το κουμπί “Αρχείο”, να βρει την επιλογή “Αποθήκευση ως” και να εκτελέσει τα απαραίτητα βήματα. Με την δομή των δεδομένων με συνέπεια, το σύστημα εξασφαλίζει ομαλή λειτουργία από την εκπαίδευση μέχρι την εφαρμογή στον πραγματικό κόσμο.

Αντιμετωπίζοντας Προκλήσεις

Ενώ αυτή είναι μια ενθουσιαστική εξέλιξη, η δημιουργία δράση-προσανατολισμένης AI έρχεται με προκλήσεις. Η κλιμάκωση είναι ένα σημαντικό ζήτημα. Η εκπαίδευση και η ανάπτυξη αυτών των μοντέλων σε διάφορες εργασίες απαιτούν σημαντικούς πόρους. Η εξασφάλιση της ασφάλειας και της αξιοπιστίας είναι εξίσου σημαντική. Τα μοντέλα πρέπει να εκτελέσουν εργασίες χωρίς απρόβλεπτες συνέπειες, ιδιαίτερα σε ευαίσθητα περιβάλλοντα. Και καθώς αυτά τα συστήματα αλληλεπιδράουν με ιδιωτικά δεδομένα, η διατήρηση των ηθικών προτύπων για την ιδιωτικότητα και την ασφάλεια είναι επίσης κρίσιμη.

Η οδικός χάρτης της Microsoft επικεντρώνεται στην βελτίωση της αποτελεσματικότητας, την επέκταση των περιπτώσεων χρήσης και τη διατήρηση των ηθικών προτύπων. Με αυτές τις εξελίξεις, τα LLMs θα μπορούσαν να αναedefinουν τον τρόπο με τον οποίο η AI αλληλεπιδρά με τον κόσμο, καθιστώντας τα πιο πρακτικά, προσαρμοσμένα και δράση-προσανατολισμένα.

Το Μέλλον της AI

Η μεταμόρφωση των LLMs σε δράση-προσανατολισμένα agents θα μπορούσε να είναι ένας game-changer. Αυτά τα συστήματα μπορούν να αυτοματοποιήσουν εργασίες, να απλοποιήσουν τις ροές εργασιών και να κάνουν την τεχνολογία πιο προσιτή. Η δουλειά της Microsoft πάνω στην δράση-προσανατολισμένη AI και εργαλεία όπως ο Πράκτορας UFO είναι μόνο η αρχή. Όσο η AI συνεχίζει να εξελίσσεται, μπορούμε να περιμένουμε πιο έξυπνα, πιο ικανά συστήματα που δεν απλώς αλληλεπιδρούν μαζί μας, αλλά και ολοκληρώνουν εργασίες.

Ο Δρ Tehseen Zia είναι Καθηγητής στο COMSATS University Islamabad, κατέχοντας διδακτορικό τίτλο στη τεχνητή νοημοσύνη από το Τεχνικό Πανεπιστήμιο της Βιέννης, Αυστρία. Ειδικεύεται στην Τεχνητή Νοημοσύνη, τον Αυτόματο Μάθηση, την Επιστήμη Δεδομένων και την Υπολογιστική Όραση, έχει κάνει σημαντικές συνεισφορές με δημοσιεύσεις σε αξιόπιστες επιστημονικές περιοδικά. Ο Δρ Tehseen έχει επίσης ηγηθεί διαφόρων βιομηχανικών έργων ως ο Principal Investigator και έχει υπηρετήσει ως Σύμβουλος Τεχνητής Νοημοσύνης.