Ηγέτες σκέψης

Πόσο Καλά Μπορούν τα LLMs να Συλλογισθούν Μέσω Σkomplikated Προβλημάτων;

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η εισαγωγή και η εξέλιξη του γεννητικού AI έχουν sido tão ξαφνική και έντονη που είναι πραγματικά δύσκολο να εκτιμηθεί πλήρως πόσο πολύ αυτή η τεχνολογία έχει αλλάξει τις ζωές μας.

Ζουμ στο παρελθόν, πριν από τρία χρόνια. Ναι, το AI γινόταν όλο και πιο διαδεδομένο, τουλάχιστον σε θεωρία. Περισσότεροι άνθρωποι γνώριζαν κάποια από τα πράγματα που μπορούσε να κάνει, αν και ακόμη και με αυτό υπήρχαν τεράστιες παρεξηγήσεις σχετικά με τις ικανότητες του AI. Κάποιο τρόπο, η τεχνολογία είχε δοθεί ταυτόχρονα όχι αρκετή και πολύ πίστωση για αυτό που μπορούσε πραγματικά να επιτύχει. Παρόλα αυτά, ο μέσος άνθρωπος θα μπορούσε να δείξει τουλάχιστον ένα ή δύο περιοχές όπου το AI ήταν σε λειτουργία, εκτελώντας εξαιρετικά εξειδικευμένα καθήκοντα καλά, σε εξαιρετικά ελεγχόμενα περιβάλλοντα. Ότι ήταν πέρα από αυτό ήταν είτε ακόμη σε ένα ερευνητικό εργαστήριο, είτε απλά δεν υπήρχε.

Σύγκρινε αυτό με σήμερα. Με μηδέν δεξιότητες εκτός από την ικανότητα να γράψεις μια πρόταση ή να κάνεις μια ερώτηση, ο κόσμος είναι στα πόδια μας. Μπορούμε να δημιουργήσουμε εικόνες, μουσική και ακόμη και ταινίες που είναι πραγματικά μοναδικές και εκπληκτικές, και έχουν τη δυνατότητα να διαταράξουν ολόκληρες βιομηχανίες. Μπορούμε να ενισχύσουμε τη διαδικασία αναζήτησής μας, ζητώντας μια απλή ερώτηση που αν τοποθετηθεί σωστά, μπορεί να δημιουργήσει σελίδες με προσαρμοσμένο περιεχόμενο αρκετά καλό για να περάσει ως ένας πανεπιστημιακός ερευνητής … ή ένας μέσος τρίτος μαθητής αν καθορίσουμε την άποψη. Ενώ αυτά τα χαρακτηριστικά έχουν γίνει κοινά σε ένα χρόνο ή δύο, θεωρούνταν απόλυτα αδύνατα πριν από λίγα χρόνια. Το πεδίο του γεννητικού AI υπήρχε αλλά δεν είχε ξεκινήσει με κανέναν τρόπο.

Σήμερα, πολλοί άνθρωποι έχουν πειραματιστεί με γεννητικό AI όπως το ChatGPT, Midjourney ή άλλα εργαλεία. Άλλοι έχουν ήδη ενσωματώσει αυτά τα εργαλεία στην καθημερινή τους ζωή. Η ταχύτητα με την οποία αυτά τα εργαλεία έχουν εξελιχθεί είναι εκπληκτική μέχρι του σημείου να είναι σχεδόν τρομακτική. Και με τις προόδους των τελευταίων έξι μηνών, δεν υπάρχει αμφιβολία ότι θα μας εκπλήξουν, πάνω και πάνω, τα επόμενα χρόνια.

Ένα συγκεκριμένο εργαλείο που παίζει ρόλο στο γεννητικό AI είναι η απόδοση των συστημάτων Retrieval-Augmented Generation (RAG) και η ικανότητά τους να σκέφτονται μέσα από ιδιαίτερα σύνθετες ερωτήσεις. Η εισαγωγή του FRAMES dataset, που εξηγείται λεπτομερώς σε ένα άρθρο σχετικά με τον τρόπο που λειτουργεί το dataset, δείχνει τόσο το σημείο όπου βρίσκεται η τεχνολογία σήμερα, όσο και το πού πηγαίνει. Ακόμη και από την εισαγωγή του FRAMES στα τέλη του 2024, ένας αριθμός πλατφορμών έχει ήδη σπάσει νέα ρεκόρ στην ικανότητά τους να σκέφτονται μέσα από δύσκολες και σύνθετες ερωτήσεις.

Ας ταξιδέψουμε σε αυτό που το FRAMES προορίζεται να αξιολογήσει και πόσο καλά τα διάφορα μοντέλα γεννητικού AI εκτελούν. Μπορούμε να δούμε πώς και η αποκεντρωποίηση και τα ανοικτά μοντέλα δεν μόνο αντέχουν (συγκριτικά με το Sentient Chat), αλλά επιτρέπουν στους χρήστες να έχουν μια σαφή ματιά στη θαυμάσια σκέψη που κάποια μοντέλα AI είναι ικανά να επιτύχουν.

FRAMES ως Παράθυρο στο Μυαλό του GenAI

Το dataset FRAMES και η διαδικασία αξιολόγησής του επικεντρώνεται σε 824 «multi-hop» ερωτήσεις που απαιτούν εύρεση, λογική σύνδεση, τη χρήση πολλών διαφορετικών πηγών για την εύρεση κρίσιμων πληροφοριών και την ικανότητα να συνδέσουν λογικά όλα αυτά για να απαντήσουν στην ερώτηση. Οι ερωτήσεις χρειάζονται μεταξύ δύο και 15 εγγράφων για να απαντηθούν σωστά και επίσης περιέχουν σκόπιμα περιορισμούς, μαθηματικές υπολογίσεις και συλλογισμούς, καθώς και την ικανότητα να επεξεργαστούν χρονικά λογικά. Με άλλα λόγια, αυτές οι ερωτήσεις είναι εξαιρετικά δύσκολες και αντιπροσωπεύουν πολύ πραγματικές ερευνητικές εργασίες που ένας άνθρωπος θα μπορούσε να αναλάβει στο διαδίκτυο. Αντιμετωπίζουμε αυτές τις προκλήσεις συνέχεια και πρέπει να ψάξουμε για τα σπασμένα κρίσιμα κομμάτια πληροφοριών σε ένα πέλαγος διαδικτυακών πηγών, να συνδέσουμε πληροφορίες με βάση διαφορετικές ιστοσελίδες, να δημιουργήσουμε νέες πληροφορίες με υπολογισμούς και συλλογισμούς και να κατανοήσουμε πώς να συντηρήσουμε αυτά τα γεγονότα σε μια σωστή απάντηση της ερώτησης.

Τι βρήκαν οι ερευνητές όταν το dataset首 lần κυκλοφόρησε και ελέγχθηκε είναι ότι τα κορυφαία μοντέλα GenAI ήταν σε θέση να είναι κάπως ακριβή (περίπου 40%) όταν έπρεπε να απαντήσουν χρησιμοποιώντας μεθόδους ενός βήματος, αλλά μπορούσαν να επιτύχουν ακρίβεια 73% αν τους επιτρεπόταν να συλλέξουν όλα τα απαραίτητα έγγραφα για να απαντήσουν στην ερώτηση. Ναι, 73% μπορεί να μην φαίνεται σαν επανάσταση. Αλλά αν κατανοήσετε ακριβώς τι πρέπει να απαντηθεί, ο αριθμός γίνεται πολύ πιο εντυπωσιακός.

Για παράδειγμα, μια συγκεκριμένη ερώτηση είναι: «Τι έτος γεννήθηκε ο αρχηγός της ομάδας που αρχικά εκτέλεσε το τραγούδι που δείχνει στο τραγούδι του Kanye West «Power»;» Πώς θα λύσει ένας άνθρωπος αυτό το πρόβλημα; Ο άνθρωπος θα μπορούσε να δει ότι χρειάζεται να συλλέξει διάφορα στοιχεία πληροφοριών, όπως τα λόγια του τραγουδιού του Kanye West που ονομάζεται «Power», και στη συνέχεια να能够 να κοιτάξει τα λόγια και να αναγνωρίσει το σημείο στο τραγούδι που πραγματικά δείχνει ένα άλλο τραγούδι. Мы ως άνθρωποι θα μπορούσαμε να ακούσουμε το τραγούδι (ακόμη και αν δεν το γνωρίζουμε) και να能够 να πούμε όταν ένα άλλο τραγούδι δείχνει.

Αλλά σκεφτείτε το: τι θα έπρεπε να επιτύχει ένα GenAI για να ανιχνεύσει ένα τραγούδι άλλο από το αρχικό ενώ «ακούγοντας» το; Αυτό είναι το σημείο όπου μια βασική ερώτηση γίνεται ένα εξαιρετικό τεστ για πραγματικά έξυπνο AI. Και αν μπορούσαμε να βρούμε το τραγούδι, να το ακούσουμε και να αναγνωρίσουμε τα λόγια που δείχνουν, αυτό είναι μόνο το Βήμα 1. Chúng masih χρειαζόμαστε να βρούμε το όνομα του τραγουδιού, να δούμε ποια είναι η μπάντα, ποιος είναι ο αρχηγός της μπάντας και μετά ποιο έτος γεννήθηκε εκείνη η personne.

Το FRAMES δείχνει ότι για να απαντήσουν σε πραγματικές ερωτήσεις, χρειάζεται μια τεράστια ποσότητα επεξεργασίας σκέψης. Δύο πράγματα έρχονται στο μυαλό εδώ.

Πρώτον, η ικανότητα των αποκεντρωμένων μοντέλων GenAI να μην ανταγωνίζονται μόνο, αλλά να κυριαρχούν στα αποτελέσματα, είναι απίστευτη. Ένας αυξανόμενος αριθμός εταιρειών χρησιμοποιεί την αποκεντρωμένη μέθοδο για να κλιμακώσει τις ικανότητες επεξεργασίας τους ενώ εξασφαλίζουν ότι μια μεγάλη κοινότητα κατέχει το λογισμικό, όχι ένα κεντρικό μαύρο κουτί που δεν θα μοιράζεται τις προόδους του. Εταιρείες όπως η Perplexity και η Sentient ηγούνται αυτής της τάσης, καθεμία με ισχυρά μοντέλα που εκτελούν πάνω από τα πρώτα ρεκόρ ακρίβειας όταν το FRAMES κυκλοφόρησε.

Το δεύτερο στοιχείο είναι ότι ένας μικρότερος αριθμός από αυτά τα μοντέλα AI δεν είναι μόνο αποκεντρωμένα, αλλά και ανοικτά. Για παράδειγμα, το Sentient Chat είναι και τα δύο, και οι πρώτες δοκιμές δείχνουν πόσο σύνθετη μπορεί να είναι η σκέψη του, χάρη στην αξιόλογη ανοικτή πρόσβαση. Η ερώτηση του FRAMES απαντάται χρησιμοποιώντας την ίδια σκέψη που θα χρησιμοποιούσε ένας άνθρωπος, με λεπτομέρειες της σκέψης διαθέσιμες για αναθεώρηση. Ίσως ακόμη πιο ενδιαφέρον, η πλατφόρμα τους είναι δομημένη ως eine σειρά από μοντέλα που μπορούν να επιμελώνουν μια δεδομένη άποψη και απόδοση, ακόμη και αν η διαδικασία επιμέλειας σε κάποια μοντέλα GenAI οδηγεί σε μειωμένη ακρίβεια. Στο caso του Sentient Chat, έχουν αναπτυχθεί πολλά διαφορετικά μοντέλα. Για παράδειγμα, ένα πρόσφατο μοντέλο που ονομάζεται «Dobby 8B» είναι σε θέση να υπερβεί το benchmark του FRAMES, αλλά και να αναπτύξει μια ξεχωριστή προ-κρυπτονομία και προ-ελευθερία στάση, η οποία επηρεάζει την άποψη του μοντέλου καθώς επεξεργάζεται κομμάτια πληροφοριών και αναπτύσσει μια απάντηση.

Στο Ορίζοντα

Το κλειδί για όλες αυτές τις εκπληκτικές καινοτομίες είναι η ταχύτητα με την οποία μας οδήγησε εδώ. Πρέπει να αναγνωρίσουμε ότι όσο γρήγορα έχει εξελιχθεί αυτή η τεχνολογία, θα εξελιχθεί ακόμη πιο γρήγορα στο άμεσο μέλλον. Θα είμαστε σε θέση να δούμε, ιδιαίτερα με αποκεντρωμένα και ανοικτά μοντέλα GenAI, αυτό το κρίσιμο όριο όπου η νοημοσύνη του συστήματος αρχίζει να υπερβαίνει όλο και περισσότερο τη δική μας, και τι σημαίνει αυτό για το μέλλον.

Ο David Balaban είναι ερευνητής υπολογιστικής ασφάλειας με πάνω από 17 χρόνια εμπειρίας στην ανάλυση κακόβουλου λογισμικού και αξιολόγηση λογισμικού αντίμετρου ιών. Ο David διαχειρίζεται τα projects MacSecurity.net και Privacy-PC.com που παρουσιάζουν ειδικές γνώμες σε σύγχρονα θέματα ασφάλειας πληροφοριών, συμπεριλαμβανομένης της κοινωνικής μηχανικής, κακόβουλου λογισμικού, δοκιμής διείσδυσης, ευφυίας απειλών, διαδικτυακής ιδιωτικής ζωής και white hat hacking. Ο David έχει ισχυρό υπόβαθρο στην αντιμετώπιση προβλημάτων κακόβουλου λογισμικού, με πρόσφατο επίκεντρο στις αντιμετρόπες για το ransomware.