Μοντέλα και πλατφόρμες AI
Διευθυντής Ερευνών για το Amazon Alexa Υποστηρίζει ότι ο Turing Test είναι Ξεπερασμένος
O Rohit Prasad, αντιπρόεδρος και επικεφαλής επιστήμονας του Alexa στην Amazon (AMZN ), υποστήριξε πρόσφατα ότι ο Τεστ Τούρινγκ, που χρησιμοποιείται για πολλά χρόνια για τη μέτρηση της σοφιστικότητας των μοντέλων AI, πρέπει να αποσυρθεί ως μέτρο για την AI.
Ο επιστήμονας υπολογιστών και μαθηματικός Alan Turing εισήγαγε αρχικά την έννοια του Τεστ Τούρινγκ πριν από περισσότερα από 70 χρόνια. Ο σκοπός του Τεστ Τούρινγκ ήταν να βοηθήσει στην απάντηση του ερωτήματος της मशινικής νοημοσύνης, καθορίζοντας εάν μια μηχανή ήταν ικανή για “σκέψη” με την ανθρώπινη έννοια. Για να απαντήσει σε αυτό το ερώτημα, ο Τούρινγκ υποστήριξε ότι εάν οι μηχανές μπορούσαν να επιδείξουν συμπεριφορά συνομιλίας τόσο σοφιστικημένη που ένας ανθρώπινος παρατηρητής δεν θα μπορούσε να διακρίνει τη διάλογο της μηχανής από τον ανθρώπινο διάλογο, η μηχανή θα πρέπει να θεωρηθεί ικανή για σκέψη.
Περιορισμοί του Τεστ Τούρινγκ
Ο Prasad υποστήριξε ότι το Τεστ Τούρινγκ έχει πολλά περιορισμοί και ότι ο ίδιος ο Τούρινγκ σχολίασε κάποια από αυτά τα περιορισμοί στο αρχικό του έγγραφο. Όσο η AI γίνεται ολοένα και πιο ενταγμένη σε κάθε πτυχή της ζωής μας, οι άνθρωποι δεν ενδιαφέρονται τόσο για το ότι είναι αδιακρίτως ανθρώπινη και περισσότερο για το ότι οι αλληλεπιδράσεις τους με την AI είναι ομαλές, υποστηρίζει ο Prasad. Για αυτόν το λόγο, το Τεστ Τούρινγκ πρέπει να θεωρηθεί ξεπερασμένο και να αντικατασταθεί με πιο χρήσιμα μέτρα.
Ο Prasad σημείωσε ότι πολλά πρώιμα chatbot είχαν σχεδιαστεί με στόχο την επιτυχία του Τεστ Τούρινγκ, και τα τελευταία χρόνια κάποια chatbot έχουν καταφέρει να εξαπατήσουν περισσότερο από το ένα τρίτο των ανθρώπινων κριτών (η μπαγκέτα που απαιτείτο για να περάσει το Τεστ Τούρινγκ). Ωστόσο, η ικανότητα να μιμείται με επιτυχία τα μοτίβα ομιλίας των ανθρώπων δεν σημαίνει ότι μια μηχανή μπορεί πραγματικά να θεωρηθεί “έξυπνη”. Τα μοντέλα AI μπορούν να είναι εξαιρετικά ικανά σε μια περιοχή και εξαιρετικά ελλιπή σε άλλες, χωρίς καμία μορφή γενικής νοημοσύνης.尽管 αυτό, το Τεστ Τούρινγκ παραμένει ένα κοινό μέτρο για τα chatbot και τους ψηφιακούς βοηθούς, με τον Prasad να σημειώνει ότι οι ηγέτες των επιχειρήσεων και οι δημοσιογράφοι συνεχώς ρωτούν πότε το Alexa θα είναι ικανό να περάσει το Τεστ Τούρινγκ.
Σύμφωνα με τον Prasad, ένα από τα основικά προβλήματα με τη χρήση του Τεστ Τούρινγκ για την αξιολόγηση της मशινικής νοημοσύνης είναι ότι αγνοεί σχεδόν εντελώς την ικανότητα των μηχανών να αναζητούν πληροφορίες και να εκτελούν γρήγορες υπολογισμούς. Τα προγράμματα AI εισάγουν τεχνητές паύσεις στην απάντηση σε σύνθετα μαθηματικά και γεωγραφικά ερωτήματα για να εξαπατήσουν τους ανθρώπους, αλλά έχουν μια απάντηση σε τέτοια ερωτήματα σχεδόν αμέσως. Πέρα από αυτό, το Τεστ Τούρινγκ δεν λαμβάνει υπόψη την αυξανόμενη ικανότητα της AI να χρησιμοποιεί δεδομένα που συλλέγονται από εξωτερικούς αισθητήρες, αγνοώντας πώς οι AI μπορούν να αλληλεπιδράσουν με τον κόσμο γύρω τους μέσω αλγορίθμων όρασης και κίνησης, βασίζοντας się μόνο στην επικοινωνία κειμένου.
Δημιουργία Νέων Μετρήσεων
Ο Prasad υποστήριξε ότι πρέπει να δημιουργηθούν νέες μορφές μέτρησης της νοημοσύνης, μεθόδους που είναι mieux προσαρμοσμένες για την αξιολόγηση ενός γενικού τύπου νοημοσύνης. Αυτά τα τεστ πρέπει να αντανακλούν πώς η AI χρησιμοποιείται στην σύγχρονη κοινωνία και τους στόχους των ανθρώπων για τη χρήση της. Τα τεστ πρέπει να είναι σε θέση να καθορίσουν πώς καλά μια AI αυξάνει την ανθρώπινη νοημοσύνη και πώς βελτιώνει την καθημερινή ζωή των ανθρώπων. Επιπλέον, ένα τεστ πρέπει να κατανοήσει πώς μια AI εκδηλώνει ανθρώπινες ιδιότητες της νοημοσύνης, συμπεριλαμβανομένης της γλωσσικής ικανότητας, της αυτο-επιτήρησης και της “κοινής λογικής”.
Τα τρέχοντα και σημαντικά πεδία της έρευνας AI, όπως η συλλογιστική, η ισότητα, η συνομιλία και η αισθητηριακή κατανόηση, δεν αξιολογούνται από το Τεστ Τούρινγκ, αλλά μπορούν να μετρηθούν με διάφορους τρόπους. Ο Prasad εξήγησε ότι ένας τρόπος μέτρησης αυτών των χαρακτηριστικών της νοημοσύνης είναι να分割 τις προκλήσεις σε συνιστώσες εργασίες. Một άλλος μέθοδος αξιολόγησης είναι η δημιουργία μιας μεγάλης κλίμακας προκλήσεων για την αλληλεπίδραση ανθρώπου-υπολογιστή.
Όταν η Amazon δημιούργησε το Alexa Prize, δημιούργησε ένα σύστημα που απαιτούσε από τα κοινωνικά bot να μιλήσουν με έναν άνθρωπο για 20 λεπτά. Τα bot θα αξιολογούνταν με βάση την ικανότητά τους να συνομιλούν συνεκτικά σε eine ευρεία ποικιλία θεμάτων όπως η τεχνολογία, ο αθλητισμός, η πολιτική και η ψυχαγωγία. Οι πελάτες ήταν υπεύθυνοι για την αξιολόγηση των bot κατά τη φάση ανάπτυξης, αναθέτοντας τους βαθμούς με βάση την επιθυμία τους να μιλήσουν ξανά με το bot. Κατά τη διάρκεια του τελικού γύρου, ανεξάρτητοι κριτές ήταν υπεύθυνοι για την αξιολόγηση των bot χρησιμοποιώντας μια 5-βαθμολογική κλίμακα. Το σύστημα που χρησιμοποιούσαν οι κριτές βασίζονταν σε μεθόδους που επέτρεπαν στα AI να εκδηλώνουν σημαντικά ανθρώπινα χαρακτηριστικά όπως η ευσπλαχνία όπου ήταν κατάλληλο.
Τελικά, ο Prasad υποστήριξε ότι η αυξανόμενη διάδοση των συσκευών AI όπως το Alexa αντιπροσωπεύει μια σημαντική ευκαιρία για τη μέτρηση της πρόοδου της AI, αλλά θα χρειαζόμαστε διαφορετικά μέτρα για να επωφεληθούμε από αυτήν την νέα ευκαιρία.
«Τέτοιες AI πρέπει να είναι ειδικοί σε ένα μεγάλο, διαρκώς αυξανόμενο αριθμό εργασιών, το οποίο είναι δυνατό μόνο με μια πιο γενικευμένη ικανότητα μάθησης αντί για μια εργασία-ειδική νοημοσύνη», εξήγησε ο Prasad. «Επομένως, για την επόμενη δεκαετία και πέρα, η χρησιμότητα των υπηρεσιών AI, με τις συνομιλητικές και προenerγικές ικανότητες τους σε περιβαλλόμενες συσκευές, είναι ένα άξιο τεστ».












