Η γωνία του Anderson
Η ομιλία είναι σήμερα ο χειρότερος τρόπος επικοινωνίας με την AI

Νέα έρευνα υποδηλώνει ότι ο τρόπος επικοινωνίας με την AI που απεικονίζεται συχνότερα στην επιστημονική φαντασία μπορεί να δίνει χειρότερα αποτελέσματα ακόμη και από προτροπές με λάθη πληκτρολόγησης.
Από τον HAL στον Deep Thought και από τον C3P0 στον Wall-E, η εξιδανικευμένη σχέση ανθρώπου και AI περιστρεφόταν πάντα γύρω από τον φωνητικό έλεγχο. Αυτό εκδηλώθηκε και στον πραγματικό κόσμο, από πρώιμους βοηθούς όπως οι Siri και Alexa μέχρι ερωτήσεις και συνομιλίες φυσικής γλώσσας με τα σημερινά μεγάλα γλωσσικά μοντέλα αιχμής.
Η ιδέα γεννήθηκε σε εποχές μικρότερης χειραφέτησης, όταν, με εξαίρεση συγγραφείς και δημοσιογράφους, η πληκτρολόγηση θεωρούνταν «ημιειδικευμένη εργασία» και γινόταν σχεδόν αποκλειστικά από γυναίκες , οι οποίες σπάνια ήταν οι δημιουργοί του περιεχομένου που πληκτρολογούσαν.
Αντίθετα, η ισχύς και η δυνατότητα δράσης εκφράζονταν μέσα από τον προφορικό λόγο: συναντήσεις και συνόδους κορυφής. Φαινόταν λοιπόν αυτονόητο ότι, αφού η σύνθετη γλώσσα υποδήλωνε νοημοσύνη, ο προφορικός λόγος θα γινόταν αναπόφευκτα το φυσικό μέσο της AI.
Πέρα από κάθε άλλο παράγοντα, οι γραπτές ανταλλαγές δεν προσφέρονταν ιδιαίτερα για τηλεόραση και κινηματογράφο. Ακόμη και τολμηρά θρίλερ επιστημονικής φαντασίας, όπως το Colossus: The Forbin Project (1970), όπου ένας υπολογιστής απαντούσε γραπτώς σε προφορικές εντολές ανθρώπων, πέρασαν γρήγορα σε αποκλειστικά φωνητικές απαντήσεις:

Σκηνή από το «Colossus: The Forbin Project» (1970), με έναν τεράστιο υπερυπολογιστή που ξεπερνά γρήγορα τα όρια του γραπτού λόγου και αρχίζει να μιλά και να φέρεται δεσποτικά λίγο μετά την ενεργοποίησή του. Πηγή: Universal Pictures
Να πληκτρολογούμε ή να μιλάμε;
Παρότι τα κορυφαία μοντέλα AI προσφέρουν ενσωματωμένες ηχητικές διεπαφές, νέα έρευνα από τις ΗΠΑ καταλήγει ότι η ομιλία προς μια AI είναι πιθανότατα ο λιγότερο αποτελεσματικός τρόπος να λάβουμε το επιθυμητό αποτέλεσμα, ιδιαίτερα όταν περιμένουμε σύνθετη έξοδο, όπως κώδικα, ως απάντηση στο αίτημά μας.
Σύμφωνα με την εργασία, το να μιλάμε σε ένα LLM όπως το ChatGPT ή το Gemini δίνει σήμερα χειρότερα αποτελέσματα από την πληκτρολόγηση προτροπής ή ερώτησης, ακόμη και αν το γραπτό περιέχει συνηθισμένα λάθη.
Αυτό συμβαίνει επειδή η προφορική είσοδος είναι πιθανότερο να αναδιαρθρωθεί από τα συστήματα απομαγνητοφώνησης με τρόπους που αφαιρούν πληροφορίες από τις οποίες εξαρτάται το μοντέλο. Η απομαγνητοφώνηση πρέπει να χειριστεί δισταγμούς και γεμίσματα όπως «εε» και «ας πούμε», επανεκκινήσεις φράσεων, γραμματικές ασάφειες και χαλαρές συντάξεις, όπως προτάσεις που εγκαταλείπονται και μετατρέπονται σε νέες χωρίς να ολοκληρωθούν.
Οι συγγραφείς αναφέρουν:
«Η ομιλία αποτελεί πλέον βασική διαδρομή πρόσβασης σε γλωσσικό μοντέλο, όχι εξειδικευμένη εξαίρεση. Πράκτορες προγραμματισμού όπως οι Claude Code και Codex δέχονται υπαγορευμένες οδηγίες. Βοηθοί τηλεφώνου όπως οι Google Assistant και Siri προωθούν προφορικά αιτήματα σε υποκείμενο LLM. Διεπαφές υπαγόρευσης όπως το Typeless προσθέτουν ένα ακόμη επίπεδο LLM που καθαρίζει και αναμορφοποιεί το προφορικό αίτημα πριν το στείλει.
»Σε κάθε περίπτωση το μοντέλο λαμβάνει απομαγνητοφώνηση και ο ομιλητής μπορεί να μην ελέγξει το κείμενο που τελικά στάλθηκε. Το μοντέλο πρέπει να απαντήσει σε ό,τι διατηρεί ή ξαναγράφει η διαδικασία απομαγνητοφώνησης».
Αυτό αποδυναμώνει την αντίληψη ότι η πληκτρολογημένη είσοδος υπερέχει επειδή είναι «εγγενής». Δεν είναι εγγενής με καμία έννοια, αφού α) αναδιατυπώνεται πάντοτε με κάποιον τρόπο, κρυφά ή φανερά, πριν μεταδοθεί στην AI και β) η γραπτή γλώσσα είναι μόνο ένα στοιχείο στον λανθάνοντα χώρο από τον οποίο προκύπτει η απάντηση.
Στα πειράματα, τα συνηθισμένα λάθη πληκτρολόγησης επηρέασαν μόνο μέτρια τις επιδόσεις. Αντίθετα, ο συνομιλιακός λόγος, οι καθαρισμένες απομαγνητοφωνήσεις και ιδίως όσες είχαν συμπτυχθεί με AI προκάλεσαν σταθερά πολύ μεγαλύτερες μειώσεις ακρίβειας σε εργασίες συλλογιστικής και παραγωγής κώδικα.
Η νέα εργασία έχει τίτλο Should We Type or Talk to LLM Agents? A Comprehensive Study of Voice and Keyboard Input Perturbations και προέρχεται από τέσσερις συγγραφείς του Santa Monica College και του Πανεπιστημίου της Νότιας Καλιφόρνιας.
(Σημείωση: Η συγκεκριμένη μελέτη συνδυάζει τη «Μέθοδο» με τις «Δοκιμές/Αποτελέσματα» με τρόπο που δεν διαχωρίζεται εύκολα στη συνηθισμένη σειρά της ανάλυσής μου. Επομένως, αναγκάζομαι να συνοψίσω και να επιλέξω υλικό περισσότερο από ό,τι συνήθως.)
Μέθοδος
Οι συγγραφείς ανέπτυξαν ένα σύνολο ελεγχόμενων αλλοιώσεων εισόδου, το Human Input Variation Engine (HIVE), για να προσομοιώσουν τα λάθη που προκύπτουν όταν οι άνθρωποι πληκτρολογούν προτροπές σε πληκτρολόγιο QWERTY ή τις εκφωνούν μέσω συστήματος απομαγνητοφώνησης:

Εννοιολογικό διάγραμμα του Human Input Variation Engine (HIVE). Η προτροπή φτάνει στο γλωσσικό μοντέλο μέσω φωνής, πληκτρολογίου QWERTY ή απευθείας αντιγραφής και επικόλλησης, με την τελευταία ως «καθαρή» αναφορά. Το χρώμα δείχνει το κανάλι εισόδου, όχι τη μέθοδο υλοποίησης. Οι μετασχηματισμοί φωνής συνδυάζουν μεταφορά ύφους μέσω LLM με λίγα παραδείγματα και ντετερμινιστικούς κανόνες, ενώ εκείνοι του πληκτρολογίου χρησιμοποιούν αποκλειστικά ντετερμινιστικούς κανόνες. Δεξιά φαίνεται το εύρος απαντήσεων που μπορεί να παράγει το μοντέλο με υποβαθμισμένη είσοδο. Πηγή
Το HIVE μοντελοποιεί τρεις διαδρομές εισόδου προτροπών: φωνή, πληκτρολόγιο QWERTY και άμεση αντιγραφή και επικόλληση. Η τελευταία αποτελεί την αμετάβλητη αναφορά για τις υπόλοιπες. Δύο επιπλέον μετασχηματισμοί λειτουργούν ως πειραματικοί έλεγχοι, αλλάζοντας τη σειρά της ερώτησης και του πλαισίου της ή τη σειρά επιλογών σε ερωτήσεις πολλαπλής επιλογής.
Οι μετασχηματισμοί αλλοίωσης υλοποιούνται με ντετερμινιστικούς κανόνες ή με μεταφορά ύφους μέσω LLM και λίγων παραδειγμάτων, χρησιμοποιώντας το Qwen2.5-7B. Έτσι οι δύο μέθοδοι εισόδου αξιολογήθηκαν σε ελεγχόμενες και άμεσα συγκρίσιμες συνθήκες.
Συνθήκες δοκιμών και αποτελέσματα
Τα πειράματα εκτελέστηκαν στα Llama-3.1-8B· Qwen2.5-7B· Qwen3-8B· Mistral-7B-v0.3· και Phi-4, με πέντε τιμές αρχικοποίησης τυχαιότητας (seeds). Τα έξι σύνολα αξιολόγησης ήταν τα GSM8K· GSM-Symbolic· GSM1k· HumanEval· MMLU-Pro STEM· και TruthfulQA MC1.
Χρησιμοποιήθηκαν 200 παραδείγματα ανά σύνολο αξιολόγησης και 164 για ολόκληρο το HumanEval. Εφαρμόστηκε άπληστη αποκωδικοποίηση —επιλογή του πιθανότερου επόμενου token κάθε φορά— ώστε κάθε αλλοιωμένη προτροπή να συγκρίνεται με την καθαρή αντίστοιχή της στην ίδια εκτέλεση μοντέλου. Προέκυψαν 550.000 βαθμολογημένες απαντήσεις από δεκαεπτά αλλαγές προτροπής και δύο δοκιμές ελέγχου , δηλαδή συγκριτικές δοκιμές για την απομόνωση συγκεκριμένων επιδράσεων.
Λήφθηκαν μέτρα ώστε να μην υπάρχει επιμόλυνση του συνόλου δοκιμών , δηλαδή επικάλυψη με δεδομένα που το μοντέλο μπορεί να είχε δει στην εκπαίδευση:

Το πλήρες σύνολο αλλοιώσεων της μελέτης και η μεταβολή ακρίβειας σε σχέση με τις καθαρές προτροπές, για αλλαγές απομαγνητοφώνησης, λάθη πληκτρολογίου QWERTY και δοκιμές ελέγχου. Η πρώτη γραμμή δίνει την ακρίβεια της καθαρής αναφοράς, ενώ οι επόμενες δείχνουν μεταβολές σε ποσοστιαίες μονάδες. Το κόκκινο σηματοδοτεί τον πιο επιβλαβή μετασχηματισμό σε κάθε ομάδα και στήλη και το μπλε τον λιγότερο επιβλαβή.
Το σαφέστερο αποτέλεσμα είναι ότι η φωνητική είσοδος προκάλεσε μεγαλύτερη ζημιά από το πληκτρολόγιο στις κύριες συνθήκες δοκιμών. Οι αλλαγές που συνδέονται με την ομιλία μείωναν την ακρίβεια περίπου τρεις φορές περισσότερο από τα λάθη πληκτρολόγησης. Τα χειρότερα αποτελέσματα εμφανίστηκαν όταν τα προφορικά αιτήματα ξαναγράφονταν αυτόματα ώστε να είναι πιο καθαρά και συνοπτικά, επειδή η επεξεργασία συχνά άλλαζε τη δομή του αιτήματος που λάμβανε το μοντέλο.
Αυτό έχει σημασία επειδή η χαμηλότερη απόδοση της φωνής δεν οφειλόταν κυρίως στα προφανή «περιττά» στοιχεία της ομιλίας. Γεμίσματα όπως «εε» και «ας πούμε» επηρέαζαν την ακρίβεια όταν προστίθενταν σε καθαρές γραπτές προτροπές, αλλά η αφαίρεσή τους από προφορικές απομαγνητοφωνήσεις δεν αποκαθιστούσε τις επιδόσεις.
Διατήρηση του αρχικού περιεχομένου
Το μεγαλύτερο πρόβλημα ήταν επομένως ο τρόπος αναδιάρθρωσης των προφορικών προτροπών πριν φτάσουν στο μοντέλο.
Κεντρικό ερώτημα ήταν αν το μοντέλο εξακολουθούσε να λαμβάνει αρκετό από το αρχικό κείμενο ώστε να ανασυνθέσει την πρόθεση του χρήστη. Τα λάθη πληκτρολόγησης συχνά φθείρουν την «επιφάνεια» μιας λέξης χωρίς να την αφαιρούν εντελώς, οπότε το περιβάλλον κείμενο βοηθά ακόμη στην κατανόηση.
Αντίθετα, μια «καθαρισμένη» απομαγνητοφώνηση μπορεί να αντικαταστήσει την αρχική διατύπωση με μια συντομότερη και πιο ομαλή εκδοχή που δεν διατηρεί πλέον τις ίδιες σχέσεις ανάμεσα στα δεδομένα.
Γι’ αυτό τα λάθη πληκτρολογίου συχνά ήταν λιγότερο επιβλαβή: αντεστραμμένα ή διπλά γράμματα, κενά που λείπουν και πατήματα γειτονικών πλήκτρων συνήθως άφηναν ανακτήσιμο μεγάλο μέρος της αρχικής διατύπωσης. Ο καθαρισμός ομιλίας συχνότερα αφαιρούσε ή αναδιοργάνωνε πληροφορίες πριν το μοντέλο μπορέσει να τις ερμηνεύσει.
Χαμένο στη μετάφραση
Η εργασία δίνει ένα παράδειγμα όπου το αντικείμενο αναφοράς χάνεται κατά τη διαδρομή από τον χρήστη στο LLM. Η φράση «έδωσε ίση ποσότητα [βιβλίων] στα παιδιά της» επανερμηνεύτηκε ως αναφορά σε χρήματα αντί για βιβλία. Η αγγλική λέξη «amount» αποσυνδέθηκε από το αντικείμενο στο οποίο αναφερόταν και συνδέθηκε λανθασμένα με τη συνηθέστερη συσχέτισή της, τα χρήματα:

Πόσο από το αρχικό ερώτημα διατηρείται μετά από κάθε αλλαγή εισόδου. Οι μεγάλες κουκκίδες αντιστοιχούν σε επιμέρους τύπους αλλοίωσης, ενώ οι μικρές σε εντονότερες εκδοχές των ίδιων λαθών πληκτρολογίου.
Η επίδραση ήταν ισχυρότερη όταν το μοντέλο έπρεπε να κατασκευάσει απάντηση από την προτροπή, αντί να επιλέξει από ήδη διαθέσιμες επιλογές. Οι αριθμητικές εργασίες και η παραγωγή κώδικα επηρεάστηκαν περισσότερο, επειδή εξαρτώνταν από τη διατήρηση των ακριβών σχέσεων μέσα στο αίτημα. Οι δοκιμές πολλαπλής επιλογής ήταν λιγότερο εκτεθειμένες σε αυτή τη ζημιά.
Οι συγγραφείς καταλήγουν:
«Διαπιστώνουμε ότι η ομιλία είναι το ακριβό κανάλι, ότι το κόστος της βλάβης εξαρτάται από το πόσο καταστρέφεται ο αρχικός διαχωρισμός του ερωτήματος σε token και ότι ούτε η επιμόλυνση των δοκιμών ούτε η ελαφριά προσαρμογή εξηγούν ή διορθώνουν τη βλάβη.
»Προκύπτουν ορισμένα συμπεράσματα. Αν πληκτρολογείτε, ένα μοντέλο συλλογιστικής απορροφά τα λάθη σας. Αν υπαγορεύετε, δεν το κάνει· επομένως η διατύπωση που εκφωνείτε είναι η διατύπωση με την οποία εργάζεται το μοντέλο.
»Αν αναπτύσσετε εργαλεία υπαγόρευσης, μην αναμορφοποιείτε και μην αναδιαρθρώνετε όσα είπε ο χρήστης: αφαιρέστε ελάχιστα τα στοιχεία δισταγμού και αφήστε τις ομόηχες λέξεις όπως είναι.
»Το τελευταίο έχει τη μεγαλύτερη σημασία, επειδή οι διεπαφές υπαγόρευσης γίνονται συνηθισμένος τρόπος πρόσβασης σε μοντέλα. Το επίπεδο επαναδιατύπωσής τους προκαλεί τη μεγαλύτερη ζημιά που μετράμε και είναι το φθηνότερο στοιχείο για να αλλάξει».
Συμπέρασμα
Όποιος έχει απομαγνητοφωνήσει χειροκίνητα μια συνέντευξη —συνηθισμένη και μοναχική δημοσιογραφική αγγαρεία πριν από την AI— γνωρίζει πόσο ερμηνευτική μπορεί να είναι η διαδικασία. Εξαίρεση αποτελεί ένας εξαιρετικά εύγλωττος ομιλητής ή κάποιος που, όπως συχνά συμβαίνει, επαναλαμβάνει μηχανικά τις συνηθισμένες ιστορίες του.
Πέρα από τέτοιες περιπτώσεις, όταν μιλάμε με άλλους, αγνοούμε αυτόματα τους δισταγμούς και εξάγουμε το νόημα. Αυτό κάνει αναπόφευκτα τη χρήσιμη απομαγνητοφώνηση πράξη ερμηνείας: το κείμενό της αποδίδει τις προθέσεις καλύτερα από μια απολύτως κυριολεκτική, φωνητικά πιστή μεταγραφή. Είναι ενδιαφέρον ότι και οι ηχητικές διεπαφές προς LLM δυσκολεύονται αντίστοιχα να διατηρήσουν ή ακόμη και να εντοπίσουν το ίδιο νόημα με τις γραπτές εκδοχές.
Είναι εύλογο να αναμένουμε ότι νεότερα πλαίσια θα ωφεληθούν από περαιτέρω μελέτη και, ελπίζουμε, πλούσια σύνολα δεδομένων που θα βοηθήσουν να γεφυρωθούν τα κενά της νέας εργασίας. Μέχρι τότε, η μελέτη υποδεικνύει ότι η φωνητική επικοινωνία με AI ίσως ταιριάζει περισσότερο στις σύντομες εντολές που χαρακτήριζαν τους καταναλωτικούς ψηφιακούς βοηθούς.
Πρώτη δημοσίευση: Τετάρτη 12 Αυγούστου 2026












