Μοντέλα και πλατφόρμες AI

EchoSpeech: Επανάσταση στην Επικοινωνία με Τεχνολογία Αναγνώρισης Σιωπηλού Λόγου

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ερευνητές στο Πανεπιστήμιο Κορνέλ έχουν αναπτύξει το EchoSpeech, μια διεπαφή αναγνώρισης σιωπηλού λόγου που χρησιμοποιεί ακουστική ανίχνευση και τεχνητή νοημοσύνη για τη συνεχή αναγνώριση μέχρι 31 μη προφορικών εντολών με βάση τις κινήσεις των χειλιών και του στόματος. Αυτή η διεπαφή χαμηλής ισχύος και φορητή μπορεί να λειτουργήσει σε ένα smartphone και απαιτεί μόνο quelques λεπτά δεδομένων εκπαίδευσης του χρήστη για την αναγνώριση εντολών.

Ο Ruidong Zhang, διδακτορικός φοιτητής πληροφορικής, είναι ο κύριος συγγραφέας του “EchoSpeech: Συνεχής Αναγνώριση Σιωπηλού Λόγου σε Ελαφρά Ενοχλητικά Γυαλιά με Ακουστική Ανίχνευση,” το οποίο θα παρουσιαστεί στη Διάσκεψη της Ένωσης για την Επιστήμη των Υπολογιστών για Ανθρώπινους Παράγοντες σε Συστήματα Υπολογιστών (CHI) αυτό το μήνα στο Αμβούργο, Γερμανία.

«Για άτομα που δεν μπορούν να προφορίσουν ήχους, αυτή η τεχνολογία σιωπηλού λόγου θα μπορούσε να είναι μια εξαιρετική είσοδος για einen συνθετητή φωνής. Θα μπορούσε να δώσει στους ασθενείς την φωνή τους πίσω», είπε ο Zhang, υπογραμμίζοντας τις πιθανές εφαρμογές της τεχνολογίας με περαιτέρω ανάπτυξη.

Πρακτικές Εφαρμογές και Πλεονεκτήματα Ιδιωτικότητας

Στην τρέχουσα μορφή της, το EchoSpeech θα μπορούσε να χρησιμοποιηθεί για επικοινωνία με άλλους μέσω smartphone σε περιβάλλοντα όπου η ομιλία είναι άβολη ή ανεπιθύμητη, όπως σε θορυβώδεις εστιατόρια ή σιωπηλά βιβλιοθήκες. Η διεπαφή σιωπηλού λόγου μπορεί επίσης να συνδυαστεί με ένα στυλό και να χρησιμοποιηθεί με λογισμικό σχεδίασης όπως το CAD, μειώνοντας σημαντικά την ανάγκη για πληκτρολόγιο και ποντίκι.

Εξοπλισμένα με μικρόφωνα και ηχεία μικρότερα από μολύβια, τα γυαλιά EchoSpeech λειτουργούν ως φορητό σύστημα sonar με τεχνητή νοημοσύνη, στέλνοντας και λαμβάνοντας ήχους στο πρόσωπο και ανιχνεύοντας κινήσεις του στόματος. Ένα αλγόριθμο βαθιάς μάθησης αναλύει αυτά τα προφίλ ηχών σε πραγματικό χρόνο με ακρίβεια περίπου 95%.

«Μεταφέρουμε το sonar στο σώμα», είπε ο Cheng Zhang, βοηθός καθηγητής πληροφορικής και διευθυντής του Εργαστηρίου Smart Computer Interfaces για Μελλοντικές Συnergies (SciFi) του Κορνέλ.

Η υφιστάμενη τεχνολογία αναγνώρισης σιωπηλού λόγου συνήθως βασίζεται σε einen περιορισμένο σύνολο προκαθορισμένων εντολών και απαιτεί από τον χρήστη να αντιμετωπίζει ή να φοράει μια κάμερα. Ο Cheng Zhang εξήγησε ότι αυτό δεν είναι ούτε πρακτικό ούτε εφικτό και επίσης δημιουργεί σημαντικές προβληματικές ιδιωτικότητας τόσο για τον χρήστη όσο και για εκείνους με τους οποίους αλληλεπιδρά.

Η τεχνολογία ακουστικής ανίχνευσης του EchoSpeech εξαλείφει την ανάγκη για φορητές βιντεοκαμερές. Επιπλέον, поскольку τα δεδομένα ήχου είναι μικρότερα από τα δεδομένα εικόνας ή βίντεο, απαιτούν λιγότερο εύρος ζώνης για επεξεργασία και μπορούν να μεταδοθούν σε ένα smartphone μέσω Bluetooth σε πραγματικό χρόνο, σύμφωνα με τον François Guimbretière, καθηγητή πληροφορικής.

«Και επειδή τα δεδομένα επεξεργάζονται τοπικά στο smartphone σας αντί να ανεβαίνουν στο cloud», είπε, «πληροφορίες ευαίσθητες στην ιδιωτικότητα ποτέ δεν αφήνουν τον έλεγχό σας».

Ο Alex McFarland είναι δημοσιογράφος και συγγραφέας του AI που εξερευνά τις τελευταίες εξελίξεις στην τεχνητή νοημοσύνη. Έχει συνεργαστεί με πολλές startups και εκδόσεις του AI σε όλο τον κόσμο.