Μοντέλα και πλατφόρμες AI
Τα ακουστικά AI επιτρέπουν να ακούτε ένα άτομο σε ένα πλήθος
Σε ένα πλήθος, θορυβώδες περιβάλλον, έχουν ποτέ ευχηθεί να μπορούσατε να αποκλείσετε όλο τον θόρυβο και να επικεντρωθείτε αποκλειστικά στο άτομο που προσπαθείτε να ακούσετε; Ενώ τα ακουστικά με ακύρωση θορύβου έχουν κάνει μεγάλα βήματα στην δημιουργία μιας ακουστικής λευκής σελίδας, ακόμη παλεύουν να επιτρέψουν συγκεκριμένα ήχους από το περιβάλλον του χρήστη να διηθήσουν. Αλλά τι αν τα ακουστικά σας μπορούσαν να εκπαιδευτούν να πιάσουν και να ενισχύσουν τη φωνή ενός seul ατόμου, ακόμη και καθώς κινείστε γύρω σε ένα δωμάτιο γεμάτο με άλλες συνομιλίες;
Target Speech Hearing (TSH), ένα πρωτοποριακό σύστημα AI που αναπτύχθηκε από ερευνητές στο Πανεπιστήμιο του Ουάσινγκτον, κάνει πρόοδο σε αυτήν την περιοχή.
Πώς λειτουργεί το Target Speech Hearing
Για να χρησιμοποιήσετε το TSH, ένα άτομο που φοράει ειδικά εξοπλισμένα ακουστικά απλώς πρέπει να κοιτάξει το άτομο που θέλει να ακούσει για quelques δευτερόλεπτα. Αυτή η σύντομη “εγγραφή” επιτρέπει στο σύστημα AI να μάθει και να πιάσει τα μοναδικά φωνητικά μοτίβα του στόχου ομιλητή.
Εδώ είναι πώς λειτουργεί κάτω από το καπό:
- Ο χρήστης πατάει ένα κουμπί ενώ κατευθύνει το κεφάλι του προς τον επιθυμητό ομιλητή για 3-5 δευτερόλεπτα.
- Τα μικρόφωνα και στις δύο πλευρές του headset πιάνουν τα κύματα ήχου από τη φωνή του ομιλητή ταυτόχρονα (με ένα περιθώριο λάθους 16 μοιρών).
- Τα ακουστικά μεταδίδουν αυτό το σήμα ήχου σε einen ενσωματωμένο υπολογιστή.
- Το λογισμικό machine learning αναλύει τη φωνή και δημιουργεί ένα μοντέλο των διακριτικών φωνητικών χαρακτηριστικών του ομιλητή.
- Το σύστημα AI χρησιμοποιεί αυτό το μοντέλο για να απομονώσει και να ενισχύσει τη φωνή του εγγεγραμμένου ομιλητή σε πραγματικό χρόνο, ακόμη και καθώς ο χρήστης κινείται γύρω σε ένα θορυβώδες περιβάλλον.
Ο περισσότερος ομιλητής μιλάει, το περισσότερο δεδομένο εκπαίδευσης λαμβάνει το σύστημα, επιτρέποντάς του να επικεντρωθεί καλύτερα και να διασαφηνίσει την επιθυμητή φωνή. Αυτή η καινοτόμος προσέγγιση της “σελεκτίβης ακοής” ανοίγει ένα κόσμο δυνατοτήτων για τη βελτίωση της επικοινωνίας και της προσβασιμότητας σε απαιτητικά ακουστικά περιβάλλοντα.
Shyam Gollakota είναι ο senior author του εγγράφου και καθηγητής στο Πανεπιστήμιο του Ουάσινγκτον
“Συνήθως σκεφτόμαστε το AI τώρα ως web-основанные chatbots που απαντούν σε ερωτήσεις. Αλλά σε αυτό το έργο, αναπτύσσουμε AI για να τροποποιήσουμε την ακουστική αντίληψη οποιουδήποτε φορούσε ακουστικά, βάσει των προτιμήσεών του. Με τις συσκευές μας τώρα μπορείτε να ακούσετε ένα seul ομιλητή καθαρά ακόμη και αν βρίσκεστε σε ένα θορυβώδες περιβάλλον με πολλούς άλλους ανθρώπους που μιλάνε.” – Gollakota
Δοκιμή των ακουστικών AI με TSH
Για να δοκιμάσουν το Target Speech Hearing, η ερευνητική ομάδα διεξήγαγε μια μελέτη με 21 συμμετέχοντες. Κάθε υποκείμενο φόρεσε τα ακουστικά TSH και εγγράφηκε σε ένα θορυβώδες περιβάλλον. Τα αποτελέσματα ήταν εντυπωσιακά – κατά μέσο όρο, οι χρήστες αξιολόγησαν τη σαφήνεια της φωνής του εγγεγραμμένου ομιλητή ως σχεδόν δύο φορές υψηλότερη σε σύγκριση με το μη φιλτράρισμα σήμα ήχου.
Αυτή η đột破 βασίζεται στην προηγούμενη δουλειά της ομάδας για την “σεμαντική ακοή”, η οποία επέτρεψε στους χρήστες να φιλτράρουν το ακουστικό περιβάλλον τους βάσει προκαθορισμένων κατηγοριών ήχου, όπως τα πουλιά που τριλιάζουν ή οι ανθρώπινες φωνές. Το TSH παίρνει αυτήν την концепция ένα βήμα παραπέρα, επιτρέποντας την επιλεκτική ενίσχυση της φωνής ενός συγκεκριμένου ατόμου.
Οι επιπτώσεις είναι σημαντικές, από την ενίσχυση των προσωπικών συνομιλιών σε θορυβώδεις ρυθμίσεις έως την βελτίωση της προσβασιμότητας για εκείνους με προβλήματα ακοής. Όσο η τεχνολογία εξελίσσεται, θα μπορούσε να αλλάξει θεμελιωδώς τον τρόπο με τον οποίο βιώνονται και αλληλεπιδρούν με τον ακουστικό κόσμο μας.
Βελτιώνοντας τα ακουστικά AI και Αντιμετωπίζοντας τις Περιορισμούς
Ενώ το Target Speech Hearing αντιπροσωπεύει ένα μεγάλο βήμα προς τα εμπρός στην ακουστική AI, το σύστημα έχει κάποιους περιορισμούς στη σημερινή του μορφή:
- Εγγραφή seul ομιλητή: Για τώρα, το TSH μπορεί να εκπαιδευτεί μόνο για να επικεντρωθεί σε έναν ομιλητή κάθε φορά. Η εγγραφή πολλών ομιλητών ταυτόχρονα δεν είναι ακόμη δυνατή.
- Επίδραση από παρόμοιες πηγές ήχου: Αν άλλη μια έντονη φωνή έρχεται από την ίδια κατεύθυνση με τον στόχο ομιλητή κατά τη διάρκεια της εγγραφής, το σύστημα μπορεί να παλεύει να απομονώσει τα φωνητικά μοτίβα του επιθυμητού ατόμου.
- Χειροκίνητη εγγραφή: Αν ο χρήστης δεν είναι ικανοποιημένος με την ποιότητα ήχου μετά την αρχική εκπαίδευση, πρέπει να επανεγγράψει χειροκίνητα τον στόχο ομιλητή για να βελτιώσει τη σαφήνεια.
Παρά αυτούς τους περιορισμούς, η ομάδα του Πανεπιστημίου του Ουάσινγκτον εργάζεται ενεργά για την εξέλιξη και την επέκταση των ικανοτήτων του TSH. Ένας από τους κύριους στόχους τους είναι να μινιματίζουν την τεχνολογία, επιτρέποντας την ομαλή ενσωμάτωση σε καταναλωτικά προϊόντα όπως τα earbuds και τα ακουστικά.
Όσο οι ερευνητές συνεχίζουν να推ουν τα όρια του τι είναι δυνατό με την ακουστική AI, οι πιθανές εφαρμογές είναι τεράστιες, από την ενίσχυση της παραγωγικότητας σε απομακρυσμένα γραφειακά περιβάλλοντα έως την διευκόλυνση της σαφούς επικοινωνίας για τους πρώτους απανταχού και στρατιωτικό προσωπικό σε υψηλές επικίνδυνες καταστάσεις. Το μέλλον της σελεκτίβης ακοής φαίνεται λαμπρό, και το Target Speech Hearing είναι έτοιμο να παίξει einen καθοριστικό ρόλο στη διαμόρφωση του.












