Μοντέλα και πλατφόρμες AI
Ερευνητές Αναπτύσσουν Μοντέλο Αναγνώρισης Ανθρώπινης Ομιλίας με Βαθιά Νευρωνικά Δίκτυα
Μια ομάδα ερευνητών από τη Γερμανία εξερευνά ένα νέο μοντέλο αναγνώρισης ανθρώπινης ομιλίας με βάση τη μηχανική μάθηση και τα βαθιά νευρωνικά δίκτυα. Το νέο μοντέλο μπορεί να βοηθήσει σημαντικά στην βελτίωση της αναγνώρισης ανθρώπινης ομιλίας.
Οι αλγόριθμοι των συσκευών ακουστικής ενίσχυσης χρησιμοποιούνται συνήθως για τη βελτίωση της αναγνώρισης ανθρώπινης ομιλίας και αξιολογούνται μέσω διαφόρων πειραμάτων που καθορίζουν το λόγο σήματος προς θόρυβο στο οποίο αναγνωρίζεται ένα bestimmμένο αριθμός λέξεων. Ωστόσο, αυτά τα πειράματα είναι συχνά χρονοβόρα και ακριβά.
Το νέο μοντέλο περιγράφηκε σε έρευνα που δημοσιεύθηκε στο The Journal of the Acoustical Society of America.
Προβλέψεις για Ακουστικά Βλαβές
Η Jana Roßbach είναι ένας από τους συγγραφείς από το Carl Von Ossietzky University.
«Η καινοτομία του μοντέλου μας είναι ότι παρέχει καλές προβλέψεις για ακουστικά βλαβές για τύπους θορύβου με πολύ διαφορετική πολυπλοκότητα και δείχνει και χαμηλά λάθη και υψηλή συσχέτιση με τα μετρούμενα δεδομένα», είπε η Roßbach.
Η ομάδα των ερευνητών υπολόγισε πόσες λέξεις ανά πρόταση μπορούσε να καταλάβει ένας ακροατής μέσω αυτόματης αναγνώρισης ομιλίας (ASR). Τα εργαλεία αναγνώρισης ομιλίας όπως η Alexa και η Siri βασίζονται σε αυτήν την ASR, η οποία είναι ευρέως διαθέσιμη.
Η Μελέτη και τα Αποτελέσματα
Η μελέτη που διεξήχθη από την ομάδα αφορούσε οκτώ άτομα με φυσιολογική ακοή και 20 άτομα με ακουστική βλάβη. Οι ακροατές εκτέθηκαν σε πολλά διαφορετικά σύνθετα θορύβους που κρύβουν την ομιλία, και οι ακουστικά βλαβείς ακροατές κατηγοριοποιήθηκαν σε τρεις ομάδες ανάλογα με το επίπεδο της ηλικιακής ακουστικής βλάβης τους.
Μέσω του νέου μοντέλου, οι ερευνητές μπορούσαν να προβλέψουν την απόδοση αναγνώρισης ανθρώπινης ομιλίας για ακουστικά βλαβείς ακροατές με διαφορετικά επίπεδα ακουστικής βλάβης. Μπορούσαν να κάνουν αυτές τις προβλέψεις για διάφορους θορύβους με διαφορετική πολυπλοκότητα σε χρονική τροποποίηση και πόσο παρόμοιοι ήταν με την πραγματική ομιλία. Όλα αυτά επέτρεψαν σε κάθε άτομο να παρατηρηθεί και να αναλυθεί ατομικά σε σχέση με πιθανή ακουστική βλάβη.
«Η μεγαλύτερη μας έκπληξη ήταν ότι οι προβλέψεις λειτουργούσαν καλά για όλους τους τύπους θορύβου. Περιμέναμε το μοντέλο να έχει προβλήματα όταν χρησιμοποιούσε έναν μόνο ανταγωνιστικό ομιλητή. Ωστόσο, δεν ήταν così», είπε η Roßbach.
Καθώς το μοντέλο ήταν επικεντρωμένο στην ακοή ενός αυτιού, η ομάδα θα κοιτάξει τώρα να δημιουργήσει ένα δισωτικό μοντέλο για ακοή δύο αυτιών. Λένε επίσης ότι το νέο μοντέλο θα μπορούσε να χρησιμοποιηθεί για να προβλέψει την προσπάθεια ακρόασης ή την ποιότητα ομιλίας επίσης.












