Συνεντεύξεις
Amr Nour-Eldin, Αντιπρόεδρος Τεχνολογίας στην LXT – Σειρά Συνεντεύξεων

O Amr Nour-Eldin είναι ο Αντιπρόεδρος Τεχνολογίας στην LXT. Ο Amr είναι ερευνητικός επιστήμονας με διδακτορικό τίτλο με πάνω από 16 χρόνια επαγγελματικής εμπειρίας στα πεδία της επεξεργασίας ομιλίας/ήχου και της μηχανικής μάθησης στο πλαίσιο της Αυτόματης Αναγνώρισης Ομιλίας (ASR), με ιδιαίτερη εστίαση και πρακτική εμπειρία τα τελευταία χρόνια στις τεχνικές βαθιάς μάθησης για την αναγνώριση ομιλίας σε πραγματικό χρόνο.
LXT είναι ένας αναδυόμενος ηγέτης στα δεδομένα εκπαίδευσης AI για την ενδυνάμωση της έξυπνης τεχνολογίας για τις παγκόσμιες οργανώσεις. Σε συνεργασία με ένα διεθνές δίκτυο συντελεστών, η LXT συλλέγει και αναノτάει δεδομένα σε πολλαπλά μέσα με την ταχύτητα, την κλίμακα και την ευελιξία που απαιτούν οι επιχειρήσεις. Η παγκόσμια εμπειρία τους εκτείνεται σε πάνω από 145 χώρες και πάνω από 1000 τοπικές γλώσσες.
Ποια ήταν η αρχική σας επαφή με το πεδίο της επεξεργασίας σήματος;
Πάντα ήθελα να σπουδάσω μηχανική και μου άρεσε η φυσική, αλλά ήμουν πιο προσηλωμένος στη μαθηματική και τη φυσική. Μου άρεσε να κατανοώ πώς λειτουργεί η φύση και πώς να εφαρμόσω αυτή την κατανόηση για να δημιουργήσω τεχνολογία. Μετά το λύκειο, είχα την ευκαιρία να μελετήσω ιατρική και άλλα επαγγέλματα, αλλά επέλεξα τη μηχανική επειδή αντιπροσωπεύει την ιδανική συνδυασμό θεωρίας και εφαρμογής στα δύο πεδία που μου ήταν πιο κοντά: τα μαθηματικά και τη φυσική. Και μετά, όταν επέλεξα τη μηχανική, υπήρχαν πολλά πιθανά μονοπάτια – μηχανική, πολιτική, κ.λπ. Αλλά επέλεξα τη μηχανική επειδή είναι η πιο κοντινή και η πιο δύσκολη, κατά τη γνώμη μου, στα μαθηματικά και τη φυσική προβλήματα που πάντα με ενδιέφεραν και μου άρεσε περισσότερο, καθώς και τη βάση της σύγχρονης τεχνολογίας που με ώθησε πάντα.
Μέσα στη μηχανική, υπάρχουν διάφορα ειδικά πεδία να επιλέξεις, τα οποία γενικά χωρίζονται σε δύο κατηγορίες: τηλεπικοινωνίες και επεξεργασία σήματος, και αυτή της ενέργειας και της ηλεκτρικής μηχανικής. Όταν ήρθε η ώρα να επιλέξω μεταξύ τους, επέλεξα τις τηλεπικοινωνίες και την επεξεργασία σήματος επειδή είναι πιο κοντά στη περιγραφή της φύσης μέσω της φυσικής και των μαθηματικών. Μιλάμε για σήματα, είτε είναι ήχος, εικόνες ή βίντεο· κατανοούμε πώς επικοινωνούμε και τι αντιλαμβανόμαστε με τις αισθήσεις μας, και πώς να αναπαραστήσουμε μαθηματικά αυτή την πληροφορία με τρόπο που μας επιτρέπει να εκμεταλλευτούμε αυτή τη γνώση για να δημιουργήσουμε και να βελτιώσουμε την τεχνολογία.
Μπορείτε να μας μιλήσετε για την έρευνά σας στο McGill University σχετικά με την πληροφοριακή θεωρία της τεχνητής διεύρυνσης ζώνης (BWE);
Μετά το που ολοκλήρωσα το πτυχίο μου, ήθελα να συνεχίσω να μελετώ το πεδίο της επεξεργασίας σήματος. Μετά από ένα χρόνο σπουδών στη Φωτονική ως μέρος του μεταπτυχιακού μου στη Φυσική, αποφάσισα να επιστρέψω στη Μηχανική για να συνεχίσω το μεταπτυχιακό μου στην επεξεργασία ήχου και ομιλίας, με εστίαση στην αναγνώριση ομιλίας. Όταν ήρθε η ώρα να κάνω το διδακτορικό μου, ήθελα να διευρύνω το πεδίο μου λίγο περισσότερο στην επεξεργασία ήχου και ομιλίας, καθώς και στα συναφή πεδία της μηχανικής μάθησης και της πληροφοριακής θεωρίας, και όχι μόνο στην εφαρμογή της αναγνώρισης ομιλίας.
Το όχημα για το διδακτορικό μου ήταν η διεύρυνση ζώνης της στενής ζώνης ομιλίας. Η στενή ζώνη ομιλίας αναφέρεται στην τηλεφωνική ομιλία. Το περιεχόμενο συχνότητας της ομιλίας εκτείνεται μέχρι τα 20 kilohertz, αλλά το μεγαλύτερο μέρος του περιεχομένου πληροφορίας είναι συγκεντρωμένο μέχρι τα 4 kilohertz. Η διεύρυνση ζώνης αναφέρεται στην τεχνητή διεύρυνση του περιεχομένου ομιλίας από τα 3,4 kilohertz, που είναι το ανώτερο όριο συχνότητας στην τηλεφωνική ομιλία, πάνω από αυτό, μέχρι τα 8 kilohertz ή περισσότερο. Για να ανακατασκευάσουμε καλύτερα το λείπουμενο υψηλότερο περιεχόμενο συχνότητας με βάση μόνο το διαθέσιμο περιεχόμενο στενής ζώνης, πρέπει πρώτα να ποσοτικοποιήσουμε την αμοιβαία πληροφορία μεταξύ του περιεχομένου ομιλίας στις δύο ζώνες συχνότητας, και μετά να χρησιμοποιήσουμε αυτή την πληροφορία για να εκπαιδεύσουμε ένα μοντέλο που μαθαίνει αυτή την αμοιβαία πληροφορία· ένα μοντέλο που, μια φορά εκπαιδευμένο, μπορεί να χρησιμοποιηθεί για να δημιουργήσει υψηλής ζώνης περιεχόμενο με βάση μόνο την ομιλία στενής ζώνης και ό,τι το μοντέλο έμαθε για τη σχέση μεταξύ της διαθέσιμης ομιλίας στενής ζώνης και του λείπουμενου υψηλής ζώνης περιεχομένου. Η ποσοτικοποίηση και η αναπαράσταση αυτής της αμοιβαίας “αμοιβαίας πληροφορίας” είναι όπου η πληροφοριακή θεωρία έρχεται. Η πληροφοριακή θεωρία είναι η μελέτη της ποσοτικοποίησης και αναπαράστασης της πληροφορίας σε οποιοδήποτε σήμα. Έτσι, η έρευνά μου ήταν σχετικά με την ενσωμάτωση της πληροφοριακής θεωρίας για να βελτιώσω την τεχνητή διεύρυνση ζώνης της ομιλίας. Jako takový, το διδακτορικό μου ήταν πιο διεπιστημονική ερευνητική δραστηριότητα όπου συνδύασα την επεξεργασία σήματος με την πληροφοριακή θεωρία και τη μηχανική μάθηση.
Ήταντε Αρχισυντάκτης Επιστημονικού Λόγου στην Nuance Communications, τώρα μέρος της Microsoft (MSFT ), για πάνω από 16 χρόνια, ποια ήταν κάποια από τα βασικά συμπεράσματά σας από αυτή την εμπειρία;
Από την πλευρά μου, το πιο σημαντικό όφελος ήταν ότι εργαζόμουν πάντα με τις τελευταίες τεχνικές επεξεργασίας σήματος και μηχανικής μάθησης και τις εφαρμόζαμε σε πραγματικές εφαρμογές. Έχω την ευκαιρία να εφαρμόσω αυτές τις τεχνικές σε προϊόντα AI συζήτησης σε πολλά πεδία. Αυτά τα πεδία περιελάμβαναν επιχειρήσεις, υγεία, αυτοκίνητα, κινητικότητα, μεταξύ άλλων. Κάποιες από τις συγκεκριμένες εφαρμογές περιελάμβαναν εικονικούς βοηθούς, διαδραστικές τηλεφωνικές απαντήσεις, μετατροπή φωνητικών μηνυμάτων σε κείμενο, και άλλες όπου η σωστή αναπαράσταση και μεταγραφή είναι κρίσιμη, όπως στην υγεία με τις αλληλεπιδράσεις γιατρού-ασθενούς. καθ’ όλη τη διάρκεια αυτών των 16 ετών, είχα την τύχη να δω πρώτο χέρι και να είμαι μέρος της εξέλιξης της συζήτησης AI, από τις ημέρες της στατιστικής μοντελοποίησης με Κρυφές Μαρκοβιανές Μονάδες, μέχρι τη σταδιακή ανάπτυξη της Βαθιάς Μάθησης, μέχρι τώρα όπου η βαθιά μάθηση κυριαρχεί και домινά几乎 όλα τα аспектια της AI, συμπεριλαμβανομένης της Γεννήτριας AI καθώς και της παραδοσιακής προβλεπτικής ή διακριτικής AI. Ένα άλλο βασικό συμπέρασμα από αυτή την εμπειρία είναι ο κρίσιμος ρόλος που παίζει τα δεδομένα, μέσω ποσότητας και ποιότητας, ως βασικός οδηγός των ικανοτήτων και της απόδοσης των μοντέλων AI.
Έχετε δημοσιεύσει πάνω από δώδεκα εργασίες, συμπεριλαμβανομένων σε τόσο διακεκριμένα περιοδικά όπως το IEEE. Ποια είναι η πιο επαναστατική εργασία που δημοσιεύσατε και γιατί ήταν σημαντική;
Η πιο επηρεαστική, με βάση τον αριθμό των αναφορών σύμφωνα με το Google (GOOGL ) Scholar, θα ήταν μια εργασία του 2008 με τίτλο “Mel-Frequency Cepstral Coefficient-Based Bandwidth Extension of Narrowband Speech”. Σε υψηλό επίπεδο, ο στόχος αυτής της εργασίας είναι να ανακατασκευάσει το περιεχόμενο ομιλίας χρησιμοποιώντας μια αναπαράσταση χαρακτηριστικών που χρησιμοποιείται ευρέως στο πεδίο της αυτόματης αναγνώρισης ομιλίας (ASR), τα mel-συχνότητας κεφαλής.
Ωστόσο, η πιο καινοτόμος εργασία, κατά τη γνώμη μου, είναι μια εργασία με την δεύτερη περισσότερη αναφορά, μια εργασία του 2011 με τίτλο “Memory-Based Approximation of the Gaussian Mixture Model Framework for Bandwidth Extension of Narrowband Speech“. Σε αυτή τη δουλειά, πρότεινα μια νέα στατιστική μοντελοποίηση τεχνική που ενσωματώνει χρονικές πληροφορίες στην ομιλία. Το πλεονέκτημα αυτής της τεχνικής είναι ότι επιτρέπει την μοντελοποίηση μακροχρόνιων πληροφοριών στην ομιλία με ελάχιστη πρόσθετη πολυπλοκότητα και με τρόπο που επιτρέπει ακόμη τη δημιουργία υψηλής ζώνης ομιλίας σε πραγματικό χρόνο.
Τον Ιούνιο του 2023 σας προσλήφθηκε ως Αντιπρόεδρος Τεχνολογίας στην LXT, τι σας έκανε να ενδιαφερθείτε για αυτή τη θέση;
Κατά τη διάρκεια της ακαδημαϊκής και επαγγελματικής μου εμπειρίας πριν από την LXT, εργαζόμουν πάντα με δεδομένα. Στην πραγματικότητα, όπως ανέφερα νωρίτερα, ένα από τα βασικά συμπεράσματα από την εργασία μου με την επιστήμη ομιλίας και τη μηχανική μάθηση ήταν ο κρίσιμος ρόλος που παίζουν τα δεδομένα στο κύκλο ζωής του μοντέλου AI. Έχοντας αρκετά ποιοτικά δεδομένα στη σωστή μορφή ήταν, και συνεχίζει να είναι, ζωτικό για την επιτυχία των state-of-the-art μοντέλων βαθιάς μάθησης. Όπως ανέφερα, όταν ήμουν σε ένα στάδιο της καριέρας μου όπου αναζητούσα ένα περιβάλλον startup όπου θα μπορούσα να μάθω, να διευρύνω τις ικανότητές μου, καθώς και να αξιοποιήσω την εμπειρία μου στην ομιλία και την AI για να έχω την μεγαλύτερη επίδραση, είχα την τύχη να έχω την ευκαιρία να ενταχθώ στην LXT. Ήταν η ιδανική ταίριασμα. Όχι μόνο η LXT είναι ένας πάροχος δεδομένων AI που μεγαλώνει με εντυπωσιακό και συνεχή ρυθμό, αλλά είδα επίσης ότι ήταν στο ιδανικό στάδιο όσον αφορά την ανάπτυξη της γνώσης AI, καθώς και την ποικιλία των πελατών και την ποικιλία των τύπων AI και δεδομένων AI. Χαιρόμουν την ευκαιρία να ενταχθώ και να βοηθήσω στην πορεία της ανάπτυξής της· να έχω μια μεγάλη επίδραση φέρνοντας την προοπτική ενός τελικού χρήστη δεδομένων μετά από τόσα χρόνια ως χρήστης επιστήμονα δεδομένων AI.
Τι είναι η μέση σας ημέρα στην LXT;
Η μέση μου ημέρα αρχίζει με την έρευνα για τις τελευταίες εξελίξεις σε ένα θέμα ή άλλο, το οποίο έχει κεντρίσει τελευταία στη γεννήτρια AI και πώς μπορούμε να την εφαρμόσουμε στις ανάγκες των πελατών μας. Ευτυχώς, έχω μια εξαιρετική ομάδα που είναι πολύ ικανή να δημιουργεί και να προσαρμόζει λύσεις για τις εξειδικευμένες ανάγκες δεδομένων AI των πελατών μας. Έτσι, εργάζομαι στενά μαζί τους για να ορίσω αυτό το πρόγραμμα.
Υπάρχει επίσης, φυσικά, στρατηγική ετήσια και τριμηνιαία σχεδιασμός, και η διάσπαση των στρατηγικών στόχων σε ατομικούς στόχους ομάδας και τη διατήρηση της ταχύτητας με τις εξελίξεις κατά μήκος αυτών των σχεδίων. Όσον αφορά την ανάπτυξη χαρακτηριστικών που κάνουμε, γενικά έχουμε δύο τεχνολογικούς δρόμους. Ο ένας είναι να βεβαιωθούμε ότι έχουμε τα σωστά κομμάτια στη θέση τους για να παραδώσουμε τα καλύτερα αποτελέσματα στα τρέχοντα και νέα ερχόμενα προγράμματα. Ο άλλος δρόμος είναι η βελτίωση και η διεύρυνση των τεχνολογικών μας ικανοτήτων, με εστίαση στην ενσωμάτωση της μηχανικής μάθησης σε αυτές.
Μπορείτε να μας μιλήσετε για τους τύπους των αλγορίθμων μηχανικής μάθησης που εργάζεστε στην LXT;
Οι λύσεις AI μεταμορφώνουν τις επιχειρήσεις σε όλους τους κλάδους, και εμείς στην LXT τιμούμαστε που παρέχουμε τα υψηλής ποιότητας δεδομένα για να εκπαιδεύσουμε τους αλγορίθμους μηχανικής μάθησης που τις ενδυναμώνουν. Οι πελάτες μας εργάζονται σε eine ευρεία γκάμα εφαρμογών, συμπεριλαμβανομένων της αυξημένης και εικονικής πραγματικότητας, της επεξεργασίας εικόνας, της συζήτησης AI, της γεννήτριας AI, της αναζήτησης και της φυσικής γλώσσας (NLP), μεταξύ άλλων. Είμαστε αφοσιωμένοι στο να ενδυναμώσουμε τις μελλοντικές τεχνολογίες AI μέσω της δημιουργίας και της βελτίωσης δεδομένων σε κάθε γλώσσα, πολιτισμό και μέσο.
Εσωτερικά, ενσωματώνουμε επίσης τη μηχανική μάθηση για να βελτιώσουμε και να оптимίσουμε τις εσωτερικές μας διαδικασίες, από την αυτοματοποίηση της επαλήθευσης ποιότητας δεδομένων μας, μέχρι την ενεργοποίηση ενός μοντέλου ετικέτας ανθρώπινου-στο-βρόχο σε όλα τα μέσα δεδομένων που εργαζόμαστε.
Η ομιλία και η επεξεργασία ήχου προσεγγίζουν ταχύτατα την πληρότητα όταν πρόκειται για την αγγλική γλώσσα και ειδικά τους λευκούς άνδρες. Πόσο καιρό αναμένετε ότι θα χρειαστεί μέχρι να γίνει ένα ισόπεδο πεδίο σε όλες τις γλώσσες, φύλα και εθνοτικές ομάδες;
Αυτή είναι μια σύνθετη ερώτηση, και εξαρτάται από πολλούς παράγοντες, συμπεριλαμβανομένων των οικονομικών, πολιτικών, κοινωνικών και τεχνολογικών, μεταξύ άλλων. Αλλά αυτό που είναι σαφές είναι ότι η κυριαρχία της αγγλικής γλώσσας είναι αυτό που ώθησε την AI στο σημείο όπου είμαστε τώρα. Για να φτάσουμε σε ένα σημείο όπου είναι ένα ισόπεδο πεδίο πραγματικά εξαρτάται από το ρυθμό με τον οποίο η αναπαράσταση δεδομένων από διαφορετικές εθνοτικές ομάδες και πληθυσμούς αυξάνεται στο διαδίκτυο, και το ρυθμό με τον οποίο αυξάνεται είναι αυτό που θα καθορίσει όταν θα φτάσουμε εκεί.
Ωστόσο, η LXT και παρόμοιες εταιρείες possono να έχουν ένα μεγάλο χέρι στο να οδηγήσουν μας προς ένα πιο ισόπεδο πεδίο. Όσο τα δεδομένα για λιγότερο εκπροσωπούμενες γλώσσες, φύλα και εθνοτικές ομάδες είναι δύσκολο να προσεγγιστούν ή απλά δεν είναι διαθέσιμα, αυτή η αλλαγή θα έρθει πιο αργά. Αλλά προσπαθούμε να κάνουμε το μέρος μας. Με κάλυψη για πάνω από 1.000 τοπικές γλώσσες και εμπειρία σε 145 χώρες, η LXT βοηθά να κάνει την πρόσβαση σε περισσότερα δεδομένα γλωσσών δυνατή.
Τι είναι η οπτική σας για το πώς η LXT μπορεί να επιταχύνει τις προσπάθειες AI για διαφορετικούς πελάτες;
Ο στόχος μας στην LXT είναι να παρέχουμε τις λύσεις δεδομένων που επιτρέπουν την αποτελεσματική, ακριβή και ταχύτερη ανάπτυξη AI. Μέσω των 12 ετών εμπειρίας μας στο χώρο δεδομένων AI, όχι μόνο έχουμε συλλέξει εκτενή γνώση σχετικά με τις ανάγκες των πελατών μας σε όλους τους τομείς που αφορούν τα δεδομένα, αλλά έχουμε επίσης συνεχώς βελτιώσει τις διαδικασίες μας για να παραδώσουμε τα υψηλότερα ποιότητας δεδομένα με τον ταχύτερο ρυθμό και τις καλύτερες τιμές. Κατά συνέπεια, ως αποτέλεσμα της σταθερής μας δέσμευσης για την παροχή στους πελάτες μας την ιδανική συνδυασμό ποιότητας δεδομένων AI, αποδοτικότητας και τιμών, έχουμε γίνει một αξιόπιστος συνεργάτης δεδομένων AI, όπως φαίνεται από τους πελάτες μας που συνεχίζουν να επιστρέφουν στην LXT για τις συνεχώς αυξανόμενες και εξελισσόμενες ανάγκες δεδομένων AI. Η οπτική μου είναι να στερεώσω, να βελτιώσω και να διευρύνω αυτή την “οπτική” της LXT σε όλα τα μέσα δεδομένων που εργαζόμαστε, καθώς και σε όλους τους τύπους ανάπτυξης AI που εξυπηρετούμε τώρα, συμπεριλαμβανομένης της γεννήτριας AI. Η επίτευξη αυτού του στόχου περιστρέφεται γύρω από τη στρατηγική διεύρυνση των ικανοτήτων μηχανικής μάθησης και επιστήμης δεδομένων μας, τόσο σε τεχνολογία όσο και σε πόρους.
Ευχαριστούμε για τη μεγάλη συνέντευξη, οι αναγνώστες που επιθυμούν να μάθουν περισσότερα μπορούν να επισκεφθούν την LXT.












