Συνεντεύξεις

Dylan Fox, Διευθύνων Σύμβουλος & Ιδρυτής της AssemblyAI – Σειρά Συνεντεύξεων

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

O Dylan Fox είναι ο Διευθύνων Σύμβουλος & Ιδρυτής της AssemblyAI, μια πλατφόρμα που μετατρέπει αυτόματα αρχεία ήχου και βίντεο και ζωντανούς ήχους σε κείμενο με τα Speech-to-Text APIs της AssemblyAI.

Τι σας έκανε να ενδιαφερθείτε αρχικά για τη μηχανική μάθηση;

Ξεκίνησα μαθαίνοντας να προγραμματίζω και παρακολούθησα συνεδριάσεις Python Meetups στην Ουάσινγκτον DC, όπου πήγα στο κολλέγιο. Μέσω μαθημάτων κολλεγίου, βρέθηκα να προσανατολίζομαι περισσότερο σε προβλήματα προγραμματισμού τύπου αλγορίθμων, τα οποία με οδήγησαν φυσικά στη μηχανική μάθηση και NLP.

Πριν ιδρύσετε την AssemblyAI, ήσασταν Senior Software Engineer στην Cisco, τι δουλεύατε;

Στην Cisco, ήμουν Senior Software Engineer με επίκεντρο τη Μηχανική Μάθηση για τα προϊόντα συνεργασίας.

Πώς σας έκανε η δουλειά σας στην Cisco και ένα πρόβλημα με την προμήθεια τεχνολογίας αναγνώρισης ομιλίας να σας εμπνεύσει να εκκινήσετε την AssemblyAI;

Σε κάποιες από τις προηγούμενες δουλειές μου, είχα την ευκαιρία να δουλέψω σε πολλά προγράμματα AI, συμπεριλαμβανομένων προγραμμάτων που απαιτούσαν αναγνώριση ομιλίας. Αλλά όλες οι εταιρείες που προσφέρουν αναγνώριση ομιλίας ως υπηρεσία ήταν απίστευτα παλαιωμένες, δύσκολες να αγοράσετε κάτι από αυτές και εκτελούσαν παλιές τεχνολογίες AI.

Όσο γινόμουν όλο και πιο ενδιαφερόμενος για την έρευνα AI, παρατήρησα ότι υπήρχε πολλή δουλειά που γινόταν στον τομέα της αναγνώρισης ομιλίας και πόσο γρήγορα βελτιωνόταν η έρευνα. Έτσι ήταν μια συνδυασμός παραγόντων που με έκανε να σκεφτώ, «Τι αν μπορούσατε να χτίσετε μια εταιρεία API τύπου Twilio χρησιμοποιώντας τις τελευταίες έρευνες AI που ήταν πολύ πιο εύκολες για τους développers να έχουν πρόσβαση σε state-of-the-art μοντέλα AI για αναγνώριση ομιλίας, με πολύ καλύτερη εμπειρία développper.»

Και ήταν από εκεί που η ιδέα για την AssemblyAI μεγάλωσε.

Τι είναι η μεγαλύτερη πρόκληση πίσω από την κατασκευή ακριβούς και αξιόπιστης τεχνολογίας αναγνώρισης ομιλίας;

Το κόστος και ο ταλαντός είναι οι μεγαλύτερες προκλήσεις για κάθε εταιρεία να αντιμετωπίσει όταν κατασκευάζει ακριβή και αξιόπιστη τεχνολογία αναγνώρισης ομιλίας.

Τα δεδομένα είναι ακριβά να αποκτήσετε, και συνήθως χρειάζεστε εκατοντάδες χιλιάδες ώρες για να χτίσετε ένα robust σύστημα αναγνώρισης ομιλίας. Όχι μόνο αυτό, οι απαιτήσεις υπολογισμού είναι τεράστιες για να εκπαιδεύσετε. Και η εξυπηρέτηση αυτών των μοντέλων σε παραγωγή είναι επίσης δαπανηρή και απαιτεί εξειδικευμένο ταλαντό για να оптимیزεται και να γίνει οικονομική.

Η κατασκευή αυτών των τεχνολογιών απαιτεί επίσης εξειδικευμένο σετ δεξιοτήτων που είναι δύσκολο να βρεθεί. Αυτός είναι ένας μεγάλος λόγος για τον οποίο οι πελάτες έρχονται σε μας για ισχυρά μοντέλα AI που ερευνάμε, εκπαιδεύουμε και αναπτύσσουμε εντός. Λαμβάνουν πρόσβαση σε χρόνια έρευνας σε state-of-the-art μοντέλα AI για ASR και NLP, όλα με ένα απλό API.

Εκτός από την καθαρή μεταγραφή ήχου και βίντεο περιεχομένου, η AssemblyAI προσφέρει επιπλέον μοντέλα, μπορείτε να συζητήσετε τι είναι αυτά τα μοντέλα;

Η συλλογή μας από μοντέλα AI εκτείνεται πέρα από την πραγματική και ασύγχρονη μεταγραφή. Τα ονομάζουμε Audio Intelligence μοντέλα, καθώς βοηθούν τους πελάτες να αναλύσουν και να κατανοήσουν καλύτερα τα δεδομένα ήχου.

Το μοντέλο μας Summarization παρέχει μια συνολική περίληψη, καθώς και χρονοκωδικές περίληψεις που αυτόματα διαχωρίζουν και δημιουργούν μια περίληψη για κάθε «κεφάλαιο» όπως τα θέματα σε μια συζήτηση αλλάζουν (παρόμοια με τα κεφάλαια του YouTube).

Το μοντέλο μας Sentiment Analysis ανιχνεύει τη στάση κάθε προτάσεως ομιλίας σε αρχεία ήχου. Κάθε πρόταση σε μια μεταγραφή μπορεί να σημειωθεί ως Θετική, Αρνητική ή Ουδέτερη.

Το μοντέλο μας Entity Detection αναγνωρίζει ένα ευρύ φάσμα οντοτήτων που αναφέρονται σε αρχεία ήχου, όπως ονόματα προσώπων ή εταιρειών, διευθύνσεις email, ημερομηνίες και τοποθεσίες.

Το μοντέλο μας Topic Detection ετικετάρει τα θέματα που αναφέρονται σε αρχεία ήχου και βίντεο. Οι προβλεπόμενες ετικέτες θεμάτων ακολουθούν την τυποποιημένη ταξινόμηση IAB, η οποία τις καθιστά κατάλληλες για περιεχομενική στόχευση.

Το μοντέλο μας Content Moderation ανιχνεύει ευαίσθητο περιεχόμενο σε αρχεία ήχου και βίντεο — όπως μίσος, βία, ευαίσθητα κοινωνικά θέματα, αλκοόλ, ναρκωτικά και άλλα.

Τι είναι μερές από τις μεγαλύτερες περιπτώσεις χρήσης για εταιρείες που χρησιμοποιούν την AssemblyAI;

Οι μεγαλύτερες περιπτώσεις χρήσης εταιρειών για την AssemblyAI διασχίζουν τέσσερις κατηγορίες: τηλεφωνία, βίντεο, εικονικές συναντήσεις και μέσα ενημέρωσης.

Η CallRail είναι ένα εξαιρετικό παράδειγμα πελάτη στον χώρο της Τηλεφωνίας, που αξιοποιεί τα μοντέλα AI της AssemblyAI — Core Transcription, Automatic Transcript Highlights και PII Redaction — για να προσφέρει μια ισχυρή λύση Conversational Intelligence στους πελάτες της.

Ουσιαστικά, η CallRail μπορεί τώρα να επιφέρει αυτόματα και να ορίσει κλειδί περιεχόμενο στις τηλεφωνικές κλήσεις των πελατών της σε κλίμακα — κλειδί περιεχόμενο όπως συγκεκριμένες αιτήσεις πελατών, συχνά ζητούμενα ερωτήματα και συχνά χρησιμοποιούμενα κλειδιά και φράσεις. Το μοντέλο μας PII Redaction βοηθά τους να ανιχνεύσουν και να αφαιρέσουν αυτόματα ευαίσθητα δεδομένα που βρέθηκαν σε κείμενο μεταγραφής (π.χ. αριθμούς κοινωνικής ασφάλισης, αριθμούς πιστωτικών καρτών, προσωπικές διευθύνσεις και άλλα).

Βίντεο περιπτώσεις χρήσης κυμαίνονται από πλατφόρμες βίντεο ροής σε επεξεργαστές βίντεο όπως η Veed, που χρησιμοποιούν τα μοντέλα Core Transcription της AssemblyAI για να απλοποιήσουν τη διαδικασία επεξεργασίας βίντεο για τους χρήστες. Η Veed επιτρέπει στους χρήστες της να μεταγράψουν τα βίντεό της και να τα επεξεργαστούν απευθείας χρησιμοποιώντας τους υπότιτλους.

Στις Εικονικές Συναντήσεις, εταιρείες λογισμικού μεταγραφής συναντήσεων όπως η Fathom χρησιμοποιούν την AssemblyAI για να χτίσουν έξυπνες λειτουργίες που βοηθούν τους χρήστες να μεταγράψουν και να υπογραμμίσουν τα κλειδιά στιγμές από τις κλήσεις Zoom, προάγοντας καλύτερη συμμετοχή σε συναντήσεις και εξαλείφοντας τα TEDIOUS καθήκοντα κατά τη διάρκεια και μετά τις συναντήσεις (π.χ. σημειώσεις).

Στα Μέσα, βλέπουμε πλατφόρμες φιλοξενίας podcast να χρησιμοποιούν τα μοντέλα μας Content Moderation και Topic Detection, ώστε να μπορέσουν να προσφέρουν καλύτερα εργαλεία διαφήμισης για περιπτώσεις ασφάλειας μάρκας και να κερδοφορήσουν το αυτοδημιούργητο περιεχόμενο με δυναμικές διαφημίσεις.

Η AssemblyAI raised πρόσφατα 30 εκατομμύρια δολάρια στη σειρά B. Πώς θα επιταχύνει αυτό την αποστολή της AssemblyAI;

Η πρόοδος που γίνεται στον τομέα του AI είναι απίστευτα ενθουσιώδης. Ο στόχος μας είναι να εκθέσουμε αυτήν την πρόοδο σε κάθε développper και ομάδα προϊόντων στο διαδίκτυο — μέσω eines απλού συνόλου API. Όσο συνεχίζουμε να ερευνάμε και να εκπαιδεύουμε state-of-the-art μοντέλα AI για ASR και NLP εργασίες (όπως αναγνώριση ομιλίας, περίληψη, αναγνώριση γλώσσας και πολλές άλλες εργασίες), θα συνεχίσουμε να εκθέτουμε αυτά τα μοντέλα AI σε développpers και ομάδες προϊόντων μέσω απλών API — διαθέσιμων δωρεάν.

Η AssemblyAI είναι ένας χώρος όπου και développpers και ομάδες προϊόντων μπορούν να έρθουν για εύκολη πρόσβαση στα προηγμένα μοντέλα AI που χρειάζονται για να χτίσουν ενθουσιώδεις νέες εφαρμογές, υπηρεσίες και ολόκληρες εταιρείες.

Τους τελευταίους 6 μήνες, abbiamo launched ASR υποστήριξη για 15 νέες γλώσσες — συμπεριλαμβανομένων Ισπανικών, Γερμανικών, Γαλλικών, Ιταλικών, Χίντι και Ιαπωνικών, κυκλοφόρησαν σημαντικές βελτιώσεις στα μοντέλα μας Summarization, Real-Time ASR, Content Moderation και αμέτρητες άλλες ενημερώσεις προϊόντων.

Δεν έχουμε ακόμη χρησιμοποιήσει τα κεφάλαια της Σειράς A, αλλά η νέα χρηματοδότηση θα μας δώσει τη δυνατότητα να ενισχύσουμε τις προσπάθειές μας — χωρίς να συμβιβαστούμε με το δρόμο μας.

Με τη νέα χρηματοδότηση, θα μπορέσουμε να επιταχύνουμε το δρόμο μας προϊόντων, να χτίσουμε καλύτερη AI υποδομή για να επιταχύνουμε την έρευνά μας AI και τους κινητήρες συλλογής, και να μεγαλώσουμε την ομάδα έρευνας AI — η οποία σήμερα περιλαμβάνει ερευνητές από το DeepMind, Google (GOOGL ) Brain, Meta AI, BMW και Cisco.

Υπάρχει κάτι άλλο που θα ήθελε να μοιραστείτε σχετικά με την AssemblyAI;

Η αποστολή μας είναι να κάνουμε τα state-of-the-art μοντέλα AI προσιτά σε développpers και ομάδες προϊόντων σε εξαιρετικά μεγάλη κλίμακα μέσω eines απλού API.

Ευχαριστούμε για τη μεγάλη συνέντευξη, οι αναγνώστες που θέλουν να μάθουν περισσότερα πρέπει να επισκεφθούν την AssemblyAI.

Ο Antoine είναι ένας οραματιστής ηγέτης και συνιδρυτής της Unite.AI, οδηγείται από μια αμετάβλητη страсть για το σχήμα και την προώθηση του μέλλοντος της τεχνητής νοημοσύνης και της ρομποτικής. Ένας σειριακός επιχειρηματίας, πιστεύει ότι η τεχνητή νοημοσύνη θα είναι τόσο διαταρακτική για την κοινωνία όσο και η ηλεκτρική ενέργεια, και συχνά πιάνεται να μιλάει για το δυναμικό των διαταρακτικών τεχνολογιών και της AGI.

Ως μελλοντολόγος, είναι αφιερωμένος στο να εξερευνήσει πώς αυτές οι καινοτομίες θα σχήματίσουν τον κόσμο μας. Επιπλέον, είναι ο ιδρυτής του Securities.io, μιας πλατφόρμας που επικεντρώνεται στις επενδύσεις σε ακριβές τεχνολογίες που ανασχεδιάζουν το μέλλον και αναμορφώνουν ολόκληρες βιομηχανίες.