Interviews

Thuy Le, Leiterin des Produktmanagements bei Speechmatics – Interviewreihe

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Thuy Le ist die Leiterin des Produktmanagements bei Speechmatics. Thuy hat über zwei Jahrzehnte Erfahrung in der Technologie und der Entwicklung innovativer Ideen, sowie einen Bachelor-Abschluss in Maschinenbau vom MIT und einen Master-Abschluss in Produkt-Design von Stanford. Thuy hat eine breite Erfahrung in Produktmanagement, Design und Entwicklung, sowie in Forschung und Entwicklung, Ingenieurwesen, Medienentwicklung und Geschäftsstrategie. Bei Speechmatics ist sie für die Einführung innovativer Produkte und Dienstleistungen verantwortlich, um sicherzustellen, dass das Unternehmen in allem, was es tut, marktführend bleibt.

Sie haben Speechmatics im November 2019 nach einer Arbeit in verschiedenen Branchen, einschließlich selbstfahrender Fahrzeuge und B2B-Analyse-Software, beigetreten. Was hat Sie dazu bewogen, im Bereich der Spracherkennung zu arbeiten?

Ich bin immer von der Anwendung neuer Technologien für interessante Anwendungsfälle und bedeutende Auswirkungen angezogen worden. Die Spracherkennung, insbesondere bei Speechmatics, erfüllt diese Kriterien. Es war großartig, unseren Kunden zu helfen, den Wert von Sprache-zu-Text in ihren eigenen vielfältigen Produktangeboten zu nutzen.

Als Leiterin des Produktmanagements bei Speechmatics, was besteht Ihr tägliches Arbeitspensum aus?

Speechmatics ist ein Unternehmen im Aufbau und unser Produktteam ist klein (und wächst!), daher sind keine zwei Tage gleich und jeder muss einbringen, wo und wenn notwendig. Als Leiterin des Produktmanagements umfasst mein Arbeitspensum alles, von der höheren Unternehmens- und Produktstrategie bis hin zu den typischen Produktverantwortungen wie der Priorisierung von Produkt-Roadmaps und Kundeninteraktionen bis hin zu detaillierter, handwerklicher Problemlösung bei der Lieferung. Offensichtlich gehören auch die Beziehungsarbeit innerhalb der verschiedenen Funktionen im Unternehmen und die Rekrutierung zu meinen Aufgaben.

Können Sie über die Herausforderungen sprechen, die mit dem Zugriff auf Datensätze mit verschiedenen Dialekten und Akzenten verbunden sind?

Bei der Sprachtechnologie wird der Motor normalerweise durch Training auf einem Dialekt einer Sprache aufgebaut, was zu dem Dialekt führt, den er am genauesten erkennt und transkribiert. Im Englischen ist es das amerikanische Englisch, und die Fehlerquoten sind in der Regel höher für australische Akzente, britische Akzente, jamaikanische Akzente und so weiter. Für Unternehmen, die die Technologie nutzen, um mit einer globalen Kundenbasis zu interagieren, stellt dies eine massive Herausforderung dar. Vor drei Jahren, im Jahr 2018, haben wir Global English, unser branchenführendes Sprachpaket, das jeden englischen Akzent und Dialekt versteht, eingeführt, und im vergangenen Jahr haben wir diese Mission mit der Einführung von Global Spanish fortgesetzt. Wir glauben, dass die Sprachtechnologie ihr volles Potenzial nur dann erreichen kann, wenn sie jeden versteht, mit dem sie interagiert. Wir freuen uns darauf, die künstliche Intelligenz-Lücke bei den Akzenten mit weiteren Innovationen in diesem Jahr zu schließen.

Welche maschinellen Lernmethoden werden verwendet, um aus diesen Datensätzen zu trainieren?

Wir verwenden vertraute überwachte Deep-Learning-Techniken und neuronale Netze in unserem Motor. Wir forschen auch kontinuierlich nach neuen Ansätzen, insbesondere daran, wie wir die Menge an gekennzeichneten Daten reduzieren können, die in ASR-Modellen benötigt werden. Daten sind der Schlüssel zum Aufbau von Spracherkennungstechnologie, daher ist es wichtig, Forschung voranzutreiben, die es uns ermöglicht, unsere Datenreichweite zu erweitern. Der Einsatz von neuronalen Netzen in unserem Motor ermöglicht es uns, besser auf verschiedene Kontexte und Sprachen zu generalisieren.

Speechmatics ist derzeit Branchenführer, wobei Tests ergeben haben, dass Global Spanish 3-20% genauer ist als das Angebot von Google (GOOGL ) und 4-13% genauer als das vergleichbare Produkt von Microsoft (MSFT ). Was führen Sie diesen Erfolg auf zurück?

Wie ich bereits erwähnt habe, muss die Sprachtechnologie wirklich ein Vermögenswert für Unternehmen sein, um ihnen zu helfen, ihre gesamte Kundenbasis zu verstehen, unabhängig von der Sprache, in der sie sprechen, oder dem Dialekt, den sie verwenden. Dies ist der Kern der Innovationen von Speechmatics, und wir sind entschlossen, diese komplexen Herausforderungen zu lösen. Und wir haben ein großartiges Team, das leidenschaftlich, engagiert und investiert ist, um die neuesten Deep-Learning-Techniken zu nutzen, um unseren Kunden die beste Technologie auf dem Markt anzubieten.

Welche Sprachen werden derzeit angeboten und welche Sprachen werden derzeit erforscht, um hinzugefügt zu werden?

Wir bieten derzeit über 30 kommerzielle Sprachen an, von Arabisch bis Mandarin, Polnisch bis Portugiesisch und vielen mehr. Aber es sind unsere englischen und spanischen Sprachpakete, die global sind. Wenn wir in die Zukunft blicken, suchen wir nach neuen Techniken, die es uns nicht nur ermöglichen, neue Sprachen schneller hinzuzufügen, sondern auch unsere bestehenden Sprachen regelmäßiger zu verbessern.

Was ist Ihre Meinung zu einer sprachaktivierten Zukunft, in der die Stimme die primäre Form der Kommunikation ist?

Unternehmen erkennen immer mehr den Wert der Spracherkennungstechnologie: 2020 sah eine deutliche Zunahme der Adoption dieser Technologie bei Unternehmen, wobei 68% der Befragten angaben, dass ihr Unternehmen eine Strategie für Sprachtechnologie hat – ein Anstieg von 18% im Vergleich zum Vorjahr. Aber um ihr volles Potenzial zu erreichen, muss die Technologie aufgewertet werden. Ein Gespräch besteht aus mehr als nur Worten – es besteht auch aus Kontexthinweisen wie Sentiment, Kadenz, Punktuation, Hintergrundgeräuschen, Ton, Sprecherwechseln und vielem mehr. Während die Texte aus der Spracherkennungstechnologie allein bereits viel Wert bieten, kann die tatsächliche gesprochene Sprache in Audio- oder Video-Dateien über bloße Wörter hinausgehen. Die Zukunft der Spracherkennungstechnologie wird all diese anderen Faktoren berücksichtigen. Erst dann wird es nicht nur darum gehen, Sprache in Text umzuwandeln, sondern Sprache in Wert umzuwandeln und wirklich jede Stimme zu verstehen.

Gibt es noch etwas, das Sie über Speechmatics teilen möchten?

Wir haben einige wirklich spannende Neuerungen, die später in diesem Jahr veröffentlicht werden, und wir freuen uns darauf, sie zu teilen, also halten Sie Ausschau!

Vielen Dank für das großartige Interview. Leser, die mehr erfahren möchten, sollten Speechmatics besuchen: Speechmatics.

Antoine ist ein visionärer Leiter und Gründungspartner von Unite.AI, getrieben von einer unerschütterlichen Leidenschaft für die Gestaltung und Förderung der Zukunft von KI und Robotik. Als Serienunternehmer glaubt er, dass KI für die Gesellschaft so disruptiv sein wird wie Elektrizität, und er wird oft dabei erwischt, wie er über das Potenzial disruptiver Technologien und AGI schwärmt.

Als Futurist ist er darauf bedacht, zu erforschen, wie diese Innovationen unsere Welt prägen werden. Darüber hinaus ist er der Gründer von Securities.io, einer Plattform, die sich auf Investitionen in bahnbrechende Technologien konzentriert, die die Zukunft neu definieren und ganze Branchen umgestalten.