Interviews
Dylan Fox, CEO & Gründer von AssemblyAI – Interview-Serie

Dylan Fox ist der CEO & Gründer von AssemblyAI, einer Plattform, die automatisch Audio- und Videodateien sowie Live-Audio-Streams in Text umwandelt, indem sie AssemblyAIs Speech-to-Text-APIs verwendet.
Was hat Sie ursprünglich zur maschinellen Lerntheorie hingezogen?
Ich habe angefangen, Programmieren zu lernen und besuchte Python-Meetups in Washington DC, wo ich auf die Universität ging. Durch Universitätskurse fand ich mich mehr in Richtung Algorithmus-artige Programmierprobleme neigend, was mich natürlich zur maschinellen Lerntheorie und NLP führte.
Bevor Sie AssemblyAI gründeten, waren Sie Senior-Software-Engineer bei Cisco. Was haben Sie dort gearbeitet?
Bei Cisco war ich Senior-Software-Engineer mit dem Schwerpunkt maschinelles Lernen für ihre Kollaborationsprodukte.
Wie hat Ihre Arbeit bei Cisco und ein Problem mit der Beschaffung von Spracherkennungstechnologie Sie dazu inspiriert, AssemblyAI zu gründen?
In einigen meiner vorherigen Jobs hatte ich die Gelegenheit, an vielen AI-Projekten zu arbeiten, einschließlich mehrerer Projekte, die Spracherkennung erforderten. Aber alle Unternehmen, die Spracherkennung als Dienstleistung anboten, waren unglaublich veraltet, schwer zu kaufen und liefen veraltete AI-Technologie.
Als ich mich mehr und mehr für AI-Forschung interessierte, bemerkte ich, dass in dem Bereich der Spracherkennung viel Arbeit geleistet wurde und wie schnell die Forschung verbessert wurde. Es war also eine Kombination von Faktoren, die mich dazu inspirierten, zu denken: “Was, wenn man ein Twilio-ähnliches API-Unternehmen aufbauen könnte, das die neueste AI-Forschung verwendet, um Entwicklern den Zugang zu State-of-the-Art-AI-Modellen für Spracherkennung zu erleichtern, mit einem viel besseren Entwickler-Erlebnis.”
Und es war von dort, dass die Idee für AssemblyAI entstand.
Was ist die größte Herausforderung beim Aufbau genauer und zuverlässiger Spracherkennungstechnologie?
Kosten und Talent sind die größten Herausforderungen für jedes Unternehmen, das genaue und zuverlässige Spracherkennungstechnologie aufbaut.
Die Daten sind teuer zu beschaffen, und man benötigt normalerweise Hunderttausende von Stunden, um ein robustes Spracherkennungssystem aufzubauen. Nicht nur das, die Rechenanforderungen sind enorm, um diese Modelle zu trainieren. Und die Ausführung dieser Modelle in der Produktion ist auch teuer und erfordert spezialisiertes Talent, um sie zu optimieren und wirtschaftlich zu machen.
Das Aufbauen dieser Technologien erfordert auch ein spezialisiertes Skillset, das schwer zu finden ist. Das ist ein großer Grund, warum Kunden zu uns kommen, um leistungsstarke AI-Modelle zu erhalten, die wir in-house erforschen, trainieren und bereitstellen. Sie erhalten Zugang zu Jahren der Forschung in State-of-the-Art-AI-Modellen für ASR und NLP, alles über eine einfache API.
Außerhalb der reinen Transkription von Audio- und Videoinhalten bietet AssemblyAI zusätzliche Modelle an. Können Sie über diese Modelle sprechen?
Unsere Suite von AI-Modellen erstreckt sich über die reine Echtzeit- und asynchrone Transkription hinaus. Wir bezeichnen diese zusätzlichen Modelle als Audio-Intelligenz-Modelle, da sie Kunden helfen, Audio-Daten zu analysieren und besser zu verstehen.
Unser Summarization-Modell bietet eine Gesamtzusammenfassung sowie zeitcodierte Zusammenfassungen, die automatisch segmentieren und eine Zusammenfassung für jedes “Kapitel” generieren, wenn Themen in einer Konversation wechseln (ähnlich wie YouTube-Kapitel).
Unser Sentiment-Analyse-Modell erkennt die Stimmung jedes Satzes, der in Audio-Dateien gesprochen wird. Jeder Satz in einer Transkription kann als positiv, negativ oder neutral markiert werden.
Unser Entity-Erkennungs-Modell identifiziert eine breite Palette von Entitäten, die in Audio-Dateien erwähnt werden, wie z.B. Personennamen, Firmennamen, E-Mail-Adressen, Daten und Orte.
Unser Topic-Erkennungs-Modell kennzeichnet die Themen, die in Audio- und Videodateien besprochen werden. Die vorhergesagten Themenetiketten folgen der standardisierten IAB-Taxonomie, was sie für kontextuelle Zielgruppen geeignet macht.
Unser Content-Moderations-Modell erkennt sensible Inhalte in Audio- und Videodateien – wie z.B. Hassrede, Gewalt, sensible soziale Themen, Alkohol, Drogen und mehr.
Was sind einige der größten Anwendungsfälle für Unternehmen, die AssemblyAI verwenden?
Die größten Anwendungsfälle für Unternehmen, die AssemblyAI verwenden, umfassen vier Kategorien: Telefoniemittel, Video, virtuelle Meetings und Medien.
CallRail ist ein gutes Beispiel für einen Kunden im Telefoniemittel-Bereich, der AssemblyAIs AI-Modelle – Core-Transkription, Automatic-Transcript-Highlights und PII-Redaktion – nutzt, um eine leistungsstarke Conversational-Intelligence-Lösung für seine Kunden bereitzustellen.
Im Grunde kann CallRail jetzt automatisch Schlüsselinhalte in ihren Telefonanrufen an ihre Kunden im großen Maßstab bereitstellen – Schlüsselinhalte wie spezifische Kundenanfragen, häufig gestellte Fragen und häufig verwendete Schlüsselwörter und Phrasen. Unser PII-Redaktions-Modell hilft ihnen, sensible Daten in Transkript-Texten automatisch zu erkennen und zu entfernen (z.B. Sozialversicherungsnummern, Kreditkartennummern, persönliche Adressen und mehr).
Video-Anwendungsfälle reichen von Video-Streaming-Plattformen bis hin zu Video-Editoren wie Veed, die AssemblyAIs Core-Transkriptions-Modelle verwenden, um den Video-Bearbeitungsprozess für Benutzer zu vereinfachen. Veed ermöglicht es seinen Benutzern, ihre Videos zu transkribieren und direkt mithilfe der Untertitel zu bearbeiten.
Bei virtuellen Meetings verwenden Unternehmen wie Fathom AssemblyAI, um intelligente Funktionen zu erstellen, die ihren Benutzern helfen, ihre Zoom-Anrufe zu transkribieren und zu highlighten, um eine bessere Teilnahme an Meetings zu fördern und langweilige Aufgaben während und nach Meetings zu eliminieren (z.B. Notizen machen).
Im Medien-Bereich sehen wir beispielsweise Podcast-Hosting-Plattformen, die unsere Content-Moderations- und Topic-Erkennungs-Modelle verwenden, um bessere Werbemittel für Markensicherheitsanwendungsfälle anzubieten und Benutzer-generierte Inhalte mit dynamischen Anzeigen zu monetarisieren.
AssemblyAI hat kürzlich eine 30-Millionen-Dollar-Serie-B-Runde aufgenommen. Wie wird dies die Mission von AssemblyAI beschleunigen?
Die Fortschritte in der AI-Forschung sind unglaublich aufregend. Unser Ziel ist es, diese Fortschritte jedem Entwickler und jeder Produkt-Team auf dem Internet zugänglich zu machen – über eine einfache API. Wenn wir weiterhin State-of-the-Art-AI-Modelle für ASR- und NLP-Aufgaben (wie Spracherkennung, Summarisierung, Sprachidentifizierung und viele andere Aufgaben) erforschen und trainieren, werden wir diese AI-Modelle weiterhin über einfache APIs bereitstellen – kostenlos verfügbar.
AssemblyAI ist ein Ort, an dem sowohl Entwickler als auch Produkt-Teams kommen können, um einfachen Zugang zu den fortschrittlichen AI-Modellen zu erhalten, die sie benötigen, um aufregende neue Produkte, Dienstleistungen und ganze Unternehmen aufzubauen.
In den letzten 6 Monaten haben wir ASR-Unterstützung für 15 neue Sprachen eingeführt – einschließlich Spanisch, Deutsch, Französisch, Italienisch, Hindi und Japanisch – und haben große Verbesserungen an unseren Summarisierungs-, Echtzeit-ASR-, Content-Moderations-Modellen und zahlreichen anderen Produkt-Updates vorgenommen.
Wir haben kaum unsere Series-A-Mittel verwendet, aber diese neue Finanzierung wird es uns ermöglichen, unsere Bemühungen aggressiv zu skalieren – ohne unsere Laufzeit zu beeinträchtigen.
Mit dieser neuen Finanzierung werden wir in der Lage sein, unsere Produkt-Roadmap zu beschleunigen, bessere AI-Infrastruktur aufzubauen, um unsere AI-Forschung und Inferenz-Engines zu beschleunigen, und unser AI-Forschungsteam zu vergrößern – das heute Forscher von DeepMind, Google (GOOGL ) Brain, Meta AI, BMW und Cisco umfasst.
Gibt es noch etwas, das Sie über AssemblyAI teilen möchten?
Unsere Mission ist es, State-of-the-Art-AI-Modelle für Entwickler und Produkt-Teams in extrem großem Maßstab über eine einfache API zugänglich zu machen.
Vielen Dank für das großartige Interview. Leser, die mehr erfahren möchten, sollten AssemblyAI besuchen.












