Finanzierung

Modulate sammelt $25 Millionen, um die Intelligenzschicht für Voice‑KI aufzubauen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Modulate hat $25 Millionen neue Mittel aufgenommen, da das in Boston ansässige Unternehmen eine wachsende Herausforderung im Bereich künstliche Intelligenz nutzen will: Maschinen beizubringen, nicht nur zu verstehen, was Menschen sagen, sondern auch, wie sie es sagen.

Future Ventures leitete die Finanzierungsrunde, an der Hyperplane und Lakestar teilnahmen. Die Finanzierung erhöht die Gesamtkapitalisierung von Modulate auf $60 Millionen und wird verwendet, um die KI‑Forschung, Engineering‑Teams, Entwickler‑Tools, Partnerschaften und Bereitstellungsoptionen auszubauen.

Die Investition erfolgt zu dem Zeitpunkt, an dem Sprache zunehmend als Schnittstelle für KI‑Agenten, Kundenservice‑Plattformen, Gaming‑Umgebungen und Sicherheitssysteme dient. Während die Spracherkennung‑zu‑Text‑Technologie stark verbessert wurde, setzt Modulate darauf, dass Transkripte allein einen Großteil der in menschlicher Sprache enthaltenen Informationen auslassen.

Stattdessen analysiert seine Technologie das zugrunde liegende Audio auf Signale wie Emotion, Tonfall, Absicht, Pausen, synthetische Sprache und Gesprächsverhalten.

Über die reine Spracherkennung hinaus

Ein Großteil des heutigen Voice‑KI‑Stacks folgt einer relativ einfachen Architektur: Sprache in Text umwandeln und das resultierende Transkript anschließend an ein großes Sprachmodell (LLM) senden.

Das funktioniert gut, wenn die Wörter selbst den Großteil der relevanten Informationen enthalten. Es wird jedoch einschränkend, wenn die Bedeutung von Sarkasmus, Frustration, Zögern, Stress, Unterbrechungen oder Tonwechseln abhängt.

Modulate hat seine Flaggschiffplattform Velma um die Idee herum aufgebaut, dass diese Signale direkt aus dem Audio analysiert werden sollten, anstatt nachträglich aus einem Transkript rekonstruiert zu werden.

Das Unternehmen beschreibt Velma als ein audio‑nativer Gesprächs‑Intelligenz‑System, das Transkripte erzeugen kann, während es gleichzeitig Sprecher, Emotionen, Gesprächsthemen, Stimmungen und mehr als 150 Verhaltensweisen identifiziert. Entwickler können zudem benutzerdefinierte Verhaltensweisen mittels natürlicher Sprachbeschreibungen festlegen.

Damit eröffnet die Technologie Anwendungen, die von der Erkennung eines frustrierten Kunden, bevor ein Anruf sich verschlechtert, über die Detektion verdächtiger Verhaltensweisen während einer Finanztransaktion bis hin zur Identifizierung, wann ein KI‑Sprachagent unerwartet agiert, reichen.

Im Juni hat Modulate Velma direkt für Entwickler über eine API geöffnet und damit den Zugang über die bisherigen Enterprise‑Implementierungen hinaus erweitert.

Modulate verfolgt einen Ensemble‑Ansatz für Audio‑KI

Die Architektur unterhalb von Velma ist das, was Modulate ein Ensemble Listening Model nennt, kurz ELM.

Anstatt ein einzelnes riesiges Modell für alle Aufgaben zu verwenden, koordiniert ELM mehr als 100 spezialisierte Modelle, wobei einzelne Komponenten unterschiedliche Merkmale eines Audiostreams analysieren.

Diese Modelle können grundlegende Eigenschaften wie Sprecherwechsel und Pausen ebenso untersuchen wie höherstufige Signale wie Emotion, wahrgenommene Absicht, Marker synthetischer Stimmen, Verwirrung oder Verhaltensmuster. Eine Orchestrierungsschicht fasst diese Beobachtungen anschließend zu einer umfassenderen Interpretation des Gesprächs zusammen.

Dies stellt eine deutlich andere Philosophie dar als die zunehmend verbreitete Strategie, immer größere multimodale Grundmodelle auf Audio anzuwenden.

Modulate argumentiert, dass Spezialisierung seiner Architektur ermöglicht, transparenter Ergebnisse zu liefern und gleichzeitig den erforderlichen Rechenaufwand zu reduzieren. Für Unternehmensanwendungen wie Betrugserkennung und Compliance kann die Fähigkeit, zu verstehen, warum ein System einen Alarm ausgelöst hat, fast ebenso wichtig sein wie der Alarm selbst.

Laut dem Unternehmen kann der Ansatz bei manchen Audio‑Analyse‑Workloads bis zu 1.000‑fach rechen­effizienter sein als die Verwendung eines einzelnen großen Modells.

Voice‑KI schafft ein neues Überwachungsproblem

Der Zeitpunkt der Finanzierung spiegelt zudem einen breiteren Wandel wider, der sich im Unternehmens‑KI‑Umfeld vollzieht.

KI‑Systeme sind zunehmend in der Lage, vollständige Sprachgespräche mit Kunden zu führen. Das bedeutet, dass Unternehmen nun Interaktionen überwachen müssen, die nicht nur menschliche Mitarbeitende, sondern autonome Agenten umfassen, die über Tausende oder potenziell Millionen von Gesprächen hinweg operieren.

Ein Sprachagent kann technisch einem Skript folgen, dabei jedoch wiederholt Kunden unterbrechen, Frustration nicht erkennen, die Absicht missverstehen oder schlecht auf emotionale Situationen reagieren.

Modulate sieht eine Chance, eine unabhängige Zuhörschicht zu werden, die neben diesen Agenten sitzt.

Seine Sprach‑Agent‑Technologie ist darauf ausgelegt, Signale wie Unterbrechungen, Pausen, Emotionen, Akzente und andere Merkmale zu erkennen, die allein aus Text schwer zu erfassen sind, sodass Entwickler das Verhalten eines Agenten anpassen können, während die Gespräche noch laufen.

Dieselbe Infrastruktur kann auf menschliche Gespräche angewendet werden, bei denen Organisationen in Echtzeit Betrug, Compliance‑Risiken, Belästigung oder andere potenziell bedeutende Ereignisse erkennen müssen.

Von der Spielmoderation zur umfassenderen Sprachintelligenz

Die aktuellen Ambitionen von Modulate stellen eine bedeutende Erweiterung gegenüber dem früheren Fokus auf Online‑Gaming dar.

Eines seiner bekanntesten Produkte, ToxMod, wurde entwickelt, um Live‑Sprachkommunikation auf Gaming‑ und Sozialplattformen zu analysieren und Belästigung, Bedrohungen, Grooming sowie weiteres schädliches Verhalten zu erkennen.

Das bleibt ein wichtiger Teil des Geschäfts. Modulate sagt, dass ToxMod sich direkt in bestehende Sprachinfrastrukturen integrieren kann, während potenziell problematische Interaktionen an Moderationssysteme oder menschliche Prüfer weitergeleitet werden.

Das Unternehmen hat mit großen Gaming‑Firmen zusammengearbeitet, darunter Activision, Riot Games, Rockstar Games und Rec Room.

Aber die zugrunde liegende Technologie, die erforderlich ist, um Toxizität in einem Mehrspieler‑Spiel zu verstehen, kann auch an andere Umgebungen angepasst werden, in denen Kontext wichtig ist.

Modulate positioniert seine Technologie nun in den Bereichen Betrugsprävention, Contact‑Center, Aufsicht von KI‑Agenten, Deep‑Fake‑Erkennung, Kundenerlebnis sowie Vertrauen und Sicherheit.

Seine Entwicklerplattform bietet derzeit mehrere Modellfamilien, die Transkription, Deep‑Fake‑Erkennung, Audio‑Redaktion, Konversations‑Intelligenz und weitere Audio‑Analyse‑Funktionen umfassen.

Deepfakes bieten einen weiteren Grund, Audio direkt zu verstehen

Synthetische Sprache wird ein weiterer wichtiger Teil dieser Chance.

Da immer überzeugendere Stimmklonungen verfügbar werden, müssen Organisationen, die Finanztransaktionen oder sensible Informationen bearbeiten, nicht nur bestimmen, was ein Anrufer sagt, sondern auch, ob die Stimme selbst authentisch ist.

Modulate hat daher die Deep‑Fake‑Erkennung ausgebaut und kombiniert die Analyse synthetischer Stimmen mit den breiteren Kontextinformationen, die über seine Audio‑Modelle verfügbar sind.

Das Unternehmen gibt an, dass seine Technologie derzeit mehr als 10 Millionen Stunden Audio pro Monat analysiert und insgesamt über 600 Millionen Stunden verarbeitet hat.

Die Erweiterung in Bereiche wie die Erkennung von KI‑generierter Musik zeigt zudem, wie breit die zugrunde liegende Ensemble‑Architektur potenziell angewendet werden kann. Modulates Musik‑Erkennungssystem bewertet beispielsweise separat das Vorhandensein von Musik, KI‑generierten Gesangsstimmen und KI‑generierten Instrumentierungen, bevor die Signale zu einem interpretierbaren Ergebnis kombiniert werden.

Die nächste Herausforderung für Voice‑KI ist das Verstehen, nicht das Sprechen

Die $25 million Investition gibt Modulate zusätzliche Ressourcen, um seine Forschung, Technik, Entwickler‑Tools und Partnerschaften auszubauen. Allgemeiner spiegelt sie eine wachsende Herausforderung für Voice‑KI wider: Natürlich zu sprechen ist nur die Hälfte einer Unterhaltung.

Wenn Sprach‑Agenten in den Kundenservice, das Gesundheitswesen, Finanzdienstleistungen und andere Bereiche vordringen, müssen Systeme Signale verstehen, die Transkripte häufig übersehen, darunter Frustration, Zögern, Betonung, Tonfall und mögliche synthetische Sprache.

Das könnte eine neue Intelligenzschicht rund um Sprachinteraktionen schaffen, die Systemen hilft, Betrug zu erkennen, festzustellen, wann Kunden unzufrieden sind, oder zu identifizieren, wann ein KI‑Agent ein Gespräch missversteht oder falsch handhabt.

Doch die Technologie wirft auch Fragen zu Datenschutz, Genauigkeit und Voreingenommenheit auf. Das Ableiten von Emotionen oder Absichten aus Sprache ist subjektiver als das Transkribieren von Wörtern, insbesondere über verschiedene Akzente, Sprachen und Kulturen hinweg.

Da KI zunehmend in der Lage ist, wie ein Mensch zu sprechen, könnte die nächste Grenze darin bestehen, zu bestimmen, wie gut Maschinen tatsächlich zuhören können – und wie verantwortungsbewusst diese Fähigkeiten eingesetzt werden.

Antoine ist ein visionärer Leiter und Gründungspartner von Unite.AI, getrieben von einer unerschütterlichen Leidenschaft für die Gestaltung und Förderung der Zukunft von KI und Robotik. Als Serienunternehmer glaubt er, dass KI für die Gesellschaft so disruptiv sein wird wie Elektrizität, und er wird oft dabei erwischt, wie er über das Potenzial disruptiver Technologien und AGI schwärmt.

Als Futurist ist er darauf bedacht, zu erforschen, wie diese Innovationen unsere Welt prägen werden. Darüber hinaus ist er der Gründer von Securities.io, einer Plattform, die sich auf Investitionen in bahnbrechende Technologien konzentriert, die die Zukunft neu definieren und ganze Branchen umgestalten.