Interviews
Jean-Louis Quéguiner, Gründer und CEO von Gladia – Interview-Serie

Jean-Louis Quéguiner ist der Gründer und CEO von Gladia. Er war zuvor als Group Vice President of Data, AI und Quantum Computing bei OVHcloud tätig, einem der führenden Cloud-Anbieter in Europa. Er hat einen Master-Abschluss in Symbolic AI von der University of Québec in Kanada und Arts et Métiers ParisTech in Paris. Im Laufe seiner Karriere hat er bedeutende Positionen in verschiedenen Branchen innegehalten, darunter Finanzdatenanalyse, maschinelles Lernen für Echtzeit-Digitalwerbung und die Entwicklung von Sprach-AI-APIs.
Gladia bietet fortschrittliche Audio-Transkription und Echtzeit-AI-Lösungen für eine nahtlose Integration in Produkte über Branchen, Sprachen und Technologiestapel hinweg. Durch die Optimierung von State-of-the-Art-ASR- und generativen AI-Modellen stellt es genaue, verzögerungsfreie Sprach- und Sprachverarbeitung sicher. Gladia’s Plattform ermöglicht auch die Echtzeit-Extraktion von Erkenntnissen und Metadaten aus Anrufen und Meetings, um wichtige Unternehmensanwendungsfälle wie Vertriebsunterstützung und automatisierten Kundensupport zu unterstützen.
Was hat Sie dazu inspiriert, die Herausforderungen in der Sprach-zu-Text-Technologie (STT) anzugehen, und welche Lücken haben Sie im Markt gesehen?
Als ich Gladia gründete, war das anfängliche Ziel breit gefasst – ein AI-Unternehmen, das komplexe Technologie zugänglich machen würde. Aber als wir tiefer eintauchten, wurde klar, dass die Sprachtechnologie der am meisten gebrochene und doch wichtigste Bereich war, auf den wir uns konzentrieren mussten.
Die Sprache ist zentral in unserem täglichen Leben, und die meisten unserer Kommunikation findet durch Sprache statt. Doch die Tools, die für Entwickler zur Verfügung standen, um mit Sprachdaten zu arbeiten, waren unzureichend in Bezug auf Geschwindigkeit, Genauigkeit und Preis – insbesondere über Sprachen hinweg.
Ich wollte das ändern, die Komplexität der Sprachtechnologie aufschlüsseln und sie in etwas Einfaches, Effizientes, Leistungsfähiges und Zugängliches umwandeln. Entwickler sollten sich nicht um die Feinheiten von AI-Modellen oder die Nuancen der Kontextlänge in der Spracherkennung kümmern müssen. Mein Ziel war es, eine unternehmensgrade Sprach-zu-Text-API zu erstellen, die nahtlos funktionierte, unabhängig vom zugrunde liegenden Modell oder der Technologie – eine wahre Plug-and-Play-Lösung.
Welche einzigartigen Herausforderungen sind Ihnen beim Aufbau einer Transkriptionslösung für den Unternehmenseinsatz begegnet?
Bei der Spracherkennung sind Geschwindigkeit und Genauigkeit – die beiden wichtigsten Leistungsindikatoren in diesem Bereich – invers proportional konzipiert. Das bedeutet, dass die Verbesserung der einen die andere beeinträchtigt, zumindest bis zu einem bestimmten Grad. Der Kostenfaktor resultiert zu einem großen Teil aus der Wahl des Anbieters zwischen Geschwindigkeit und Qualität.
Als wir Gladia aufbauten, war unser Ziel, den perfekten Ausgleich zwischen diesen beiden Faktoren zu finden, während wir gleichzeitig sicherstellten, dass die Technologie für Start-ups und KMU verfügbar bleibt. Im Laufe des Prozesses erkannten wir auch, dass die grundlegenden ASR-Modelle wie OpenAI’s Whisper, mit denen wir umfassend gearbeitet haben, voreingenommen sind und stark auf Englisch ausgerichtet sind, da ihre Trainingsdaten größtenteils auf Englisch basieren, was viele Sprachen unterrepräsentiert lässt.
Daher war es für uns – als europäisches, mehrsprachiges Team – wichtig, unsere Kernmodelle zu optimieren und zu feinjustieren, um eine wirklich globale API zu erstellen, die Unternehmen über Sprachen hinweg unterstützt.
Wie unterscheidet sich Gladia in dem überfüllten AI-Transkriptionsmarkt? Was macht Ihre Whisper-Zero-ASR so einzigartig?
Unser neuer Echtzeit-Engine (Gladia Real Time) erreicht eine branchenführende Latenz von 300 ms. Darüber hinaus kann es Erkenntnisse aus einem Anruf oder Meeting mit den sogenannten “Audio-Intelligenz”-Add-ons oder -Funktionen wie Named Entity Recognition (NER) oder Sentiment-Analyse extrahieren.
Soweit wir wissen, sind nur wenige Wettbewerber in der Lage, sowohl Transkription als auch Erkenntnisse mit einer so geringen Latenz (weniger als 1 s) zu liefern – und all dies genau in Sprachen andere als Englisch. Unsere Sprachunterstützung umfasst heute über 100 Sprachen.
Wir legen auch großen Wert darauf, das Produkt wirklich stapelagnostisch zu machen. Unsere API ist mit allen bestehenden Technologiestapeln und Telefonieprotokollen kompatibel, einschließlich SIP, VoIP, FreeSwitch und Asterisk. Telefonieprotokolle sind besonders komplex zu integrieren, daher glauben wir, dass dieser Produktaspekt einen enormen Wert für den Markt bringen kann.
Halluzinationen in AI-Modellen sind ein erhebliches Problem, insbesondere bei Echtzeit-Transkription. Können Sie erklären, was Halluzinationen im Kontext von STT sind und wie Gladia dieses Problem angeht?
Halluzinationen treten normalerweise auf, wenn das Modell nicht genug Wissen oder Kontext über das Thema hat. Obwohl Modelle Ausgaben erzeugen können, die auf eine Anfrage abgestimmt sind, können sie nur auf Informationen verweisen, die zum Zeitpunkt ihrer Ausbildung existierten, und diese Informationen mögen nicht auf dem neuesten Stand sein. Das Modell erstellt kohärente Antworten, indem es Lücken mit Informationen füllt, die plausibel klingen, aber falsch sind.
Obwohl Halluzinationen zuerst im Kontext von LLMs bekannt wurden, treten sie auch bei Spracherkennungsmodellen auf – wie Whisper ASR, einem führenden Modell in diesem Bereich, das von OpenAI entwickelt wurde. Die Halluzinationen von Whisper sind ähnlich wie die von LLMs aufgrund einer ähnlichen Architektur, daher ist dies ein Problem, das generative Modelle betrifft, die in der Lage sind, die Wörter vorherzusagen, die auf den Kontext folgen. Auf eine Weise “erfinden” sie die Ausgabe.
Dieser Ansatz kann mit traditionelleren, akustisch basierten ASR-Architekturen kontrastiert werden, die den Eingabeklang mit der Ausgabe in mechanischer Weise abgleichen. Als Ergebnis können Sie Wörter in einer Transkription finden, die tatsächlich nicht gesagt wurden, was besonders in Bereichen wie der Medizin, wo ein Fehler dieser Art schwerwiegende Konsequenzen haben kann, problematisch ist.
Es gibt mehrere Methoden, um Halluzinationen zu erkennen und zu verwalten. Ein häufiger Ansatz ist die Verwendung eines Retrieval-augmented-Generation- (RAG-) Systems, das die generativen Fähigkeiten des Modells mit einem Abrufmechanismus kombiniert, um Fakten zu überprüfen. Ein weiterer Ansatz beinhaltet die Verwendung eines “chain-of-thought”-Ansatzes, bei dem das Modell durch eine Reihe von vordefinierten Schritten oder Prüfungen geführt wird, um sicherzustellen, dass es auf einem logischen Pfad bleibt.
Ein weiterer Ansatz zur Erkennung von Halluzinationen beinhaltet die Verwendung von Systemen, die die Wahrhaftigkeit der Ausgabe des Modells während der Ausbildung bewerten. Es gibt Benchmarks, die speziell dafür entwickelt wurden, Halluzinationen zu bewerten, und die verschiedene Kandidatenantworten, die vom Modell generiert werden, vergleichen und bestimmen, welche davon am genauesten ist.
Wir bei Gladia haben mit einer Kombination von Techniken experimentiert, als wir Whisper-Zero, unsere proprietäre ASR, die virtuell alle Halluzinationen entfernt, aufbauten. Es hat hervorragende Ergebnisse in asynchroner Transkription gezeigt, und wir optimieren es derzeit für Echtzeit, um die gleiche Informationsfidelität von 99,9 % zu erreichen.
Die STT-Technologie muss eine Vielzahl von Komplexitäten wie Akzente, Rauschen und mehrsprachige Konversationen bewältigen. Wie geht Gladia diese Herausforderungen an, um eine hohe Genauigkeit zu gewährleisten?
Die Sprachdetektion in der ASR ist eine extrem komplexe Aufgabe. Jeder Sprecher hat eine einzigartige vokale Signatur, die wir Merkmale nennen. Durch die Analyse des vokalen Spektrums können maschinelles Lernen und Algorithmen Klassifizierungen durchführen, indem sie die Mel-Frequenz-Cepstral-Koeffizienten (MFCC) verwenden, um die wichtigsten Frequenzmerkmale zu extrahieren.
MFCC ist eine Methode, die von der menschlichen auditiven Wahrnehmung inspiriert ist. Es ist Teil des “psychoakustischen” Bereichs, der sich auf die Art und Weise konzentriert, wie wir Klänge wahrnehmen. Es betont niedrige Frequenzen und verwendet Techniken wie normalisierte Fourier-Zerlegung, um Audio in ein Frequenzspektrum umzuwandeln.
Es gibt jedoch eine Einschränkung: Es basiert rein auf Akustik. Wenn Sie also Englisch mit einem starken Akzent sprechen, kann das System den Inhalt möglicherweise nicht verstehen, sondern stattdessen auf Ihre Prosodie (Rhythmus, Betonung, Intonation) urteilen.
Dabei kommt Gladia’s innovative Lösung ins Spiel. Wir haben einen hybriden Ansatz entwickelt, der psychoakustische Merkmale mit Kontextverständnis für dynamische Sprachdetektion kombiniert.
Unser System hört nicht nur, wie Sie sprechen, sondern versteht auch, was Sie sagen. Dieser doppelte Ansatz ermöglicht effizientes Code-Switching und lässt starke Akzente nicht falsch darstellen oder missverstehen.
Code-Switching – das ist einer unserer wichtigsten Unterschiede – ist eine besonders wichtige Funktion bei der Bewältigung mehrsprachiger Konversationen. Sprecher können während eines Gesprächs (oder sogar während eines Satzes) zwischen Sprachen wechseln, und die Fähigkeit des Modells, dies genau und in Echtzeit zu transkribieren, ist entscheidend.
Gladia API ist einzigartig in ihrer Fähigkeit, Code-Switching mit so vielen Sprachpaaren und einer hohen Genauigkeit zu bewältigen und funktioniert auch in lauten Umgebungen, die bekanntermaßen die Qualität der Transkription verringern.
Echtzeit-Transkription erfordert eine extrem geringe Latenz. Wie erreicht Ihre API eine Latenz von weniger als 300 Millisekunden, während sie gleichzeitig die Genauigkeit aufrechterhält?
Die Latenz unter 300 Millisekunden zu halten, während die Genauigkeit aufrechterhalten wird, erfordert einen mehrfach gefächerten Ansatz, der Hardware-Expertise, Algorithmus-Optimierung und Architektur-Design kombiniert.
Echtzeit-AI ist nicht wie traditionelles Rechnen – es ist eng mit der Leistung und Effizienz von GPGPUs verbunden. Ich habe fast ein Jahrzehnt in diesem Bereich gearbeitet, als Leiter der AI-Abteilung bei OVHCloud (dem größten Cloud-Anbieter in der EU), und habe gelernt, dass es immer darum geht, das richtige Gleichgewicht zu finden: wie viel Hardware-Leistung man benötigt, wie viel es kostet und wie man die Algorithmen so anpasst, dass sie nahtlos mit dieser Hardware zusammenarbeiten.
Die Leistung in Echtzeit-AI kommt aus der effektiven Ausrichtung unserer Algorithmen mit den Fähigkeiten der Hardware, um sicherzustellen, dass jeder Vorgang den Durchsatz maximiert und Verzögerungen minimiert.
Es geht jedoch nicht nur um AI und Hardware. Die Systemarchitektur spielt auch eine große Rolle, insbesondere das Netzwerk, das die Latenz wirklich beeinflussen kann. Unser CTO, der tiefere Expertise in Low-Latency-Netzwerkdesign aus seiner Zeit bei Sigfox (einem IoT-Pionier) hat, hat unsere Netzwerkkonfiguration optimiert, um wertvolle Millisekunden abzuschneiden.
Es ist also wirklich eine Mischung all dieser Faktoren – intelligente Hardware-Auswahl, optimierte Algorithmen und Netzwerk-Design – die es uns ermöglicht, konstant eine Latenz von unter 300 ms zu erreichen, ohne die Genauigkeit zu beeinträchtigen.
Gladia geht über die Transkription hinaus mit Funktionen wie Sprecher-Diarisierung, Sentiment-Analyse und Zeitstempel-Transkripte. Welche innovativen Anwendungen haben Sie bei Ihren Kunden gesehen, die diese Tools nutzen?
ASR schaltet eine breite Palette von Anwendungen für Plattformen über verschiedene Branchen hinweg frei, und es ist erstaunlich, wie viele wirklich bahnbrechende Unternehmen in den letzten zwei Jahren aufgetaucht sind, die LLMs und unsere API nutzen, um führende, wettbewerbsfähige Produkte zu entwickeln. Hier sind einige Beispiele:
- Intelligente Notizen: Viele Kunden bauen Tools für Fachleute, die Informationen aus Meetings, Studentenvorlesungen oder medizinischen Konsultationen schnell erfassen und organisieren müssen. Mit Sprecher-Diarisierung kann unsere API erkennen, wer was gesagt hat, was es einfacher macht, Gespräche zu verfolgen und Aufgaben zuzuweisen. Kombiniert mit Zeitstempel-Transkripten können Benutzer direkt zu bestimmten Momenten in einer Aufnahme springen, was Zeit spart und sicherstellt, dass nichts verloren geht.
- Vertriebsunterstützung: Im Vertrieb ist das Verständnis der Kundensentiments alles. Teams nutzen unsere Sentiment-Analyse-Funktion, um Echtzeit-Einblicke in die Reaktionen von Kunden während Anrufen oder Demos zu erhalten. Zusätzlich helfen Zeitstempel-Transkripte Teams, wichtige Teile eines Gesprächs noch einmal zu besprechen, um ihre Präsentation zu verfeinern oder Kundenbedenken effektiver zu behandeln. Für diesen spezifischen Anwendungsfall ist NER auch entscheidend, um Namen, Firmendetails und andere Informationen zu identifizieren, die aus Vertriebsanrufen extrahiert und automatisch in das CRM eingespeist werden können.
- Call-Center-Unterstützung: Unternehmen im Call-Center-Bereich nutzen unsere API, um Live-Unterstützung für Agenten zu bieten sowie Kundensentiments während Anrufen zu flaggen. Sprecher-Diarisierung stellt sicher, dass das Gesagte der richtigen Person zugeordnet wird, während Zeitstempel-Transkripte es Supervisoren ermöglichen, kritische Momente oder Compliance-Probleme schnell zu überprüfen. Dies verbessert nicht nur die Kundenerfahrung – mit besserer Auflösungsrate und Qualitätsüberwachung – sondern steigert auch die Produktivität und Zufriedenheit der Agenten.
Können Sie die Rolle von benutzerdefinierten Vokabularen und Entitäts-Erkennung bei der Verbesserung der Transkriptionszuverlässigkeit für Unternehmensanwender diskutieren?
Viele Branchen verlassen sich auf spezielle Terminologie, Markennamen und einzigartige Sprachnuancen. Die Integration von benutzerdefinierten Vokabularen ermöglicht es der STT-Lösung, sich an diese spezifischen Bedürfnisse anzupassen, was entscheidend ist, um kontextuelle Nuancen zu erfassen und Ausgaben zu liefern, die die Geschäftsanforderungen genau widerspiegeln. Zum Beispiel ermöglicht es die Erstellung einer Liste von branchenspezifischen Wörtern, wie Markennamen, in einer bestimmten Sprache.
Warum es nützlich ist: Die Anpassung der Transkription an die spezifischen Bedürfnisse des Unternehmens ermöglicht es, Fehler in Transkripten zu minimieren und so eine bessere Benutzererfahrung zu erzielen. Diese Funktion ist insbesondere in Bereichen wie Medizin oder Finanzen von entscheidender Bedeutung.
Benannte Entitäts-Erkennung (NER) extrahiert und identifiziert wichtige Informationen aus unstrukturierten Audio-Daten, wie Namen von Personen, Organisationen, Orten und mehr. Eine häufige Herausforderung bei unstrukturierten Daten ist, dass diese kritischen Informationen nicht leicht zugänglich sind – sie sind in der Transkription vergraben.
Um dies zu lösen, hat Gladia einen strukturierten Key-Data-Extraktionsansatz (KDE) entwickelt. Durch die Nutzung der generativen Fähigkeiten von Whisper-basierten Architekturen – ähnlich wie bei LLMs – kann Gladia’s KDE Kontext erfassen, um relevante Informationen direkt zu identifizieren und zu extrahieren.
Dieser Prozess kann durch Funktionen wie benutzerdefinierte Vokabulare und NER weiter verbessert werden, um Unternehmen zu ermöglichen, ihre CRM-Systeme schnell und effizient mit wichtigen Daten zu füllen.
Wie sieht Gladia die Zukunft der Echtzeit-Transkription in den nächsten 5-10 Jahren?
Ich denke, dass diese Technologie, die wir jetzt als Echtzeit-AI bezeichnen, überall sein wird. Im Wesentlichen bezieht sich dies auf die nahtlose Fähigkeit von Maschinen, mit Menschen zu interagieren, so wie wir Menschen bereits miteinander interagieren.
Und wenn man sich jeden Hollywood-Film (wie “Her”) ansieht, der in der Zukunft spielt, sieht man nie jemanden, der mit intelligenten Systemen über eine Tastatur interagiert. Für mich ist das der ultimative Beweis, dass in der kollektiven Vorstellung der Menschheit die Sprache immer der primäre Weg sein wird, auf dem wir mit der Welt um uns herum interagieren.
Die Sprache, als zentraler Bestandteil unserer Kultur und Geschichte, ist seit viel längerer Zeit Teil der menschlichen Kommunikation als die Schrift. Dann übernahm die Schrift, da sie es uns ermöglichte, unser Wissen effektiver zu bewahren als durch die Abhängigkeit von den Ältesten der Gemeinschaft, die als Hüter unserer Geschichten und Weisheit dienen.
GenAI-Systeme, die in der Lage sind, Sprache zu verstehen, Antworten zu generieren und unsere Interaktionen zu speichern, brachten etwas völlig Neues in den Raum. Es ist das Beste aus beiden Welten und das Beste der Menschheit. Es gibt uns diese einzigartige Energie und Kraft der Sprachkommunikation mit dem Vorteil des Gedächtnisses, den zuvor nur geschriebene Medien für uns sichern konnten. Deshalb glaube ich, dass es überall sein wird – es ist unser kollektiver Traum.
Vielen Dank für das großartige Interview. Leser, die mehr erfahren möchten, sollten Gladia besuchen.












