KI-Modelle und Plattformen
Decagon stellt Voice 3‑Agent mit Chord‑Sprachmodell vor

Decagon stellte Voice 3, seinen Sprach‑KI‑Agent für Kundenanrufe, sowie Chord, das erste Sprachmodell von Decagon Labs, auf der Decagon Dialogues 2026‑Veranstaltung am 1. Oktober 2026 vor und erklärte, dass der Agent mehr als 70 Sprachen unterstützt und auf einer neuen Duplex‑Architektur läuft.
In der Voice 3‑Ankündigung, verfasst von Produktmanager Quique Lores und Senior Product Marketing Manager Ariana Xiang, beschrieb Decagon Voice 3 als seinen bislang fortschrittlichsten Sprach‑KI‑Agenten. Der Agent spricht über Chord und wurde zusammen mit drei weiteren Produkten auf den Decagon Dialogues 2026 vorgestellt.
Im Decagon Dialogues 2026‑Beitrag nannten die Mitbegründer Jesse Zhang, CEO von Decagon, und Ashwin Sreenivas, Präsident, die anderen drei Veröffentlichungen: Personal Agent Gateway, das die persönlichen KI‑Agenten der Kunden identifiziert und ihnen einen dedizierten Kanal für die Interaktion mit einem Unternehmen bietet; Agent Modules, das einen Agenten über Journeys hinaus über den Support hinaus erweitert; und Duet Apprentice, das dem Duet‑System des Unternehmens ermöglicht, ein Unternehmen anhand interner Ressourcen und eskalierter Kundenunterhaltungen zu erlernen.
Unternehmen setzten zunächst Decagon-Agenten ein, um Support‑Tickets zu lösen, schrieben die Mitbegründer, und diese Agenten qualifizieren jetzt Leads, führen Kunden ein, sammeln Zahlungen und bauen Beziehungen aus. Die vier Veröffentlichungen erweitern, wie Kunden das erreichen, was Decagon als KI‑Concierge bezeichnet, und was dieser für sie tun kann.
Voice 3 und das Chord‑Sprachmodell
Chord ist das erste von Decagon Labs trainierte Sprachmodell, und das Unternehmen gibt an, dass es nachträglich mit realen Kundenerfahrungs‑Konversationen trainiert wurde, anstatt für das breite Anwendungsspektrum, das die meisten Sprachmodelle abdecken, von Hörbuch‑Erzählungen bis zu Videospiel‑Sprachaufnahmen. Decagon sagt, das Modell formt die Sprache Satz für Satz, verlangsamt sich für einen Bestätigungscode oder eine Telefonnummer und kehrt dann zu einem konversationellen Tempo zurück, anstatt sich auf eine einheitliche Geschwindigkeitseinstellung zu verlassen. Bestehende Sprach‑Anpassungs‑Steuerungen bleiben erhalten: Stimmwahl, Aussprache geschäftsspezifischer Begriffe und eine auf das Unternehmen abgestimmte Wiedergabe.
Voice 3 unterstützt mehr als 70 Sprachen, ohne dass Teams für jede Sprache einen separaten Agenten erstellen müssen, so die Ankündigung. Es erkennt die Sprache des Anrufers und wechselt automatisch, selbst wenn ein Anrufer mitten im Satz die Sprache wechselt, und Decagon sagt, dass seine lokalspezifischen Stimmen das Sprechverhalten in jedem Markt widerspiegeln und vor dem Rollout von Muttersprachlern validiert werden.
Decagon gibt an, dass Chord mit lizenzierten Daten und einwilligenden Stimmkünstlern trainiert wurde, niemals mit von Kunden eigenen Daten. Christian Niedworok, Leiter Digital Service Communication bei Deutsche Telekom, sagte in der Ankündigung, dass jahrelange IVR‑Systeme Kunden darauf trainiert haben, in kurzen Fragmenten zu sprechen, nur um einen Menschen zu erreichen, und dass die Stimme von Decagon tatsächlich zuzuhören scheint und das Gespräch am Laufen hält, anstatt während der Verarbeitung still zu werden. Chime Chief Operating Officer Janelle Sallenave erklärte, dass Decagon Voice es Chime ermöglicht, hohe Leistungsfähigkeit mit nahtloser Marken‑Anpassung und kanalübergreifendem Gedächtnis zu verbinden, sodass jede Interaktion vernetzt und den mitglieder‑zentrierten Werten treu bleibt.
Trainings‑Pipeline und Basismodell
Ein Begleitender Beitrag von Samuel Zhang, einem Mitglied des technischen Teams von Decagon, das sich auf die Orchestrierung von Agenten konzentriert, beschreibt, wie Chord gebaut wurde. Seine Trainings‑Pipeline ist darauf ausgelegt, die Textur echter Konversationen zu bewahren, einschließlich wechselnder Tempi, natürlicher Betonungen, Pausen und Füllwörter, anstatt Aufnahmen zu säubern und gleichmäßig vorzulesen, was laut Beitrag Stimmen synthetisch klingen lässt. Zwei Methoden unterstützen diesen Ansatz: ein wörtlicher Transkriptionsprozess, der Tempo, Betonung und Unflüssigkeiten erhält, und ein Aufnahmemodell, das den Inhalt eines Skripts mit der Natürlichkeit eines freien Gesprächs kombiniert, anstatt eine performative Vorlesung von Sprachschauspielern zu verwenden.
Für das Basismodell hat Decagon ein token‑freies Diffusionsmodell nachtrainiert. Der Beitrag argumentiert, dass die Diskretisierung von Audio in Tokens bei jedem Tokenisierungs‑Schritt Informationen verwirft, während eine token‑freie Darstellung nahezu verlustfrei bleibt und die feinen Details bewahrt, die eine Stimme, die nur verständlich ist, von einer Stimme, die präsent klingt, unterscheidet. Außerdem macht dies das Modell laut Beitrag deutlich steuerbarer, sodass Decagon Emotion, Tempo und Betonung präzise formen kann. In der Produktion wird Chord über Modal bereitgestellt.
Duplex‑Architektur
Decagon sagt, dass die meisten Sprach‑Agenten eine kaskadierte Pipeline verwenden, bei der Speech‑to‑Text den Anrufer transkribiert, ein Large‑Language‑Model entscheidet, wie zu antworten ist, und Text‑to‑Speech die Antwort spricht, wobei jede Stufe Verzögerungen hinzufügt und die Koordination zwischen den Stufen natürliches Wechseln erschwert. Voice 3 ersetzt diese Anordnung durch eine Duplex‑Architektur, die zwei Schichten parallel ausführt: ein latenzarmes Konversationsmodell übernimmt das Zuhören und Sprechen, von Antworten bis zu Fortschritts‑Updates, während ein leistungsfähigeres Modell das Denken, das Aufrufen von Werkzeugen und die Durchsetzung von Leitplanken hinter der Konversation steuert.
Laut dem Unternehmen verarbeitet der Agent eingehendes Audio, selbst während er spricht, sodass er weiter spricht, wenn ein Anrufer “mhm” sagt, aber bei einer echten Unterbrechung nachgibt. Er berichtet über seinen Fortschritt während langer Abfragen, beantwortet Anschlussfragen, während eine Aufgabe noch läuft, und unterstützt zwischendurch bei kleineren Anfragen, anstatt den Anrufer in Stille oder Warteschleife zu lassen.
Vom Unternehmen gemeldete Bewertungsergebnisse
Zhangs Beitrag berichtet über Kunden aus dem Telekommunikations-, Finanzdienstleistungs- und Reise- und Gastgewerbebereich, die von einer Standardstimme zu einer Stimme auf Chord gewechselt haben und dabei dieselben Programme vor und nach dem Wechsel verglichen wurden, wobei nur die Stimme geändert wurde. Die Lösungsrate stieg in jedem Fall, berichtet Decagon: up 6.1 points für den Telekommunikationskunden, 7.1 points für den Finanzdienstleister und 2.6 points für die Reisemarke. Die Barge‑Rate, die Decagon als den Anteil der Anrufe definiert, bei denen das einzige Ziel des Anrufers darin besteht, einen Menschen zu erreichen, sank bei den drei Kunden um 14.5, 6.1 und 5.3 Punkte.
In einem blind durchgeführten Hörtest mit drei Stimmen hörten die Teilnehmenden dieselben Audiosamples einmal von Chord und einmal von dem Stimmkünstler, auf dem Chord basiert, und sollten auswählen, welche die KI sei. Decagon berichtet, dass 45.7% der Teilnehmenden glaubten, die echte menschliche Stimme sei die KI, ein Ergebnis, das das Unternehmen als so nahe an einem 50‑50‑Münzwurf beschreibt, dass die beiden praktisch nicht zu unterscheiden seien. Die Ankündigung von Voice 3 fasst das Ergebnis zusammen als etwa 90% der Nutzer, die keinen Unterschied erkennen konnten.
Decagon berichtet außerdem über einen Präferenztest, bei dem Chord gegen drei andere, als führend bezeichnete Sprachmodelle direkt antreten ließ, wobei jedes dieselben Wörter sprach und die Teilnehmenden gebeten wurden, die Stimme auszuwählen, mit der sie als Kunde bei einem Problem am liebsten sprechen würden. Bei 185 Teilnehmenden erreichte Chord demnach insgesamt den ersten Platz mit 36.2% und erreichte in einzelnen Runden bis zu 48.4%.
Ausblickend sagt Decagon, dass das schwierigere und wertvollere Problem darin besteht, wie sich eine Stimme in einem echten Gespräch verhält, einschließlich der Frage, ob sie innerhalb von fünf Minuten Vertrauen gewinnt und stabil bleibt, wenn ein Anruf chaotisch wird. Das Unternehmen beschreibt Chord als die neueste Manifestation der Kernthese von Decagon Labs: dass für Kundeninteraktionen ein für eine spezifische Aufgabe feinabgestimmtes Modell ein generelles Front‑Modell, das für alles gebaut wurde, übertrifft.












