Interviews
Neal Lathia, Mitbegründer und CTO von Gradient Labs – Interview‑Reihe

Neal Lathia, Mitbegründer und CTO von Gradient Labs, ist ein Leiter im Bereich Machine Learning und Data Science mit fast zwei Jahrzehnten Erfahrung in Finanztechnologie, Verbraucherplattformen und akademischer Forschung. Vor der Mitgründung von Gradient Labs im Jahr 2023 verbrachte er mehr als fünf Jahre bei Monzo, wo er vom Senior Data Scientist zum Leiter des Machine Learning und Senior Machine Learning Engineer aufstieg, maschinelle Lerninfrastruktur aufbaute und half, die Disziplin zu skalieren, um Anwendungen in den Bereichen Betrieb, Finanzkriminalität und Produkt zu unterstützen. Zuvor arbeitete Lathia als Senior Data Scientist bei Skyscanner und hatte Forschungspositionen an der University of Cambridge und der University College London, wo seine Arbeit Empfehlungssysteme, Verhaltensdaten, Smartphone‑Sensing und personalisierte digitale Dienste untersuchte. Bei Gradient Labs leitet er nun die Technologie hinter KI‑Agenten, die für komplexe, regulierte Workflows im Finanzdienstleistungssektor konzipiert sind.
Gradient Labs ist ein in London ansässiges KI‑Unternehmen, das spezialisierte autonome Agenten für Finanzdienstleistungen entwickelt, mit dem Fokus, Kundenoperationen zu automatisieren, die traditionell einen erheblichen menschlichen Aufwand erfordern. Gegründet von ehemaligen Monzo‑Führungskräften Dimitri Masin, Neal Lathia und Danai Antoniou, entwickelt das Unternehmen Agenten für Bereiche wie Kreditvergabe und Inkasso, Streitfälle, Know Your Business (KYB), Onboarding, Versicherungsansprüche und Kundenservice, die über Stimme, Chat und E‑Mail arbeiten und dabei Compliance‑Leitplanken für regulierte Umgebungen integrieren. Gradient Labs gibt an, dass seine Technologie inzwischen mehr als 32 Millionen Endnutzer bei Kunden wie Wise, Zego, Current, Stash und Rho bedient. Im Juni 2026 kündigte das Unternehmen an, seine Series‑A‑Finanzierung auf $26 Millionen ausgeweitet zu haben, um einer breiteren Vision nachzugehen, komplexe Bank‑ und FinTech‑Operationen mit vernetzten, spezialisierten KI‑Agenten zu automatisieren.
Sie verbrachten mehr als fünf Jahre damit, bei Monzo Machine Learning aufzubauen und zu leiten, bevor Sie 2023 Gradient Labs mitbegründeten. Was haben Sie bei Monzo aus erster Hand erlebt, das Sie davon überzeugte, dass es eine Chance gibt, ein neues Unternehmen rund um autonome KI‑Agenten zu gründen, und warum machte das Aufkommen großer Sprachmodelle diese Möglichkeit realisierbar?
Bei Monzo verbrachte ich Jahre damit, ML‑Systeme zu bauen, die in einer regulierten Umgebung funktionieren mussten, in der Fehler sehr reale Konsequenzen haben und alles eine Prüfspur erfordert. Am meisten beeinflusste mich die Notwendigkeit, maßgeschneiderte Infrastruktur zu entwickeln, weil keine vorgefertigte Lösung unter diesen strengen Vorgaben sicher arbeiten konnte. Diese Erfahrung hinterließ zwei Überzeugungen in mir. Die erste war, dass Technologie endlich Banken aus der operativen Belastung befreien könnte, die die Branche seit Jahrzehnten zurückhält. Die zweite war, dass allgemeine, horizontale KI dort keinen Unterschied machen würde – die Nuancen regulierter Arbeit sind zu spezifisch. Als LLMs fähig wurden, mehrstufige, manchmal mehrdeutige Kundeninteraktionen zu durchdenken, wurde es machbar, Agenten zu bauen, die komplette regulierte Workflows von Anfang bis Ende steuern können, anstatt nur einen Menschen dabei zu unterstützen. Diese Lücke zwischen dem, was regulierte Unternehmen tatsächlich benötigen, und dem, was bereits existierte, ist der Grund, warum wir Gradient Labs gegründet haben und warum wir auf vertikale KI setzen, die speziell für den Finanzsektor entwickelt wurde.
Sie haben beschrieben, was Verbraucher erleben, als die „gezackte Kante des Erlebnisses“: Ein KI‑Agent kann eine außerordentlich komplexe Aufgabe erledigen, während ein anderes System bei etwas so Einfachem wie der Unterscheidung einer Telefonnummer von einem Namen scheitert. Was verursacht tatsächlich eine solch dramatische Kluft zwischen KI‑Erfahrungen, wenn die zugrunde liegenden Modelle ähnlich leistungsfähig sein können?
Ich würde sagen, die Lücke liegt eher daran, wie viel Engineering in das Modell investiert wird, als an der reinen Modellkompetenz. Wenn ein System bei einer einfachen Aufgabe scheitert, etwa einer Verwechslung einer Telefonnummer mit einem Namen, bedeutet das, dass es nicht in das umgebende Framework investiert hat, wie Validierung, Fallback‑Logik, strukturierte Datenverarbeitung usw. Der beeindruckendere Agent wurde wahrscheinlich exakt für seine Aufgabe entwickelt. Es handelt sich um dieselbe grundlegende Modellfamilie, jedoch mit völlig unterschiedlicher Strenge im Umfeld, und genau das erzeugt die gezackte Kante.
Da sich Frontier‑Modelle weiter verbessern, warum bestehen scheinbar grundlegende KI‑Fehler weiterhin? Liegt das hauptsächlich an den Einschränkungen der Modelle selbst oder an Versagen in der umgebenden Systemarchitektur, den Daten, Workflows, der Bewertung und dem Produktdesign?
Es ist hauptsächlich das System und nicht das Modell. Frontier‑Modelle verbessern weiterhin ihre Fähigkeit zum Schließen von Schlüssen. Unternehmen koppeln sie jedoch häufig an Systeme, die nicht für wahrscheinlichkeitbasierte Verhaltensweisen entwickelt wurden. Es gibt fragile Integrationen und unvollständige Daten in den Systemen, ohne einen echten Evaluations‑Loop, bevor Änderungen ausgerollt werden. Ein einfacher KI‑Fehler im Produktivbetrieb ist daher nicht wirklich ein KI‑Fehler, sondern ein Versagen, in Evaluierung, Monitoring und Workflow‑Design‑Prozesse zu investieren.
Viele Unternehmen scheinen den KI‑Kundendienst nach Geschwindigkeit, Containment oder Ticket‑Abweisung zu optimieren. Welche Kennzahlen sollten Unternehmen stattdessen verwenden, wenn sie messen wollen, ob ein KI‑Agent die Kundenerfahrung tatsächlich verbessert?
Dafür müssten wir die Lösungsgenauigkeit berücksichtigen. Geschwindigkeit und Containment werden verwendet, um zu beurteilen, ob Sie einen Kunden vom Telefonieren abbringen konnten, nicht ob Sie sein Problem gelöst haben. Die Lösungsgenauigkeit, die zur Messung der Leistungsfähigkeit eines KI‑Agents herangezogen werden sollte, prüft, ob der Agent das Richtige getan hat, im Gegensatz dazu, nur schnell zu reagieren. Sie wird zusammen mit anderen Signalen wie Wiederkontaktquoten, der Anzahl von Beschwerden und der Häufigkeit, mit der ein Mensch nachträglich eingreifen muss, verwendet. Sie werden wissen, dass Sie das falsche Ergebnis optimieren, wenn die Deflektierungsrate steigt, aber gleichzeitig Wiederkontakte und Beschwerden ebenfalls zunehmen.
Gradient Labs konzentriert sich auf regulierte Finanzdienstleistungen, bei denen eine falsche Antwort weitaus gravierendere Folgen haben kann als ein typischer Kundenservice‑Fehler. Wie bestimmen Sie, wann ein KI‑Agent zuverlässig genug ist, um Prozesse in Bereichen wie Kreditvergabe, Streitigkeiten, Onboarding oder Know‑Your‑Customer‑Prüfungen eigenständig zu bearbeiten?
Der Standardweg, den die meisten Teams bevorzugen, ist der des Co‑Piloten: Jemand genehmigt jede Aktion, weil es sich sicherer anfühlt. Und die meisten gehen davon aus, dass es sicherer ist. In Wirklichkeit jedoch, da die KI die meisten Dinge korrekt erledigt, genehmigen Prüfer Dinge, ohne sie wirklich zu überprüfen, und die Sicherheit geht trotzdem verloren. Das trägt nichts dazu bei, die bestehende Arbeitsbelastung zu reduzieren. Es macht sie lediglich schneller und verringert den Nutzen, den Sie erhalten.
Deshalb ist das Konzept, dass ein KI‑Agent ausreichend zuverlässig ist, bei Gradient Labs stark prozessabhängig. Für uns muss er durch gestufte Autonomie entwickelt werden und darf nicht als ein einziges Ziel betrachtet werden, das abgehakt wird. Ein Agent kann erst dann mehr Unabhängigkeit bei Themen wie KYC oder Streitigkeiten erhalten, wenn er gegen einen großen, lebendigen Katalog realer Fälle benchmarked wurde, wobei auch nach dem Produktionsstart eine Stichprobe seiner Entscheidungen von Menschen geprüft wird. Interessanterweise bestätigt dies, dass Umkehrbarkeit hier ebenfalls von großer Bedeutung ist. Wenn etwas rückgängig gemacht werden kann, erlangt es schneller Autonomie als etwas, das das nicht kann.
Guardrails werden zunehmend als Lösung präsentiert, um KI‑Agents sicherer zu machen, doch das Hinzufügen weiterer Regeln kann Systeme auch starr machen oder sie daran hindern, legitime Aufgaben zu erledigen. Wie balancieren Sie Autonomie und Guardrails, ohne einen Agenten zu einem weiteren stark eingeschränkten Chatbot zu reduzieren?
Der Fehler besteht darin, Guardrails als eine Wand zu behandeln, von der der Agent einfach abprallt. In unserem System erfüllen sie gleichzeitig zwei Funktionen. Wir setzen Guardrails bei jedem einzelnen Dialogschritt ein – einige prüfen, was der Kunde sagt, um etwaige Verwundbarkeiten, finanzielle Schwierigkeiten oder Beschwerden zu erkennen, und andere prüfen, was der Agent sagen will, um die Konformität sicherzustellen. Wenn jedoch eine Guardrail ausgelöst wird, blockiert sie nicht nur, sondern leitet den Agenten zum richtigen Verfahren um, und diese Entscheidung ist im Denkprozess des Agenten transparent, sodass die Betreiber sehen können, warum er so gehandelt hat. Die tiefergehenden Guardrails sind zudem in die Art und Weise eingebettet, wie dem Agenten beigebracht wird, über eine Aufgabe nachzudenken, auf welche Daten er zugreifen kann und welche Werkzeuge er verwenden darf. Diese Kombination sorgt dafür, dass er sicher bleibt, ohne starr zu werden: Der Agent versteht, was die Guardrails sind und warum sie existieren, sodass er eine legitime Aufgabe erledigt, anstatt alles abzulehnen, was nur einem unzulässigen Vorgang ähnelt.
Hier denke ich, dass das Problem darin liegt, Guardrails als eine Ziegelwand zu sehen, von der der Agent abprallt. Genauer gesagt führen wir bei jedem einzelnen Dialogschritt zwei verschiedene Arten von Guardrails aus. Erstens haben wir die Kunden‑Guardrails, die prüfen, was der Kunde sagt, und darauf abzielen, Verwundbarkeiten, finanzielle Schwierigkeiten, Beschwerden von Kunden und Ähnliches zu erkennen. Zweitens gibt es die Agent‑Guardrails, die umgekehrt arbeiten und überprüfen, was der Agent sagen wird, bevor die Nachricht gesendet wird, um die Konformität sicherzustellen.
Das bedeutet, dass anstelle einer vollständigen Blockierung einer Aktion, wenn eine dieser Guardrails ausgelöst wird, diese zur richtigen Vorgehensweise umgeleitet wird. Auf diese Weise bleibt die Transparenz der Entscheidungsprozesse des Agenten erhalten und menschliche Betreiber erhalten den Grund für die getroffene Maßnahme.
Wir können dies auch umsetzen, weil nicht jeder Aspekt des Denkprozesses eines Agenten zwingend durch ein LLM laufen muss. Guardrails dieser Art sind deterministisch, da sie nicht nur am Ende einer Unterhaltung ausgelöst werden, sondern während der gesamten Lebensdauer des Agenten. So können wir dem Agenten sensible Kommunikation anvertrauen und die Anpassung spezifischer Agenten für Anwendungsfälle in großem Umfang und auf vorhersehbare Weise ermöglichen.
Am wichtigsten ist, wie dem Agenten zunächst beigebracht wird, eine Aufgabe zu durchdenken, sodass er auf relevante Daten zugreifen und die erforderlichen Werkzeuge kennen kann. Diese Fähigkeit des Agenten, eine legitime Aufgabe zu erledigen, anstatt alles abzulehnen, was scheinbar nicht erlaubt ist, trägt zur Verbesserung der Sicherheit und zur Vermeidung von Starrheit bei.
Wo sollten Menschen weiterhin im Prozess verbleiben, wenn KI‑Agents immer autonomer werden? Gibt es bestimmte Entscheidungen oder Kundeninteraktionen, von denen Sie glauben, dass sie weiterhin menschliches Urteilsvermögen erfordern, unabhängig davon, wie leistungsfähig die zugrunde liegenden Modelle werden?
Ein Mensch muss eingebunden werden, wenn eine Entscheidung ehrliche Diskretion erfordert, erhebliche Auswirkungen für den Kunden hat oder ein Ergebnis betrifft, gegen das der Agent noch nicht bewertet wurde. Der Mensch muss nicht unbedingt alles übernehmen, aber er sollte nach Bedarf prüfen oder genehmigen. Das gilt wahrscheinlich sogar, wenn die Modelle leistungsfähiger werden, weil es dabei oft weniger um die Fähigkeit geht, sondern um Verantwortung und das Recht des Kunden auf einen menschlichen Entscheidungsträger, etwa bei Kreditentscheidungen oder Streitfällen.
Ein Mensch muss eingebunden werden, wenn eine Entscheidung ehrliche Diskretion erfordert, erhebliche Auswirkungen für den Kunden hat oder ein Ergebnis betrifft, gegen das der Agent noch nicht bewertet wurde. Ich würde das sogar etwas weiter gehen lassen als das übliche Rückfallmodell und argumentieren, dass Agenten zunehmend ihren Platz in der Organisationsstruktur neben Menschen einnehmen. Dadurch verlagert sich der menschliche Aufwand stärker auf Eskalationen und Urteilsentscheidungen, während Agenten die Koordination und Weiterleitung übernehmen.
Damit das wirklich funktioniert, benötigen Agenten denselben institutionellen Kontext wie ein Mensch, damit sie wissen, wen sie bei bestimmten Problemen einbinden müssen und zu welchem Zeitpunkt. Deshalb haben wir Collaborate entwickelt. Es ermöglicht Operatoren, Ingenieuren und Agenten, als Gleichgestellte zusammenzuarbeiten, mit Versionskontrolle, Bewertungen und kontinuierlichem Lernen im Kern. So bleibt der Mensch vollständig im Loop, und der Loop ändert lediglich seine Form, um die Koordination zwischen Agent und Mensch zu berücksichtigen.
Gradient Labs konzentriert sich auf spezialisierte Agenten, die für bestimmte Workflows im Finanzdienstleistungsbereich entwickelt wurden, anstatt auf einen einzigen Allzweck‑Agenten. Glauben Sie, dass die Zukunft von Enterprise‑AI hauptsächlich aus Netzwerken spezialisierter Agenten bestehen wird, oder werden immer leistungsfähigere Basis‑Modelle diese Spezialisierung irgendwann weniger wichtig machen?
Ich denke, selbst wenn Basis‑Modelle besser werden, bleibt Spezialisierung wichtig. Kunden zahlen nicht nur für ein intelligentes Modell, sondern für eine auf den Workflow zugeschnittene Bewertung, Guardrails und die Datenintegration, die darum herum aufgebaut sind. Und diese Arbeit verschwindet nicht, nur weil das zugrunde liegende Modell besser wird. Ich sehe das eher als ein Netzwerk spezialisierter Agenten, die alle auf einem gemeinsamen, starken Basis‑Modell aufbauen, anstatt einen einzigen Allzweck‑Agenten, der alles erledigt.
KI‑Agenten müssen nach dem Deployment zunehmend lernen und sich verbessern, doch in regulierten Umgebungen kann bereits eine kleine Verhaltensänderung neue Risiken mit sich bringen. Wie können Unternehmen einen Agenten kontinuierlich verbessern, ohne dass Updates Regressionen, Compliance‑Probleme oder unerwartetes Verhalten verursachen?
Unser Prinzip ist, dass jedes Update als neue Modell‑Version behandelt wird, nicht als inkrementelle Konfigurationsänderung, sodass jede Änderung einer vollständigen Evaluationssuite unterzogen wird, bevor sie ausgeliefert wird. Das beinhaltet Regressionstests gegen Vorgänge, bei denen ein Fehler einen echten Unterschied gemacht hätte, und nichts wird gleichzeitig an alle Kunden ausgerollt: Wir führen die Einführung schrittweise durch und überwachen sie, sodass wir bei auftretendem Drift nur einen begrenzten Teil des Datenverkehrs betreffen, anstatt das gesamte System. Genau darauf basiert unser jüngstes Collaborate‑Release. Collaborate lässt Operatoren, Ingenieure und den KI‑Agenten als Gleichgestellte an derselben lebenden Definition arbeiten, wie der Agent denken soll, mit Versionskontrolle, Bewertungen und kontinuierlichem Lernen, die direkt in den Workflow integriert sind. Wenn also jemand die Handhabung eines Falls durch den Agenten verbessert, wird diese Änderung versioniert, gegen vergangene Konversationen getestet und unter denselben Kontrollen wie jede andere Veröffentlichung ausgerollt. Das bedeutet, ein Agent kann nach dem Deployment besser werden, ohne dass die Verbesserung selbst eine Regression oder ein Compliance‑Problem verursacht.
Wenn der Zugang zu leistungsstarken Basis‑Modellen zunehmend commoditisiert wird, woher wird dann der eigentliche Wettbewerbsvorteil bei KI‑Anwendungen kommen? Werden die Gewinner diejenigen sein, die die besten Modelle besitzen, oder diejenigen, die am besten zuverlässige Systeme konstruieren und konsequent gute Erlebnisse rund um diese Modelle liefern?
Da immer mehr Basis‑Modelle zu konvergieren beginnen, wird der Vorsprung fast ausschließlich denen gehören, die am besten zuverlässige Systeme um diese Modelle herum bauen, einschließlich Bewertung, Guardrails, Daten und Workflow‑Design. Das Modell wird zu einer Commodity‑Komponente, aber Konsistenz und Verlässlichkeit in der Produktion sind das eigentliche Produkt.
Darüber hinaus sehe ich den Vorteil eher darin, wie tief ein Agent in die Abläufe eines Unternehmens eingebettet ist. Agenten, die sich in vielen verschiedenen Bereichen eines Unternehmens integrieren lassen, werden Werkzeuge übertreffen, die nur spezifische Probleme lösen oder nur die Frontline erreichen. Wenn ein Agent sowohl in Front‑ als auch Back‑Office‑Systemen arbeiten kann, bringt er mehr Kontext in Interaktionen ein und kann komplexe Probleme end‑to‑end bearbeiten, genau wie ein Mensch. Die Fähigkeit eines Agenten, sich an die tatsächliche Arbeitsweise eines Unternehmens anzupassen, ist meiner Ansicht nach der entscheidende langfristige Gewinnfaktor.
Vielen Dank für das großartige Interview, Leser, die mehr erfahren möchten, sollten Gradient Labs besuchen.












