Entretiens
Neal Lathia, co-fondateur et CTO de Gradient Labs – Série d’interviews

Neal Lathia, co-fondateur et CTO de Gradient Labs, est un leader en apprentissage automatique et en science des données avec près de deux décennies d’expérience couvrant la technologie financière, les plateformes grand public et la recherche académique. Avant de co-fonder Gradient Labs en 2023, il a passé plus de cinq ans chez Monzo, évoluant de Senior Data Scientist à Director of Machine Learning puis à Staff Machine Learning Engineer, où il a construit l’infrastructure d’apprentissage automatique et aidé à faire évoluer la discipline pour soutenir des applications dans les opérations, la lutte contre la criminalité financière et les produits. Auparavant, Lathia a travaillé comme Senior Data Scientist chez Skyscanner et a occupé des postes de recherche à l’Université de Cambridge et à University College London, où ses travaux ont porté sur les systèmes de recommandation, les données comportementales, la détection via smartphone et les services numériques personnalisés. Chez Gradient Labs, il dirige désormais la technologie derrière les agents IA conçus pour des flux de travail financiers complexes et réglementés.
Gradient Labs est une entreprise d’IA basée à Londres qui crée des agents autonomes spécialisés pour les services financiers, en se concentrant sur l’automatisation des opérations client qui nécessitent traditionnellement une forte implication humaine. Fondée par d’anciens dirigeants de Monzo, Dimitri Masin, Neal Lathia et Danai Antoniou, la société développe des agents pour des domaines tels que le prêt et le recouvrement, les litiges, Know Your Business (KYB), l’onboarding, les réclamations d’assurance et le service client, fonctionnant sur la voix, le chat et le courriel tout en intégrant des garde-fous de conformité conçus pour des environnements réglementés. Gradient Labs indique que sa technologie sert désormais plus de 32 millions d’utilisateurs finaux auprès de clients tels que Wise, Zego, Current, Stash et Rho. En juin 2026, l’entreprise a annoncé avoir porté son financement de série A à 26 millions de dollars alors qu’elle poursuit une vision plus large d’automatisation des opérations bancaires et fintech complexes avec des agents IA spécialisés interconnectés.
Vous avez passé plus de cinq ans à construire et diriger l’apprentissage automatique chez Monzo avant de co-fonder Gradient Labs en 2023. Qu’avez‑vous constaté directement chez Monzo qui vous a convaincu qu’il existait une opportunité de créer une nouvelle entreprise autour d’agents IA autonomes, et pourquoi l’arrivée des grands modèles de langage a‑t‑elle rendu cette opportunité possible ?
Chez Monzo, j’ai passé des années à construire des systèmes d’IA qui devaient fonctionner dans un environnement réglementé, où les erreurs ont des conséquences bien réelles et où tout nécessite une traçabilité. Ce qui m’a le plus influencé, c’est le besoin de développer une infrastructure sur mesure, car aucune solution pré‑existante ne pouvait fonctionner en toute sécurité sous ces contraintes strictes. Cette expérience m’a laissé deux convictions. La première était que la technologie pouvait enfin libérer les banques du fardeau opérationnel qui freine l’industrie depuis des décennies. La seconde était que l’IA généraliste et horizontale ne ferait pas de différence — la nuance du travail réglementé est trop spécifique. Lorsque les grands modèles de langage sont devenus suffisamment capables de raisonner à travers des interactions client multi‑étapes, parfois ambiguës, il a commencé à être possible de créer des agents capables de gérer des flux de travail réglementés de bout en bout, plutôt que de simplement assister un humain. Cet écart, entre ce dont les entreprises réglementées ont réellement besoin et ce qui existait déjà, est la raison pour laquelle nous avons lancé Gradient Labs et pourquoi nous misons sur une IA verticale construite spécifiquement pour la finance.
Vous avez décrit ce que les consommateurs vivent comme le « bord irrégulier de l’expérience » : un agent IA peut accomplir une tâche extraordinairement complexe tandis qu’un autre système échoue sur quelque chose d’aussi simple que de distinguer un numéro de téléphone d’un nom. Qu’est‑ce qui cause réellement un tel écart dramatique entre les expériences IA alors que les modèles sous‑jacents peuvent être tout aussi performants ?
Je dirais que l’écart dépend davantage de l’ampleur de l’ingénierie appliquée au modèle que de la simple compétence brute du modèle. Si un système échoue sur une tâche simple, comme confondre un numéro de téléphone avec un nom, cela signifie qu’il n’a pas investi dans le cadre qui l’entoure, tel que la validation, la logique de repli, la gestion de données structurées, etc. L’agent le plus impressionnant a probablement été conçu précisément pour sa tâche. C’est la même famille de modèles fondamentaux, mais avec un niveau de rigueur totalement différent, et c’est exactement ce qui crée le bord irrégulier.
Alors que les modèles de pointe continuent de s’améliorer, pourquoi les échecs d’IA apparemment basiques persistent‑ils ? S’agit‑il principalement de limites des modèles eux‑mêmes, ou d’échecs dans l’architecture du système environnant, les données, les flux de travail, l’évaluation et la conception du produit ?
C’est principalement le système et non le modèle. Les modèles de pointe continuent de s’améliorer en matière de raisonnement. Cependant, les entreprises les intègrent souvent à des systèmes qui n’ont pas été développés pour des comportements basés sur la probabilité. Il existe des intégrations fragiles et des données incomplètes dans les systèmes, sans véritable boucle d’évaluation avant le déploiement des changements. Ainsi, un échec d’IA basique en production n’est pas vraiment un échec d’IA, mais un manque d’investissement dans l’évaluation, la surveillance et les processus de conception des flux de travail.
De nombreuses entreprises semblent optimiser le service client IA autour de la rapidité, de la résolution ou de la déviation des tickets. Quels indicateurs les entreprises devraient‑elles utiliser à la place si elles veulent mesurer si un agent IA améliore réellement l’expérience client ?
Pour cela, nous devons prendre en compte la précision de résolution. La rapidité et la limitation sont utilisées pour évaluer si vous avez pu raccrocher le client, pas si vous avez pu résoudre son problème. La précision de résolution, qui devrait être utilisée pour mesurer la capacité d’un agent IA, tiendra compte du fait que l’agent a fait le bon choix, plutôt que de simplement répondre rapidement. Cela fonctionnera conjointement avec d’autres indicateurs tels que les taux de contacts répétés, le volume des plaintes et la fréquence à laquelle un humain doit intervenir par la suite. Vous saurez que vous optimisez le mauvais résultat si le taux de déviation augmente, mais que les contacts répétés et les plaintes augmentent également.
Gradient Labs se concentre sur les services financiers réglementés, où une réponse incorrecte peut avoir des conséquences bien plus importantes qu’une erreur typique du service client. Comment déterminez‑vous quand un agent IA est suffisamment fiable pour gérer de façon autonome des processus touchant des domaines tels que le prêt, les litiges, l’onboarding ou les vérifications Know Your Customer ?
La voie par défaut que la plupart des équipes préfèrent est celle du copilote : quelqu’un approuve chaque action parce que cela semble plus sûr. Et la plupart supposent que c’est effectivement plus sûr. Mais en réalité, alors que l’IA obtient la plupart des réponses correctes, les réviseurs valident les choses sans vraiment vérifier, et la sécurité est tout de même perdue. Cela ne contribue en rien à réduire la charge de travail existante. Cela ne fait que l’accélérer et diminuer la valeur obtenue.
C’est pourquoi la notion d’un agent IA suffisamment fiable est très spécifique aux processus chez Gradient Labs. Pour nous, elle doit être développée à travers une autonomie progressive et ne doit pas être considérée comme un simple objectif à cocher. Un agent ne peut se voir accorder une plus grande indépendance sur des tâches comme le KYC ou les litiges qu’après avoir été évalué par rapport à un vaste ensemble vivant de cas réels, avec une révision humaine d’un échantillon de ses décisions même après son déploiement en production. Fait intéressant, cela confirme que la réversibilité compte réellement ici. Si quelque chose peut être annulé, il gagnera en autonomie plus rapidement qu’un élément qui ne le peut pas.
Les garde‑fous sont de plus en plus présentés comme la solution pour rendre les agents IA plus sûrs, mais ajouter davantage de règles peut également rendre les systèmes rigides ou les empêcher d’accomplir des tâches légitimes. Comment équilibrer autonomie et garde‑fous sans réduire un agent à un autre chatbot fortement contraint ?
L’erreur consiste à considérer les garde‑fous comme un mur contre lequel l’agent rebondit simplement. Dans notre système, ils remplissent deux fonctions simultanément. Nous appliquons des garde‑fous à chaque tour de conversation — certains examinent ce que le client dit, afin de détecter des vulnérabilités, des difficultés financières ou une plainte, et d’autres vérifient ce que l’agent s’apprête à dire, pour garantir la conformité. Mais lorsqu’un garde‑fous se déclenche, il ne se contente pas de bloquer : il redirige l’agent vers la bonne procédure, et cette décision est transparente dans le raisonnement de l’agent, de sorte que les opérateurs peuvent voir pourquoi il a agi ainsi. Les garde‑fous plus profonds sont également intégrés à la façon dont l’agent apprend à aborder une tâche, aux données auxquelles il peut accéder et aux outils qu’il peut utiliser. Cette combinaison permet de le garder sûr sans le rendre rigide : l’agent comprend quels sont les garde‑fous et pourquoi ils existent, il accomplit donc une tâche légitime au lieu de refuser tout ce qui ressemble simplement à une action interdite.
Ici, je pense que le problème vient de la perception des garde‑fous comme un mur de briques contre lequel l’agent rebondit. Plus précisément, nous exécutons deux types différents de garde‑fous à chaque tour de conversation. D’abord, nous avons les garde‑fous clients qui examinent ce que le client dit et sont censés détecter les vulnérabilités, les difficultés financières, les plaintes des clients, etc. Ensuite, nous avons les garde‑fous agents qui fonctionnent à l’inverse et vérifient ce que l’agent va dire avant d’envoyer le message, afin d’en assurer la conformité.
Cela signifie qu’au lieu de bloquer complètement une action lorsqu’un de ces garde‑fous se déclenche, il la redirigera vers le bon chemin. Ainsi, il maintient la transparence des processus de décision de l’agent et fournit aux opérateurs humains la raison de cette action.
Nous pouvons également le faire parce que chaque aspect du processus de raisonnement d’un agent n’est pas obligé de passer par un LLM. Des garde‑fous comme ceux‑ci sont déterministes, car ils ne se déclenchent pas seulement à la fin d’une conversation, mais tout au long de la vie de l’agent. C’est ainsi que nous pouvons faire confiance à l’agent pour des communications sensibles et permettre la personnalisation d’agents spécifiques pour des cas d’usage à grande échelle et de manière prévisible.
Ce qui importe le plus, c’est la façon dont l’agent est formé à réfléchir à une tâche dès le départ, en veillant à ce qu’il puisse accéder aux données pertinentes et connaître les outils qu’il doit utiliser. Cette capacité de l’agent à accomplir une tâche légitime plutôt que de refuser tout ce qui semble non autorisé contribue à améliorer la sécurité et à éviter la rigidité.
Où les humains doivent‑ils rester dans la boucle à mesure que les agents IA deviennent de plus en plus autonomes ? Existe‑t‑il certaines décisions ou interactions client que vous estimez devoir toujours nécessiter un jugement humain, quel que soit le niveau de capacité des modèles sous‑jacents ?
Un humain doit intervenir si une décision nécessite une discrétion honnête, a des répercussions importantes pour le client, ou concerne un résultat que l’agent n’a pas encore été évalué. L’humain n’a pas forcément à tout faire, mais il doit réviser ou approuver selon les besoins. Cela sera probablement vrai même à mesure que les modèles deviennent plus performants, car il s’agit souvent moins d’une question de capacité que de responsabilité et du droit du client à un décideur humain lorsque des questions telles que les résultats de crédit ou les litiges sont en jeu.
Un humain doit intervenir si une décision nécessite une discrétion honnête, a des répercussions importantes pour le client, ou concerne un résultat que l’agent n’a pas encore été évalué. J’irais même un peu plus loin que le modèle de repli habituel pour soutenir que les agents gagnent progressivement leur place dans l’organigramme aux côtés des humains. En retour, cela déplace les efforts humains vers les escalades et les jugements, laissant les agents gérer la coordination et le routage.
Mais pour que cela fonctionne réellement, les agents ont besoin du même contexte institutionnel qu’un humain, afin de savoir qui impliquer dans tel problème et à quel moment. C’est pourquoi nous avons créé Collaborate. Pour permettre aux opérateurs, ingénieurs et agents de travailler ensemble en tant que pairs, avec le contrôle de version, les évaluations et l’apprentissage continu au cœur du processus. Cela garantit que les humains restent pleinement dans la boucle, et que la boucle change simplement de forme pour tenir compte de la façon dont l’agent et l’humain se coordonnent.
Gradient Labs s’est concentré sur des agents spécialisés conçus pour des flux de travail spécifiques aux services financiers plutôt que sur un seul agent à usage général. Pensez‑vous que l’avenir de l’IA d’entreprise sera principalement constitué de réseaux d’agents spécialisés, ou que des modèles de fond de plus en plus performants rendront cette spécialisation moins importante ?
Je pense que même si les modèles de base s’améliorent, la spécialisation reste importante. Les clients ne paieront pas seulement pour un modèle intelligent, mais pour une évaluation spécifique au flux de travail, des garde‑fous et une intégration des données construits autour de celui‑ci. Et ce travail ne disparaît pas simplement parce que le modèle sous‑jacent s’améliore. J’imagine cela comme un réseau d’agents spécialisés tous construits sur un modèle de base commun et solide, plutôt qu’un seul agent à usage général qui ferait tout.
Les agents d’IA doivent de plus en plus apprendre et s’améliorer après le déploiement, mais dans des environnements réglementés, même un petit changement de comportement peut introduire de nouveaux risques. Comment les entreprises peuvent‑elles améliorer continuellement un agent tout en veillant à ce que les mises à jour ne créent pas de régressions, de problèmes de conformité ou de comportements inattendus ?
Le principe que nous appliquons est que chaque mise à jour est traitée comme une nouvelle version du modèle, et non comme un simple changement de configuration incrémental, de sorte que chaque modification passe par une suite complète d’évaluations avant d’être déployée. Cela comprend des tests de régression exécutés sur des précédents où une erreur aurait fait une réelle différence, et rien n’est mis en production pour tous les clients d’un coup : nous déployons progressivement et surveillons, de sorte que si une dérive commence, nous la détectons sur une portion limitée du trafic plutôt qu’à grande échelle. C’est exactement ce sur quoi repose notre récente version de Collaborate. Collaborate permet aux opérateurs, ingénieurs et à l’agent d’IA de travailler ensemble en tant que pairs sur la même définition vivante de la façon dont l’agent doit raisonner, avec le contrôle de version, les évaluations et l’apprentissage continu intégrés directement dans le flux de travail. Ainsi, lorsqu’une personne améliore la façon dont l’agent gère un cas, ce changement est versionné, testé sur les conversations passées et déployé sous les mêmes contrôles que toute autre version. Cela signifie qu’un agent peut continuer à s’améliorer après le déploiement sans que l’amélioration elle‑même devienne la cause d’une régression ou d’un problème de conformité.
En regardant vers l’avenir, à mesure que l’accès à des modèles de fond puissants devient de plus en plus banalisé, d’où proviendra le véritable avantage concurrentiel dans les applications d’IA ? Les gagnants seront‑ils ceux qui possèdent les meilleurs modèles, ou ceux qui excellent à concevoir des systèmes fiables et à offrir des expériences constamment bonnes autour d’eux ?
Maintenant que de plus en plus de modèles de fond commencent à converger, l’avantage se déplacera presque entièrement en faveur de celui qui est le meilleur pour concevoir des systèmes plus fiables autour de ces modèles, y compris l’évaluation, les garde‑fous, les données et la conception des flux de travail. Le modèle devient une entrée de commodité, mais c’est la cohérence et la fiabilité en production qui constituent le véritable produit.
Au‑delà de cela, je vois l’avantage venir davantage de la profondeur d’intégration d’un agent dans les opérations d’une entreprise. Les agents capables de s’intégrer dans de nombreuses parties des opérations d’une société l’emporteront sur les outils qui ne peuvent gérer que des problèmes spécifiques ou n’atteignent que le front‑office. Lorsqu’un agent peut travailler à la fois sur les systèmes du front‑office et du back‑office, il peut apporter plus de contexte aux interactions et gérer des problèmes plus complexes de bout en bout, tout comme le ferait un humain. La capacité d’un agent à s’adapter à la façon dont une entreprise fonctionne réellement est, à mon avis, la source du succès durable.
Merci pour cette excellente interview, les lecteurs qui souhaitent en savoir plus devraient visiter Gradient Labs.












