Entrevistas
Neal Lathia, cofundador y CTO de Gradient Labs – Serie de entrevistas

Neal Lathia, cofundador y CTO de Gradient Labs, es un líder en aprendizaje automático y ciencia de datos con casi dos décadas de experiencia que abarca tecnología financiera, plataformas de consumo e investigación académica. Antes de cofundar Gradient Labs en 2023, pasó más de cinco años en Monzo, ascendiendo de Científico de datos senior a Director de aprendizaje automático y Ingeniero de aprendizaje automático senior, donde construyó la infraestructura de aprendizaje automático y ayudó a escalar la disciplina para respaldar aplicaciones en operaciones, crimen financiero y producto. Anteriormente, Lathia trabajó como Científico de datos senior en Skyscanner y ocupó puestos de investigación en la University of Cambridge y University College London, donde su trabajo exploró sistemas de recomendación, datos de comportamiento, detección mediante smartphones y servicios digitales personalizados. En Gradient Labs, ahora lidera la tecnología detrás de los agentes de IA diseñados para flujos de trabajo financieros regulados y complejos.
Gradient Labs es una empresa de IA con sede en Londres que crea agentes autónomos especializados para servicios financieros, centrada en automatizar operaciones de cliente que tradicionalmente requieren una considerable intervención humana. Fundada por exlíderes de Monzo, Dimitri Masin, Neal Lathia y Danai Antoniou, la compañía desarrolla agentes para áreas que incluyen préstamos y cobros, disputas, Know Your Business (KYB), incorporación, reclamaciones de seguros y atención al cliente, operando a través de voz, chat y correo electrónico mientras incorpora barreras de cumplimiento diseñadas para entornos regulados. Gradient Labs afirma que su tecnología ahora atiende a más de 32 millones de usuarios finales entre clientes como Wise, Zego, Current, Stash y Rho. En junio de 2026, la empresa anunció que había ampliado su financiación Serie A a $26 millones mientras avanza hacia una visión más amplia de automatizar operaciones bancarias y fintech complejas con agentes de IA especializados e interconectados.
Pasaste más de cinco años construyendo y liderando el aprendizaje automático en Monzo antes de cofundar Gradient Labs en 2023. ¿Qué viste de primera mano en Monzo que te convenció de que había una oportunidad para crear una nueva empresa centrada en agentes de IA autónomos, y por qué la llegada de los grandes modelos de lenguaje hizo posible esa oportunidad?
En Monzo, pasé años construyendo sistemas de aprendizaje automático que debían operar en un entorno regulado, donde los errores tienen consecuencias muy reales y todo requiere una cadena de auditoría. Lo que más me influyó fue la necesidad de desarrollar una infraestructura a medida, porque nada prefabricado podía funcionar de manera segura bajo esas estrictas limitaciones. Esa experiencia me dejó dos convicciones. La primera fue que la tecnología podría finalmente liberar a los bancos de la carga operativa que ha frenado a la industria durante décadas. La segunda fue que la IA de propósito general y horizontal no tendría un impacto significativo — el matiz del trabajo regulado es demasiado específico. Cuando los LLM alcanzaron la capacidad suficiente para razonar a través de interacciones con clientes de varios pasos, a veces ambiguas, empezó a ser posible crear agentes que pudieran gestionar flujos de trabajo regulados completos de extremo a extremo, en lugar de simplemente asistir a un humano. Esa brecha, entre lo que realmente necesitan las empresas reguladas y lo que ya existía, es la razón por la que fundamos Gradient Labs y por la que apostamos por una IA vertical construida específicamente para finanzas.
Has descrito lo que los consumidores están experimentando como el “borde irregular de la experiencia”: un agente de IA puede realizar una tarea extraordinariamente compleja mientras otro sistema falla en algo tan simple como distinguir un número de teléfono de un nombre. ¿Qué causa realmente esa brecha tan dramática entre experiencias de IA cuando los modelos subyacentes pueden ser igualmente capaces?
Diría que la brecha tiene más que ver con la cantidad de ingeniería que se incorpora al modelo que con la competencia bruta del modelo en sí. Si un sistema falla en una tarea sencilla, como confundir un número de teléfono con un nombre, significa que no ha invertido en el marco que lo rodea, como la validación, la lógica de respaldo, el manejo de datos estructurados, etc. El agente más impresionante probablemente ha sido diseñado precisamente para su tarea. Es la misma familia de modelos fundamental con un nivel de rigurosidad completamente diferente, y eso es exactamente lo que genera el borde irregular.
A medida que los modelos de frontera continúan mejorando, ¿por qué persisten fallas aparentemente básicas de la IA? ¿Son estas limitaciones principalmente de los propios modelos, o fallas en la arquitectura del sistema circundante, los datos, los flujos de trabajo, la evaluación y el diseño del producto?
Principalmente es el sistema y no el modelo. Los modelos de frontera siguen mejorando en razonamiento. Sin embargo, las empresas a menudo los acoplan a sistemas que no fueron desarrollados para comportamientos basados en probabilidades. Hay integraciones frágiles y datos incompletos en los sistemas, sin un bucle de evaluación real antes de que se implementen los cambios. Por lo tanto, una falla básica de IA en producción no es realmente una falla de IA, sino una falta de inversión en procesos de evaluación, monitoreo y diseño de flujos de trabajo.
Muchas empresas parecen optimizar el servicio al cliente de IA en torno a la velocidad, la contención o la desviación de tickets. ¿Qué métricas deberían usar en su lugar si quieren medir si un agente de IA está mejorando genuinamente la experiencia del cliente?
Para ello, tendríamos que considerar la precisión de la resolución. La velocidad y la contención se utilizan para evaluar si se logró sacar al cliente del teléfono, no si se logró resolver su problema. La precisión de la resolución, que debería usarse para medir la capacidad de un agente de IA, considerará si el agente hizo lo correcto, en lugar de simplemente responder rápido. Esto se combinará con otras señales como las tasas de contactos repetidos, el volumen de quejas y la frecuencia con la que un humano debe intervenir después. Sabrá que está optimizando el resultado equivocado si la desviación aumenta, pero también lo hacen los contactos repetidos y las quejas.
Gradient Labs se centra en servicios financieros regulados, donde una respuesta incorrecta puede tener consecuencias mucho mayores que un error típico de atención al cliente. ¿Cómo determina cuándo un agente de IA es lo suficientemente fiable como para manejar de forma autónoma procesos que involucren áreas como préstamos, disputas, incorporación o verificaciones Know Your Customer?
La ruta predeterminada que la mayoría de los equipos prefieren es la del copiloto: alguien aprueba cada acción porque parece más seguro. Y la mayoría asumiría que es más seguro. Pero, en realidad, a medida que la IA acierta la mayor parte de las cosas, los revisores aprueban sin comprobar realmente, y la seguridad se pierde de todos modos. Esto no reduce la carga de trabajo existente; simplemente lo hace más rápido y disminuye el valor que se obtiene.
Por eso, el concepto de que un agente de IA sea lo suficientemente fiable es bastante específico de proceso en Gradient Labs. Para nosotros, debe desarrollarse mediante autonomía escalonada y no verse como un único objetivo a marcar. Un agente puede recibir mayor independencia en tareas como KYC o disputas solo después de haber sido comparado con un amplio conjunto vivo de casos reales, con revisión humana de una muestra de sus decisiones incluso después de haber entrado en producción. Curiosamente, esto confirma que la reversibilidad también es realmente importante aquí. Si algo puede deshacerse, ganará autonomía más rápido que algo que no puede.
Los guardarraíles se presentan cada vez más como la solución para hacer que los agentes de IA sean más seguros, pero añadir más reglas también puede volver los sistemas rígidos o impedir que completen tareas legítimas. ¿Cómo equilibras la autonomía con los guardarraíles sin reducir al agente a otro chatbot altamente restringido?
El error es tratar los guardarraíles como una pared contra la que el agente simplemente rebota. En nuestro sistema, hacen dos cosas a la vez. Ejecutamos guardarraíles en cada turno de una conversación: algunos inspeccionan lo que el cliente está diciendo, para detectar vulnerabilidad, dificultad financiera o una queja, y otros inspeccionan lo que el agente está a punto de decir, para mantener el cumplimiento. Pero cuando uno se activa, no solo bloquea: redirige al agente al procedimiento correcto, y esa decisión es transparente en el razonamiento del agente, de modo que los operadores pueden ver por qué actuó. Los guardarraíles más profundos también están integrados en cómo se enseña al agente a pensar en una tarea, los datos a los que puede acceder y las herramientas que puede usar. Esa combinación es lo que lo mantiene seguro sin hacerlo rígido: el agente entiende qué son los guardarraíles y por qué existen, por lo que completa una tarea legítima en lugar de rechazar cualquier cosa que solo se parezca a una prohibida.
Aquí, creo que el problema es ver los guardarraíles como una pared de ladrillos contra la que el agente rebota. Más específicamente, ejecutamos dos tipos diferentes de guardarraíles en cada turno de una conversación. Primero, tenemos los guardarraíles del cliente que inspeccionan lo que el cliente dice y deben detectar vulnerabilidades, dificultades financieras, quejas y similares. Segundo, tenemos los guardarraíles del agente que funcionan al revés y verifican lo que el agente dirá antes de enviar el mensaje, para mantener el cumplimiento.
Esto significa que, en lugar de bloquear completamente una acción cuando se activa uno de estos guardarraíles, se redirige al camino correcto. De esta forma, se mantiene la transparencia respecto a los procesos de toma de decisiones del agente y se brinda a los operadores humanos la razón de la acción tomada.
También podemos hacerlo porque no todo el proceso de razonamiento de un agente está obligado a pasar por un LLM. Guardarraíles como estos son determinísticos porque no solo se activan al final de una conversación, sino que lo hacen a lo largo de la vida del agente. Así es como podemos confiar en el agente para comunicaciones sensibles y permitir la personalización de agentes específicos para casos de uso a gran escala y de manera predecible.
Lo que más importa es cómo se enseña al agente a pensar en una tarea desde el principio, asegurando que pueda acceder a los datos relevantes y conozca las herramientas que necesita usar. Esta capacidad del agente para completar una tarea legítima en lugar de negarse a asumir algo que parece no permitido es lo que ayuda a mejorar la seguridad y evitar la rigidez.
¿En qué momentos los humanos deben seguir estando en el bucle a medida que los agentes de IA se vuelven cada vez más autónomos? ¿Existen decisiones o interacciones con clientes que usted considera que deben seguir requiriendo juicio humano, sin importar cuán capaces se vuelvan los modelos subyacentes?
Se necesita la intervención humana si una decisión requiere discreción honesta, tiene repercusiones significativas para el cliente, o tiene que ver con un resultado contra el cual el agente aún no ha sido evaluado. No es necesario que el humano haga todo, pero debe revisar o aprobar según sea necesario. Probablemente esto siga siendo cierto a medida que los modelos se vuelvan más capaces, porque a menudo no se trata de una cuestión de capacidad, sino de responsabilidad y del derecho del cliente a un tomador de decisiones humano cuando están involucrados resultados de crédito o disputas.
Se necesita la intervención humana si una decisión requiere discreción honesta, tiene repercusiones significativas para el cliente, o tiene que ver con un resultado contra el cual el agente aún no ha sido evaluado. Incluso iría un paso más allá del modelo típico de retroceso para argumentar que los agentes están ganando cada vez más su lugar en el organigrama junto a los humanos. A su vez, esto está desplazando los esfuerzos humanos hacia escaladas y decisiones de juicio, dejando a los agentes manejar la coordinación y el enrutamiento.
Pero para que esto sea realmente exitoso, los agentes necesitan el mismo contexto institucional que tendría un humano, de modo que sepan a quién involucrar en ciertos problemas y en qué momento. Por eso creamos Collaborate. Para permitir que operadores, ingenieros y agentes trabajen juntos como pares, con control de versiones, evaluaciones y aprendizaje continuo en el centro. Esto garantiza que los humanos permanezcan totalmente en el bucle, y el bucle simplemente cambie de forma para tener en cuenta cuán bien coordinan el agente y el humano.
Gradient Labs se ha centrado en agentes especializados diseñados para flujos de trabajo específicos de servicios financieros, en lugar de un único agente de propósito general. ¿Crees que el futuro de la IA empresarial consistirá principalmente en redes de agentes especializados, o que los modelos de base cada vez más capaces acabarán haciendo que esa especialización sea menos importante?
Creo que incluso a medida que los modelos base mejoren, la especialización sigue siendo importante. La gente no pagará solo por un modelo inteligente, sino por una evaluación específica al flujo de trabajo, barreras de seguridad y la integración de datos construida alrededor de él. Y ese trabajo no desaparece solo porque el modelo subyacente mejore. Yo lo vería como una red de agentes especializados construidos sobre un modelo base común y sólido, en lugar de un único agente de propósito general que lo haga todo.
Los agentes de IA cada vez necesitan aprender y mejorar después del despliegue, pero en entornos regulados incluso un pequeño cambio de comportamiento puede introducir nuevos riesgos. ¿Cómo pueden las empresas mejorar continuamente un agente asegurándose de que las actualizaciones no generen regresiones, problemas de cumplimiento o comportamientos inesperados?
El principio con el que trabajamos es que cada actualización se trata como un nuevo lanzamiento de modelo, no como un cambio incremental de configuración, de modo que cada cambio pasa por una suite completa de evaluaciones antes de ser enviado. Eso incluye pruebas de regresión contra precedentes donde un error habría marcado una diferencia real, y nada se despliega a todos los clientes de una vez: lo lanzamos gradualmente y lo monitorizamos, de modo que si comienza a producirse desviación lo detectamos en una porción limitada del tráfico en lugar de a gran escala. Esto es exactamente en lo que se basa nuestro reciente lanzamiento de Collaborate. Collaborate permite que operadores, ingenieros y el agente de IA trabajen juntos como pares en la misma definición viva de cómo debe pensar el agente, con control de versiones, evaluaciones y aprendizaje continuo integrados directamente en el flujo de trabajo. Así, cuando alguien mejora la forma en que el agente maneja un caso, ese cambio se versiona, se prueba contra conversaciones pasadas y se despliega bajo los mismos controles que cualquier otro lanzamiento. Significa que un agente puede seguir mejorando después del despliegue sin que la propia mejora sea lo que introduzca una regresión o un problema de cumplimiento.
Mirando hacia el futuro, a medida que el acceso a potentes modelos de base se vuelve cada vez más commoditizado, ¿de dónde provendrá la verdadera ventaja competitiva en aplicaciones de IA? ¿Serán los ganadores aquellos con los mejores modelos, o aquellos que mejor sepan diseñar sistemas fiables y ofrecer experiencias consistentemente buenas alrededor de ellos?
Ahora que cada vez más modelos de base comienzan a converger, la ventaja se desplazará casi por completo a favor de quien sea mejor en diseñar sistemas más fiables alrededor de estos modelos, incluyendo evaluación, barreras de seguridad, datos y diseño de flujos de trabajo. El modelo se está convirtiendo en una entrada commoditizada, pero la consistencia y la fiabilidad en producción son el verdadero producto.
Incluso más allá de eso, veo que la ventaja provendrá más de cuán profundamente un agente se haya integrado en las operaciones de una empresa. Los agentes que tengan la capacidad de integrarse en muchas partes diferentes de las operaciones de una compañía ganarán frente a herramientas que solo pueden abordar problemas específicos o solo llegar a la primera línea. Cuando un agente puede trabajar tanto en sistemas de primera línea como de back‑office, puede aportar más contexto a las interacciones y manejar problemas más complejos de extremo a extremo, al igual que lo haría un humano. La capacidad de un agente de encajar con la forma en que una empresa realmente funciona es donde espero que provenga la victoria duradera.
Gracias por la excelente entrevista, los lectores que deseen saber más deberían visitar Gradient Labs.












