Intervjuer
Neal Lathia, medgrundare och CTO för Gradient Labs – Intervjuserie

Neal Lathia, medgrundare och CTO för Gradient Labs, är en ledare inom maskininlärning och datavetenskap med nästan två decennier av erfarenhet som sträcker sig över finansiell teknik, konsumentplattformar och akademisk forskning. Innan han medgrundade Gradient Labs år 2023 tillbringade han mer än fem år på Monzo, där han avancerade från Senior Data Scientist till Direktör för maskininlärning och Chefsmaskininlärningsingenjör, och byggde maskininlärningsinfrastruktur samt hjälpte till att skala disciplinen för att stödja tillämpningar inom drift, finansiell brottslighet och produkt. Tidigare arbetade Lathia som Senior Data Scientist på Skyscanner och hade forskningspositioner vid University of Cambridge och University College London, där hans arbete utforskade rekommendationssystem, beteendedata, smartphonemätning och personliga digitala tjänster. På Gradient Labs leder han nu teknologin bakom AI‑agenter som är utformade för komplexa, reglerade arbetsflöden inom finansiella tjänster.
Gradient Labs är ett AI‑företag baserat i London som bygger specialiserade autonoma agenter för finansiella tjänster, med fokus på att automatisera kundoperationer som traditionellt kräver omfattande mänsklig inblandning. Företaget grundades av tidigare Monzo‑ledare Dimitri Masin, Neal Lathia och Danai Antoniou och utvecklar agenter för områden såsom utlåning och indrivning, tvister, Know Your Business (KYB), onboarding, försäkringsanspråk och kundservice, och fungerar över röst, chatt och e‑post samtidigt som det införlivar efterlevnadsramverk avsedda för reglerade miljöer. Gradient Labs uppger att deras teknik nu betjänar mer än 32 miljoner slutanvändare hos kunder inklusive Wise, Zego, Current, Stash och Rho. I juni 2026 meddelade företaget att de hade utökat sin Series A-finansiering till $26 million som de arbetar mot en bredare vision om att automatisera komplexa bank‑ och fintech‑operationer med sammankopplade specialiserade AI‑agenter.
Du tillbringade mer än fem år med att bygga och leda maskininlärning på Monzo innan du medgrundade Gradient Labs år 2023. Vad såg du på nära håll på Monzo som övertygade dig om att det fanns en möjlighet att starta ett nytt företag kring autonoma AI‑agenter, och varför gjorde ankomsten av stora språkmodeller den möjligheten möjlig?
På Monzo tillbringade jag åratal med att bygga ML‑system som behövde fungera i en reglerad miljö, där misstag får mycket verkliga konsekvenser och allt kräver en revisionsspår. Det som påverkade mig mest var behovet av att utveckla skräddarsydd infrastruktur, eftersom ingen färdig lösning kunde fungera säkert under dessa strikta begränsningar. Den erfarenheten gav mig två övertygelser. Den första var att teknologin äntligen kunde lyfta bankerna från det operativa bördan som har hållt branschen tillbaka i årtionden. Den andra var att generell, horisontell AI inte skulle göra någon märkbar skillnad – nyanserna i reglerat arbete är för specifika. När LLM‑modeller blev tillräckligt kapabla att resonera genom flerstegiga, ibland tvetydiga kundinteraktioner, blev det möjligt att bygga agenter som kunde hantera hela reglerade arbetsflöden från början till slut, snarare än bara assistera en människa. Det gapet, mellan vad reglerade företag faktiskt behövde och vad som redan fanns, är varför vi startade Gradient Labs och varför vi satsade på vertikal AI som är byggd specifikt för finans.
Du har beskrivit vad konsumenter upplever som den ”ojämna kanten av upplevelsen”: en AI‑agent kan utföra en extraordinärt komplex uppgift medan ett annat system misslyckas med något så enkelt som att skilja ett telefonnummer från ett namn. Vad orsakar egentligen ett så dramatiskt gap mellan AI‑upplevelser när de underliggande modellerna kan vara likvärdigt kapabla?
Jag skulle säga att gapet handlar mer om hur mycket ingenjörsarbete som läggs på modellen än om den rena modellkompetensen. Om ett system misslyckas med en enkel uppgift, såsom att förväxla ett telefonnummer med ett namn, betyder det att det inte har investerat i ramverket omkring det, som validering, reservlogik, strukturerad datahantering osv. Den mer imponerande agenten har sannolikt konstruerats exakt för sin uppgift. Det är samma grundläggande modellfamilj men med en helt annan nivå av stringens kring den, och det är precis vad som skapar den ojämna kanten.
Allt eftersom frontier‑modeller fortsätter att förbättras, varför kvarstår till synes grundläggande AI‑fel? Är dessa främst begränsningar i modellerna själva, eller misslyckanden i den omgivande systemarkitekturen, data, arbetsflöden, utvärdering och produktdesign?
Det är främst systemet och inte modellen. Frontier‑modeller fortsätter att förbättras i resonemang. Men företag kopplar ofta dem till system som inte utvecklats för sannolikhetsbaserat beteende. Det finns sköra integrationer och ofullständig data i systemen, utan någon riktig utvärderingsloop innan förändringar släpps. Så ett grundläggande AI‑fel i produktion är egentligen inte ett AI‑fel alls, utan ett misslyckande att investera i utvärdering, övervakning och processer för arbetsflödesdesign.
Många företag verkar optimera AI‑kundservice kring hastighet, hantering eller ticket‑avledning. Vilka mått bör företag använda istället om de vill mäta huruvida en AI‑agent verkligen förbättrar kundupplevelsen?
För detta måste vi överväga upplösningsnoggrannhet. Hastighet och innehållsbegränsning används för att bedöma om du lyckades få en kund av telefonen, inte om du lyckades lösa deras problem. Upplösningsnoggrannhet, som bör användas för att mäta en AI‑agents förmåga, beaktar om agenten gjorde rätt sak, snarare än bara svarade snabbt. Detta samverkar med andra signaler som återkommande kontaktfrekvens, antalet klagomål och hur ofta en människa måste ingripa efteråt. Du vet att du optimerar fel resultat om avledning ökar, men återkommande kontakter och klagomål också ökar.
Gradient Labs fokuserar på reglerade finansiella tjänster, där ett felaktigt svar kan få mycket större konsekvenser än ett typiskt kundservicemisstag. Hur avgör du när en AI‑agent är tillräckligt pålitlig för att autonomt hantera processer inom områden som utlåning, tvister, onboarding eller Know Your Customer‑kontroller?
Den standardväg som de flesta team föredrar är co‑pilot‑modellen: någon godkänner varje åtgärd eftersom det känns säkrare. Och de flesta antar att det är säkrare. Men i verkligheten, när AI:n får de flesta saker rätt, godkänner granskare saker utan att verkligen kontrollera, och säkerheten går ändå förlorad. Detta minskar inte den befintliga arbetsbördan. Det gör bara processen snabbare och minskar det värde du får.
Det är därför begreppet att en AI‑agent är tillräckligt pålitlig är mycket processspecifikt på Gradient Labs. För oss måste den utvecklas genom stegvis autonomi och får inte ses som ett enda mål att bocka av. En agent kan ges större självständighet i exempelvis KYC eller tvister först efter att den har benchmarkats mot en stor, levande uppsättning verkliga fall, med mänsklig granskning av ett urval av dess beslut även efter att den har gått i produktion. Intressant nog bekräftar detta också att reversibilitet verkligen spelar roll här. Om något kan återkallas får det autonomi snabbare än något som inte kan det.
Räcken presenteras i allt högre grad som lösningen för att göra AI‑agenter säkrare, men att lägga till fler regler kan också göra systemen stela eller hindra dem från att slutföra legitima uppgifter. Hur balanserar du autonomi med räcken utan att reducera en agent till en annan starkt begränsad chatbot?
Felet är att behandla räcken som en vägg som agenten bara studsar mot. I vårt system gör de två saker samtidigt. Vi kör räcken på varje enskild tur i en konversation — vissa inspekterar vad kunden säger för att fånga upp saker som sårbarhet, ekonomiska svårigheter eller ett klagomål, och andra inspekterar vad agenten är på väg att säga för att hålla den i linje med regelverket. Men när en av dem aktiveras blockerar den inte bara: den omdirigerar agenten till rätt procedur, och beslutet är transparent i agentens resonemang, så operatörer kan se varför den agerade. De djupare räcken är också inbäddade i hur agenten lär sig tänka kring en uppgift, vilka data den kan komma åt och vilka verktyg den kan använda. Den kombinationen är det som håller den säker utan att göra den stel: agenten förstår vad räcken är och varför de finns, så den slutför en legitim uppgift istället för att avvisa allt som bara liknar en otillåten.
Här tror jag att problemet är att se räcken som en tegelvägg som agenten studsar mot. Mer specifikt kör vi två olika typer av räcken vid varje enskild tur i en konversation. Först har vi kundräcken som inspekterar vad kunden säger och ska upptäcka sårbarheter, ekonomiska svårigheter, kunder som lämnar klagomål och liknande. Därefter har vi agenträcken som fungerar tvärtom och kontrollerar vad agenten kommer att säga innan meddelandet skickas, för att hålla det regelkompatibelt.
Det innebär att i stället för att helt blockera en åtgärd när ett av dessa räcken aktiveras, omdirigeras den till rätt väg. På så sätt bibehålls transparensen kring agentens beslutsprocesser och mänskliga operatörer får anledning till varför åtgärden vidtogs.
Vi kan också göra detta eftersom inte varje aspekt av en agents resonemangsprocess tvingas gå igenom en LLM. Räcken som dessa är deterministiska eftersom de inte bara aktiveras i slutet av en konversation, utan triggas under hela agentens livstid. Så här kan vi lita på agenten med känslig kommunikation och möjliggöra anpassning av specifika agenter för användningsfall i skala och på ett förutsägbart sätt.
Det som är viktigast är hur agenten lärs att tänka igenom en uppgift från början, så att den kan komma åt relevant data och veta vilka verktyg den behöver använda. Denna förmåga för agenten att slutföra en legitim uppgift istället för att vägra ta på sig något som verkar otillåtet är det som förbättrar säkerheten och undviker stelhet.
Var bör människor förbli i loopen när AI‑agenter blir allt mer autonoma? Finns det vissa beslut eller kundinteraktioner som du anser bör fortsätta kräva mänskligt omdöme oavsett hur kapabla de underliggande modellerna blir?
En människa måste vara involverad om ett beslut kräver ärlig diskretion, har betydande konsekvenser för kunden, eller rör ett resultat som agenten ännu inte har utvärderats mot. Människan behöver inte nödvändigtvis göra hela arbetet, men bör granska eller godkänna vid behov. Detta gäller troligen även när modeller blir mer kapabla, eftersom det ofta handlar mindre om förmåga än om ansvar och kundens rätt till en mänsklig beslutsfattare när frågor som kreditresultat eller tvister är inblandade.
En människa måste vara involverad om ett beslut kräver ärlig diskretion, har betydande konsekvenser för kunden, eller rör ett resultat som agenten ännu inte har utvärderats mot. Jag skulle gå ännu längre än den vanliga fallback-modellen och hävda att agenter alltmer får en plats i organisationsschemat bredvid människor. Detta skiftar i sin tur var mänskliga insatser i hög grad riktas mot eskaleringar och bedömningsbeslut, medan agenterna hanterar samordnings- och routningsarbetet.
Men för att detta verkligen ska lyckas behöver agenter samma institutionella kontext som en människa har, så att de vet vem de ska involvera i specifika frågor och när. Därför byggde vi Collaborate. För att låta operatörer, ingenjörer och agenter arbeta tillsammans som jämlikar med versionskontroll, utvärderingar och kontinuerligt lärande i centrum. Detta säkerställer att människor förblir helt i loopen, och loopen förändras bara i form för att anpassa sig till hur väl agenten och människan samordnas.
Gradient Labs har fokuserat på specialistagenter utformade för specifika arbetsflöden inom finansiella tjänster snarare än en enda allmän agent. Tror du att framtidens företags‑AI främst kommer bestå av nätverk av specialiserade agenter, eller att alltmer kapabla grundmodeller så småningom gör specialiseringen mindre viktig?
Jag tror att även när basmodeller förbättras, så är specialisering fortfarande viktig. Folk kommer inte bara betala för en smart modell, utan för utvärdering som är specifik för arbetsflödet, skyddsmekanismer och dataintegration kring den. Och det arbetet försvinner inte bara för att den underliggande modellen blir bättre. Jag ser det som ett nätverk av specialistagenter byggda på en gemensam och stark basmodell snarare än en allmän agent som gör allt.
AI‑agenter måste i allt högre grad lära sig och förbättras efter driftsättning, men i reglerade miljöer kan även en liten beteendeförändring medföra nya risker. Hur kan företag kontinuerligt förbättra en agent samtidigt som de säkerställer att uppdateringar inte skapar regressioner, efterlevnadsproblem eller oväntat beteende?
Principen vi arbetar efter är att varje uppdatering behandlas som en ny modellrelease, inte som en inkrementell konfigurationsändring, så varje förändring går igenom en fullständig utvärderingssvit innan den levereras. Det inkluderar regressionstester mot tidigare fall där ett misstag skulle ha gjort en verklig skillnad, och inget rullas ut till alla kunder på en gång: vi lanserar gradvis och övervakar, så att om drift uppstår fångas den på en begränsad del av trafiken snarare än i full skala. Detta är exakt vad vår senaste Collaborate‑release bygger på. Collaborate låter operatörer, ingenjörer och AI‑agenten arbeta tillsammans som jämlikar på samma levande definition av hur agenten ska tänka, med versionskontroll, utvärderingar och kontinuerligt lärande inbäddat i arbetsflödet. Så när någon förbättrar hur agenten hanterar ett ärende, versioneras förändringen, testas mot tidigare konversationer och rullas ut under samma kontroller som någon annan release. Det innebär att en agent kan bli bättre efter driftsättning utan att förbättringen i sig blir den faktor som introducerar en regression eller ett efterlevnadsproblem.
Ser vi framåt, när tillgången till kraftfulla grundmodeller blir alltmer standardiserad, varifrån kommer den verkliga konkurrensfördelen i AI‑applikationer? Kommer vinnarna vara de med de bästa modellerna, eller de som är bäst på att konstruera pålitliga system och leverera konsekvent goda upplevelser kring dem?
Nu när fler och fler grundmodeller börjar konvergera kommer fördelen nästan helt att gå till den som är bäst på att bygga mer pålitliga system kring dessa modeller, inklusive utvärdering, skyddsmekanismer, data och arbetsflödesdesign. Modellen blir en standardiserad insats, men det är konsistens och pålitlighet i produktion som blir den faktiska produkten.
Även bortom det ser jag fördelen komma mer från hur djupt en agent har integrerats i ett företags verksamhet. Agenter som kan embeddas i många olika delar av ett företags processer kommer att vinna över verktyg som bara kan hantera specifika problem eller bara nå frontlinjen. När en agent kan arbeta både i frontlinje‑ och backoffice‑system kan den tillföra mer kontext till interaktioner och hantera mer komplexa problem end‑to‑end, precis som en människa. Att en agent kan anpassas till hur ett företag faktiskt arbetar är där jag förväntar mig att den bestående vinsten kommer ifrån.
Tack för den fantastiska intervjun, läsare som vill veta mer bör besöka Gradient Labs.












