Interviews
Neal Lathia, medstifter og CTO for Gradient Labs – Interviewserie

Neal Lathia, medstifter og CTO for Gradient Labs, er en leder inden for maskinlæring og datavidenskab med næsten to årtiers erfaring inden for finansiel teknologi, forbrugerplatforme og akademisk forskning. Før han medstiftede Gradient Labs i 2023, tilbragte han mere end fem år hos Monzo, hvor han avancerede fra Senior Data Scientist til Director of Machine Learning og Staff Machine Learning Engineer, og hvor han byggede maskinlæringsinfrastruktur og hjalp med at skalere disciplinen til at understøtte applikationer inden for drift, økonomisk kriminalitet og produkt. Tidligere arbejdede Lathia som Senior Data Scientist hos Skyscanner og havde forskningsstillinger ved University of Cambridge og University College London, hvor hans arbejde udforskede anbefalingssystemer, adfærdsdata, smartphonesensorik og personlige digitale tjenester. Hos Gradient Labs leder han nu teknologien bag AI‑agenter designet til komplekse, regulerede arbejdsprocesser inden for finansielle tjenester.
Gradient Labs er et AI‑firma med base i London, der bygger specialiserede autonome agenter til finansielle tjenester, med fokus på at automatisere kundedrift, som traditionelt kræver betydelig menneskelig involvering. Virksomheden blev grundlagt af de tidligere Monzo‑ledere Dimitri Masin, Neal Lathia og Danai Antoniou, og udvikler agenter til områder som udlån og inddrivelse, tvister, Know Your Business (KYB), onboarding, forsikringskrav og kundeservice, som opererer på stemme, chat og e‑mail, samtidig med at de indarbejder overholdelses‑sikkerhedsforanstaltninger designet til regulerede miljøer. Gradient Labs siger, at deres teknologi nu betjener mere end 32 millioner slutbrugere hos kunder som Wise, Zego, Current, Stash og Rho. I juni 2026 annoncerede virksomheden, at de havde udvidet deres Series A‑finansiering til $26 millioner, mens de arbejder mod en bredere vision om at automatisere komplekse bank‑ og fintech‑operationer med sammenkoblede specialiserede AI‑agenter.
Du tilbragte mere end fem år med at bygge og lede maskinlæring hos Monzo, før du medstiftede Gradient Labs i 2023. Hvad så du på første hånd hos Monzo, som overbeviste dig om, at der var en mulighed for at bygge en ny virksomhed omkring autonome AI‑agenter, og hvorfor gjorde ankomsten af store sprogmodeller denne mulighed mulig?
På Monzo tilbragte jeg år med at bygge ML‑systemer, der skulle fungere i et reguleret miljø, hvor fejl har meget reelle konsekvenser, og alt kræver et revisionsspor. Det, der påvirkede mig mest, var behovet for at udvikle skræddersyet infrastruktur, fordi ingen færdiglavet løsning kunne fungere sikkert under så strenge rammer. Denne erfaring gav mig to overbevisninger. Den første var, at teknologi endelig kunne løfte bankerne fra den operationelle byrde, der har holdt branchen tilbage i årtier. Den anden var, at generel, tværgående AI ikke ville gøre en forskel – nuancen i reguleret arbejde er for specifik. Da LLM‑erne blev i stand til at resonere gennem flertrins‑, til tider tvetydige kundesamtaler, blev det muligt at bygge agenter, der kunne håndtere hele regulerede arbejdsprocesser fra ende til ende, i stedet for blot at assistere et menneske. Det hul, mellem hvad regulerede virksomheder faktisk har brug for, og hvad der allerede findes, er grunden til, at vi startede Gradient Labs, og hvorfor vi satser på vertikal AI, der er bygget specifikt til finans.
Du har beskrevet, hvad forbrugerne oplever som “den ujævne kant af oplevelsen”: en AI‑agent kan udføre en ekstraordinært kompleks opgave, mens et andet system fejler på noget så simpelt som at skelne et telefonnummer fra et navn. Hvad forårsager egentlig et så dramatisk gab mellem AI‑oplevelser, når de underliggende modeller kan være lige så kompetente?
Jeg vil sige, at gabet mere handler om, hvor meget ingeniørarbejde der lægges i modellen, end om den rå modelkompetence. Hvis et system fejler på en simpel opgave, som at forveksle et telefonnummer med et navn, betyder det, at der ikke er investeret i rammerne omkring det, såsom validering, fallback‑logik, struktureret databehandling osv. Den mere imponerende agent er sandsynligvis designet præcis til sin opgave. Det er den samme grundlæggende modelfamilie med en helt anden grad af stringens omkring den, og det er netop, hvad der skaber den ujævne kant.
Efterhånden som frontier‑modeller fortsætter med at forbedre sig, hvorfor vedvarer tilsyneladende grundlæggende AI‑fejl? Er disse primært begrænsninger i modellerne selv, eller fejl i den omgivende systemarkitektur, data, arbejdsprocesser, evaluering og produktdesign?
Det er primært systemet og ikke modellen. Frontmodeller fortsætter med at forbedre deres ræsonnement. Men virksomheder binder dem ofte til systemer, der ikke er udviklet til sandsynlighedsbaseret adfærd. Der er skrøbelige integrationer og ufuldstændige data i systemerne, uden en reel evalueringssløjfe inden ændringer frigives. Så en grundlæggende AI‑fejl i produktion er egentlig ikke en AI‑fejl overhovedet, men en mangel på investering i evaluerings‑, overvågnings‑ og arbejdsprocesdesign.
Mange virksomheder ser ud til at optimere AI‑kundeservice omkring hastighed, indeholdelse eller ticket‑afledning. Hvilke målinger bør virksomheder i stedet bruge, hvis de vil måle, om en AI‑agent virkelig forbedrer kundeoplevelsen?
For dette skal vi overveje løsningsnøjagtighed. Hastighed og indeholdelse bruges til at vurdere, om du formåede at få en kunde af telefonen, ikke om du formåede at løse deres problem. Løsningsnøjagtighed, som bør bruges til at måle en AI-agents kapacitet, vil overveje, om agenten gjorde det rigtige, i stedet for blot at svare hurtigt. Dette vil arbejde sammen med andre signaler som gentagne kontaktfrekvenser, antallet af klager og hvor ofte en menneskelig operatør skal gribe ind bagefter. Du vil vide, at du optimerer for det forkerte resultat, hvis afledning stiger, men gentagne kontakter og klager også øges.
Gradient Labs fokuserer på regulerede finansielle tjenester, hvor et forkert svar kan have langt større konsekvenser end en typisk kundeservicfejl. Hvordan fastlægger du, hvornår en AI-agent er pålidelig nok til autonomt at håndtere processer inden for områder som udlån, tvister, onboarding eller Know Your Customer‑kontroller?
Den standardvej, som de fleste teams foretrækker, er co‑pilot‑modellen: nogen godkender hver handling, fordi det føles sikrere. Og de fleste antager, at det er sikrere. Men i virkeligheden, efterhånden som AI’en får de fleste ting rigtige, godkender anmeldere ting uden at kontrollere dem ordentligt, og sikkerheden går alligevel tabt. Det gør intet for at minimere den eksisterende arbejdsbyrde. Det gør blot processen hurtigere og reducerer den værdi, du får.
Derfor er begrebet om, at en AI-agent er tilstrækkeligt pålidelig, meget processpecifikt hos Gradient Labs. For os skal den udvikles gennem trinvis autonomi og må ikke betragtes som blot ét mål, der skal krydses af. En agent kan få større selvstændighed i forhold til KYC eller tvister først, når den er benchmarket mod et stort, levende sæt af reelle sager, med menneskelig gennemgang af et udvalg af dens beslutninger, selv efter den er sat i produktion. Interessant nok bekræfter dette, at reversibilitet også virkelig betyder noget her. Hvis noget kan fortrydes, vil det opnå autonomi hurtigere end noget, der ikke kan.
Guardrails præsenteres i stigende grad som løsningen på at gøre AI-agenter sikrere, men at tilføje flere regler kan også gøre systemerne stive eller forhindre dem i at udføre legitime opgaver. Hvordan balancerer du autonomi med guardrails uden at reducere en agent til en anden stærkt begrænset chatbot?
Fejlen er at betragte guardrails som en væg, som agenten blot hopper af. I vores system gør de to ting på én gang. Vi kører guardrails på hver eneste vending i en samtale — nogle inspicerer, hvad kunden siger, for at fange ting som sårbarhed, økonomisk vanskelighed eller en klage, og andre inspicerer, hvad agenten er ved at sige, for at holde den i overensstemmelse. Men når en af dem udløses, blokerer den ikke blot: den omdirigerer agenten til den rette procedure, og den beslutning er gennemsigtig i agentens ræsonnement, så operatører kan se, hvorfor den handlede. De dybere guardrails er også indbygget i, hvordan agenten læres at tænke over en opgave, de data den kan tilgå, og de værktøjer den kan bruge. Denne kombination er det, der holder den sikker uden at gøre den stiv: agenten forstår, hvad guardrails er, og hvorfor de findes, så den fuldfører en legitim opgave i stedet for at afvise alt, der blot ligner en ulovlig handling.
Her mener jeg, at problemet er at se guardrails som en murstenvægsbarriere, som agenten skal hoppe af. Mere specifikt kører vi to forskellige typer guardrails ved hver eneste vending i en samtale. Først har vi kundeguardrails, der inspicerer, hvad kunden siger, og som skal opdage sårbarheder, økonomiske vanskeligheder, kunder der fremsætter klager og lignende. For det andet har vi agentguardrails, der fungerer omvendt og tjekker, hvad agenten vil sige, før beskeden sendes, for at sikre overensstemmelse.
Det betyder, at i stedet for fuldstændigt at blokere en handling, når en af disse guardrails udløses, vil den omdirigere den til den rette vej. På den måde bevarer den gennemsigtighed omkring agentens beslutningsprocesser og giver menneskelige operatører årsagen til den pågældende handling.
Vi kan også gøre dette, fordi ikke alle aspekter af en agents ræsonnement er tvunget til at passere en LLM. Guardrails som disse er deterministiske, fordi de ikke kun udløses ved samtalens afslutning, men aktiveres gennem hele agentens levetid. Sådan kan vi stole på agenten med følsom kommunikation og muliggøre tilpasning af specifikke agenter til brugssager i stor skala og på en forudsigelig måde.
Det vigtigste er, hvordan agenten i første omgang lærer at tænke gennem en opgave, så den kan få adgang til relevante data og kende de værktøjer, den skal bruge. Denne evne for agenten til at udføre en legitim opgave i stedet for at afvise alt, der synes at være forbudt, er det, der hjælper med at forbedre sikkerheden og undgå stivhed.
Hvor skal mennesker forblive i kredsløbet, efterhånden som AI-agenter bliver stadig mere autonome? Er der bestemte beslutninger eller kundesamtaler, som du mener fortsat bør kræve menneskelig dømmekraft, uanset hvor kapable de underliggende modeller bliver?
En menneskelig aktør skal være involveret, hvis en beslutning kræver ærlig skøn, har betydelige konsekvenser for kunden, eller vedrører et resultat, som agenten endnu ikke er blevet evalueret imod. Mennesket behøver ikke nødvendigvis at udføre hele opgaven, men bør gennemgå eller godkende efter behov. Dette er sandsynligvis også sandt, efterhånden som modellerne bliver mere kapable, fordi det ofte handler mindre om evne end om ansvarlighed og kundens ret til en menneskelig beslutningstager, når der er tale om kreditresultater eller tvister.
En menneskelig aktør skal være involveret, hvis en beslutning kræver ærlig skøn, har betydelige konsekvenser for kunden, eller vedrører et resultat, som agenten endnu ikke er blevet evalueret imod. Jeg vil endda gå lidt videre end den typiske fallback‑model og argumentere for, at agenter i stigende grad får deres plads i organisationsdiagrammet ved siden af mennesker. Dette skifter, hvor menneskelige indsatser i høj grad anvendes til eskaleringer og dømmende beslutninger, mens agenterne håndterer koordination og routing.
Men for at dette skal lykkes, har agenter brug for den samme institutionelle kontekst, som et menneske også har, så de ved, hvem de skal inddrage i bestemte problemstillinger, og hvornår. Derfor har vi bygget Collaborate. Så operatører, ingeniører og agenter kan arbejde sammen som jævnbyrdige med versionskontrol, evalueringer og kontinuerlig læring i centrum. Det sikrer, at mennesker forbliver fuldt i løkken, og løkken blot ændrer form for at tage højde for, hvor godt agenten og mennesket koordinerer.
Gradient Labs har fokuseret på specialiserede agenter designet til specifikke arbejdsprocesser inden for finansielle tjenester frem for en enkelt generel agent. Tror du, at fremtiden for enterprise‑AI primært vil bestå af netværk af specialiserede agenter, eller vil stadig mere kapable grundmodeller efterhånden gøre denne specialisering mindre vigtig?
Jeg mener, at selvom grundmodellerne forbedres, forbliver specialisering vigtigt. Folk vil ikke kun betale for en smart model, men for evaluering specifikt til arbejdsprocessen, sikkerhedsrammer og dataintegration omkring den. Og dette arbejde forsvinder ikke, blot fordi den underliggende model bliver bedre. Jeg ser det som et netværk af specialistagenter, alle bygget oven på en fælles og stærk grundmodel, snarere end én generel agent, der gør alting.
AI‑agenter skal i stigende grad lære og forbedre sig efter implementering, men i regulerede miljøer kan selv en lille adfærdsændring introducere nye risici. Hvordan kan virksomheder løbende forbedre en agent, samtidig med at de sikrer, at opdateringer ikke skaber regressioner, compliance‑problemer eller uventet adfærd?
Principen, vi arbejder efter, er, at hver opdatering behandles som en ny modeludgivelse, ikke som en inkrementel konfigurationsændring, så hver ændring gennemgår en fuld evalueringssuite, før den frigives. Det inkluderer regressionstests mod præcedenser, hvor en fejl ville have haft reel betydning, og intet rulles ud til alle kunder på én gang: vi ruller gradvist ud og monitorerer, så hvis der opstår drift, fanger vi det på en begrænset del af trafikken i stedet for i fuld skala. Dette er præcis, hvad vores seneste Collaborate‑udgivelse er bygget omkring. Collaborate lader operatører, ingeniører og AI‑agenten arbejde sammen som jævnbyrdige på den samme levende definition af, hvordan agenten skal tænke, med versionskontrol, evalueringer og kontinuerlig læring indbygget direkte i arbejdsprocessen. Så når nogen forbedrer, hvordan agenten håndterer en sag, versioneres ændringen, testes mod tidligere samtaler og rulles ud under de samme kontroller som enhver anden udgivelse. Det betyder, at en agent kan blive bedre efter implementering uden at selve forbedringen bliver den faktor, der introducerer en regression eller et compliance‑problem.
Ser vi fremad, efterhånden som adgangen til kraftfulde grundmodeller bliver stadig mere kommercialiseret, hvor vil den reelle konkurrencefordel i AI‑applikationer komme fra? Vil vinderne være dem med de bedste modeller, eller dem, der er bedst til at konstruere pålidelige systemer og levere konsekvent gode oplevelser omkring dem?
Nu hvor flere og flere grundmodeller begynder at konvergere, vil overtaget næsten udelukkende gå til dem, der er bedst til at bygge mere pålidelige systemer omkring disse modeller, inklusive evaluering, sikkerhedsrammer, data og workflow‑design. Modellen bliver en vareinput, men det er konsistens og pålidelighed i produktion, der er det egentlige produkt.
Endda ud over dette ser jeg fordelen komme mere fra, hvor dybt en agent er indlejret i en virksomheds drift. Agenter, der kan integreres i mange forskellige dele af en virksomheds processer, vil vinde over værktøjer, der kun kan håndtere specifikke problemer eller kun nå frontlinjen. Når en agent kan arbejde på tværs af front‑ og back‑office‑systemer, kan den tilføre mere kontekst til interaktioner og håndtere mere komplekse problemer fra ende til ende, præcis som et menneske ville. At en agent kan passe ind i, hvordan en virksomhed faktisk fungerer, er, hvor jeg forventer, at den varige sejr vil komme fra.
Tak for det gode interview, læsere der ønsker at lære mere, bør besøge Gradient Labs.












