Intervjuer

Neal Lathia, medgründer og CTO i Gradient Labs – Intervjuserie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Neal Lathia, medgründer og CTO i Gradient Labs, er en leder innen maskinlæring og datavitenskap med nesten to tiår erfaring som spenner over finansiell teknologi, forbrukerplattformer og akademisk forskning. Før han medgrunnla Gradient Labs i 2023, tilbrakte han mer enn fem år i Monzo, hvor han avanserte fra Senior Data Scientist til direktør for maskinlæring og senior maskinlæringsingeniør, og bygde maskinlæringsinfrastruktur samt bidro til å skalere disiplinen for å støtte applikasjoner innen drift, økonomisk kriminalitet og produkt. Tidligere jobbet Lathia som Senior Data Scientist i Skyscanner og hadde forskningsstillinger ved University of Cambridge og University College London, hvor hans arbeid utforsket anbefalingssystemer, atferdsdata, smarttelefon-sensing og personaliserte digitale tjenester. I Gradient Labs leder han nå teknologien bak AI-agenter designet for komplekse, regulerte arbeidsflyter i finanssektoren.

Gradient Labs er et AI-selskap basert i London som utvikler spesialiserte autonome agenter for finansielle tjenester, med fokus på å automatisere kundedrift som tradisjonelt krever omfattende menneskelig involvering. Selskapet ble grunnlagt av tidligere Monzo-ledere Dimitri Masin, Neal Lathia og Danai Antoniou, og utvikler agenter for områder som utlån og inkasso, tvister, Know Your Business (KYB), onboarding, forsikringskrav og kundeservice, som opererer via tale, chat og e‑post samtidig som de integrerer etterlevelsesrammer designet for regulerte miljøer. Gradient Labs oppgir at teknologien nå betjener mer enn 32 millioner sluttbrukere hos kunder som Wise, Zego, Current, Stash og Rho. I juni 2026 kunngjorde selskapet at de hadde utvidet sin Series A‑finansiering til 26 millioner dollar mens de arbeider mot en bredere visjon om å automatisere komplekse bank- og fintech‑operasjoner med sammenkoblede spesialiserte AI‑agenter.

Du tilbrakte mer enn fem år med å bygge og lede maskinlæring i Monzo før du medgrunnla Gradient Labs i 2023. Hva så du på nært hold i Monzo som overbeviste deg om at det var en mulighet til å starte et nytt selskap rundt autonome AI‑agenter, og hvorfor gjorde ankomsten av store språkmodeller denne muligheten mulig?

Hos Monzo tilbrakte jeg år med å bygge ML‑systemer som måtte fungere i et regulert miljø, hvor feil har svært reelle konsekvenser og alt krever en revisjonsspor. Det som påvirket meg mest var behovet for å utvikle skreddersydd infrastruktur, fordi ingen forhåndslagde løsninger kunne operere trygt under så strenge begrensninger. Denne erfaringen ga meg to overbevisninger. Den første var at teknologi endelig kunne løfte banker fra den operative byrden som har holdt bransjen tilbake i flere tiår. Den andre var at generell, horisontal AI ikke ville gjøre noen forskjell – nyansene i regulert arbeid er for spesifikke. Da LLM‑ene ble kraftige nok til å resonere gjennom flertrinns, noen ganger tvetydige kundesamtaler, ble det mulig å bygge agenter som kunne håndtere komplette regulerte arbeidsflyter fra ende til ende, i stedet for bare å assistere et menneske. Det gapet mellom hva regulerte selskaper faktisk trengte og hva som allerede eksisterte, er grunnen til at vi startet Gradient Labs og satset på vertikal AI bygget spesielt for finans.

Du har beskrevet det forbrukerne opplever som «den hakkete kanten av opplevelsen»: en AI‑agent kan utføre en usedvanlig kompleks oppgave mens et annet system feiler på noe så enkelt som å skille et telefonnummer fra et navn. Hva forårsaker egentlig et så dramatisk gap mellom AI‑opplevelser når de underliggende modellene kan være like kapable?

Jeg vil si at gapet handler mer om hvor mye ingeniørarbeid som legges i modellen enn om den rå modellkompetansen. Hvis et system feiler på en enkel oppgave, som å forveksle et telefonnummer med et navn, betyr det at det ikke har investert i rammeverket rundt det, som validering, fallback‑logikk, håndtering av strukturerte data osv. Den mer imponerende agenten er sannsynligvis bygget akkurat for sin oppgave. Det er samme grunnleggende modellfamilie, men med helt ulik strenghet rundt den, og det er nettopp dette som skaper den hakkete kanten.

Etter hvert som frontmodeller fortsetter å forbedre seg, hvorfor vedvarer tilsynelatende grunnleggende AI‑feil? Er dette hovedsakelig begrensninger i modellene selv, eller feil i den omkringliggende systemarkitekturen, data, arbeidsflyter, evaluering og produktdesign?

Det er hovedsakelig systemet og ikke modellen. Frontmodeller blir stadig bedre på resonnering. Likevel kobler selskaper dem ofte til systemer som ikke er utviklet for sannsynlighetsbasert oppførsel. Det finnes skjøre integrasjoner og ufullstendige data i systemene, uten en reell evalueringssløyfe før endringer rulles ut. Så en enkel AI‑feil i produksjon er egentlig ikke en AI‑feil i det hele tatt, men en mangel på investering i evaluerings‑, overvåkings‑ og arbeidsflytdesignprosesser.

Mange selskaper ser ut til å optimalisere AI‑kundeservice rundt hastighet, innhold eller ticket‑defleksjon. Hvilke måleparametere bør selskaper bruke i stedet hvis de vil måle om en AI‑agent virkelig forbedrer kundeopplevelsen?

For dette må vi vurdere løsningsnøyaktighet. Hastighet og innholdskontroll brukes til å måle om du klarte å få en kunde av telefonen, ikke om du klarte å løse problemet deres. Løsningsnøyaktighet, som bør brukes til å måle en AI‑agents evne, vil vurdere om agenten gjorde det rette, i motsetning til bare å svare raskt. Dette vil fungere sammen med andre signaler som gjentatte kontaktfrekvenser, antall klager og hvor ofte en menneskelig operatør må gripe inn i etterkant. Du vil vite at du optimaliserer for feil resultat hvis avledning øker, men gjentatte kontakter og klager også øker.

Gradient Labs fokuserer på regulerte finansielle tjenester, hvor et feil svar kan ha langt større konsekvenser enn en vanlig kundeservicefeil. Hvordan fastslår du når en AI‑agent er pålitelig nok til autonomt å håndtere prosesser innen områder som utlån, tvister, onboarding eller Know Your Customer‑kontroller?

Standardruten de fleste team foretrekker er co‑pilot‑modellen: noen godkjenner hver handling fordi det føles tryggere. Og de fleste antar at det er tryggere. Men i realiteten, etter hvert som AI får de fleste ting riktig, godkjenner gjennomgangspersoner uten å sjekke grundig, og sikkerheten går tapt uansett. Dette bidrar ikke til å redusere den eksisterende arbeidsmengden. Det gjør bare prosessen raskere og reduserer verdien du får.

Derfor er konseptet om at en AI‑agent er pålitelig nok svært prosessspesifikt hos Gradient Labs. For oss må den utvikles gjennom trinnvis autonomi og kan ikke sees på som kun ett mål å krysse av. En agent kan få større selvstendighet i saker som KYC eller tvister først etter at den er benchmarket mot et stort, levende sett av virkelige saker, med menneskelig gjennomgang av et utvalg av beslutningene også etter at den er i produksjon. Interessant nok bekrefter dette også at reversibilitet virkelig betyr noe her. Hvis noe kan omgjøres, vil det oppnå autonomi raskere enn noe som ikke kan.

Guardrails blir i økende grad presentert som løsningen for å gjøre AI‑agenter tryggere, men å legge til flere regler kan også gjøre systemer stive eller hindre dem i å fullføre legitime oppgaver. Hvordan balanserer du autonomi med guardrails uten å redusere en agent til en annen sterkt begrenset chatbot?

Feilen er å behandle guardrails som en vegg agenten bare spretter av. I vårt system gjør de to ting samtidig. Vi kjører guardrails på hvert eneste samtaleturn – noen inspiserer hva kunden sier, for å fange opp ting som sårbarhet, økonomisk vanskelighet eller en klage, og andre inspiserer hva agenten er i ferd med å si, for å holde den i samsvar. Men når en av dem aktiveres, blokkerer den ikke bare: den omdirigerer agenten til riktig prosedyre, og den beslutningen er transparent i agentens begrunnelse, slik at operatører kan se hvorfor den handlet slik. De dypere guardrails er også bygget inn i hvordan agenten læres å tenke på en oppgave, hvilke data den kan få tilgang til, og hvilke verktøy den kan bruke. Denne kombinasjonen holder den trygg uten å gjøre den stiv: agenten forstår hva guardrails er og hvorfor de finnes, så den fullfører en legitim oppgave i stedet for å avvise alt som bare ligner på en ulovlig.

Her mener jeg at problemet er å se guardrails som en mursteinsvegg agenten skal sprette av. Mer spesifikt kjører vi to ulike typer guardrails på hvert eneste samtaleturn. Først har vi kundeguardrails som inspiserer hva kunden sier og skal fange opp sårbarheter, økonomiske vanskeligheter, kunder som kommer med klager og lignende. Deretter har vi agentguardrails som fungerer motsatt vei og sjekker hva agenten vil si før meldingen sendes, for å holde den i samsvar.

Dette betyr at i stedet for å blokkere en handling fullstendig når en av disse guardrailsene aktiveres, vil den omdirigere den til riktig vei. På den måten opprettholdes transparens rundt agentens beslutningsprosesser, og menneskelige operatører får begrunnelsen for den aktuelle handlingen.

Vi kan også gjøre dette fordi ikke alle deler av en agents begrunnelsesprosess er tvunget til å gå gjennom en LLM. Guardrails som disse er deterministiske fordi de ikke bare aktiveres på slutten av en samtale, men trigges gjennom hele agentens levetid. Slik kan vi stole på agenten med sensitiv kommunikasjon og tillate tilpasning av spesifikke agenter for bruk i stor skala på en forutsigbar måte.

Det som betyr mest er hvordan agenten læres å tenke gjennom en oppgave fra starten av, slik at den kan få tilgang til relevant data og kjenne til verktøyene den trenger å bruke. Denne evnen til å fullføre en legitim oppgave i stedet for å nekte å ta på seg noe som ser ut som om det ikke er tillatt, er det som bidrar til økt sikkerhet og unngår stivhet.

Hvor bør mennesker forbli i kretsløpet etter hvert som AI‑agenter blir stadig mer autonome? Finnes det bestemte beslutninger eller kundesamhandlinger som du mener fortsatt bør kreve menneskelig skjønn, uavhengig av hvor kapable de underliggende modellene blir?

Et menneske må være involvert dersom en beslutning krever ærlig skjønn, har betydelige konsekvenser for kunden, eller gjelder et resultat som agenten ennå ikke er evaluert mot. Personen trenger ikke nødvendigvis å gjøre alt, men bør gjennomgå eller godkjenne etter behov. Dette er sannsynligvis også sant etter hvert som modeller blir mer kapable, fordi det ofte handler mer om ansvarlighet enn om evne, samt kundens rett til en menneskelig beslutningstaker når det gjelder for eksempel kredittresultater eller tvister.

Et menneske må være involvert dersom en beslutning krever ærlig skjønn, har betydelige konsekvenser for kunden, eller gjelder et resultat som agenten ennå ikke er evaluert mot. Jeg vil gå enda litt lenger enn den vanlige fallback-modellen og hevde at agenter stadig mer får sin plass i organisasjonskartet ved siden av mennesker. Dette fører til at menneskelige innsatsområder i større grad flyttes til eskaleringer og skjønnsvurderinger, mens agenter håndterer koordinasjons- og rutearbeid.

Men for at dette skal lykkes, trenger agenter samme institusjonelle kontekst som et menneske, slik at de vet hvem de skal involvere i ulike saker og når. Derfor bygde vi Collaborate. For å la operatører, ingeniører og agenter jobbe sammen som jevnaldrende med versjonskontroll, evalueringer og kontinuerlig læring i kjernen. Dette sikrer at mennesker forblir fullt involvert, og at loopen bare endrer form for å tilpasse seg hvor godt agenten og mennesket koordinerer.

Gradient Labs har fokusert på spesialiserte agenter designet for spesifikke arbeidsflyter innen finansielle tjenester i stedet for én generell agent. Tror du at fremtiden for bedrifts‑AI hovedsakelig vil bestå av nettverk av spesialiserte agenter, eller vil stadig mer kapable grunnmodeller etter hvert gjøre denne spesialiseringen mindre viktig?

Jeg tror at selv om grunnmodeller blir bedre, er spesialisering fortsatt viktig. Folk vil ikke bare betale for en smart modell, men for evalueringer som er spesifikke for arbeidsflyten, sikkerhetsrammer og dataintegrasjon rundt den. Og dette arbeidet forsvinner ikke bare fordi den underliggende modellen blir bedre. Jeg ser dette som et nettverk av spesialiserte agenter som alle er bygget på en felles og sterk grunnmodell, i stedet for én generell agent som gjør alt.

AI‑agenter må i økende grad lære og forbedre seg etter utrulling, men i regulerte miljøer kan selv en liten atferdsendring introdusere nye risikoer. Hvordan kan selskaper kontinuerlig forbedre en agent samtidig som de sikrer at oppdateringer ikke skaper regresjoner, samsvarsproblemer eller uventet oppførsel?

Prinsippet vi jobber etter er at hver oppdatering behandles som en ny modellutgivelse, ikke som en inkrementell konfigurasjonsendring, slik at hver endring går gjennom en full evalueringspakke før den distribueres. Det inkluderer regresjonstester mot tidligere situasjoner der en feil ville ha gjort en reell forskjell, og ingenting rulles ut til alle kunder samtidig: vi lanserer gradvis og overvåker, slik at hvis avdrift begynner å oppstå, fanger vi det på et begrenset trafikksegment i stedet for i full skala. Dette er akkurat det vår nylige Collaborate‑utgivelse er bygget rundt. Collaborate lar operatører, ingeniører og AI‑agenten samarbeide som jevnaldrende på den samme levende definisjonen av hvordan agenten skal tenke, med versjonskontroll, evalueringer og kontinuerlig læring integrert direkte i arbeidsflyten. Så når noen forbedrer hvordan agenten håndterer en sak, blir endringen versjonert, testet mot tidligere samtaler, og rullet ut under de samme kontrollene som enhver annen utgivelse. Det betyr at en agent kan bli bedre etter utrulling uten at forbedringen i seg selv blir årsaken til en regresjon eller et samsvarsproblem.

Når vi ser fremover, og tilgangen til kraftige grunnmodeller blir stadig mer kommersialisert, hvor vil den reelle konkurransefordelen i AI‑applikasjoner komme fra? Vil vinnerne være de med de beste modellene, eller de som er best på å konstruere pålitelige systemer og levere konsekvent gode opplevelser rundt dem?

Nå som flere og flere grunnmodeller begynner å konvergere, vil overtaket nesten helt gå til den som er best på å bygge mer pålitelige systemer rundt disse modellene, inkludert evaluering, sikkerhetsrammer, data og arbeidsflytdesign. Modellen blir en varevare‑input, men det er konsistens og pålitelighet i produksjon som er det egentlige produktet.

Selv utover dette ser jeg fordelen komme mer fra hvor dypt en agent er integrert i en bedrifts operasjoner. Agenter som har evnen til å integreres i mange ulike deler av en bedrifts prosesser vil vinne over verktøy som kun kan håndtere spesifikke problemer eller kun nå frontlinjen. Når en agent kan arbeide på tvers av front‑ og back‑office‑systemer, kan den tilføre mer kontekst til interaksjoner og håndtere mer komplekse problemer fra ende til ende, akkurat som et menneske ville gjort. At en agent passer inn i hvordan en bedrift faktisk fungerer, er der jeg forventer at den varige gevinsten vil komme fra.

Takk for det flotte intervjuet, lesere som ønsker å lære mer bør besøke Gradient Labs.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.