Intervjuer
Anand Kannappan, CEO og medgrunnlegger av Patronus AI – Intervju-serie

Anand Kannappan er medgrunnlegger og CEO av Patronus AI, den første automatiserte AI-evaluering og sikkerhetsplattformen for å hjelpe bedrifter å fange LLM-feil i stor skala. Tidligere ledet Anand ML-forståelse og avansert eksperimentering ved Meta Reality Labs.
Hva var det som først tiltalte deg til datavitenskap?
Da jeg vokste opp, var jeg alltid fascinert av teknologi og hvordan den kunne brukes til å løse virkelige problemer. Tanken på å kunne skape noe fra scratch ved hjelp av bare en datamaskin og kode var spennende. Da jeg dykket dyptere inn i datavitenskap, innsett jeg det enorme potensialet det har for innovasjon og transformasjon over flere bransjer. Dette drivet til å innovere og gjøre en forskjell er det som først tiltalte meg til datavitenskap.
Kan du dele historien bak Patronus AI?
Historien bak Patronus AI er ganske en interessant reise. Da OpenAI lanserte ChatGPT, ble det den raskest voksende forbrukerproduktet, med over 100 millioner brukere på bare to måneder. Dette massive adopsjonen viste potensialet for generativ AI, men det viste også på tveksenheten bedrifter hadde med å deployere AI i så raskt tempo. Mange bedrifter var bekymret for mulige feil og uforutsigbarhet i store språkmodeller (LLM).
Rebecca og jeg har kjent hverandre i årevis, etter å ha studert datavitenskap sammen ved University of Chicago. Ved Meta, møtte vi begge utfordringer med å evaluere og tolke maskinlæringsutdata – Rebecca fra et forskningsperspektiv og jeg fra et anvendt perspektiv. Da ChatGPT ble annonsert, så vi begge det transformative potensialet i LLM, men vi forsto også tveksenheten bedrifter utøvde.
Vendepunktet kom da min brors investeringsbank, Piper Sandler, bestemte seg for å forby OpenAI-tilgang internt. Dette gjorde oss klar over at selv om AI hadde fremmet betydelig, var det fortsatt et gap i bedriftsadoptsjon på grunn av bekymringer om pålitelighet og sikkerhet. Vi grunnla Patronus AI for å løse dette gapet og øke bedriftsfortroendet til generativ AI ved å tilby en evaluering og sikkerhetslag for LLM.
Kan du beskrive Patronus AI-plattformens kjernefunksjonalitet for å evaluere og sikre LLM?
Vårt mål er å forbedre bedriftsfortroendet til generativ AI. Vi har utviklet den første automatiserte evaluering og sikkerhetsplattformen spesifikt for LLM. Vår plattform hjelper bedrifter å oppdage feil i LLM-utdata i stor skala, og muliggjør trygg og selvbevisst deployering av AI-produkter.
Vår plattform automatiserer flere nøkkelprosesser:
- Scoring: Vi evaluerer modellprestasjon i virkelige scenarier, med fokus på viktige kriterier som hallucinasjoner og sikkerhet.
- Testgenerering: Vi genererer automatisk adversarial test-suiter i stor skala for å strengt vurdere modellkapasiteter.
- Benchmarking: Vi sammenligner ulike modeller for å hjelpe kunder med å identifisere den beste passningen for deres spesifikke brukssager.
Bedrifter foretrekker hyppige evalueringer for å tilpasse seg utviklende modeller, data og brukerbehov. Vår plattform fungerer som en pålitelig tredjeparts-evaluator, og gir en upartisk perspektiv lik Moody’s i AI-rommet. Våre tidlige partnere inkluderer ledende AI-selskaper som MongoDB (MDB ), Databricks, Cohere og Nomic AI, og vi er i diskusjoner med flere profilerte selskaper i tradisjonelle industrier for å pilotere vår plattform.
Hvilke typer feil eller “hallucinasjoner” detekterer Patronus AI sin Lynx-modell i LLM-utdata, og hvordan løser den disse problemene for bedrifter?
LLM er virkelig kraftfulle verktøy, men deres probabilistiske natur gjør dem utsatt for “hallucinasjoner”, eller feil hvor modellen genererer uriktige eller irrelevante opplysninger. Disse hallucinasjonene er problematisk, særlig i høyrisikområder hvor nøyaktighet er kritisk.
Tradisjonelt har bedrifter avhengig av manuell inspeksjon for å evaluere LLM-utdata, en prosess som ikke bare er tidskrevende, men også uskalerbar. For å strømlinjeform dette, utviklet Patronus AI Lynx, en spesialisert modell som forbedrer plattformens evne ved å automatisere detektering av hallucinasjoner. Lynx, integrert i vår plattform, gir omfattende testdekning og robuste ytelsesgarantier, med fokus på å identifisere kritiske feil som kunne ha betydelig innvirkning på bedriftsoperasjoner, som feil i finansielle beregninger eller feil i juridiske dokumentgjennomganger.
Med Lynx mitigere vi begrensningene i manuell evaluering gjennom automatisert adversarial testing, og utforsker et bredt spekter av potensielle feilscenarier. Dette muliggjør detektering av problemer som kunne unnslippe menneskelige evaluatorene, og tilbyr bedrifter forbedret pålitelighet og tillit til å deployere LLM i kritiske applikasjoner.
FinanceBench beskrives som den første benchmark for å evaluere LLM-prestasjon på finansielle spørsmål. Hvilke utfordringer i finanssektoren førte til utviklingen av FinanceBench?
FinanceBench ble utviklet som respons på de unike utfordringene finanssektoren møtte ved å adoptere LLM. Finansielle applikasjoner krever høy nøyaktighet og pålitelighet, da feil kan føre til betydelige finansielle tap eller regulatoriske problemer. Til tross for LLM-ens løfte om å håndtere store mengder finansielle data, viste vår forskning at state-of-the-art-modeller som GPT-4 og Llama 2 hadde vanskeligheter med finansielle spørsmål, og ofte ikke klarte å hente nøyaktig informasjon.
FinanceBench ble skapt som en omfattende benchmark for å evaluere LLM-prestasjon i finansielle sammenhenger. Den inkluderer 10 000 spørsmål og svarpar basert på offentlig tilgjengelige finansielle dokumenter, og dekker områder som numerisk resonnering, informasjonsinnhenting, logisk resonnering og verdenskunnskap. Ved å tilby denne benchmarken, håper vi å hjelpe bedrifter med å bedre forstå begrensningene i nåværende modeller og identifisere områder for forbedring.
Vår initielle analyse avdekket at mange LLM feiler i å møte de høye standardene som kreves for finansielle applikasjoner, og understreker behovet for ytterligere forbedring og målrettet evaluering. Med FinanceBench tilbyr vi et verdifullt verktøy for bedrifter til å vurdere og forbedre LLM-prestasjon i finanssektoren.
Din forskning viste at ledende AI-modeller, særlig OpenAI sin GPT-4, genererte opphavsrettsliggjort innhold i betydelige rater når de ble promptet med utdrag fra populære bøker. Hva mener du er de langtidsimplikasjonene av disse funnene for AI-utvikling og den bredere teknologiindustrien, særlig når det gjelder pågående debatter om AI og opphavsrett?
Problemstillingen med AI-modeller som genererer opphavsrettsliggjort innhold er et komplekst og presserende problem i AI-industrien. Vår forskning viste at modeller som GPT-4, når de ble promptet med utdrag fra populære bøker, ofte reproduserte opphavsrettsliggjort materiale. Dette reiser viktige spørsmål om opphavsrett og de juridiske implikasjonene av å bruke AI-generert innhold.
På lang sikt understreker disse funnene behovet for tydeligere retningslinjer og reguleringer rundt AI og opphavsrett. Industrien må arbeide mot å utvikle AI-modeller som respekterer opphavsrett, samtidig som de beholder sin kreative kapasitet. Dette kan innebære å finpusse treningsdataene for å ekskludere opphavsrettsliggjort materiale, eller å implementere mekanismer som detekterer og forhindrer reprodusering av beskyttet innhold.
Den bredere teknologiindustrien må engasjere seg i pågående diskusjoner med juridiske eksperter, politiske beslutningstakere og interessenter for å etablere en ramme som balanserer innovasjon med respekt for eksisterende lover. Ettersom AI fortsetter å utvikle seg, er det kritisk å adresse disse utfordringene proaktivt for å sikre ansvarlig og etisk AI-utvikling.
Med tanke på den alarmerende hastigheten som state-of-the-art LLM reproducerer opphavsrettsliggjort innhold, som vist i din studie, hva tror du AI-utviklere og industrien som helhet må gjøre for å løse disse bekymringene? Hvordan planlegger Patronus AI å bidra til å skape mer ansvarlige og lovmessige AI-modeller i lys av disse funnene?
Løsning av problemet med AI-modeller som reproducerer opphavsrettsliggjort innhold krever en flerfoldig tilnærming. AI-utviklere og industrien som helhet må prioritere transparens og ansvar i AI-modellutvikling. Dette inkluderer:
- Forbedring av dataseleksjon: Sørge for at treningsdataene er kurert omsorgsfullt for å unngå opphavsrettsliggjort materiale, med mindre det er nødvendig å få lisenser.
- Utvikling av detekteringsmekanismer: Implementere systemer som kan identifisere når en AI-modell genererer potensielt opphavsrettsliggjort innhold, og gi brukerne alternativer for å modifisere eller fjerne slike innhold.
- Etablering av bransjestandarder: Samarbeide med juridiske eksperter og industriaktører for å skape retningslinjer og standarder for AI-utvikling som respekterer opphavsrett.
Ved Patronus AI er vi dedikert til å bidra til ansvarlig AI-utvikling ved å fokusere på evaluering og overholdelse. Vår plattform inkluderer produkter som EnterprisePII, som hjelper bedrifter å detektere og håndtere potensielle personvernsproblemer i AI-utdata. Ved å tilby disse løsningene, håper vi å gi bedrifter mulighet til å bruke AI på en ansvarlig og etisk måte, samtidig som de minimiserer juridiske risiko.
Med verktøy som EnterprisePII og FinanceBench, hva slags endringer forventer du i hvordan bedrifter deployer AI, særlig i følsomme områder som finans og personlige data?
Disse verktøyene gir bedrifter mulighet til å evaluere og håndtere AI-utdata mer effektivt, særlig i følsomme områder som finans og personlige data.
I finanssektoren muliggjør FinanceBench at bedrifter kan vurdere LLM-prestasjon med høy presisjon, og sikrer at modellene møter de strenge kravene for finansielle applikasjoner. Dette gir bedrifter mulighet til å utnytte AI for oppgaver som dataanalyse og beslutningstaking med større tillit og pålitelighet.
Tilsvarende hjelper verktøy som EnterprisePII bedrifter å navigere kompleksiteten i personvernsproblemer. Ved å gi innsikt i potensielle risiko og tilby løsninger for å mitigere dem, muliggjør disse verktøyene at bedrifter kan deployere AI på en mer sikker og ansvarlig måte.
Samlet sett åpner disse verktøyene vei for en mer informert og strategisk tilnærming til AI-adoptsjon, og hjelper bedrifter å utnytte AI-fordelene samtidig som de minimiserer assosiert risiko.
Hvordan samarbeider Patronus AI med bedrifter for å integrere disse verktøyene i deres eksisterende LLM-deployeringer og arbeidsflyter?
Ved Patronus AI forstår vi viktigheten av sømløs integrasjon når det gjelder AI-adoptsjon. Vi arbeider tett med våre kunder for å sikre at våre verktøy er lett integrert i deres eksisterende LLM-deployeringer og arbeidsflyter. Dette inkluderer å gi kundene:
- Tilpassede integreringsplaner: Vi samarbeider med hver kunde for å utvikle tilpassede integreringsplaner som møter deres spesifikke behov og mål.
- Omfattende støtte: Vårt team tilbyr kontinuerlig støtte gjennom hele integreringsprosessen, og gir veiledning og assistanse for å sikre en jevn overgang.
- Trening og utdanning: Vi tilbyr treningsøkter og utdanningsressurser for å hjelpe kundene med å fullt ut forstå og utnytte våre verktøy, og gi dem mulighet til å maksimere sine AI-investeringer.
Gitt kompleksiteten i å sikre at AI-utdata er sikre, nøyaktige og overholdelige med ulike lover, hva råd ville du gi både til utviklere av LLM og bedrifter som ønsker å bruke dem?
Ved å prioritere samarbeid og støtte, håper vi å gjøre integreringsprosessen så enkel og effektiv som mulig, og muliggjøre at bedrifter kan utnytte fullt potensialet i våre AI-løsninger.
Kompleksiteten i å sikre at AI-utdata er sikre, nøyaktige og overholdelige med ulike lover, presenterer betydelige utfordringer. For utviklere av store språkmodeller (LLM) er nøkkelaspektet kvaliteten på data. Utviklere må sikre at treningsdataene er godt kurert og fri for opphavsrettsliggjort materiale, med mindre det er nødvendig å få lisenser. Dette hjelper ikke bare med å forebygge potensielle juridiske problemer, men sikrer også at AI genererer pålitelige utdata.
Robuste evalueringprosedyrer er essensielle. Implementering av strenge tester og bruk av benchmark-verktøy som FinanceBench kan hjelpe med å vurdere ytelsen og påliteligheten til AI-modellene, og sikre at de møter kravene for spesifikke brukssager. I tillegg bør etiske overveielser være i forkant. Engasjement med etiske retningslinjer og rammer sikrer at AI-systemer utvikles ansvarlig og i samsvar med samfunnets verdier.
For bedrifter som ønsker å utnytte LLM, er det viktig å forstå AIens kapasiteter. Det er viktig å sette realistiske forventninger og sikre at AI brukes effektivt innenfor organisasjonen. Sømløs integrasjon og støtte er også avgjørende. Ved å samarbeide med pålitelige partnere, kan bedrifter integrere AI-løsninger i eksisterende arbeidsflyter og sikre at deres team er trent og støttet for å utnytte AI effektivt.
Overholdelse og sikkerhet bør prioriteres, med fokus på å overholde relevante reguleringer og datavernloven. Verktøy som EnterprisePII kan hjelpe med å overvåke og håndtere potensielle risiko. Kontinuerlig overvåking og regelmessig evaluering av AI-ytelse er også nødvendig for å opprettholde nøyaktighet og pålitelighet, og tillate justeringer etter behov.
Takk for det flotte intervjuet, lesere som ønsker å lære mer kan besøke Patronus AI.












