Interviews
Anand Kannappan, administrerende direktør og medstifter af Patronus AI – Interviewserie

Anand Kannappan er medstifter og administrerende direktør for Patronus AI, den første automatiserede AI-evaluering og sikkerhedsplatform til at hjælpe virksomheder med at fange LLM-fejl i stor skala. Tidligere ledte Anand ML-forklarings- og avancerede eksperimenteringsindsatsen på Meta Reality Labs.
Hvad tiltrak dig til computervidenskab?
Da jeg voksede op, var jeg altid fascineret af teknologi og hvordan den kunne bruges til at løse virkelige problemer. Ideen om at kunne skabe noget fra scratch ved hjælp af en computer og kode fascinerede mig. Da jeg dykkede dybere ind i computervidenskab, indså jeg det enorme potentiale, det har for innovation og forandring på tværs af forskellige brancher. Denne drivkraft til at innovere og gøre en forskel er det, der tiltrak mig til computervidenskab.
Kan du dele historien bag Patronus AI?
Historien bag Patronus AI er ret interessant. Da OpenAI lancerede ChatGPT, blev det den hurtigst voksende forbrugerprodukt, med over 100 millioner brugere på blot to måneder. Denne massive adoption fremhævede potentialet for generativ AI, men det fremhævede også den tøven, virksomheder havde med at implementere AI i så hurtigt et tempo. Mange virksomheder var bekymrede over de potentielle fejl og uforudsigelige adfærd hos store sprogmodeller (LLM’er).
Rebecca og jeg har kendt hinanden i mange år, efter at have studeret computervidenskab sammen på University of Chicago. På Meta stod vi begge over for udfordringer med at evaluere og fortolke maskinlæringsoutput – Rebecca fra et forskningsperspektiv og jeg selv fra et anvendt perspektiv. Da ChatGPT blev annonceret, så vi begge potentialet for LLM’er, men vi forstod også den forsigtighed, virksomheder udviser.
Vendepunktet kom, da min brors investeringsbank, Piper Sandler, besluttede at forbyde adgang til OpenAI internt. Dette gjorde os klar over, at selvom AI havde udviklet sig betydeligt, var der stadig et gap i virksomhedsadoptionen på grund af bekymringer over pålidelighed og sikkerhed. Vi grundlagde Patronus AI for at imødekomme dette gap og øge virksomhedens tillid til generativ AI ved at tilbyde en evaluering og sikkerhedslag for LLM’er.
Kan du beskrive Patronus AI’s platforms kernefunktion for evaluering og sikkerhed af LLM’er?
Vores mission er at forbedre virksomhedens tillid til generativ AI. Vi har udviklet branchens første automatiserede evaluering og sikkerhedsplatform specifikt til LLM’er. Vores platform hjælper virksomheder med at opdage fejl i LLM-output på stor skala, hvilket giver dem mulighed for at implementere AI-produkter sikkert og med tillid.
Vores platform automatiserer flere nøgleprocesser:
- Scoring: Vi evaluerer modelpræstation i virkelige scenarier, med fokus på vigtige kriterier som hallucinationer og sikkerhed.
- Testgenerering: Vi genererer automatisk adversarial testssæt i stor skala for at vurderere modelkapaciteter.
- Benchmarking: Vi sammenligner forskellige modeller for at hjælpe kunder med at identificere den bedste fit til deres specifikke brugsområder.
Virksomheder foretrækker hyppige evalueringer for at tilpasse sig udviklende modeller, data og brugerbehov. Vores platform fungerer som en troværdig tredjeparts-evaluator, der giver en upartisk perspektiv lignende Moody’s i AI-rummet. Vores tidlige partnere inkluderer førende AI-virksomheder som MongoDB (MDB ), Databricks, Cohere og Nomic AI, og vi er i diskussioner med flere prominente virksomheder i traditionelle brancher for at teste vores platform.
Hvilke fejl eller “hallucinationer” kan Patronus AI’s Lynx-model opdage i LLM-output, og hvordan løser den disse problemer for virksomheder?
LLM’er er virkelig kraftfulde værktøjer, men deres sandsynlighedsnatur gør dem tilbøjelige til “hallucinationer” eller fejl, hvor modellen genererer urigtig eller irrelevant information. Disse hallucinationer er problematiske, især i højrisikområder, hvor nøjagtighed er kritisk.
Traditionelt har virksomheder afhængigt af manuel inspektion for at evaluere LLM-output, en proces, der ikke blot er tidskrævende, men også uskalerbar. For at strømlinje dette har Patronus AI udviklet Lynx, en specialiseret model, der forbedrer vores platforms kapacitet ved at automatisere opdækkelsen af hallucinationer. Lynx, integreret i vores platform, giver omfattende testdækning og robuste ydelsesgarantier, med fokus på at identificere kritiske fejl, der kan have betydelig indvirkning på virksomhedens drift, såsom forkerte finansielle beregninger eller fejl i juridiske dokumentgennemgange.
Med Lynx formindsker vi begrænsningerne for manuel evaluering gennem automatiseret adversarial testning, hvor vi udforsker et bredt spektrum af potentielle fejlscenarier. Dette giver os mulighed for at opdage problemer, der måske undgår menneskelige evaluatorer, og giver virksomhederne forbedret pålidelighed og tillid til at implementere LLM’er i kritiske anvendelser.
FinanceBench beskrives som den første benchmark for evaluering af LLM-præstation på finansielle spørgsmål. Hvad var udfordringerne i den finansielle sektor, der førte til udviklingen af FinanceBench?
FinanceBench blev udviklet som svar på de unikke udfordringer, den finansielle sektor stod over for i forbindelse med implementering af LLM’er. Finansielle anvendelser kræver en høj grad af nøjagtighed og pålidelighed, da fejl kan føre til betydelige finansielle tab eller regulatoriske problemer. Trods LLM’ernes løfte om at håndtere store mængder finansielle data, viste vores forskning, at state-of-the-art-modeller som GPT-4 og Llama 2 havde svært ved at håndtere finansielle spørgsmål og ofte ikke kunne hente præcis information.
FinanceBench blev skabt som en omfattende benchmark for at evaluere LLM-præstation i finansielle sammenhænge. Den indeholder 10.000 spørgsmål og svarpar, baseret på offentligt tilgængelige finansielle dokumenter, der dækker områder som numerisk resonnering, informationshenting, logisk resonnering og verdenskundskab. Ved at tilbyde denne benchmark, søger vi at hjælpe virksomheder med bedre at forstå begrænsningerne for nuværende modeller og identificere områder for forbedring.
Vores første analyse afslørede, at mange LLM’er ikke opfylder de høje standarder, der kræves for finansielle anvendelser, hvilket fremhæver behovet for yderligere forfinelse og målrettet evaluering. Med FinanceBench tilbyder vi et værdifuldt værktøj for virksomheder til at evaluere og forbedre LLM-præstation i den finansielle sektor.
Din forskning fremhævede, at førende AI-modeller, især OpenAI’s GPT-4, genererede ophavsretligt indhold i betydelige mængder, når de blev stillet med uddrag fra populære bøger. Hvad mener du er de langsigtede implikationer af disse fund for AI-udvikling og den bredere teknologiindustri, især i lyset af de pågående debatter om AI og ophavsret?
Spørgsmålet om AI-modeller, der genererer ophavsretligt indhold, er et komplekst og presserende problem i AI-industrien. Vores forskning viste, at modeller som GPT-4, når de blev stillet med uddrag fra populære bøger, ofte reproducerede ophavsretligt indhold. Dette rejser vigtige spørgsmål om ejendomsret og de juridiske implikationer af at bruge AI-genereret indhold.
På lang sigt fremhæver disse fund behovet for klarere retningslinjer og reguleringer omkring AI og ophavsret. Branchen må arbejde på at udvikle AI-modeller, der respekterer ejendomsret og samtidig opretholder deres kreative evner. Dette kunne indebære at forfine træningsdatasæt for at udelukke ophavsretligt indhold, medmindre det er korrekt licenseret, eller implementere mekanismer, der kan opdage og forhindre reproduktion af beskyttet indhold.
Den bredere teknologiindustri må engagere sig i fortsatte diskussioner med juridiske eksperter, politikere og interessenter for at etablere en ramme, der balancerer innovation med respekt for eksisterende love. Da AI fortsætter med at udvikle sig, er det afgørende at imødekomme disse udfordringer proaktivt for at sikre ansvarlig og etisk AI-udvikling.
Givet den alarmerende hastighed, hvormed state-of-the-art LLM’er reproducerer ophavsretligt indhold, som din studie har vist, hvad trin mener du, at AI-udviklere og branchen som helhed bør tage for at imødekomme disse bekymringer? Desuden, hvordan planlægger Patronus AI at bidrage til at skabe mere ansvarlige og juridisk kompatible AI-modeller i lyset af disse fund?
At imødekomme problemet med AI-modeller, der reproducerer ophavsretligt indhold, kræver en multifacetteret tilgang. AI-udviklere og branchen som helhed må prioritere gennemsigtighed og ansvarlighed i AI-modeludviklingen. Dette indebærer:
- Forbedring af datasælgevalg: Sørge for, at træningsdatasæt er omhyggeligt udvalgt for at undgå ophavsretligt indhold, medmindre det er korrekt licenseret.
- Udvikling af detektionsmekanismer: Implementere systemer, der kan identificere, når en AI-model genererer potentielt ophavsretligt indhold, og give brugerne mulighed for at ændre eller fjerne sådant indhold.
- Etablering af branchestandarder: Samarbejde med juridiske eksperter og branchestakeholdere for at skabe retningslinjer og standarder for AI-udvikling, der respekterer ejendomsret.
På Patronus AI er vi dedikeret til at bidrage til ansvarlig AI-udvikling ved at fokusere på evaluering og overholdelse. Vores platform inkluderer produkter som EnterprisePII, der hjælper virksomheder med at opdage og håndtere potentielle privatlivsproblemer i AI-output. Ved at tilbyde disse løsninger søger vi at give virksomheder mulighed for at bruge AI på en ansvarlig og etisk måde, samtidig med at vi minimiserer juridiske risici.
Med værktøjer som EnterprisePII og FinanceBench, hvilke ændringer forventer du i, hvordan virksomheder implementerer AI, især i følsomme områder som finans og personlige data?
Disse værktøjer giver virksomheder mulighed for at evaluere og håndtere AI-output mere effektivt, især i følsomme områder som finans og personlige data.
I den finansielle sektor giver FinanceBench virksomheder mulighed for at evaluere LLM-præstation med en høj grad af præcision, hvilket sikrer, at modeller opfylder de strenge krav, der stilles til finansielle anvendelser. Dette giver virksomheder mulighed for at udnytte AI til opgaver som dataanalyse og beslutningstagning med større tillid og pålidelighed.
Lignende værktøjer som EnterprisePII hjælper virksomheder med at navigere i kompleksiteterne ved dataprivatliv. Ved at give indsigt i potentielle risici og tilbyde løsninger til at mindske dem, giver disse værktøjer virksomheder mulighed for at implementere AI på en mere sikker og ansvarlig måde.
Samlet set baner disse værktøjer vejen for en mere informeret og strategisk tilgang til AI-adoption, hvor virksomheder kan udnytte AI’s fordele, samtidig med at de minimiserer de tilhørende risici.
Hvordan samarbejder Patronus AI med virksomheder om at integrere disse værktøjer i deres eksisterende LLM-implementeringer og arbejdsgange?
På Patronus AI forstår vi vigtigheden af en problemfri integration, når det kommer til AI-adoption. Vi arbejder tæt sammen med vores kunder for at sikre, at vores værktøjer er lette at integrere i deres eksisterende LLM-implementeringer og arbejdsgange. Dette inkluderer at give kunderne:
- Tilpassede integrationsplaner: Vi samarbejder med hver kunde for at udvikle tilpassede integrationsplaner, der er tilpasset deres specifikke behov og mål.
- Omfattende support: Vores team giver løbende support under integrationsprocessen, hvor vi tilbyder vejledning og assistance for at sikre en problemfri overgang.
- Uddannelse og træning: Vi tilbyder uddannelsessessioner og uddannelsesressourcer for at hjælpe kunderne med at forstå og udnytte vores værktøjer fuldt ud, hvilket giver dem mulighed for at maksimere deres AI-investeringer.
Givet kompleksiteten af at sikre, at AI-output er sikker, nøjagtig og overholder forskellige love, hvad råd ville du give til både udviklere af LLM’er og virksomheder, der søger at bruge dem?
Ved at prioritere samarbejde og support søger vi at gøre integrationsprocessen så enkel og effektiv som muligt, hvilket giver virksomheder mulighed for at udnytte det fulde potentiale i vores AI-løsninger.
Kompleksiteten af at sikre, at AI-output er sikker, nøjagtig og overholder forskellige love, stiller betydelige udfordringer. For udviklere af store sprogmodeller (LLM’er) er det afgørende at prioritere gennemsigtighed og ansvarlighed under hele udviklingsprocessen.
En af de grundlæggende aspekter er kvaliteten af data. Udviklere må sikre, at træningsdatasæt er omhyggeligt udvalgt og fri for ophavsretligt indhold, medmindre det er korrekt licenseret. Dette hjælper ikke blot med at forebygge potentielle juridiske problemer, men sikrer også, at AI genererer pålidelig output. Desuden er det afgørende at tackle bias og fairness. Ved aktivt at arbejde på at identificere og mindske bias, og ved at udvikle diverse og repræsentative træningsdata, kan udviklere reducere bias og sikre retfærdige resultater for alle brugere.
Robuste evalueringssystemer er essentielle. Implementering af rigorøse tests og brug af benchmarks som FinanceBench kan hjælpe med at evaluere præstationen og pålideligheden af AI-modeller, hvilket sikrer, at de opfylder kravene for specifikke brugsområder. Desuden bør etiske overvejelser være i forgrunden. Engagement med etiske retningslinjer og rammer sikrer, at AI-systemer udvikles ansvarligt og i overensstemmelse med samfundsværdier.
For virksomheder, der søger at udnytte LLM’er, er det vigtigt at forstå AI’s kapaciteter. Det er afgørende at have realistiske forventninger og sikre, at AI bruges effektivt inden for virksomheden. Problemfri integration og support er også afgørende. Ved at samarbejde med troværdige partnere kan virksomheder integrere AI-løsninger i eksisterende arbejdsgange og sikre, at deres teams er trænet og understøttet for at udnytte AI effektivt.
Overholdelse og sikkerhed bør prioriteres, med fokus på at overholde relevante reguleringer og dataskyddlove. Værktøjer som EnterprisePII kan hjælpe med at overvåge og håndtere potentielle risici. Kontinuerlig overvågning og regelmæssig evaluering af AI-præstation er også nødvendige for at opretholde nøjagtighed og pålidelighed, hvilket giver mulighed for justeringer efter behov.
Tak for det gode interview. Læsere, der ønsker at lære mere, kan besøge Patronus AI.












