Intervjuer

Anand Kannappan, VD och medgrundare av Patronus AI – Intervjuer

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Anand Kannappan är medgrundare och VD för Patronus AI, den första automatiserade AI-utvärderings- och säkerhetsplattformen som hjälper företag att upptäcka LLM-fel i stor skala. Tidigare ledde Anand ML-förklarbarhet och avancerad experimentverksamhet på Meta Reality Labs.

Vad var det som initialt drog dig till datavetenskap?

Växande upp, var jag alltid fascinerad av teknologi och hur den kunde användas för att lösa verkliga problem. Idén att kunna skapa något från scratch med hjälp av enbart en dator och kod fascinerade mig. När jag gick djupare in i datavetenskap, insåg jag den enorma potential som den har för innovation och transformation inom olika branscher. Denna drivkraft att innovativa och göra en skillnad är vad som initialt drog mig till datavetenskap.

Kan du dela berättelsen om hur Patronus AI kom till?

Uppkomsten av Patronus AI är en ganska intressant resa. När OpenAI lanserade ChatGPT, blev det den snabbast växande konsumentprodukten, med över 100 miljoner användare på bara två månader. Denna massiva adoption belyste potentialen för generativ AI, men den visade också på företagens tveksamhet när det gäller att distribuera AI i så snabb takt. Många företag var oroliga för de potentiella felen och oförutsägbara beteendet hos stora språkmodeller (LLM).

Rebecca och jag har känt varandra i år, sedan vi studerade datavetenskap tillsammans vid University of Chicago. På Meta, stötte vi båda på utmaningar när det gällde att utvärdera och tolka maskinlärningsutdata – Rebecca från ett forskningsperspektiv och jag från ett tillämpat perspektiv. När ChatGPT tillkännagavs, såg vi båda den transformerande potentialen hos LLM, men vi förstod också försiktigheten som företag utövade.

Vändpunkten kom när min brors investmentbank, Piper Sandler, beslutade att förbjuda OpenAI-åtkomst internt. Detta gjorde oss medvetna om att även om AI hade utvecklats avsevärt, fanns fortfarande ett gap i företagsadoptionen på grund av oro för tillförlitlighet och säkerhet. Vi grundade Patronus AI för att täppa till detta gap och öka företagens förtroende för generativ AI genom att tillhandahålla en utvärderings- och säkerhetslager för LLM.

Kan du beskriva den centrala funktionen i Patronus AI:s plattform för utvärdering och säkerhet av LLM?

Vår mission är att förbättra företagens förtroende för generativ AI. Vi har utvecklat branschens första automatiserade utvärderings- och säkerhetsplattform specifikt för LLM. Vår plattform hjälper företag att upptäcka fel i LLM-utdata i stor skala, vilket möjliggör en säker och trygg distribution av AI-produkter.

Vår plattform automatiserar flera viktiga processer:

  • Bedömning: Vi utvärderar modellprestanda i verkliga scenarier, med fokus på viktiga kriterier som hallucinationer och säkerhet.
  • Testgenerering: Vi genererar automatiskt adversariala testsviter i stor skala för att rigoröst utvärdera modellförmågor.
  • Benchmarking: Vi jämför olika modeller för att hjälpa kunder att identifiera den bästa passningen för sina specifika användningsfall.

Företag föredrar frekventa utvärderingar för att anpassa sig till utvecklande modeller, data och användarbehov. Vår plattform fungerar som en pålitlig tredjepartsutvärderare, som tillhandahåller en opartisk perspektiv liknande Moody’s i AI-utrymmet. Våra tidiga partners inkluderar ledande AI-företag som MongoDB (MDB ), Databricks, Cohere och Nomic AI, och vi är i diskussioner med flera välkända företag inom traditionella branscher för att prova vår plattform.

Vilka typer av fel eller “hallucinationer” upptäcker Patronus AI:s Lynx-modell i LLM-utdata, och hur hanterar den dessa problem för företag?

LLM är verkligen kraftfulla verktyg, men deras sannolikhetsbaserade natur gör dem benägna att “hallucinationer”, eller fel där modellen genererar felaktig eller irrelevant information. Dessa hallucinationer är problematiska, särskilt i högriskmiljöer där exakthet är avgörande.

Traditionellt har företag förlitat sig på manuell inspektion för att utvärdera LLM-utdata, en process som inte bara är tidskrävande utan också oskalbar. För att strömlinjeforma detta, utvecklade Patronus AI Lynx, en specialiserad modell som förbättrar plattformens förmåga genom att automatisera upptäckten av hallucinationer. Lynx, integrerad i vår plattform, tillhandahåller omfattande testtäckning och robusta prestandagarantier, med fokus på att identifiera kritiska fel som kan ha en betydande inverkan på affärsverksamheten, såsom felaktiga finansiella beräkningar eller fel i juridiska dokumentgranskningar.

Med Lynx mildrar vi begränsningarna för manuell utvärdering genom automatiserad adversarial testning, som undersöker ett brett spektrum av potentiella felscenarier. Detta möjliggör upptäckten av problem som kan undgå mänskliga utvärderare, vilket ger företag förbättrad tillförlitlighet och förtroende att distribuera LLM i kritiska tillämpningar.

FinanceBench beskrivs som den första benchmarken för utvärdering av LLM-prestanda på finansiella frågor. Vilka utmaningar inom den finansiella sektorn ledde till utvecklingen av FinanceBench?

FinanceBench utvecklades som svar på de unika utmaningar som den finansiella sektorn stod inför när det gällde att anta LLM. Finansiella tillämpningar kräver en hög grad av exakthet och tillförlitlighet, eftersom fel kan leda till betydande finansiella förluster eller regulatoriska problem. Trots LLM:s potential för att hantera stora mängder finansiella data, visade vår forskning att state-of-the-art-modeller som GPT-4 och Llama 2 kämpade med finansiella frågor, ofta utan att kunna hämta exakt information.

FinanceBench skapades som en omfattande benchmark för att utvärdera LLM-prestanda i finansiella sammanhang. Den innehåller 10 000 fråga- och svarpar baserat på offentligt tillgängliga finansiella dokument, som täcker områden som numerisk resonemang, informationsåtervinning, logiskt resonemang och världskunskap. Genom att tillhandahålla denna benchmark, syftar vi till att hjälpa företag att bättre förstå begränsningarna för nuvarande modeller och identifiera områden för förbättring.

Vår initiala analys visade att många LLM inte uppfyller de höga standarder som krävs för finansiella tillämpningar, vilket betonar behovet av ytterligare förfining och riktad utvärdering. Med FinanceBench tillhandahåller vi ett värdefullt verktyg för företag att utvärdera och förbättra prestandan hos LLM i den finansiella sektorn.

Er forskning belyste att ledande AI-modeller, särskilt OpenAI:s GPT-4, genererade upphovsrättsskyddat innehåll i betydande grad när de tillfrågades med utdrag från populära böcker. Vad tror du är de långsiktiga implikationerna av dessa fynd för AI-utveckling och den bredare teknikindustrin, särskilt med tanke på pågående debatter kring AI och upphovsrättslag?

Frågan om AI-modeller som genererar upphovsrättsskyddat innehåll är en komplex och angelägen fråga inom AI-industrin. Vår forskning visade att modeller som GPT-4, när de tillfrågades med utdrag från populära böcker, ofta reproducerade upphovsrättsskyddat material. Detta väcker viktiga frågor om immateriella rättigheter och de juridiska implikationerna av att använda AI-genererat innehåll.

På lång sikt understryker dessa fynd behovet av tydligare riktlinjer och regleringar kring AI och upphovsrätt. Branschen måste arbeta mot att utveckla AI-modeller som respekterar immateriella rättigheter samtidigt som de upprätthåller sin kreativa förmåga. Detta kan innefatta att förbättra träningssatser för att utesluta upphovsrättsskyddat material eller implementera mekanismer som upptäcker och förhindrar reproduktion av skyddat innehåll.

Den bredare teknikindustrin behöver engagera sig i pågående diskussioner med juridiska experter, beslutsfattare och intressenter för att etablera en ram som balanserar innovation med respekt för befintliga lagar. När AI fortsätter att utvecklas är det avgörande att proaktivt hantera dessa utmaningar för att säkerställa ansvarsfull och etisk AI-utveckling.

Med tanke på den alarmerande takten som state-of-the-art LLM reproducerar upphovsrättsskyddat innehåll, som visas i er studie, vilka steg tror du att AI-utvecklare och branschen som helhet behöver ta för att hantera dessa problem? Dessutom, hur planerar Patronus AI att bidra till att skapa mer ansvarsfulla och juridiskt förenliga AI-modeller i ljuset av dessa fynd?

Att hantera frågan om AI-modeller som reproducerar upphovsrättsskyddat innehåll kräver en multifacetterad strategi. AI-utvecklare och branschen som helhet behöver prioritera transparens och ansvar i AI-modellutveckling. Detta inkluderar:

  • Att förbättra dataselektion: Se till att träningssatser är noggrant utvalda för att undvika upphovsrättsskyddat material såvida inte lämpliga licenser erhålls.
  • Att utveckla upptäcktsmekanismer: Implementera system som kan identifiera när en AI-modell genererar potentiellt upphovsrättsskyddat innehåll och ge användarna alternativ för att modifiera eller ta bort sådant innehåll.
  • Att etablera branschstandarder: Samarbeta med juridiska experter och branschaktörer för att skapa riktlinjer och standarder för AI-utveckling som respekterar immateriella rättigheter.

På Patronus AI är vi engagerade i att bidra till ansvarsfull AI-utveckling genom att fokusera på utvärdering och efterlevnad. Vår plattform inkluderar produkter som EnterprisePII, som hjälper företag att upptäcka och hantera potentiella sekretessproblem i AI-utdata. Genom att tillhandahålla dessa lösningar syftar vi till att ge företag möjlighet att använda AI på ett ansvarsfullt och etiskt sätt samtidigt som de minimerar juridiska risker.

Med verktyg som EnterprisePII och FinanceBench, vilka skiftningar förväntar du dig i hur företag distribuerar AI, särskilt i känsliga områden som finans och personuppgifter?

Dessa verktyg ger företag möjlighet att utvärdera och hantera AI-utdata mer effektivt, särskilt i känsliga områden som finans och personuppgifter.

Inom den finansiella sektorn möjliggör FinanceBench företag att utvärdera LLM-prestanda med en hög grad av precision, vilket säkerställer att modellerna uppfyller de stränga kraven för finansiella tillämpningar. Detta ger företag möjlighet att utnyttja AI för uppgifter som dataanalys och beslutsfattning med större förtroende och tillförlitlighet.

Likaså hjälper verktyg som EnterprisePII företag att navigera i komplexiteten kring datasekretess. Genom att ge insikt i potentiella risker och erbjuda lösningar för att mildra dem, möjliggör dessa verktyg för företag att distribuera AI på ett mer säkert och ansvarsfullt sätt.

Sammantaget är dessa verktyg på väg att bana väg för en mer informerad och strategisk tillvägagångssätt för AI-antagande, som hjälper företag att utnyttja fördelarna med AI samtidigt som de minimerar associerade risker.

Hur arbetar Patronus AI med företag för att integrera dessa verktyg i deras befintliga LLM-distributioner och arbetsflöden?

På Patronus AI förstår vi vikten av smidig integration när det gäller AI-antagande. Vi arbetar nära med våra kunder för att säkerställa att våra verktyg integreras smidigt i deras befintliga LLM-distributioner och arbetsflöden. Detta inkluderar att tillhandahålla kunderna med:

  • Anpassade integrationsplaner: Vi samarbetar med varje kund för att utveckla anpassade integrationsplaner som motsvarar deras specifika behov och mål.
  • Omfattande support: Vårt team tillhandahåller kontinuerlig support under integrationsprocessen, erbjuda vägledning och assistans för att säkerställa en smidig övergång.
  • Utbildning och utbildningsresurser: Vi erbjuder utbildningssessioner och utbildningsresurser för att hjälpa kunder att fullständigt förstå och utnyttja våra verktyg, vilket ger dem möjlighet att utnyttja sin AI-investering på bästa sätt.

Med tanke på komplexiteten i att säkerställa att AI-utdata är säkra, exakta och förenliga med olika lagar, vad råd skulle du ge till både utvecklare av LLM och företag som vill använda dem?

Genom att prioritera samarbete och support, syftar vi till att göra integrationsprocessen så smidig och effektiv som möjligt, vilket möjliggör för företag att utnyttja full potentialen av våra AI-lösningar.

Komplexiteten i att säkerställa att AI-utdata är säkra, exakta och förenliga med olika lagar presenterar betydande utmaningar. För utvecklare av stora språkmodeller (LLM) är nyckeln att prioritera transparens och ansvar under utvecklingsprocessen.

En av de grundläggande aspekterna är kvaliteten på data. Utvecklare måste säkerställa att träningssatser är välutvalda och fria från upphovsrättsskyddat material såvida inte lämpliga licenser erhålls. Detta hjälper inte bara till att förhindra potentiella juridiska problem, utan säkerställer också att AI genererar tillförlitliga utdata. Dessutom är det viktigt att hantera bias och rättvisa. Genom att aktivt arbeta för att identifiera och mildra bias, och genom att utveckla diversifierad och representativ träningdata, kan utvecklare minska bias och säkerställa rättvisa resultat för alla användare.

Robusta utvärderingsförfaranden är avgörande. Genom att implementera rigorösa tester och använda benchmark som FinanceBench kan man utvärdera prestanda och tillförlitlighet hos AI-modeller, vilket säkerställer att de uppfyller kraven för specifika användningsfall. Dessutom bör etiska överväganden vara i förgrunden. Engagemang med etiska riktlinjer och ramverk säkerställer att AI-system utvecklas på ett ansvarsfullt sätt och i linje med samhällets värderingar.

För företag som vill utnyttja LLM är det viktigt att förstå AI:s förmågor. Det är viktigt att ha realistiska förväntningar och säkerställa att AI används effektivt inom organisationen. Smidig integration och support är också avgörande. Genom att arbeta med pålitliga partners kan företag integrera AI-lösningar i befintliga arbetsflöden och säkerställa att deras team är utbildade och stödda för att utnyttja AI effektivt.

Efterlevnad och säkerhet bör prioriteras, med fokus på att följa relevanta regler och dataskyddslagar. Verktyg som EnterprisePII kan hjälpa till att övervaka och hantera potentiella risker. Kontinuerlig övervakning och regelbunden utvärdering av AI-prestanda är också nödvändiga för att upprätthålla exakthet och tillförlitlighet, vilket möjliggör justeringar vid behov.

Tack för den underbara intervjun, läsare som vill lära sig mer bör besöka Patronus AI.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.