Interviews

Anand Kannappan, CEO & Co-founder van Patronus AI – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Anand Kannappan is mede-oprichter en CEO van Patronus AI, het eerste geautomatiseerde AI-evaluatie- en beveiligingsplatform om bedrijven te helpen bij het opsporen van LLM-fouten op grote schaal. Eerder leidde Anand de inspanningen op het gebied van ML-uitlegbaarheid en geavanceerd experimenteren bij Meta Reality Labs.

Wat trok je aanvankelijk aan tot informatica?

Toen ik opgroeide, was ik altijd gefascineerd door technologie en hoe die gebruikt kon worden om echte problemen op te lossen. Het idee dat ik iets kon creëren van scratch met alleen een computer en code, intrigeerde me. Toen ik dieper in de informatica dook, realiseerde ik me het enorme potentieel dat het heeft voor innovatie en transformatie in verschillende industrieën. Deze drive om te innoveren en een verschil te maken, is wat me aanvankelijk aantrok tot informatica.

Kun je het verhaal achter Patronus AI delen?

De oorsprong van Patronus AI is een interessante reis. Toen OpenAI ChatGPT lanceerde, werd het het snelst groeiende consumentenproduct, met meer dan 100 miljoen gebruikers in slechts twee maanden. Deze massale adoptie benadrukte het potentieel van generatieve AI, maar het bracht ook de aarzeling van bedrijven bij het implementeren van AI op zo’n snelle manier onder de aandacht. Veel bedrijven waren bezorgd over de potentiële fouten en onvoorspelbaar gedrag van grote taalmodellen (LLM’s).

Rebecca en ik hebben elkaar al jaren gekend, nadat we samen informatica hadden gestudeerd aan de Universiteit van Chicago. Bij Meta hebben we beiden uitdagingen ondervonden bij het evalueren en interpreteren van machine learning-uitvoer – Rebecca vanuit een onderzoeksstandpunt en ik vanuit een toegepast perspectief. Toen ChatGPT werd aangekondigd, zagen we beiden het transformatieve potentieel van LLM’s, maar we begrepen ook de voorzichtigheid die bedrijven betrachtten.

Het keerpunt kwam toen de investeringsbank van mijn broer, Piper Sandler, besloot om toegang tot OpenAI intern te verbieden. Dit maakte ons ervan bewust dat, hoewel AI aanzienlijk was geavanceerd, er nog steeds een kloof was in de adoptie van bedrijven vanwege zorgen over betrouwbaarheid en beveiliging. We richtten Patronus AI op om deze kloof aan te pakken en het vertrouwen van bedrijven in generatieve AI te verhogen door een evaluatie- en beveiligingslaag voor LLM’s te bieden.

Kun je de kernfunctionaliteit van het platform van Patronus AI voor het evalueren en beveiligen van LLM’s beschrijven?

Onze missie is om het vertrouwen van bedrijven in generatieve AI te verhogen. We hebben het eerste geautomatiseerde evaluatie- en beveiligingsplatform voor LLM’s ontwikkeld. Ons platform helpt bedrijven bij het detecteren van fouten in LLM-uitvoer op grote schaal, waardoor ze AI-producten veilig en met vertrouwen kunnen implementeren.

Ons platform automatiseert verschillende sleutelprocessen:

  • Scoring: We evalueren modelprestaties in real-world scenario’s, met een focus op belangrijke criteria zoals hallucinaties en veiligheid.
  • Testgeneratie: We genereren automatisch adversarial test suites op grote schaal om modelcapaciteiten grondig te beoordelen.
  • Benchmarking: We vergelijken verschillende modellen om klanten te helpen bij het identificeren van de beste fit voor hun specifieke use cases.

Bedrijven geven de voorkeur aan frequente evaluaties om zich aan te passen aan evoluerende modellen, gegevens en gebruikersbehoeften. Ons platform fungeert als een vertrouwd derde partij evaluator, waardoor een onbevooroordeelde perspectief wordt geboden, vergelijkbaar met Moody’s in de AI-ruimte. Onze vroege partners omvatten toonaangevende AI-bedrijven zoals MongoDB (MDB ), Databricks, Cohere en Nomic AI, en we zijn in gesprek met verschillende bekende bedrijven in traditionele industrieën om ons platform te testen.

Welke soorten fouten of “hallucinaties” detecteert het Lynx-model van Patronus AI in LLM-uitvoer, en hoe lost het deze problemen op voor bedrijven?

LLM’s zijn inderdaad krachtige tools, maar hun probabilistische aard maakt ze gevoelig voor “hallucinaties”, of fouten waarbij het model onnauwkeurige of irrelevante informatie genereert. Deze hallucinaties zijn problematisch, vooral in high-stakes businessomgevingen waar nauwkeurigheid essentieel is.

Traditioneel hebben bedrijven vertrouwd op handmatige inspectie om LLM-uitvoer te evalueren, een proces dat niet alleen tijdrovend is, maar ook niet schaalbaar. Om dit te vereenvoudigen, ontwikkelde Patronus AI Lynx, een gespecialiseerd model dat de capaciteit van ons platform verhoogt door de detectie van hallucinaties te automatiseren. Lynx, geïntegreerd in ons platform, biedt uitgebreide testdekking en robuuste prestatiegaranties, met een focus op het identificeren van kritieke fouten die een aanzienlijke impact kunnen hebben op bedrijfsoperaties, zoals onjuiste financiële berekeningen of fouten in juridische documentbeoordelingen.

Met Lynx mitigeren we de beperkingen van handmatige evaluatie door middel van geautomatiseerde adversarial testing, waarbij we een breed spectrum van potentiële foutscenario’s onderzoeken. Dit stelt bedrijven in staat om problemen te detecteren die menselijke evaluatoren zouden kunnen ontgaan, waardoor ze een verhoogde betrouwbaarheid en vertrouwen krijgen om LLM’s in kritieke toepassingen in te zetten.

FinanceBench wordt beschreven als de eerste benchmark voor het evalueren van LLM-prestaties op financiële vragen. Welke uitdagingen in de financiële sector leidden tot de ontwikkeling van FinanceBench?

FinanceBench is ontwikkeld als reactie op de unieke uitdagingen waarmee de financiële sector te maken kreeg bij het adopteren van LLM’s. Financiële toepassingen vereisen een hoge mate van nauwkeurigheid en betrouwbaarheid, aangezien fouten kunnen leiden tot aanzienlijke financiële verliezen of regulatorische problemen. Ondanks de belofte van LLM’s bij het omgaan met grote hoeveelheden financiële gegevens, toonde ons onderzoek aan dat state-of-the-art modellen zoals GPT-4 en Llama 2 worstelden met financiële vragen, vaak zonder accurate informatie te kunnen ophalen.

FinanceBench is ontwikkeld als een uitgebreide benchmark om LLM-prestaties in financiële contexten te evalueren. Het omvat 10.000 vraag- en antwoordparen op basis van openbaar beschikbare financiële documenten, waaronder numerieke redenering, informatieopslag, logische redenering en wereldkennis. Door deze benchmark te bieden, hopen we bedrijven te helpen de beperkingen van huidige modellen beter te begrijpen en verbeteringsgebieden te identificeren.

Onze initiële analyse onthulde dat veel LLM’s niet voldoen aan de hoge standaarden die vereist zijn voor financiële toepassingen, waardoor de noodzaak voor verdere verfijning en gerichte evaluatie wordt benadrukt. Met FinanceBench bieden we een waardevol instrument voor bedrijven om de prestaties van LLM’s in de financiële sector te beoordelen en te verbeteren.

Uw onderzoek wees uit dat toonaangevende AI-modellen, met name OpenAI’s GPT-4, auteursrechtelijk beschermd materiaal gegenereerd bij aanzienlijke tarieven toen ze werden geprompt met citaten uit populaire boeken. Wat zijn uw mening over de langetermijnimplicaties van deze bevindingen voor AI-ontwikkeling en de bredere technologie-industrie, met name in het licht van de lopende debatten over AI en auteursrechtswetgeving?

Het probleem van AI-modellen die auteursrechtelijk beschermd materiaal genereren, is een complex en dringend probleem in de AI-industrie. Ons onderzoek toonde aan dat modellen zoals GPT-4, wanneer ze werden geprompt met citaten uit populaire boeken, vaak auteursrechtelijk beschermd materiaal reproduceerden. Dit roept belangrijke vragen op over intellectuele eigendomsrechten en de juridische implicaties van het gebruik van AI-gegenereerde inhoud.

Op lange termijn benadrukken deze bevindingen de noodzaak van duidelijke richtlijnen en regelgeving rondom AI en auteursrecht. De industrie moet werken aan het ontwikkelen van AI-modellen die intellectuele eigendomsrechten respecteren, terwijl ze hun creatieve capaciteiten behouden. Dit kan het verfijnen van trainingsdatasets om auteursrechtelijk beschermd materiaal uit te sluiten, tenzij passende licenties zijn verkregen, of het implementeren van mechanismen die detecteren en voorkomen dat beschermd materiaal wordt gereproduceerd.

De bredere technologie-industrie moet een voortdurend gesprek aangaan met juridische experts, beleidsmakers en belanghebbenden om een kader te creëren dat innovatie in evenwicht brengt met respect voor bestaande wetten. Naarmate AI blijft evolueren, is het cruciaal om deze uitdagingen proactief aan te pakken om verantwoorde en ethische AI-ontwikkeling te garanderen.

Gezien het alarmerende tempo waarin state-of-the-art LLM’s auteursrechtelijk beschermd materiaal reproduceren, zoals aangetoond door uw studie, welke stappen denkt u dat AI-ontwikkelaars en de industrie als geheel moeten nemen om deze zorgen aan te pakken? Bovendien, hoe plant Patronus AI om bij te dragen aan het creëren van meer verantwoorde en juridisch conforme AI-modellen in het licht van deze bevindingen?

Het aanpakken van het probleem van AI-modellen die auteursrechtelijk beschermd materiaal reproduceren, vereist een multifaceted benadering. AI-ontwikkelaars en de industrie als geheel moeten prioriteit geven aan transparantie en verantwoordelijkheid in AI-modelontwikkeling. Dit omvat:

  • Verbetering van dataselectie: Ervoor zorgen dat trainingsdatasets zorgvuldig zijn geselecteerd om auteursrechtelijk beschermd materiaal te vermijden, tenzij passende licenties zijn verkregen.
  • Ontwikkeling van detectiemechanismen: Het implementeren van systemen die kunnen detecteren wanneer een AI-model mogelijk auteursrechtelijk beschermd materiaal genereert en gebruikers de optie bieden om dergelijk materiaal te modificeren of te verwijderen.
  • Opstellen van industrienormen: Samenwerken met juridische experts en industrie stakeholders om richtlijnen en normen voor AI-ontwikkeling te creëren die intellectuele eigendomsrechten respecteren.

Bij Patronus AI zijn we toegewijd om bij te dragen aan verantwoorde AI-ontwikkeling door ons te concentreren op evaluatie en conformiteit. Ons platform omvat producten zoals EnterprisePII, die bedrijven helpen bij het detecteren en beheren van potentiële privacyproblemen in AI-uitvoer. Door deze oplossingen te bieden, beogen we bedrijven in staat te stellen AI op een verantwoorde en ethische manier te gebruiken, terwijl we juridische risico’s minimaliseren.

Met tools zoals EnterprisePII en FinanceBench, welke verschuivingen verwacht u in de manier waarop bedrijven AI implementeren, met name in gevoelige gebieden zoals financiën en persoonlijke gegevens?

Deze tools bieden bedrijven de mogelijkheid om AI-uitvoer effectiever te evalueren en te beheren, met name in gevoelige gebieden zoals financiën en persoonlijke gegevens.

In de financiële sector stelt FinanceBench bedrijven in staat om LLM-prestaties met een hoge mate van precisie te beoordelen, waardoor ze AI kunnen gebruiken voor taken zoals data-analyse en besluitvorming met meer vertrouwen en betrouwbaarheid.

Soortgelijke tools zoals EnterprisePII helpen bedrijven bij het navigeren door de complexiteit van gegevensbescherming. Door inzicht te bieden in potentiële risico’s en oplossingen om deze te mitigeren, stellen deze tools bedrijven in staat om AI op een veiligere en meer verantwoorde manier te implementeren.

Al met al zijn deze tools de weg vrijmakend voor een meer geïnformeerde en strategische benadering van AI-adoptie, waardoor bedrijven de voordelen van AI kunnen benutten terwijl ze de daarmee verbonden risico’s minimaliseren.

Hoe werkt Patronus AI samen met bedrijven om deze tools te integreren in hun bestaande LLM-implementaties en workflows?

Bij Patronus AI begrijpen we het belang van naadloze integratie bij AI-adoptie. We werken nauw samen met onze klanten om ervoor te zorgen dat onze tools gemakkelijk worden geïntegreerd in hun bestaande LLM-implementaties en workflows. Dit omvat het bieden van klanten met:

  • Aangepaste integratieplannen: We werken samen met elke klant om aangepaste integratieplannen te ontwikkelen die aansluiten bij hun specifieke behoeften en doelstellingen.
  • Uitgebreide ondersteuning: Ons team biedt voortdurende ondersteuning gedurende het integratieproces, waarbij we leiding en assistentie bieden om een soepele overgang te garanderen.
  • Training en educatie: We bieden trainingssessies en educatieve bronnen aan om klanten te helpen onze tools volledig te begrijpen en te gebruiken, waardoor ze het meeste uit hun AI-investeringen kunnen halen.

Gezien de complexiteit van het waarborgen dat AI-uitvoer veilig, nauwkeurig en in overeenstemming is met diverse wetten, welk advies zou u zowel aan AI-ontwikkelaars als aan bedrijven die ze willen gebruiken, geven?

Door prioriteit te geven aan samenwerking en ondersteuning, beogen we het integratieproces zo eenvoudig en efficiënt mogelijk te maken, waardoor bedrijven de volle potentie van onze AI-oplossingen kunnen benutten.

De complexiteit van het waarborgen dat AI-uitvoer veilig, nauwkeurig en in overeenstemming is met diverse wetten, stelt significante uitdagingen. Voor AI-ontwikkelaars is het prioriteren van transparantie en verantwoordelijkheid gedurende het ontwikkelingsproces essentieel.

Een van de fundamenten is de kwaliteit van de data. Ontwikkelaars moeten ervoor zorgen dat trainingsdatasets goed zijn geselecteerd en vrij zijn van auteursrechtelijk beschermd materiaal, tenzij passende licenties zijn verkregen. Dit helpt niet alleen om potentiële juridische problemen te voorkomen, maar zorgt er ook voor dat AI betrouwbare uitvoer genereert. Bovendien is het aanpakken van bias en fairness cruciaal. Door actief te werken aan het identificeren en mitigeren van biases, en door diverse en representatieve trainingsdata te ontwikkelen, kunnen ontwikkelaars bias reduceren en eerlijke uitkomsten voor alle gebruikers garanderen.

Robuuste evaluatieprocedures zijn essentieel. Het implementeren van rigoureuze tests en het gebruik van benchmarks zoals FinanceBench kan helpen bij het beoordelen van de prestaties en betrouwbaarheid van AI-modellen, waardoor ze voldoen aan de eisen van specifieke use cases. Bovendien moeten ethische overwegingen voorop staan. Het betrekken van ethische richtlijnen en kaders zorgt ervoor dat AI-systemen op een verantwoorde en ethische manier worden ontwikkeld.

Voor bedrijven die AI willen gebruiken, is het begrijpen van de capaciteiten van AI cruciaal. Het is belangrijk om realistische verwachtingen te hebben en ervoor te zorgen dat AI effectief binnen de organisatie wordt gebruikt. Naadloze integratie en ondersteuning zijn ook essentieel. Door samen te werken met vertrouwde partners, kunnen bedrijven AI-oplossingen integreren in bestaande workflows en ervoor zorgen dat hun teams getraind en ondersteund zijn om AI effectief te gebruiken.

Conformiteit en beveiliging moeten prioriteit hebben, met een focus op het naleven van relevante regelgeving en wetgeving inzake gegevensbescherming. Tools zoals EnterprisePII kunnen helpen bij het monitoren en beheren van potentiële risico’s. Continue monitoring en regelmatige evaluatie van AI-prestaties zijn ook noodzakelijk om nauwkeurigheid en betrouwbaarheid te behouden, waardoor aanpassingen kunnen worden gemaakt als nodig.

Bedankt voor het geweldige interview, lezers die meer willen leren, kunnen Patronus AI bezoeken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.