Interviews
Alex Ratner, administrerende direktør og medstifter af Snorkel AI – Interviewserie

Alex Ratner er administrerende direktør og medstifter af Snorkel AI, et firma født ud af Stanford AI-laboratoriet.
Snorkel AI gør AI-udvikling hurtig og praktisk ved at omdanne manuelle AI-udviklingsprocesser til programmeringsløsninger. Snorkel AI giver virksomheder mulighed for at udvikle AI, der fungerer for deres unikke arbejdsmængder ved hjælp af deres eget data og viden 10-100 gange hurtigere.
Hvad var det, der oprindeligt tiltrak dig til datalogi?
Der er to meget spændende aspekter ved datalogi, når du er ung. For det første kan du lære så hurtigt, du vil, ved at eksperimentere og bygge, takket være den øjeblikkelige feedback, uden at skulle vente på en lærer. For det andet kan du bygge meget uden at skulle bede om tilladelse!
Jeg begyndte at programmere, da jeg var en lille dreng, af disse årsager. Jeg elskede også den præcision, det krævede. Jeg nød processen med at abstrahere komplekse processer og rutiner og derefter kodificere dem på en modulær måde.
Senere, som voksen, kom jeg tilbage til datalogi professionelt via en job i rådgivning, hvor jeg blev bedt om at skrive script til at udføre nogle grundlæggende analyser af patentkorpusset. Jeg var fascineret af, hvor meget menneskelig viden – alt, hvad nogen nogensinde havde betragtet som patenterbart – var tilgængeligt, men samtidig så utilgængeligt, fordi det var så svært at udføre selv de enkleste analyser over komplekse tekniske tekster og multimodale data.
Dette var, hvad der fik mig tilbage ned i kaninhullet, og til sidst tilbage til Stanford, hvor jeg fokuserede på NLP, der er området for at bruge ML/AI på naturlig sprog.
Du startede og ledede det åbne Snorkel-projekt, mens du var på Stanford. Kan du fortælle os om rejsen i disse tidlige dage?
Dengang var vi, ligesom mange i branchen, fokuseret på at udvikle nye algoritmer og – dvs. alle de “fancy” machine learning-ting, som folk i fællesskabet forskede i og offentliggjorde artikler om.
Men vi var altid meget fokuseret på at forankre dette i virkelige problemer – primært med læger og videnskabsmænd på Stanford. Men hver gang, vi præsenterede en ny model eller algoritme, blev svaret “ja, vi ville prøve det, men vi ville have brug for alle disse mærkede træningsdata, som vi ikke har tid til at oprette!”
Vi så, at det store uudtalte problem var omkring processen med at mærke og kuraterer træningsdata – så vi skiftede hele vores fokus til det, og det er, hvordan Snorkel-projektet og idéen om “data-centreret AI” startede.
Snorkel har en data-centreret AI-tilgang. Kan du definere, hvad det betyder, og hvordan det adskiller sig fra model-centreret AI-udvikling?
Data-centreret AI betyder at fokusere på at bygge bedre data for at bygge bedre modeller.
Dette står i kontrast til – men fungerer hånd i hånd med – model-centreret AI. I model-centreret AI antager dataeksperter eller forskere, at data er statisk, og de bruger deres energi på at justere modelarkitekturer og parametre for at opnå bedre resultater.
Forskere gør stadig godt arbejde i model-centreret AI, men standardmodeller og auto ML-teknikker er blevet så meget bedre, at modelvalget er blevet kommercialiseret på produktions tidspunkt. Når det er tilfældet, er den bedste måde at forbedre disse modeller at forsyne dem med mere og bedre data.
Hvad er de centrale principper for en data-centreret AI-tilgang?
Det centrale princip for data-centreret AI er simpelt: bedre data bygger bedre modeller.
I vores akademiske arbejde har vi kaldt dette “data-programmering”. Idéen er, at hvis du føder en robust nok model nok eksempler på input og forventede output, lærer modellen at duplikere disse mønstre.
Dette præsenterer en større udfordring, end du måske ville forvente. Den overvældende majoritet af data har ingen mærker – eller i hvert fald ingen nyttige mærker til din ansøgning. At mærke data manuelt kræver kedelighed, tid og menneskelig indsats.
At have en mærket datasæt garanterer ikke kvalitet. Menneskelig fejl sniger sig ind overalt. Hver forkert eksempel i din grundsandhed vil forringe præstationen af den endelige model. Ingen mængde af parameterjustering kan dække over denne virkelighed. Forskere har endda fundet forkert mærkede poster i grundlæggende åbne datasæt.
Kan du uddybe, hvad det betyder for data-centreret AI at være programmeringsbaseret?
At mærke data manuelt præsenterer alvorlige udfordringer. Det kræver mange menneskelige timer, og disse menneskelige timer kan være dyre. Medicinske dokumenter, for eksempel, kan kun mærkes af læger.
Derudover resulterer manuelle mærkningsløb ofte i enkeltbrugsprojekter. Mærkere mærker dataene i overensstemmelse med en fast skema. Hvis en virksomheds behov ændrer sig og kræver en anden sæt mærker, må mærkere starte forfra.
Programmeringsbaserede tilgange til data-centreret AI minimiserer begge disse problemer. Snorkel AI’s programmeringsbaserede mærkningsystem inkorporerer diverse signaler – fra eksisterende modeller til eksisterende mærker til eksterne videnbasers – for at udvikle sandsynligvis mærker i stor målestok. Vores primære kilde til signal kommer fra fagfolk, der samarbejder med dataeksperter for at bygge mærkningsfunktioner. Disse kodificerer deres ekspertdom til skalerbare regler, der tillader den indsats, der investeres i én beslutning, at påvirke dusinvis eller hundredvis af datapunkter.
Dette rammeværk er også fleksibelt. I stedet for at starte forfra, når forretningsbehov ændrer sig, tilføjer, fjerner og justerer brugerne mærkningsfunktioner for at anvende nye mærker på få timer i stedet for dage.
Hvordan giver denne data-centreret tilgang mulighed for hurtig skala af umærket data?
Vores programmeringsbaserede tilgang til data-centreret AI giver mulighed for hurtig skala af umærket data ved at forstærke virkningen af hver valg. Når fagfolk etablerer en initial, lille sæt grundsandhed, begynder de at samarbejde med dataeksperter for hurtig iteration. De definerer et par mærkningsfunktioner, træner en hurtig model, analyserer virkningen af deres mærkningsfunktioner og tilføjer, fjerner eller justerer mærkningsfunktioner efter behov.
Hver cyklus forbedrer modelpræstationen, indtil den opfylder eller overgår projektets mål. Dette kan reducere måneder med mærkningsarbejde til bare timer. I et Snorkel-forskningsprojekt mærkede to af vores forskere 20.000 dokumenter på en enkelt dag – en mængde, der kunne have taget manuelle mærkere ti uger eller længere.
Snorkel tilbyder flere AI-løsninger, herunder Snorkel Flow, Snorkel GenGlow og Snorkel Foundry. Hvad er forskellen på disse tilbud?
Snorkel AI-suiten giver brugerne mulighed for at oprette mærkningsfunktioner (f.eks. søger efter nøgleord eller mønstre i dokumenter) for at mærke millioner af datapunkter på minutter i stedet for at mærke et datapunkt ad gangen.
Det komprimerer den tid, der kræves for virksomheder for at oversætte deres eget data til produktionsklare modeller og begynde at udtrække værdi fra dem. Snorkel AI giver virksomheder mulighed for at skala menneske-i-løkken tilgange ved effektivt at inkorporere menneskelig dømmekraft og faglig viden.
Dette giver mere gennemsigtig og forklarlig AI, der giver virksomheder mulighed for at håndtere bias og levere ansvarlige resultater.
Når vi kommer til detaljerne, giver Snorkels AI mulighed for, at Fortune 500-virksomheder:
- Udvikler højkvalitetsmærket data til at træne modeller eller forbedre RAG;
- Tilpasser LLM’er med finjustering;
- Destillerer LLM’er til specialiserede modeller, der er meget mindre og billigere at operere;
- Bygger domæne- og opgave-specifikke LLM’er med fortræning.
Hvilken af dine artikler er, ifølge dig, den vigtigste?
En af de vigtigste artikler var den oprindelige artikel om data-programmering (mærkning af træningsdata programmeringsmæssigt) og den om Snorkel.
Hvad er din vision for Snorkels fremtid?
Jeg ser Snorkel som en troværdig partner for alle store virksomheder, der er alvorlige omkring AI.
Snorkel Flow skal blive et almindeligt værktøj for datavidenskabs hold på store virksomheder – uanset om de tilpasser brugerdefinerede store sprogmodeller til deres virksomhed, bygger billedklassificeringsmodeller eller bygger enkle, udviklede logistiske regressionsmodeller.
Uanset hvilken type modeller en virksomhed har brug for, vil de have brug for højkvalitetsmærket data til at træne dem.
Tak for det gode interview. Læsere, der ønsker at lære mere, kan besøge Snorkel AI,












