Intervjuer

Alex Ratner, CEO og medgrunnlegger av Snorkel AI – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Alex Ratner er CEO og medgrunnlegger av Snorkel AI, et selskap som ble født ut av Stanford AI-laboratoriet.

Snorkel AI gjør AI-utvikling rask og praktisk ved å transformere manuelle AI-utviklingsprosesser til programmerbare løsninger. Snorkel AI muliggjør at bedrifter utvikler AI som fungerer for deres unike arbeidsbyrde ved hjelp av deres eget data og kunnskap 10-100 ganger raskere.

Hva var det som først tiltalte deg til datavitenskap?

Det er to veldig spennende aspekter ved datavitenskap når du er ung. En, du får lære så raskt du vil ved å eksperimentere og bygge, gitt den umiddelbare tilbakemeldingen, i stedet for å måtte vente på en lærer. To, du får bygge mye uten å måtte spørre noen om tillatelse!

Jeg begynte å programmere da jeg var en liten gutt av disse grunnene. Jeg elsket også presisjonen det krevde. Jeg likte prosessen med å abstrahere komplekse prosesser og rutiner, og deretter kode dem på en modulær måte.

Senere, som voksen, kom jeg tilbake til datavitenskap profesjonelt via en jobb i konsulentbransjen hvor jeg ble bedt om å skrive skript for å gjøre noen grundige analyser av patentkorpuset. Jeg var fascinert av hvor mye menneskelig kunnskap – alt noen noensinne hadde ansett som patenterbart – var lett tilgjengelig, men likevel så utilgjengelig fordi det var så vanskelig å gjøre selv de enkleste analyser over komplekse tekniske tekster og multimodale data.

Dette var det som ledet meg tilbake ned i kaninhullet, og til slutt tilbake til Stanford som student, med fokus på NLP, som er området hvor man bruker ML/AI på naturlig språk.

Du startet og ledet Snorkel-prosjektet mens du var ved Stanford, kan du fortelle oss om reisen i disse tidlige dagene?

Da var vi, som mange i bransjen, fokusert på å utvikle nye algoritmer og – dvs. all den “fancy” maskinlærings-stoffet som folk i samfunnet forsket på og publiserte papirer om.

Men vi var alltid svært dedikert til å forankre dette i virkelige problemer – hovedsakelig med leger og forskere ved Stanford. Men hver gang vi presenterte en ny modell eller algoritme, ble svaret “ja, vi ville prøve det, men vi ville trenge all denne merketreningdataen som vi ikke har tid til å lage!”

Vi så at det store, uutsagte problemet var rundt prosessen med å merke og kuratere denne treningdataen – så vi skiftet all vår fokus til det, og det er hvordan Snorkel-prosjektet og ideen om “data-sentrert AI” startet.

Snorkel har en data-sentrert AI-tilnærming, kan du definere hva dette betyr og hvordan det skiller seg fra modell-sentrert AI-utvikling?

Data-sentrert AI betyr å fokusere på å bygge bedre data for å bygge bedre modeller.

Dette står i kontrast til – men fungerer hånd i hånd med – modell-sentrert AI. I modell-sentrert AI antar dataforskere eller forskere at dataene er statiske og legger all sin energi i å justere modellarkitekturer og parametre for å oppnå bedre resultater.

Forskere gjør fremdeles stor arbeid i modell-sentrert AI, men ferdige modeller og auto ML-teknikker har blitt så mye bedre at modellvalg har blitt kommodifisert på produksjonstid. Når det er tilfelle, er den beste måten å forbedre disse modellene å forsyne dem med mer og bedre data.

Hva er de grunnleggende prinsippene for en data-sentrert AI-tilnærming?

Det grunnleggende prinsippet for data-sentrert AI er enkelt: bedre data bygger bedre modeller.

I vårt akademiske arbeid har vi kalt dette “data-programmering”. Ideen er at hvis du mater en robust nok modell med nok eksempler på inndata og forventede utdata, lærer modellen å duplisere disse mønsterene.

Dette presenterer en større utfordring enn du kanskje forventer. Det overveldende flertall av data har ingen merking – eller, i hvert fall, ingen nyttige merking for din applikasjon. Å merke denne dataen for hånd krever kjedsommelighet, tid og menneskelig innsats.

Å ha en merket datamengde garanterer heller ikke kvalitet. Menneskelig feil kryper inn overalt. Hver feilaktig merket eksempel i din grunntruth vil forringe ytelsen til den endelige modellen. Ingen mengde parameterjustering kan dekke over denne realiteten. Forskere har til og med funnet feilaktig merkte poster i åpne kildekodedata.

Kunne du utdype hva det betyr for Data-Centric AI å være programmerbar?

Manuell merking av data presenterer alvorlige utfordringer. Dette krever mange menneskelige timer, og noen ganger kan disse menneskelige timene være dyre. Medisinske dokumenter, for eksempel, kan bare merkes av leger.

I tillegg er manuelle merkingssprint ofte engangprosjekter. Merkerne merker dataene i henhold til en rigid skjema. Hvis et bedrifts behov endrer seg og krever en annen sett med merking, må merkerne starte på nytt fra scratch.

Programmerbare tilnærminger til data-sentrert AI minimerer begge disse problemene. Snorkel AIs programmerbare merkingssystem inkorporerer diverse signaler – fra legacy-modeller til eksisterende merking til eksterne kunnskapsbaserte systemer – for å utvikle probabilistiske merking på stor skala. Vår primære kilde til signal kommer fra fagfolk som samarbeider med dataforskere for å bygge merkingfunksjoner. Disse funksjonene koder deres ekspertdomene inn i skalerbare regler, som lar innsatsen i én beslutning påvirke dusinvis eller hundrevis av datapunkter.

Dette rammeverket er også fleksibelt. I stedet for å starte fra scratch når bedriftens behov endrer seg, legger brukerne til, fjerner og justerer merkingfunksjoner for å anvende nye merking i timer i stedet for dager.

Hvordan muliggjør denne data-senterte tilnærmingen rask skalering av umerkt data?

Vår programmerbare tilnærming til data-sentrert AI muliggjør rask skalering av umerkt data ved å forsterke effekten av hvert valg. Når fagfolk etablerer en initial, liten mengde grunntruth, begynner de å samarbeide med dataforskere for rask iterasjon. De definerer noen merkingfunksjoner, trener en rask modell, analyserer effekten av deres merkingfunksjoner og justerer dem deretter.

Hver syklus forbedrer modellens ytelse til den møter eller overgår prosjektets mål. Dette kan redusere måneder med datamerking til bare timer. I ett av Snorkels forskningsprosjekter merket to av våre forskere 20 000 dokumenter på en enkelt dag – en mengde som kunne ha tatt manuelle merker ti uker eller lenger.

Snorkel tilbyr flere AI-løsninger, inkludert Snorkel Flow, Snorkel GenGlow og Snorkel Foundry. Hva er forskjellene mellom disse tilbudene?

Snorkel AI-suiten muliggjør at brukerne kan lage merkingfunksjoner (for eksempel, å se etter nøkkelord eller mønster i dokumenter) for å programmatically merke millioner av datapunkter på minutter, i stedet for å manuelt merke ett datapunkt om gangen.

Det komprimerer tiden det tar for selskaper å oversette eget data til produksjonsklare modeller og begynne å trekke ut verdi fra dem. Snorkel AI lar bedrifter skalerer menneske-i-løkken tilnærminger ved å inkorporere menneskelig dømmekraft og faglig ekspertkunnskap på en effektiv måte.

Dette fører til mer transparent og forklarlig AI, som utstyrer bedrifter til å håndtere fordommer og levere ansvarlige resultater.

Ned til detaljene, Snorkels AI muliggjør at Fortune 500-bedrifter:

  • Utvikler høykvalitets merket data for å trene modeller eller forbedre RAG;
  • Tilpasser LLM med finjustering;
  • Destillerer LLM til spesialiserte modeller som er mye mindre og billigere å operere;
  • Bygger domene- og oppgave-spesifikke LLM med fortrening.

Du har skrevet noen banebrytende papirer, hva er i din mening din viktigste papir?

En av de viktigste papirene var den originale om data-programmering (merking av treningdata programmatically) og om Snorkel.

Hva er din visjon for fremtiden til Snorkel?

Jeg ser for meg at Snorkel blir en pålitelig partner for alle store bedrifter som er seriøse med AI.

Snorkel Flow burde bli et ubikkvelt verktøy for dataforskningslag ved store bedrifter – enten de finjusterer tilpassede store språkmodeller for sine organisasjoner, bygger bildeklassifiseringsmodeller eller bygger enkle, distribuerbare logistiske regresjonsmodeller.

Uansett hva slags modeller et bedrift trenger, vil de trenge høykvalitets merket data for å trene det.

Takk for det flotte intervjuet, lesere som ønsker å lære mer bør besøke Snorkel AI,

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.