Interviews
Alex Ratner, CEO & Co-Founder van Snorkel AI – Interview Serie

Alex Ratner is de CEO & Co-Founder van Snorkel AI, een bedrijf dat is ontstaan uit het Stanford AI-lab.
Snorkel AI maakt AI-ontwikkeling snel en praktisch door handmatige AI-ontwikkelingsprocessen om te zetten in programmeerbare oplossingen. Snorkel AI stelt ondernemingen in staat om AI te ontwikkelen die werkt voor hun unieke workloads met behulp van hun eigen gegevens en kennis 10-100x sneller.
Wat trok je aanvankelijk aan tot informatica?
Er zijn twee zeer spannende aspecten van informatica als je jong bent. Ten eerste kun je leren zo snel als je wilt door te knutselen en te bouwen, dankzij de directe feedback, in plaats van te moeten wachten op een leraar. Ten tweede kun je veel bouwen zonder iemand om toestemming te hoeven vragen!
Ik begon te programmeren toen ik een jonge knul was om deze redenen. Ik hield ook van de precisie die het vereiste. Ik genoot van het proces van het abstract maken van complexe processen en routines en ze vervolgens in een modulaire vorm te coderen.
Later, als volwassene, kwam ik terug in de informatica via een baan in consulting waarin ik scripts moest schrijven om enkele basisanalyses van het octrooicorpus uit te voeren. Ik was gefascineerd door hoeveel menselijke kennis – alles wat iemand ooit als octrooieerbaar had beschouwd – gemakkelijk beschikbaar was, maar toch ontoegankelijk was omdat het zo moeilijk was om zelfs de eenvoudigste analyse uit te voeren over complexe technische tekst en multimodale gegevens.
Dit is wat me terug leidde naar de informatica en uiteindelijk terug naar de universiteit van Stanford, waar ik me richtte op NLP, het gebied van het gebruik van ML/AI op natuurlijke taal.
Je startte en leidde het Snorkel open-source project voor het eerst toen je aan Stanford was, kun je ons door de reis van deze vroege dagen heen leiden?
Destijds waren we, net als velen in de industrie, gericht op het ontwikkelen van nieuwe algoritmes en – i.e. alle “fancy” machine learning-dingen die mensen in de gemeenschap deden en publiceerden.
Maar we waren altijd erg toegewijd aan het verankeren van dit in echte wereldproblemen – meestal met artsen en wetenschappers aan Stanford. Maar elke keer dat we een nieuw model of algoritme presenteerden, werd de reactie “oké, we zouden dat proberen, maar we zouden allemaal gelabelde trainingsgegevens nodig hebben die we geen tijd hebben om te maken!”
We zagen dat het grote onuitgesproken probleem was rond het proces van labelen en cureren van die trainingsgegevens – dus we verlegden al onze focus naar dat, en dat is hoe het Snorkel-project en het idee van “data-centric AI” begon.
Snorkel heeft een data-centric AI-benadering, kun je uitleggen wat dit betekent en hoe het verschilt van model-centric AI-ontwikkeling?
Data-centric AI betekent het bouwen van betere gegevens om betere modellen te bouwen.
Dit staat in contrast met – maar werkt hand in hand met – model-centric AI. In model-centric AI gaan datawetenschappers of onderzoekers ervan uit dat de gegevens statisch zijn en steken hun energie in het aanpassen van modelarchitecturen en parameters om betere resultaten te behalen.
Onderzoekers doen nog steeds geweldig werk in model-centric AI, maar standaardmodellen en auto ML-technieken zijn zo veel verbeterd dat modelkeuze geïntegreerd is in de productietijd. Wanneer dat het geval is, is de beste manier om deze modellen te verbeteren door ze van meer en betere gegevens te voorzien.
Wat zijn de kernbeginselen van een data-centric AI-benadering?
Het kernbeginsel van data-centric AI is eenvoudig: beter data bouwt betere modellen.
In ons academisch werk hebben we dit “data programming” genoemd. Het idee is dat als je een robuust genoeg model voldoende voorbeelden van invoer en verwachte uitvoer geeft, het model leert om die patronen te dupliceren.
Dit presenteert een grotere uitdaging dan je misschien verwacht. Het grootste deel van de gegevens heeft geen labels – of, ten minste, geen bruikbare labels voor uw toepassing. Het labelen van die gegevens met de hand vereist saaiheid, tijd en menselijke inspanning.
Het hebben van een gelabelde gegevensset garandeert ook niet de kwaliteit. Menselijke fouten sluipen overal in. Elke onjuist gelabelde voorbeeld in uw grondwaarheid zal de prestaties van het eindmodel verslechteren. Geen enkele parameterafstemming kan die realiteit maskeren. Onderzoekers hebben zelfs onjuist gelabelde records gevonden in open source-gegevenssets.
Kunt u uitleggen wat het betekent voor Data-Centric AI om programmeerbaar te zijn?
Handmatig labelen van gegevens presenteert serieuze uitdagingen. Dit vereist veel menselijke uren, en soms kunnen die menselijke uren duur zijn. Medische documenten, bijvoorbeeld, kunnen alleen worden gelabeld door artsen.
Daarnaast leiden handmatige label-sprints vaak tot eenmalige projecten. Labelaars annoteren de gegevens volgens een star schema. Als de behoeften van een bedrijf veranderen en een ander set labels vereisen, moeten labelaars opnieuw beginnen vanaf het begin.
Programmeerbare benaderingen van data-centric AI minimaliseren beide problemen. Snorkel AI’s programmeerbare labelsysteem omvat diverse signalen – van legacy-modellen tot bestaande labels tot externe kennisbases – om probabilistische labels op grote schaal te ontwikkelen. Onze primaire bron van signaal komt van subject-matter-experts die samenwerken met datawetenschappers om label-functies te bouwen. Deze coderen hun expertoordeel in schaalbare regels, waardoor de inspanning die in één beslissing wordt geïnvesteerd, tientallen of honderden gegevenspunten kan beïnvloeden.
Deze framework is ook flexibel. In plaats van opnieuw te beginnen wanneer de behoeften van een bedrijf veranderen, voegen gebruikers label-functies toe, verwijderen of passen aan om nieuwe labels toe te passen in uren in plaats van dagen.
Hoe maakt deze data-centric benadering het mogelijk om ongelabelde gegevens snel op te schalen?
Onze programmeerbare benadering van data-centric AI maakt het mogelijk om ongelabelde gegevens snel op te schalen door de impact van elke keuze te verhogen. Zodra subject-matter-experts een initiële, kleine set grondwaarheid hebben vastgesteld, beginnen ze samen te werken met datawetenschappers voor snelle iteratie. Ze definiëren enkele label-functies, trainen een snelle model, analyseren de impact van hun label-functies en voegen, verwijderen of passen label-functies aan zoals nodig.
Elke cyclus verbetert de prestaties van het model totdat het de doelen van het project bereikt of overtreft. Dit kan maanden van gegevenslabel-werk terugbrengen tot slechts uren. In een van de onderzoeksprojecten van Snorkel labelden twee van onze onderzoekers 20.000 documenten in één dag – een volume dat handmatige labelaars tien weken of langer had kunnen duren.
Snorkel biedt meerdere AI-oplossingen, waaronder Snorkel Flow, Snorkel GenGlow en Snorkel Foundry. Wat zijn de verschillen tussen deze aanbiedingen?
De Snorkel AI-suite stelt gebruikers in staat om label-functies te maken (bijv. naar trefwoorden of patronen in documenten zoeken) om programmatisch miljoenen gegevenspunten in minuten te labelen, in plaats van handmatig één gegevenspunt per keer te labelen.
Het comprimeert de tijd die bedrijven nodig hebben om hun eigen gegevens om te zetten in productieklare modellen en om waarde uit hen te halen. Snorkel AI stelt ondernemingen in staat om mens-in-de-lus-benaderingen op te schalen door menselijke oordeel en kennis van subject-matter-experts efficiënt te integreren.
Dit leidt tot meer transparante en verklarebare AI, waardoor ondernemingen in staat zijn om vooroordelen te beheren en verantwoorde resultaten te leveren.
Om het tot de kern te komen, stelt Snorkels AI Fortune 500-ondernemingen in staat om:
- Hoge kwaliteit gelabelde gegevens te ontwikkelen om modellen te trainen of RAG te verbeteren;
- LLM’s aan te passen met fijne afstemming;
- LLM’s te destilleren in gespecialiseerde modellen die veel kleiner en goedkoper zijn om te exploiteren;
- Domein- en taakspecifieke LLM’s te bouwen met voorafgaande training.
Je hebt enkele baanbrekende papers geschreven, in jouw mening, welke is jouw meest belangrijke paper?
Een van de sleutelpapers was de oorspronkelijke over data programming (het labelen van trainingsgegevens programmatisch) en over Snorkel.
Wat is jouw visie voor de toekomst van Snorkel?
Ik zie Snorkel als een vertrouwd partner voor alle grote ondernemingen die serieus zijn over AI.
Snorkel Flow moet een alomtegenwoordig hulpmiddel worden voor data science-teams bij grote ondernemingen – of ze nu aangepaste grote taalmodellen fijn afstemmen voor hun organisaties, beeldclassificatiemodellen bouwen of eenvoudige, inzetbare logistieke regressiemodellen bouwen.
Ongeacht wat voor soort modellen een bedrijf nodig heeft, ze zullen hoge kwaliteit gelabelde gegevens nodig hebben om het te trainen.
Bedankt voor het geweldige interview, lezers die meer willen leren, moeten Snorkel AI bezoeken,












