Interviews

Steven Hillion, Senior Vice President van Data en AI bij Astronomer – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Steven Hillion is de Senior Vice President van Data en AI bij Astronomer, waar hij zijn uitgebreide academische achtergrond in onderzoekswiskunde en meer dan 15 jaar ervaring in de ontwikkeling van machine learning-platforms in Silicon Valley gebruikt. Bij Astronomer leidt hij de creatie van Apache Airflow-functies die specifiek zijn ontworpen voor ML- en AI-teams en houdt toezicht op het interne data science-team. Onder zijn leiding heeft Astronomer zijn moderne data-orchestratieplatform verder ontwikkeld, waardoor de mogelijkheden van data-pipelines aanzienlijk zijn verbeterd om een breed scala aan data-bronnen en taken te ondersteunen via machine learning.

Kunt u ons wat vertellen over uw ervaring in data science en AI, en hoe dit uw aanpak heeft beïnvloed bij het leiden van engineering- en analytics-teams?

Ik had een achtergrond in onderzoekswiskunde aan Berkeley voordat ik naar Silicon Valley verhuisde en als ingenieur werkte bij een serie succesvolle start-ups. Ik was blij om de politiek en bureaucratie van de academische wereld achter me te laten, maar ik merkte al snel dat ik de wiskunde miste. Dus ik stapte over naar het ontwikkelen van platforms voor machine learning en analytics, en dat is vrijwel alles wat ik sindsdien heb gedaan.

Mijn opleiding in zuivere wiskunde heeft ertoe geleid dat ik de voorkeur geef aan wat data scientists ‘parsimonie’ noemen – het juiste gereedschap voor de taak, en niets meer. Omdat wiskundigen over het algemeen eenvoudige oplossingen boven complexe machines verkiezen, heb ik altijd geprobeerd om eenvoud te benadrukken bij het toepassen van machine learning op bedrijfsproblemen. Diepe leermodellen zijn geweldig voor sommige toepassingen – grote taalmodellen zijn briljant voor het samenvatten van documenten, bijvoorbeeld – maar soms is een eenvoudig regressiemodel meer geschikt en gemakkelijker uit te leggen.

Het is fascinerend om te zien hoe de rol van de data scientist en de software engineer in de afgelopen twintig jaar is veranderd sinds machine learning algemeen werd. Ik heb beide hoeden gedragen en ik ben me zeer bewust van het belang van de software-ontwikkelingscyclus (vooral automatisering en testen) bij machine learning-projecten.

Wat zijn de grootste uitdagingen bij het verplaatsen, verwerken en analyseren van ongestructureerde data voor AI en grote taalmodellen (LLM’s)?

In de wereld van generatieve AI is uw data uw waardevolste bezit. De modellen worden steeds meer gemeengoed, dus uw differentiatie is al die harde, institutionele kennis die is vastgelegd in uw eigendoms- en gecuronde datasets.

Het leveren van de juiste data op het juiste moment stelt hoge eisen aan uw data-pipelines – en dit geldt evenzeer voor ongestructureerde data als voor gestructureerde data, of misschien nog wel meer. Vaak neemt u data in vanuit veel verschillende bronnen, in veel verschillende formaten. U hebt toegang nodig tot een verscheidenheid aan methoden om de data te kunnen uitpakken en klaar te maken voor gebruik in modelinference of modeltraining. U moet ook de herkomst van de data begrijpen en waar deze terechtkomt om uw “werk te kunnen laten zien”.

Als u dit maar af en toe doet om een model te trainen, is dat prima. U hoeft het niet noodzakelijkerwijs te operationaliseren. Als u het model dagelijks gebruikt om klantensentiment van online-fora te begrijpen of om facturen samen te vatten en door te sturen, dan begint het te lijken op elke andere operationele data-pipeline, wat betekent dat u moet denken aan betrouwbaarheid en reproduceerbaarheid. Of als u het model regelmatig fijn afstelt, moet u zich zorgen maken over het monitoren van de nauwkeurigheid en de kosten.

Het goede nieuws is dat data engineers een geweldig platform hebben ontwikkeld, Airflow, voor het beheren van data-pipelines, dat al met succes is toegepast op het beheren van modelimplementatie en -monitoring door enkele van ‘s werelds meest geavanceerde ML-teams. Dus de modellen zijn misschien nieuw, maar orchestratie is dat niet.

Kunt u ons meer vertellen over het gebruik van synthetische data om kleinere modellen voor nauwkeurigheid te fijn af te stellen? Hoe vergelijkt dit met het trainen van grotere modellen?

Het is een krachtige techniek. U kunt de beste grote taalmodellen beschouwen als een soort encapsulering van wat ze over de wereld hebben geleerd, en ze kunnen dat doorgeven aan kleinere modellen door synthetische data te genereren. LLM’s encapsuleren enorme hoeveelheden kennis die zijn geleerd van uitgebreide training op diverse datasets. Deze modellen kunnen synthetische data genereren die de patronen, structuren en informatie vastlegt die ze hebben geleerd. Deze synthetische data kan vervolgens worden gebruikt om kleinere modellen te trainen, waardoor effectief enige kennis van de grotere modellen wordt overgedragen aan de kleinere modellen. Dit proces wordt vaak “kennisdestillatie” genoemd en helpt bij het creëren van efficiënte, kleinere modellen die nog steeds goed presteren op specifieke taken. En met synthetische data kunt u bovendien problemen met privacy vermijden en gaten in de trainingsdata opvullen die klein of onvolledig zijn.

Dit kan nuttig zijn voor het trainen van een meer domeinspecifiek generatief AI-model en kan zelfs effectiever zijn dan het trainen van een “groter” model, met een grotere mate van controle.

Data scientists hebben al een tijdje synthetische data gegenereerd en imputatie bestaat al zo lang als er rommelige datasets zijn. Maar u moest altijd heel voorzichtig zijn dat u geen biases introduceerde of verkeerde aannamen deed over de verdeling van de data. Nu synthetische data zo gemakkelijk en krachtig is, moet u nog voorzichtiger zijn. Fouten kunnen worden versterkt.

Een gebrek aan diversiteit in gegenereerde data kan leiden tot ‘modelcollapse’. Het model denkt dat het het goed doet, maar dat is omdat het nog niet het volledige beeld heeft gezien. En, meer in het algemeen, een gebrek aan diversiteit in trainingsdata is iets waar data-teams altijd naar moeten kijken.

Op een basaal niveau, of u nu synthetische data of organische data gebruikt, zijn afkomst en kwaliteit van cruciaal belang voor het trainen of fijn afstellen van elk model. Zoals we weten, zijn modellen alleen zo goed als de data waarop ze zijn getraind. Terwijl synthetische data een geweldig hulpmiddel kan zijn om een gevoelige dataset te vertegenwoordigen zonder deze bloot te geven of om gaten op te vullen die mogelijk ontbreken in een representatieve dataset, moet u een papieren spoor hebben dat laat zien waar de data vandaan komt en u moet in staat zijn om de kwaliteit ervan te bewijzen.

Wat zijn enkele innovatieve technieken die uw team bij Astronomer implementeert om de efficiëntie en betrouwbaarheid van data-pipelines te verbeteren?

Zo veel! Astro’s volledig beheerde Airflow-infrastructuur en de Astro Hypervisor ondersteunen dynamisch schalen en proactief monitoren via geavanceerde gezondheidsmetrieken. Dit zorgt ervoor dat resources efficiënt worden gebruikt en dat systemen betrouwbaar zijn op elke schaal. Astro biedt robuuste data-gecentreerde waarschuwingen met aanpasbare meldingen die via verschillende kanalen kunnen worden verzonden, zoals Slack en PagerDuty. Dit zorgt ervoor dat tijdig kan worden ingegrepen voordat problemen escaleren.

Data-validatietests, eenheidstests en datakwaliteitscontroles spelen een vitale rol bij het waarborgen van de betrouwbaarheid, nauwkeurigheid en efficiëntie van data-pipelines en uiteindelijk de data die uw bedrijf aandrijft. Deze controles zorgen ervoor dat, terwijl u snel data-pipelines bouwt om uw deadlines te halen, deze actief fouten opvangen, ontwikkelingstijden verbeteren en onvoorziene fouten in de achtergrond reduceren. Bij Astronomer hebben we tools als Astro CLI gebouwd om u te helpen de functionaliteit van uw code naadloos te controleren of integratieproblemen in uw data-pipeline te identificeren.

Hoe ziet u de evolutie van generatieve AI-governance, en welke maatregelen moeten worden genomen om de creatie van meer tools te ondersteunen?

Governance is imperatief als de toepassingen van generatieve AI succesvol willen zijn. Het gaat allemaal om transparantie en reproduceerbaarheid. Weet u hoe u dit resultaat hebt behaald, en vanwaar, en door wie? Airflow biedt u al een manier om te zien wat individuele data-pipelines doen. De gebruikersinterface was een van de redenen voor de snelle adoptie in het begin, en bij Astronomer hebben we dit aangevuld met zichtbaarheid over teams en implementaties. We bieden onze klanten ook rapportagedashboards die uitgebreide inzichten bieden in platformgebruik, prestaties en kostenallocatie voor geïnformeerde besluitvorming. Bovendien maakt de Astro API het teams mogelijk om hun Airflow-pipelines programmatisch te implementeren, te automatiseren en te beheren, waardoor risico’s die samenhangen met handmatige processen worden geminimaliseerd en naadloze bewerkingen worden gegarandeerd bij het beheren van meerdere Airflow-omgevingen. Lineage-functionaliteiten zijn ingebakken in het platform.

Deze zijn allemaal stappen om te helpen bij het beheren van data-governance, en ik geloof dat bedrijven van alle maten de belangrijkheid van data-governance erkennen voor het waarborgen van vertrouwen in AI-toepassingen. Deze erkenning en bewustwording zullen grotendeels de vraag naar data-governance-tools aandrijven, en ik verwacht dat de creatie van meer van deze tools zal versnellen naarmate generatieve AI zich verder ontwikkelt. Maar ze moeten deel uitmaken van de grotere orchestratie-stack, en dat is waarom we het als fundamenteel beschouwen voor de manier waarop we ons platform bouwen.

Kunt u voorbeelden geven van hoe Astronomers oplossingen de operationele efficiëntie en productiviteit voor klanten hebben verbeterd?

Generatieve AI-processen omvatten complexe en resource-intensieve taken die zorgvuldig moeten worden geoptimaliseerd en herhaaldelijk moeten worden uitgevoerd. Astro, Astronomers beheerde Apache Airflow-platform, biedt een kader in het centrum van de opkomende AI-app-stack om deze taken te vereenvoudigen en de mogelijkheid te vergroten om snel te innoveren.

Door generatieve AI-taken te orkestreren, kunnen bedrijven ervoor zorgen dat computationele resources efficiënt worden gebruikt en workflows worden geoptimaliseerd en aangepast in real-time. Dit is vooral belangrijk in omgevingen waar generatieve modellen regelmatig moeten worden bijgewerkt of opnieuw getraind op basis van nieuwe data.

Door Airflows workflowbeheer en Astronomers implementatie- en schaalmogelijkheden te benutten, kunnen teams minder tijd besteden aan het beheren van infrastructuur en hun aandacht richten op data-transformatie en modelontwikkeling, waardoor de implementatie van generatieve AI-toepassingen wordt versneld en de prestaties worden verbeterd.

Op deze manier heeft Astronomers Astro-platform klanten geholpen om de operationele efficiëntie van generatieve AI te verbeteren in een breed scala aan use-cases. Om er een paar te noemen, zijn use-cases onder andere e-commerce productontdekking, customer churn-risicoanalyse, supportautomatisering, juridische documentclassificatie en -samenvatting, het verzamelen van productinzichten uit klantbeoordelingen en dynamische clusterinrichting voor productafbeeldingengeneratie.

Wat is de rol van Astronomer bij het verbeteren van de prestaties en schaalbaarheid van AI- en ML-toepassingen?

Schaalbaarheid is een grote uitdaging voor bedrijven die generatieve AI in 2024 gebruiken. Wanneer u van een prototype naar productie gaat, verwachten gebruikers dat hun generatieve AI-apps betrouwbaar en prestatiegericht zijn, en dat de door hen gegenereerde output betrouwbaar is. Dit moet op een kostenefficiënte manier gebeuren en bedrijven van alle maten moeten in staat zijn om het potentieel ervan te benutten. Met Astronomer kunnen taken horizontaal worden geschaald om een groot aantal data-bronnen dynamisch te verwerken. Astro kan implementaties en de clusters waarop ze worden gehost elastisch schalen, en taakuitvoering op basis van wachtrijen met specifieke machinetype biedt grotere betrouwbaarheid en efficiënter gebruik van compute-resources. Om het stuk kosten-efficiëntie van de puzzel te helpen, biedt Astro schaal-naar-nul- en sluimerfuncties, die helpen om kosten te controleren en cloud-uitgaven te reduceren. We bieden ook complete transparantie over de kosten van het platform. Mijn eigen data-team genereert rapporten over consumptie die we dagelijks aan onze klanten beschikbaar stellen.

Wat zijn enkele toekomstige trends in AI en data science waar u enthousiast over bent, en hoe bereidt Astronomer zich daarop voor?

Verklaarbare AI is een enorm belangrijk en fascinerend ontwikkelingsgebied. Het is bijna eng om in de innerlijke werking van zeer grote modellen te kunnen kijken. En ik ben ook geïnteresseerd om te zien hoe de gemeenschap worstelt met de milieueffecten van modeltraining en -afstemming. Bij Astronomer blijven we onze Registry up-to-date houden met alle laatste integraties, zodat data- en ML-teams kunnen aansluiten op de beste modelservices en de meest efficiënte compute-platforms zonder enige inspanning.

Hoe ziet u de integratie van geavanceerde AI-hulpmiddelen zoals LLM’s met traditionele data management systemen in de komende jaren?

We hebben onlangs gezien dat zowel Databricks als Snowflake aankondigingen hebben gedaan over hoe ze het gebruik en de ontwikkeling van LLM’s binnen hun respectievelijke platforms integreren. Andere DBMS en ML-platforms zullen hetzelfde doen. Het is geweldig om te zien dat data engineers zo gemakkelijk toegang hebben tot zulke krachtige methoden, rechtstreeks vanaf de opdrachtregel of de SQL-prompt.

Ik ben vooral geïnteresseerd in hoe relationele databases machine learning integreren. Ik wacht altijd tot ML-methoden worden opgenomen in de SQL-standaard, maar om de een of andere reden hebben de twee disciplines nooit echt een connectie gemaakt. Misschien is het deze keer anders.

Ik ben erg enthousiast over de toekomst van grote taalmodellen om het werk van de data engineer te ondersteunen. Om te beginnen zijn LLM’s al bijzonder succesvol gebleken in codegeneratie, hoewel vroege pogingen om data scientists van AI-gedreven suggesties te voorzien gemengde resultaten hebben gehad: Hex is geweldig, bijvoorbeeld, terwijl Snowflake tot nu toe oninspirerend is. Maar er is een enorm potentieel om de aard van het werk voor data-teams te veranderen, veel meer dan voor ontwikkelaars. Waarom? Voor software engineers is de prompt een functienaam of de documentatie, maar voor data engineers is er ook de data. Er is zoveel context dat modellen kunnen werken met om nuttige en accurate suggesties te doen.

Wat is uw advies aan aspirant-data scientists en AI-engineers die een impact in de industrie willen maken?

Leer door te doen. Het is zo ontzettend gemakkelijk om toepassingen te bouwen tegenwoordig, en om ze te verrijken met kunstmatige intelligentie. Dus bouw iets cools, en stuur het naar een vriend van een vriend die bij een bedrijf werkt dat u bewondert. Of stuur het naar mij, en ik beloof dat ik ernaar zal kijken!

De truc is om iets te vinden waar u gepassioneerd over bent en een goede bron van gerelateerde data te vinden. Een vriend van mij deed een fascinerende analyse van anormale honkbalseizoenen die teruggaan tot de 19e eeuw en ontdekte verhalen die een film waard zijn. En enkele van Astronomers engineers kwamen onlangs op een weekend bij elkaar om een platform te bouwen voor zelfherstellende data-pipelines. I

Bedankt voor het geweldige interview, lezers die meer willen leren, kunnen bezoek Astronomer.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.