Intervjuer
Steven Hillion, SVP för data och AI på Astronomer – Intervjuer

Steven Hillion är Senior Vice President för data och AI på Astronomer, där han utnyttjar sin omfattande akademiska bakgrund inom forskningsmatematik och över 15 års erfarenhet av utveckling av maskinläringsplattformar i Silicon Valley. På Astronomer leder han skapandet av Apache Airflow-funktioner som är speciellt utformade för ML- och AI-team och övervakar det interna data science-teamet. Under hans ledning har Astronomer förbättrat sin moderna dataorkestreringsplattform, vilket har förbättrat data pipeline-funktionerna för att stödja en mångfald av datakällor och uppgifter genom maskinlärning.
Kan du dela några uppgifter om din resa inom data science och AI, och hur det har format din tillvägagångssätt för att leda ingenjörs- och analytikerlag?
Jag hade en bakgrund inom forskningsmatematik på Berkeley innan jag flyttade över bukten till Silicon Valley och arbetade som ingenjör i en serie framgångsrika start-ups. Jag var glad att lämna akademins politik och byråkrati, men jag upptäckte inom några år att jag saknade matematiken. Så jag skiftade till att utveckla plattformar för maskinlärning och analys, och det är i stort sett vad jag har gjort sedan.
Min utbildning i ren matematik har resulterat i en förkärlek för vad data scientists kallar “parsimoni” – rätt verktyg för jobbet, och ingenting mer. Eftersom matematiker tenderar att föredra eleganta lösningar över komplexa maskiner, har jag alltid försökt betona enkelhet när jag tillämpar maskinlärning på affärsproblem. Djupinlärning är bra för vissa tillämpningar – stora språkmodeller är briljanta för att sammanfatta dokument, till exempel – men ibland är en enkel regressionsmodell mer lämplig och lättare att förklara.
Det har varit fascinerande att se den skiftande rollen för data scientists och mjukvaruutvecklare under de senaste tjugo åren sedan maskinlärning blev allmänt. Eftersom jag har burit båda hattarna är jag mycket medveten om vikten av mjukvaruutvecklingslivscykeln (särskilt automatisering och testning) när det gäller maskinlärningsprojekt.
Vilka är de största utmaningarna när det gäller att flytta, bearbeta och analysera ostrukturerad data för AI och stora språkmodeller (LLM)?
I världen av generativ AI är din data din mest värdefulla tillgång. Modellerna är alltmer kommersialiserade, så din differentiering är all den hårda vunna institutionella kunskapen som fångats i dina proprietära och kuraterade datamängder.
Att leverera rätt data vid rätt tidpunkt ställer höga krav på dina data pipelines – och detta gäller för ostrukturerad data lika mycket som för strukturerad data, eller kanske mer. Ofta tar du in data från många olika källor, i många olika format. Du behöver tillgång till en mängd olika metoder för att packa upp data och göra dem redo för användning i modellinferens eller modellträning. Du behöver också förstå dataursprunget och vart den hamnar för att “visa ditt arbete”.
Om du bara gör detta ibland för att träna en modell är det okej. Du behöver inte nödvändigtvis operationalisera det. Om du använder modellen dagligen för att förstå kundsentiment från online-forum, eller för att sammanfatta och dirigera fakturor, då börjar det likna vilken annan operativ data pipeline som helst, vilket innebär att du behöver tänka på tillförlitlighet och reproducerbarhet. Eller om du finjusterar modellen regelbundet, då behöver du oroa dig för att övervaka noggrannhet och kostnad.
Det goda nyheten är att data ingenjörer har utvecklat en utmärkt plattform, Airflow, för att hantera data pipelines, som redan har tillämpats framgångsrikt på hantering av modell distribution och övervakning av vissa av världens mest avancerade ML-team. Så modellerna kan vara nya, men orkestreringen är inte det.
Kan du förklara användningen av syntetisk data för att finjustera mindre modeller för noggrannhet? Hur jämför detta med att träna större modeller?
Det är en kraftfull teknik. Du kan tänka på de bästa stora språkmodellerna som på något sätt inkapslar vad de har lärt sig om världen, och de kan förmedla det till mindre modeller genom att generera syntetisk data. LLM inkapslar enorma mängder kunskap som har lärt sig från omfattande träning på olika datamängder. Dessa modeller kan generera syntetisk data som fångar de mönster, strukturer och information de har lärt sig. Denna syntetiska data kan sedan användas för att träna mindre modeller, effektivt överföra någon av kunskapen från de större modellerna till de mindre. Denna process kallas ofta “kunskapsdestillering” och hjälper till att skapa effektiva, mindre modeller som fortfarande presterar bra på specifika uppgifter. Och med syntetisk data kan du undvika sekretessproblem och fylla i luckor i träningsdata som är små eller ofullständiga.
Detta kan vara användbart för att träna en mer domänspecifik generativ AI-modell, och kan till och med vara mer effektivt än att träna en “större” modell, med en högre grad av kontroll.
Data scientists har genererat syntetisk data under en längre tid och imputation har funnits så länge som det har funnits oordnade datamängder. Men du måste alltid vara mycket försiktig så att du inte introducerar fördomar eller gör fel antaganden om datafördelningen. Nu när syntetisk data är så mycket enklare och kraftfullare, måste du vara ännu mer försiktig. Fel kan förstoras.
En brist på mångfald i genererad data kan leda till “modellkollaps”. Modellen tror att den fungerar bra, men det är för att den inte har sett hela bilden. Och, mer allmänt, en brist på mångfald i träningsdata är något som data team alltid bör leta efter.
På en grundläggande nivå, oavsett om du använder syntetisk data eller organisk data, är härstamning och kvalitet av yttersta vikt för att träna eller finjustera någon modell. Som vi vet är modeller bara så bra som de data de tränas på. Medan syntetisk data kan vara ett bra verktyg för att hjälpa till att representera en känslig datamängd utan att exponera den eller för att fylla i luckor som kan ha lämnats i en representativ datamängd, måste du ha en pappersspår som visar var data kommer från och kunna bevisa dess kvalitetsnivå.
Vilka innovativa tekniker implementerar ditt team på Astronomer för att förbättra effektiviteten och tillförlitligheten hos data pipelines?
Så många! Astros fullständigt hanterade Airflow-infrastruktur och Astro Hypervisor stöder dynamisk skalning och proaktiv övervakning genom avancerade hälsomätningar. Detta säkerställer att resurser används effektivt och att systemen är tillförlitliga i vilken skala som helst. Astro tillhandahåller robust datacentrerad varning med anpassningsbara meddelanden som kan skickas via olika kanaler som Slack och PagerDuty. Detta säkerställer att ingripande sker i tid innan problem förvärras.
Datavalideringstester, enhetstester och datakvalitetskontroller spelar en avgörande roll för att säkerställa tillförlitligheten, noggrannheten och effektiviteten hos data pipelines och slutligen de data som driver ditt företag. Dessa kontroller säkerställer att medan du snabbt bygger data pipelines för att möta dina deadline, de aktivt fångar fel, förbättrar utvecklingstider och minskar oförutsedda fel i bakgrunden. På Astronomer har vi byggt verktyg som Astro CLI för att hjälpa till att smidigt kontrollera kodfunktionalitet eller identifiera integrationsproblem inom din data pipeline.
Hur ser du på utvecklingen av generativ AI-styrning, och vilka åtgärder bör vidtas för att stödja skapandet av fler verktyg?
Styrning är av yttersta vikt om generativ AI:s tillämpningar ska bli framgångsrika. Det handlar om transparens och reproducerbarhet. Vet du hur du fick detta resultat, och varifrån, och av vem? Airflow i sig ger dig redan ett sätt att se vad enskilda data pipelines gör. Dess användargränssnitt var en av anledningarna till dess snabba antagande tidigt, och på Astronomer har vi kompletterat det med synlighet över team och distributioner. Vi tillhandahåller också våra kunder med rapporteringsinstrumentpaneler som erbjuder omfattande insikter i plattformsanvändning, prestanda och kostnadsattribuering för informerat beslutsfattande. Dessutom möjliggör Astro API för team att programmatiskt distribuera, automatisera och hantera sina Airflow-pipelines, vilket minskar riskerna förknippade med manuella processer och säkerställer smidiga operationer i skala när du hanterar flera Airflow-miljöer. Härstamningsfunktioner är inbyggda i plattformen.
Detta är alla steg mot att hjälpa till att hantera datastyrning, och jag tror att företag av alla storlekar erkänner vikten av datastyrning för att säkerställa förtroende för AI-tillämpningar. Detta erkännande och medvetenhet kommer i stor utsträckning att driva efterfrågan på datastyrningsverktyg, och jag förväntar mig att skapandet av fler av dessa verktyg kommer att accelerera när generativ AI sprids. Men de behöver vara en del av den större orkestreringsstacken, vilket är varför vi ser det som grundläggande för hur vi bygger vår plattform.
Kan du ge exempel på hur Astronomers lösningar har förbättrat operativ effektivitet och produktivitet för kunder?
Generativ AI-processer innefattar komplexa och resurskrävande uppgifter som måste hanteras och upprepas med omsorg. Astro, Astronomers hanterade Apache Airflow-plattform, tillhandahåller en ram i centrum av den framväxande AI-appstacken för att hjälpa till att förenkla dessa uppgifter och förbättra förmågan att innovativt snabbt.
Genom att orkestrera generativa AI-uppgifter kan företag säkerställa att beräkningsresurser används effektivt och att arbetsflöden är optimerade och justerade i realtid. Detta är särskilt viktigt i miljöer där generativa modeller måste uppdateras eller omtränas ofta baserat på nya data.
Genom att utnyttja Airflows arbetsflödeshantering och Astronomers distributions- och skalningsförmåga kan team spendera mindre tid på att hantera infrastruktur och fokusera sin uppmärksamhet på dataomvandling och modellutveckling, vilket accelererar distributionen av generativa AI-tillämpningar och förbättrar prestanda.
På detta sätt har Astronomers Astro-plattform hjälpt kunder att förbättra den operativa effektiviteten hos generativ AI i en mängd olika användningsfall. För att nämna några, användningsfall inkluderar e-handelsproduktupptäckt, kundavhoppningsriskanalys, supportautomatisering, juridisk dokumentklassificering och sammanfattning, insikter om produkter från kundrecensioner och dynamisk klusterprovisionering för produktbildgenerering.
Vilken roll spelar Astronomer för att förbättra prestanda och skalbarhet hos AI- och ML-tillämpningar?
Skalbarhet är en stor utmaning för företag som använder generativ AI 2024. När man flyttar från prototyp till produktion förväntar sig användare att deras generativa AI-appar ska vara tillförlitliga och presterande, och att de utdata de producerar ska vara trovärdiga. Detta måste göras på ett kostnadseffektivt sätt och företag av alla storlekar måste kunna utnyttja dess potential. Med tanke på detta kan uppgifter skalas horisontellt med Astronomer för att dynamiskt bearbeta stora mängder datakällor. Astro kan elastiskt skala distributioner och kluster de är värd för, och köbaserad uppgiftsutförande med dedikerade maskintyper ger större tillförlitlighet och effektiv användning av beräkningsresurser. För att hjälpa till med kostnadseffektivitetsbiten av pusslet erbjuder Astro funktioner för skalning till noll och vinterdvala, som hjälper till att kontrollera skenande kostnader och minska molnutgifter. Vi tillhandahåller också fullständig transparens kring plattformens kostnad. Mitt eget data team genererar rapporter om konsumtion som vi gör tillgängliga för våra kunder dagligen.
Vilka är några framtida trender inom AI och data science som du är entusiastisk över, och hur förbereder sig Astronomer för dem?
Förklarlig AI är ett oerhört viktigt och fascinerande utvecklingsområde. Att kunna titta in i de inre mekanismerna i mycket stora modeller är nästan kusligt. Och jag är också intresserad av att se hur samhället hanterar den miljömässiga påverkan av modellträning och justering. På Astronomer fortsätter vi att uppdatera vår Registry med alla de senaste integreringarna, så att data- och ML-team kan ansluta till de bästa modelltjänsterna och de mest effektiva beräkningsplattformarna utan någon tung lyftning.
Hur ser du på integrationen av avancerade AI-verktyg som LLM med traditionella datahanteringssystem under de kommande åren?
Vi har sett både Databricks och Snowflake meddela nyligen om hur de inkorporerar både användning och utveckling av LLM inom sina respektive plattformar. Andra DBMS och ML-plattformar kommer att göra detsamma. Det är bra att se att dataingenjörer har så lätt tillgång till så kraftfulla metoder, direkt från kommandoraden eller SQL-prompten.
Jag är särskilt intresserad av hur relationsdatabaser inkorporerar maskinlärning. Jag väntar alltid på att ML-metoder ska inkorporeras i SQL-standarden, men av någon anledning har de två disciplinerna aldrig riktigt fungerat ihop. Kanske kommer denna gång att vara annorlunda.
Jag är mycket entusiastisk över framtiden för stora språkmodeller för att hjälpa dataingenjörernas arbete. Till att börja med har LLM varit särskilt framgångsrika med kodgenerering, även om tidiga försök att förse data scientists med AI-drivna förslag har varit blandade: Hex är bra, till exempel, medan Snowflake är otroligt tråkig så långt. Men det finns ett enormt potential att förändra naturen av arbetet för data team, mycket mer än för utvecklare. Varför? För programvaruutvecklare är prompten en funktionsnamn eller dokumentationen, men för dataingenjörer finns det också data. Det finns så mycket sammanhang som modeller kan arbeta med för att ge användbara och precisa förslag.
Vilken råd skulle du ge till blivande data scientists och AI-ingenjörer som vill göra en inverkan på branschen?
Lär genom att göra. Det är så otroligt enkelt att bygga applikationer idag, och att komplettera dem med artificiell intelligens. Så bygg något coolt, och skicka det till en vän till en vän som arbetar på ett företag du beundrar. Eller skicka det till mig, och jag lovar att jag kommer att ta en titt!
Knepet är att hitta något du är passionerad om och hitta en bra källa till relaterad data. En vän till mig gjorde en fascinerande analys av ovanliga basebollsäsonger som går tillbaka till 1800-talet och avslöjade några berättelser som förtjänar att ha en film gjord om dem. Och några av Astronomers ingenjörer samlades nyligen en helg för att bygga en plattform för självläkande data pipelines. Jag kan inte föreställa mig att försöka göra något liknande för några år sedan, men med bara några dagars ansträngning vann vi Cohere’s hackathon och byggde grunden för en stor ny funktion i vår plattform.
Tack för den underbara intervjun, läsare som vill lära sig mer bör besöka Astronomer.












