Interviews
Steven Hillion, Senior Vicepræsident for Data og AI hos Astronomer – Intervju-serie

Steven Hillion er Senior Vicepræsident for Data og AI hos Astronomer, hvor han udnytter sin omfattende akademiske baggrund i forskningsmatematik og mere end 15 års erfaring i udviklingen af maskinlæringsplatforme i Silicon Valley. Hos Astronomer står han i spidsen for udviklingen af Apache Airflow-funktioner, der er specielt designed til ML- og AI-hold, og han har ansvar for det interne data science-hold. Under hans ledelse har Astronomer udviklet sin moderne data-orchestrationsplatform, hvilket har betydeligt forbedret platformens data-pipeline-funktioner til at understøtte en bred vifte af datakilder og opgaver gennem maskinlæring.
Kan du dele nogen information om din rejse i datavidenskab og AI, og hvordan det har formet din tilgang til at lede ingeniør- og analytics-hold?
Jeg havde en baggrund i forskningsmatematik på Berkeley, før jeg flyttede over til Silicon Valley og arbejdede som ingeniør i en række succesfulde start-ups. Jeg var glad for at forlade akademias politik og bureaukrati, men jeg fandt ud af, at jeg savnede matematikken efter nogle få år. Så jeg skiftede til udvikling af platforme til maskinlæring og analytics, og det er det, jeg har gjort siden.
Min uddannelse i ren matematik har resulteret i en forkærlighed for, hvad datavidenskabsmænd kalder ‘parsimoni’ – det rigtige værktøj til jobbet, og intet mere. Fordi matematikere tenderer til at foretrække elegante løsninger over komplekst maskineri, har jeg altid forsøgt at understrege enkelhed, når jeg anvender maskinlæring til forretningsproblemer. Dyb læring er fantastisk til visse anvendelser – store sprogmodeller er briliante til at sammenfatte dokumenter, for eksempel – men nogle gange er en simpel regressionsmodel mere passende og lettere at forklare.
Det har været fascinerende at se den skiftende rolle for datavidenskabsmænd og software-ingeniører i de sidste 20 år, siden maskinlæring blev udbredt. Da jeg har haft begge roller, er jeg meget bevidst om vigtigheden af software-udviklingslivscyklussen (især automatisering og test) i forhold til maskinlæringsprojekter.
Hvad er de største udfordringer i at flytte, behandle og analysere ustruktureret data til AI og store sprogmodeller (LLM’er)?
I verden af generativ AI er dine data din mest værdifulde aktiv. Modellerne er mere og mere standardiserede, så din differentiering er alt det hårde institutionelle kendskab, der er fanget i dine ejendoms- og kuraterede datasæt.
At levere de rigtige data på det rigtige tidspunkt stiller store krav til dine data-pipelines – og dette gælder for ustruktureret data lige så meget som for struktureret data, eller måske endda mere. Ofte indtager du data fra mange forskellige kilder i mange forskellige formater. Du har brug for adgang til en række metoder for at pakke data ud og gøre dem klar til brug i model-inferens eller model-træning. Du har også brug for at forstå dataenes proveniens og hvor de ender for at “vise dit arbejde”.
Hvis du kun gør dette en gang imellem for at træne en model, er det i orden. Du behøver ikke nødvendigvis at operationalisere det. Hvis du bruger modellen dagligt til at forstå kundesentiment fra online-fora eller til at sammenfatte og dirigere fakturaer, så begynder det at ligne en hvilken som helst anden operationel data-pipeline, hvilket betyder, at du skal tænke på pålidelighed og reproducerbarhed. Eller hvis du finjusterer modellen jævnligt, så skal du bekymre dig om overvågning af nøjagtighed og omkostninger.
Det gode nyheds er, at data-ingeniører har udviklet en fantastisk platform, Airflow, til at styre data-pipelines, som allerede er blevet anvendt med succes til at styre model-udvikling og overvågning af nogle af verdens mest avancerede ML-hold. Så modellerne måtte være nye, men orkestrering er ikke.
Kan du uddybe brugen af synthetisk data til at finjustere mindre modeller for nøjagtighed? Hvordan sammenligner dette med træning af større modeller?
Det er en kraftfuld teknik. Du kan tænke på de bedste store sprogmodeller som en eller anden måde at indkapsle, hvad de har lært om verden, og de kan overføre det til mindre modeller ved at generere synthetisk data. LLM’er indkapslerer enorme mængder viden, der er lært fra omfattende træning på diverse datasæt. Disse modeller kan generere synthetisk data, der fanget mønstre, strukturer og information, de har lært. Denne synthetiske data kan derefter bruges til at træne mindre modeller, hvilket effektivt overfører noget af viden fra de større modeller til de mindre. Denne proces kaldes ofte “viden-destillation” og hjælper med at skabe effektive, mindre modeller, der stadig performer godt på bestemte opgaver. Og med synthetisk data kan du undgå problemer med privatliv og udfylde huller i træningsdata, der er små eller ufuldstændige.
Dette kan være nyttigt til træning af en mere domænespecifik generativ AI-model og kan endda være mere effektivt end træning af en “større” model med en højere grad af kontrol.
Data-videnskabsmænd har genereret synthetisk data i lang tid, og imputation har eksisteret lige så længe, som der har været ufuldstændige datasæt. Men du har altid skulle være meget forsigtig, så du ikke introducerede fordomme eller gjorde fejlantagelser om datafordelingen. Nu, hvor det er så meget lettere og kraftfuldt at syntetisere data, skal du være endnu mere forsigtig. Fejl kan blive forstørret.
Mangel på diversitet i genereret data kan føre til ‘model-kollaps’. Modellen tror, den gør det godt, men det er, fordi den ikke har set det fulde billede. Og mere generelt er mangel på diversitet i træningsdata noget, data-hold altid skal være på udkig efter.
På et grundlæggende niveau, uanset om du bruger synthetisk data eller organisk data, er linje og kvalitet afgørende for træning eller finjustering af enhver model. Som vi ved, er modeller kun så gode som de data, de er trænet på. Mens synthetisk data kan være et fantastisk værktøj til at repræsentere et følsomt datasæt uden at eksponere det eller udfylde huller, der måske er efterladt i et repræsentativt datasæt, skal du have en papirspor, der viser, hvor data kommer fra, og være i stand til at bevise dens niveau af kvalitet.
Hvad er nogle innovative teknikker, som dit hold hos Astronomer implementerer for at forbedre effektiviteten og pålideligheden af data-pipelines?
Så mange! Astros fuldt administrerede Airflow-infrastruktur og Astro Hypervisor understøtter dynamisk skalerings- og proaktiv overvågning gennem avancerede sundheds-målinger. Dette sikrer, at ressourcerne bruges effektivt, og systemerne er pålidelige i enhver skala. Astro giver robust data-centreret alertning med tilpassede meddelelser, der kan sendes gennem forskellige kanaler som Slack og PagerDuty. Dette sikrer, at der indgribes tilstrækkeligt tidligt, før problemerne eskalerer.
Data-valideringstests, enhedstests og datakvalitetskontroller spiller en vital rol i at sikre pålideligheden, nøjagtigheden og effektiviteten af data-pipelines og ultimativt de data, der driver din forretning. Disse kontroller sikrer, at mens du bygger data-pipelines hurtigt for at møde dine deadlines, fanger de aktivt fejl, forbedrer udviklingstider og reducerer uventede fejl i baggrunden. Hos Astronomer har vi bygget værktøjer som Astro CLI til at hjælpe med at kontrollere kodefunktionalitet eller identificere integrations-problemer inden for din data-pipeline.
Hvordan ser du på udviklingen af generativ AI-regering, og hvilke foranstaltninger skal tages for at understøtte skabelsen af flere værktøjer?
Regering er afgørende, hvis generativ AI-anvendelser skal være succesfulde. Det handler om gennemsigtighed og reproducerbarhed. Ved du, hvordan du fik dette resultat, og fra hvem, og af hvem? Airflow giver allerede i sig selv en måde at se, hvad enkeltviske data-pipelines gør. Dets brugergrænseflade var en af årsagerne til dets hurtige adoption tidligt, og hos Astronomer har vi suppleret det med gennemsigtighed på tværs af hold og installationer. Vi giver også vores kunder Rapporteringsskærmborde, der giver omfattende indsigt i platformens brug, ydeevne og omkostnings-tillæg for underrettet beslutningstagning. Derudover giver Astro API holdene mulighed for at installere, automatisere og administrere deres Airflow-pipelines programmatisk, hvilket reducerer risici forbundet med manuelle processer og sikrer problemfri drift i skala, når der håndteres multiple Airflow-miljøer. Linje-funktioner er indbygget i platformen.
Disse er alle skridt mod at hjælpe med at administrere data-regering, og jeg tror, at virksomheder af alle størrelser erkender vigtigheden af data-regering for at sikre tillid til AI-anvendelser. Denne erkendelse og bevidsthed vil i høj grad drive efterspørgslen efter data-regeringsværktøjer, og jeg forventer, at skabelsen af flere af disse værktøjer vil accelerere, da generativ AI spreder sig. Men de skal være en del af den større orkestrerings-stak, hvilket er hvorfor vi ser på det som fundamental for den måde, vi bygger vores platform på.
Kan du give eksempler på, hvordan Astronomers løsninger har forbedret operationel effektivitet og produktivitet for kunder?
Generativ AI-processer indebærer komplekse og ressourcekrævende opgaver, der skal være omhyggeligt optimeret og gentaget. Astro, Astronomers administrerede Apache Airflow-platform, giver en ramme i centrum af den opkommende AI-app-stak til at hjælpe med at simplificere disse opgaver og forbedre evnen til at innovere hurtigt.
Ved at orkestrere generativ AI-opgaver kan virksomheder sikre, at beregningsressourcerne bruges effektivt, og arbejdsgange optimeres og justeres i realtid. Dette er særligt vigtigt i miljøer, hvor generative modeller skal opdateres eller gen-trænes ofte på basis af nye data.
Ved at udnytte Airflows arbejdsgangs-styring og Astronomers installations- og skalerings-funktioner kan hold bruge mindre tid på at administrere infrastruktur og fokusere deres opmærksomhed i stedet på data-transformation og model-udvikling, hvilket accelererer udviklingen af Generativ AI-anvendelser og forbedrer ydeevnen.
På denne måde har Astronomers Astro-platform hjulpet kunder med at forbedre den operationelle effektivitet af generativ AI på tværs af en bred vifte af brugstilfælde. For at nævne nogle få, inkluderer brugstilfælde e-handelsprodukt-opdagelse, kunde-afhop-risiko-analyse, support-automatisering, juridisk dokument-klassificering og sammenfatning, indsigt i produkter fra kunde- anmeldelser og dynamisk kluster-allokering til produkt-billede-generering.
Hvad er rollen for Astronomer i at forbedre ydeevnen og skalerbarheden af AI- og ML-anvendelser?
Skalerbarhed er en stor udfordring for virksomheder, der tager del i generativ AI i 2024. Når man flytter fra prototype til produktion, forventer brugerne, at deres generative AI-apps er pålidelige og ydeevne-stærke, og at output, de producerer, er troværdige. Dette skal gøres på en kost-effektiv måde, og virksomheder af alle størrelser skal kunne udnytte dets potentiale. Med dette i mente kan opgaver skaleres vandret til at behandle store mængder datakilder dynamisk. Astro kan elastisk skaleres og de cluster, de er installeret på, og kø-baseret opgave-eksekvering med dedikeret maskine-typ giver større pålidelighed og effektiv brug af beregningsressourcer. For at hjælpe med omkostnings-effektiviteten tilbyder Astro funktioner som skaler-til-nul og dvale-funktioner, der hjælper med at kontrollere stigende omkostninger og reducere sky-udgifter. Vi giver også fuld gennemsigtighed omkring platformens omkostninger. Mit eget data-hold genererer rapporter om forbrug, som vi gør tilgængelige for vores kunder dagligt.
Hvad er nogle fremtidige trends i AI og datavidenskab, som du er begejstret for, og hvordan forbereder Astronomer sig på dem?
Forklarlig AI er et enormt vigtigt og fascinerende udviklingsområde. At kunne kigge ind i de indre mekanismer af meget store modeller er næsten uhyggeligt. Og jeg er også interesseret i at se, hvordan fællesskabet kæmper med den miljømæssige impact af model-træning og -justering. Hos Astronomer fortsætter vi med at opdatere vores Registry med alle de seneste integrationer, så data- og ML-hold kan tilslutte sig de bedste model-tjenester og de mest effektive beregnings-platforme uden nogen tung løftning.
Hvordan forestiller du dig integrationen af avancerede AI-værktøjer som LLM’er med traditionelle data-styringssystemer udvikler sig over de næste par år?
Vi har set både Databricks og Snowflake annoncere, hvordan de inkorporerer både brugen og udviklingen af LLM’er inden for deres respektive platforme. Andre DBMS og ML-platforme vil gøre det samme. Det er fantastisk at se, at data-ingeniører har så let adgang til så kraftfulde metoder, lige fra kommandolinjen eller SQL-prompten.
Jeg er særligt interesseret i, hvordan relationelle databaser inkorporerer maskinlæring. Jeg venter altid på, at ML-metoder skal blive inkorporeret i SQL-standarderne, men for nogen års skyld har de to discipliner aldrig rigtig fungeret sammen. Måske bliver det anderledes denne gang.
Jeg er meget begejstret for fremtiden for store sprogmodeller til at hjælpe data-ingeniørernes arbejde. For eksempel har LLM’er allerede været særligt succesfulde med kode-generering, selv om tidlige forsøg på at give data-videnskabsmænd AI-drevne forslag har været blandede: Hex er fantastisk, for eksempel, mens Snowflake er uinspirerende indtil videre. Men der er enormt potentiale for at ændre naturen af arbejdet for data-hold, meget mere end for udviklere. Hvorfor? For software-ingeniører er prompten en funktion-navn eller dokumentationen, men for data-ingeniører er der også data. Der er så meget kontekst, som modeller kan arbejde med for at give nyttige og præcise forslag.
Hvad er din råd til aspirerende data-videnskabsmænd og AI-ingeniører, der ønsker at gøre en indvirkning i branchen?
Lær ved at gøre. Det er så utrolig let at bygge anvendelser i dag, og at supplere dem med kunstig intelligens. Så byg noget fedt, og send det til en ven af en ven, der arbejder i en virksomhed, du beundrer. Eller send det til mig, og jeg lover, at jeg vil tage et kig!
Tricket er at finde noget, du er passioneret om, og finde en god kilde til relaterede data. En ven af mine gjorde en fascinerende analyse af anomale baseball-sæsoner tilbage til det 19. århundrede og afslørede nogle historier, der fortjener at have en film lavet om dem. Og nogle af Astronomers ingeniører samledes for nylig en weekend for at bygge en platform for selv-healing data-pipelines. Jeg kan ikke forestille mig at forsøge at gøre noget sådant for nogle år siden, men med kun nogle få dages indsats vandt vi Cohere’s hackathon og byggede grundlaget for en stor ny funktion i vores platform.
Tak for det fantastiske interview, læsere, der ønsker at lære mere, skal besøge Astronomer.












