Intervjuer

Steven Hillion, Senior Vice President for Data og AI i Astronomer – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Steven Hillion er Senior Vice President for Data og AI i Astronomer, der han utnytter sin omfattende akademiske bakgrunn i forskningsmatematikk og over 15 års erfaring i Silicon Valleys maskinlæringsplattformutvikling. Hos Astronomer står han i spissen for å skape Apache Airflow-funksjoner som er spesifikt designet for ML- og AI-team, og overvåker det interne data science-teamet. Under hans ledelse har Astronomer fremmet sin moderne data-orchestreringsplattform, vesentlig forbedret datapipekapasiteten til å støtte en mangfoldig rekke datakilder og oppgaver gjennom maskinlæring.

Kan du dele noen informasjon om din reise i datavitenskap og AI, og hvordan det har formet din tilnærming til å lede ingeniør- og analytiske team?

Jeg hadde en bakgrunn i forskningsmatematikk ved Berkeley før jeg flyttet over til Silicon Valley og arbeidet som ingeniør i en rekke vellykkede start-ups. Jeg var glad for å forlate akademias politik og byråkrati, men jeg fant ut at jeg savnet matematikken etter noen år. Så skiftet jeg over til å utvikle plattformer for maskinlæring og analyse, og det er omtrent det jeg har gjort siden.

Min utdanning i ren matematikk har resultert i en preferanse for hva datavitenskapsfolk kaller «parsimoni» — riktig verktøy for jobben, og ingenting mer. Matematikere tenderer til å favorisere elegante løsninger over komplekse maskiner, og jeg har alltid prøvd å understreke enkelhet når jeg anvender maskinlæring på forretningsproblemer. Dyb læring er fantastisk for noen anvendelser — store språkmodeller er geniale til å sammenfatte dokumenter, for eksempel — men noen ganger er en enkel regresjonsmodell mer passende og enklere å forklare.

Det har vært fascinerende å se den skiftende rollen til datavitenskapsfolk og programvareingeniører i disse siste tjue årene siden maskinlæring ble utbredt. Ettersom jeg har hatt begge hattene, er jeg svært klar over viktigheten av programvareutviklingslivssyklusen (spesielt automatisering og testing) når det gjelder maskinlæringsprosjekter.

Hva er de største utfordringene i å flytte, prosessere og analysere ustrukturert data for AI og store språkmodeller (LLM)?

I verden av generativ AI er dine data din mest verdifulle eiendom. Modellene er stadig mer kommodifiserte, så din differensiering er all den harde, institusjonelle kunnskapen som er fanget i dine proprietære og kurerte datasett.

Å levere riktig data på riktig tid stiller høye krav til dine datapipetter — og dette gjelder for ustrukturert data like mye som for strukturert data, eller kanskje mer. Ofte innhenter du data fra mange forskjellige kilder, i mange forskjellige formater. Du trenger tilgang til en rekke metoder for å pakke ut dataene og gjøre dem klare for bruk i modellinferens eller modelltrening. Du må også forstå proveniens for dataene og hvor de ender opp for å «vise ditt arbeid».

Hvis du bare gjør dette en gang i blant for å trene en modell, er det greit. Du trenger ikke nødvendigvis å operasjonalisere det. Hvis du bruker modellen daglig for å forstå kundesentiment fra nettforum, eller for å sammenfatte og dirigere fakturaer, så begynner det å ligne en annen operasjonell datapipeline, som betyr at du må tenke på pålitelighet og reproduserbarhet. Eller hvis du finjusterer modellen jevnlig, så må du bekymre deg for å overvåke nøyaktighet og kostnad.

Det gode nyheten er at dataingeniører har utviklet en flott plattform, Airflow, for å håndtere datapipetter, som allerede har blitt brukt med hell til å håndtere modellutlevering og overvåking av noen av verdens mest sofistikerte ML-team. Så modellene kan være nye, men orkestrering er ikke det.

Kan du utdype bruken av syntetisk data for å finjustere mindre modeller for nøyaktighet? Hvordan sammenligner dette med å trene større modeller?

Dette er en kraftfull teknikk. Du kan tenke på de beste store språkmodellene som på en måte inkapslerer hva de har lært om verden, og de kan overføre dette til mindre modeller ved å generere syntetisk data. LLM-er inkapslerer enorme mengder kunnskap lært fra omfattende trening på mangfoldige datasett. Disse modellene kan generere syntetisk data som fanger mønster, strukturer og informasjon de har lært. Denne syntetiske dataen kan deretter brukes til å trene mindre modeller, effektivt overføre noe av kunnskapen fra de større modellene til de mindre. Denne prosessen kalles ofte «kunnskapsdestillasjon» og hjelper med å skape effektive, mindre modeller som likevel fungerer godt på bestemte oppgaver. Og med syntetisk data kan du også unngå personvernproblemer og fylle hull i treningsdata som er små eller ufullstendige.

Dette kan være nyttig for å trene en mer domenespesifikk generativ AI-modell, og kan til og med være mer effektivt enn å trene en «større» modell, med en høyere grad av kontroll.

Datavitenskapsfolk har generert syntetisk data i en stund, og imputasjon har vært rundt like lenge som ufullstendige datasett har eksistert. Men du måtte alltid være svært forsiktig med å ikke introdusere forvrengninger eller gjøre feil antakelser om datafordelingen. Nå som syntetisk data er så mye enklere og kraftigere, må du være enda mer forsiktig. Feil kan forstørres.

Mangel på mangfold i generert data kan føre til «modellkollaps». Modellen tror den gjør det bra, men det er fordi den ikke har sett hele bildet. Og, mer generelt, mangel på mangfold i treningsdata er noe data-team bør alltid være på utkikk etter.

På et grunnleggende nivå, enten du bruker syntetisk data eller organisk data, er avstamning og kvalitet avgjørende for å trene eller finjustere noen modell. Som vi vet, er modeller bare like gode som data de er trenet på. Mens syntetisk data kan være et flott verktøy for å hjelpe med å representere et sensitivt datasett uten å eksponere det eller fylle hull i et representativt datasett, må du ha en papirspor som viser hvor dataene kommer fra og være i stand til å bevise kvaliteten.

Hva er noen innovative teknikker ditt team i Astronomer implementerer for å forbedre effisiensen og påliteligheten til datapipetter?

Så mange! Astros fullstendig managede Airflow-infrastruktur og Astro Hypervisor støtter dynamisk skalerings- og proaktiv overvåking gjennom avanserte helsemetrikker. Dette sikrer at ressurser brukes effektivt og at systemer er pålitelige i enhver skala. Astro tilbyr robust data-sentrert varsling med tilpassbare varslinger som kan sendes gjennom forskjellige kanaler som Slack og PagerDuty. Dette sikrer tidlig inngripen før problemer eskalerer.

Data-valideringstester, enhetstester og datakvalitetskontroller spiller avgjørende roller i å sikre påliteligheten, nøyaktigheten og effisiensen til datapipetter og til slutt dataene som driver din forretning. Disse testene sikrer at mens du bygger datapipetter raskt for å møte dine frister, fanger de aktivt feil, forbedrer utviklingstider og reduserer uforutsette feil i bakgrunnen. Hos Astronomer har vi bygget verktøy som Astro CLI for å hjelpe med å sjekke kodefunksjonalitet eller identifisere integreringsproblemer i din datapipeline.

Hvordan ser du på utviklingen av generativ AI-styring, og hva målinger bør tas for å støtte skapelsen av flere verktøy?

Styring er avgjørende hvis anvendelsene av generativ AI skal være vellykkede. Det handler om gjennomsiktighet og reproduserbarhet. Vet du hvordan du fikk dette resultatet, og fra hvor, og av hvem? Airflow alene gir deg allerede en måte å se hva enkeltne datapipetter gjør. Bruergrensesnittet var en av grunnene til sin rask adopsjon tidlig, og hos Astronomer har vi supplert det med synlighet over team og utrulninger. Vi tilbyr også våre kunder rapporteringsdashboards som gir omfattende innsikt i plattformbruk, ytelse og kostnadsfordeling for informert beslutning. I tillegg muliggjør Astro API at team kan programmatically utrulle, automatisere og håndtere sine Airflow-pipetter, og redusere risiko forbundet med manuelle prosesser, og sikre sømløs drift i skala når de håndterer flere Airflow-miljøer. Avstamningsfunksjoner er integrert i plattformen.

Disse er alle skritt mot å hjelpe med å håndtere datastyring, og jeg tror at selskaper av alle størrelser anerkjenner viktigheten av datastyring for å sikre tillit til AI-anvendelser. Denne anerkjennelsen og bevisstheten vil i stor grad drive etterspørselen etter datastyringsverktøy, og jeg forventer at skapelsen av flere av disse verktøyene vil akselerere når generativ AI sprenger. Men de må være en del av den større orkestreringsstaken, som er hvorfor vi ser på det som grunnleggende for måten vi bygger vår plattform på.

Kan du gi eksempler på hvordan Astronomers løsninger har forbedret operasjonell effisiens og produktivitet for kunder?

Generativ AI-prosesser innebærer komplekse og ressurskrevende oppgaver som må være nøye optimert og gjentatt utført. Astro, Astronomers managede Apache Airflow-plattform, tilbyr en ramme i sentrum av den nye AI-app-staken for å hjelpe med å forenkle disse oppgavene og forbedre evnen til å innovere raskt.

Ved å orkestrere generativ AI-oppgaver kan bedrifter sikre at beregningsressursene brukes effektivt og arbeidsflytene er optimerte og justert i sanntid. Dette er spesielt viktig i miljøer hvor generative modeller må oppdateres eller trenes på nytt basert på nye data.

Ved å utnytte Airflows arbeidsflytthåndtering og Astronomers utrulnings- og skaleringsmuligheter kan team bruke mindre tid på å håndtere infrastruktur og fokusere oppmerksomheten i stedet på data-transformasjon og modellutvikling, noe som akselerer utrulningen av generativ AI-applikasjoner og forbedrer ytelsen.

På denne måten har Astronomers Astro-plattform hjulpet kunder med å forbedre operasjonell effisiens i generativ AI over en rekke anvendelser. For å nevne noen, inkluderer anvendelser e-handelsproduktoppdagelse, kundesvikt-risikanalyse, støtteautomatisering, juridisk dokumentklassifisering og sammenfatting, å skaffe produkttinnsikt fra kundeanmeldelser og dynamisk kluster-tilrettelegging for produktbildegenerering.

Hva rolle spiller Astronomer i å forbedre ytelsen og skalerbarheten til AI- og ML-applikasjoner?

Skalerbarhet er en stor utfordring for bedrifter som tar i bruk generativ AI i 2024. Når du flytter fra prototype til produksjon, forventer brukerne at deres generative AI-applikasjoner skal være pålitelige og yte godt, og at utgangene de produserer skal være troværdige. Dette må gjøres på en kostnadseffektiv måte, og bedrifter av alle størrelser må kunne utnytte potensialet. Med tanke på dette, ved å bruke Astronomer, kan oppgaver skaleres horisontalt for å dynamisk prosessere store mengder datakilder. Astro kan elastisk skalerer utrulninger og kluster de er vert for, og købasert oppgaveutføring med dedikerte maskintyper gir større pålitelighet og effektiv bruk av beregningsressurser. For å hjelpe med kostnadseffektivitetsdelene av puslespillet, tilbyr Astro skaler-til-null og hvilefunksjoner, som hjelper med å kontrollere spirerende kostnader og redusere sky-utgifter. Vi tilbyr også full gjennomsiktighet rundt plattformkostnadene. Mitt eget data-team genererer rapporter om forbruk som vi gjør tilgjengelig for våre kunder daglig.

Hva er noen fremtidige trender i AI og datavitenskap som du er spennende på, og hvordan forbereder Astronomer seg på dem?

Forklarbar AI er et enormt viktig og fascinerende utviklingsområde. Å kunne se inn i de indre arbeidene til svært store modeller er nesten uhyggelig. Og jeg er også interessert i å se hvordan samfunnet håndterer miljøpåvirkningen av modelltrening og -justering. Hos Astronomer fortsetter vi å oppdatere vårt Registry med alle de siste integreringene, så data- og ML-team kan koble seg til de beste modelltjenestene og de mest effektive beregningsplattformene uten noen tung løfting.

Hvordan ser du for deg integreringen av avanserte AI-verktøy som LLM-er med tradisjonelle datasystemer utvikle seg de neste årene?

Vi har sett både Databricks og Snowflake gjøre annonseringer nylig om hvordan de inkorporerer både bruken og utviklingen av LLM-er innen sine respektive plattformer. Andre DBMS- og ML-plattformer vil gjøre det samme. Det er fantastisk å se at dataingeniører har så lett tilgang til så kraftfulle metoder, rett fra kommandolinjen eller SQL-prompten.

Jeg er spesielt interessert i hvordan relasjonsdatabaser inkorporerer maskinlæring. Jeg venter alltid på at ML-metoder skal inkorporeres i SQL-standarden, men for noen grunn har de to disiplinene aldri virkelig funnet sammen. Kanskje denne gangen vil det være annerledes.

Jeg er svært spennende på fremtiden for store språkmodeller for å assistere dataingeniørens arbeid. For å begynne med har LLM-er allerede vært svært vellykkede med kodegenerering, selv om tidlige forsøk på å forsyne datavitenskapsfolk med AI-drevne forslag har vært blandede: Hex er fantastisk, for eksempel, mens Snowflake er uinspirerende så langt. Men det er enormt potensial for å endre naturen til arbeidet for data-team, mye mer enn for utviklere. Hvorfor? For programvareingeniører er prompten en funksjonsnavn eller dokumentasjon, men for dataingeniører er det også dataene. Det er så mye kontekst at modellene kan jobbe med for å gi nyttige og nøyaktige forslag.

Hva råd ville du gi til aspirerende datavitenskapsfolk og AI-ingeniører som ønsker å gjøre en innvirkning i bransjen?

Lær ved å gjøre. Det er så utrolig enkelt å bygge applikasjoner i dag, og å supplere dem med kunstig intelligens. Så bygg noe coolt, og send det til en venn av en venn som jobber i et selskap du beundrer. Eller send det til meg, og jeg lover å se på det!

Trikset er å finne noe du er lidenskapelig om og finne en god kilde til relatert data. En venn av mine gjorde en fascinerende analyse av anomale baseball-sesonger tilbake til det 19. århundre og avdekket noen historier som fortjener å ha en film laget om dem. Og noen av Astronomers ingeniører samlet seg en helg for å bygge en plattform for selv-healing datapipetter. Jeg kan ikke forestille meg å prøve å gjøre noe slikt for noen år siden, men med bare noen få dagers innsats vant vi Cohere’s hackathon og bygde grunnlaget for en stor ny funksjon i vår plattform. Takk for det flotte intervjuet, lesere som ønsker å lære mer bør besøke Astronomer.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.