Rozhovory
Steven Hillion, Senior Viceprezident pro Data a AI v Astronomer – Interview Series

Steven Hillion je Senior Viceprezident pro Data a AI v Astronomer, kde využívá své rozsáhlé akademické zázemí v oblasti výzkumu matematiky a více než 15 let zkušeností ve vývoji platformy pro strojové učení v Silicon Valley. V Astronomer vede tvorbu funkcí Apache Airflow speciálně navržených pro týmy ML a AI a dohlíží na interní tým datové vědy. Pod jeho vedením Astronomer pokročil ve své moderní platformě pro orchestraci dat, významně zlepšil své schopnosti datových potrubí a tím podpořil širokou škálu zdrojů dat a úkolů prostřednictvím strojového učení.
Můžete sdílet一些 informace o své cestě v oblasti datové vědy a AI a jak to ovlivnilo váš přístup k vedení inženýrských a analytických týmů?
Měl jsem zázemí ve výzkumu matematiky na Berkeley, než jsem se přestěhoval do Silicon Valley a pracoval jako inženýr v řadě úspěšných startupů. Byl jsem rád, že jsem opustil politiku a byrokracii akademické sféry, ale brzy jsem zjistil, že mi chybí matematika. Takže jsem se zaměřil na vývoj platforem pro strojové učení a analýzu, a to je víceméně to, co jsem dělal od té doby.
Mé vzdělání v oblasti čisté matematiky mi dalo přednost k tomu, co data vědci nazývají “parsimonie” — správný nástroj pro danou úlohu a nic víc. Matematici mají tendenci preferovat elegantní řešení před složitými mechanismy, takže jsem se vždy snažil zdůraznit jednoduchost při aplikaci strojového učení na obchodní problémy. Hluboké učení je skvělé pro některé aplikace — velké jazykové modely jsou brilantní pro souhrny dokumentů, například — ale někdy je jednoduchý regresní model více vhodný a snazší vysvětlit.
Bylo fascinující sledovat měnící se roli datového vědce a softwarového inženýra v posledních dvaceti letech, kdy se strojové učení stalo široce rozšířeným. Když jsem nosil obě čepice, jsem si velmi vědom důležitosti životního cyklu softwarového vývoje (zejména automatizace a testování) aplikovaného na projekty strojového učení.
Jaké jsou největší výzvy při přesunu, zpracování a analýze nestrukturovaných dat pro AI a velké jazykové modely (LLM)?
V světě Generativního AI je vaše data nejvíce cenným aktivem. Modely jsou stále více komoditizovány, takže vaše odlišení spočívá ve všech těch tvrdě vydělaných institucionálních znalostech zachycených ve vašich proprietárních a kurátorovaných datech.
Dodání správných dat ve správný čas klade vysoké nároky na vaše datové potrubí — a to platí pro nestrukturovaná data stejně jako pro strukturovaná data, nebo možná ještě více. Často přijímáte data z mnoha různých zdrojů, ve mnoha různých formátech. Potřebujete přístup k různým metodám, aby jste mohli rozbalit data a připravit je pro použití v modelu nebo školení. Také musíte rozumět původu dat a kam nakonec skončí, aby jste mohli “ukázat svou práci”.
Můžete vysvětlit použití syntetických dat pro jemné ladění menších modelů pro přesnost? Jak se to srovnává s trénováním větších modelů?
Je to mocný nástroj. Můžete si představit nejlepší velké jazykové modely jako určitou kapsuli toho, co se naučily o světě, a mohou předat tuto znalost menším modelům generováním syntetických dat. LLM zahrnují obrovské množství znalostí naučených z rozsáhlých trénovacích dat. Tyto modely mohou generovat syntetická data, která zachycují vzory, struktury a informace, které se naučily. Tato syntetická data lze pak použít pro trénování menších modelů, efektivní přenos některých znalostí z větších modelů do menších. Tento proces se často nazývá “destilace znalostí” a pomáhá při tvorbě efektivních menších modelů, které stále dobře fungují na konkrétní úkoly. A se syntetickými daty můžete také vyhnout problémům s ochranou soukromí a vyplnit mezery ve trénovacích datech, která jsou malá nebo neúplná.
Jak vidíte budoucí trendy v oblasti AI a datové vědy, které vás zajímají, a jak se Astronomer připravuje na ně?
Explainable AI je obrovsky důležitá a fascinující oblast vývoje. Je možné nahlédnout do vnitřních mechanismů velmi velkých modelů, a to je skoro děsivé. A jsem také zvědav, jak se komunita vypořádá s environmentálním dopadem trénování a ladění modelů. V Astronomer pokračujeme v aktualizaci našeho Registru o všechny nejnovější integrace, aby datové a ML týmy mohly připojit se k nejlepším modelovým službám a nejefektivnějším výpočetním platformám bez zbytečných nákladů.
Můžete poskytnout příklady toho, jak řešení Astronomer zlepšila provozní efektivitu a produktivitu pro klienty?
Procesy Generativního AI zahrnují komplexní a náročné úkoly, které je třeba pečlivě optimalizovat a opakovaně spouštět. Astro, spravovaná platforma Apache Airflow od Astronomer, poskytuje rámec pro usnadnění těchto úkolů a zlepšení schopnosti inovovat rychle.
Jakou roli hraje Astronomer při zlepšování výkonu a škálovatelnosti aplikací AI a ML?
Škálovatelnost je velkou výzvou pro podniky, které využívají Generativní AI v roce 2024. Když se přesouváte z prototypu do produkce, uživatelé očekávají, že jejich aplikace Generativního AI budou spolehlivé a výkonné, a že výstupy, které produkují, budou důvěryhodné. To musí být provedeno nákladově efektivně a podniky všech velikostí musí být schopny využít jeho potenciál. S tímto na mysli, pomocí Astronomer, úkoly lze škálovat horizontálně pro dynamické zpracování velkého množství zdrojů dat. Astro může škálovat nasazení a cluster, na kterých jsou hostovány, a frontové provádění úkolů s vyhrazenými typy strojů poskytuje větší spolehlivost a efektivní využití výpočetních zdrojů.
Můžete poradit začínajícím datovým vědcům a inženýrům AI, kteří chtějí mít dopad v oboru?
Učte se tím, že děláte. Je tak neuvěřitelně snadné budovat aplikace a rozšiřovat je o umělou inteligenci. Takže postavte něco cool, a pošlete to kamarádovi, který pracuje v podniku, který obdivujete. Nebo pošlete to mně, a slibuji, že se na to podívám!
Děkuji za skvělý rozhovor, čtenářům, kteří chtějí se dozvědět více, doporučujeme navštívit Astronomer.












