Wywiady
Steven Hillion, Wiceprezes ds. Danych i Sztucznej Inteligencji w Astronomer – Wywiad

Steven Hillion jest Wiceprezesem ds. Danych i Sztucznej Inteligencji w Astronomer, gdzie wykorzystuje swoje rozległe doświadczenie akademickie w dziedzinie badań matematycznych oraz ponad 15-letnie doświadczenie w rozwoju platform machine learning w Dolinie Krzemowej. W Astronomer, kieruje tworzeniem funkcji Apache Airflow specjalnie zaprojektowanych dla zespołów ML i AI oraz nadzoruje wewnętrzny zespół data science. Pod jego kierownictwem, Astronomer zaawansował swoją nowoczesną platformę orchestracji danych, znacznie poprawiając możliwości rurociągów danych w celu obsługi szerokiej gamy źródeł danych i zadań za pomocą machine learning.
Czy mógłbyś podzielić się niektórymi informacjami na temat Twojej podróży w dziedzinie data science i AI, oraz jak to ukształtowało Twoje podejście do kierowania zespołami inżynierskimi i analitycznymi?
Miałem wykształcenie matematyczne na Uniwersytecie w Berkeley, zanim przeniosłem się do Doliny Krzemowej i pracowałem jako inżynier w kilku udanych startupach. Byłem zadowolony, że mogłem zostawić za sobą politykę i biurokrację akademicką, ale po kilku latach odkryłem, że tęsknię za matematyką. Więc przeniosłem się do rozwoju platform dla machine learning i analityki, i to właśnie robię od tego czasu.
Moje wykształcenie matematyczne skłoniło mnie do preferowania tego, co nazywają „oszczędnością” — właściwego narzędzia do pracy, i nic więcej. Ponieważ matematycy mają tendencję do preferowania eleganckich rozwiązań nad skomplikowanymi maszynami, zawsze starałem się podkreślać prostotę przy stosowaniu machine learning do problemów biznesowych. Głębokie uczenie się jest wspaniałe dla niektórych aplikacji — duże modele językowe są genialne dla podsumowywania dokumentów, na przykład — ale czasami prosty model regresji jest bardziej odpowiedni i łatwiejszy do wyjaśnienia.
Było fascynujące obserwować zmieniającą się rolę data scientistów i inżynierów oprogramowania w ciągu ostatnich dwudziestu lat, odkąd machine learning stał się powszechny. Nosząc obie kapelusze, jestem bardzo świadomy znaczenia cyklu życia rozwoju oprogramowania (szczególnie automatyzacji i testowania) w projektach machine learning.
Jakie są największe wyzwania w przenoszeniu, przetwarzaniu i analizowaniu nieustrukturyzowanych danych dla AI i dużych modeli językowych (LLM)?
W świecie Generative AI, Twoje dane są Twoim najcenniejszym aktywem. Modele stają się coraz bardziej komercyjne, więc Twoja różnica polega na tym, jak zdobywasz wiedzę instytucjonalną, którą uchwytasz w swoich własnych, opracowanych zbiorach danych.
Dostarczanie odpowiednich danych we właściwym czasie stawia wysokie wymagania dotyczące Twoich rurociągów danych — i dotyczy to danych nieustrukturyzowanych tak samo, jak danych ustrukturyzowanych, lub może nawet bardziej. Często ingerujesz w dane z wielu różnych źródeł, w wielu różnych formatach. Potrzebujesz dostępu do różnych metod, aby rozpakować dane i przygotować je do użycia w inferencji modelu lub szkoleniu modelu. Potrzebujesz również zrozumieć pochodzenie danych i to, gdzie kończą się one, aby „pokazać swoją pracę”.
Jeśli robisz to tylko od czasu do czasu, aby trenować model, to wszystko w porządku. Nie musisz go operacjonalizować. Jeśli używasz modelu codziennie, aby zrozumieć nastawienie klienta z forów internetowych, lub aby podsumować i przekierować faktury, to zaczyna przypominać każdy inny operacyjny rurociąg danych, co oznacza, że musisz myśleć o niezawodności i odtwarzalności. Lub jeśli często dostosowujesz model, to musisz martwić się o monitorowanie dokładności i kosztów.
Dobra wiadomość jest taka, że inżynierowie danych opracowali wspaniałą platformę, Airflow, do zarządzania rurociągami danych, która została już z powodzeniem zastosowana do zarządzania wdrożeniem modelu i monitorowaniem przez niektóre z najbardziej zaawansowanych zespołów ML na świecie. Więc modele mogą być nowe, ale orchestracja nie jest.
Czy mógłbyś wyjaśnić użycie syntetycznych danych do doskonalenia mniejszych modeli pod kątem dokładności? Jak to porównuje się do trenowania większych modeli?
To jest potężna technika. Możesz myśleć o najlepszych dużych modelach językowych jako o tym, co one nauczyły się o świecie, i mogą one przekazać to mniejszym modelom, generując syntetyczne dane. Duże modele językowe uchwytują ogromne ilości wiedzy nauczonej z rozległych zbiorów danych. Te modele mogą generować syntetyczne dane, które uchwytują wzorce, struktury i informacje, które nauczyły się. Syntetyczne dane mogą być następnie wykorzystane do trenowania mniejszych modeli, efektywnie przenosząc część wiedzy z większych modeli do mniejszych. Ten proces jest często nazywany „destylacją wiedzy” i pomaga w tworzeniu wydajnych, mniejszych modeli, które nadal działają dobrze w określonych zadaniach. I z syntetycznymi danymi możesz uniknąć problemów z prywatnością i wypełnić luki w danych szkoleniowych, które są małe lub niekompletne.
To może być pomocne w trenowaniu bardziej specyficznego modelu generatywnego AI, i może być nawet bardziej skuteczne niż trenowanie „większego” modelu, z większym poziomem kontroli.
Data scientists generują syntetyczne dane od dawna i imputacja istnieje tak długo, jak istnieją nieładne zestawy danych. Ale zawsze musisz być bardzo ostrożny, aby nie wprowadzać stronniczości lub nie robić błędnych założeń o rozkładzie danych. Teraz, gdy syntetyzowanie danych jest tak łatwe i potężne, musisz być jeszcze bardziej ostrożny. Błędy mogą być powiększone.
Brak różnorodności w generowanych danych może prowadzić do „zawalenia modelu”. Model myśli, że działa dobrze, ale to dlatego, że nie widział pełnego obrazu. I ogólnie, brak różnorodności w danych szkoleniowych jest czymś, na co zespoły danych powinny zawsze zwracać uwagę.
Na poziomie podstawowym, niezależnie od tego, czy używasz syntetycznych danych, czy organicznych, linia i jakość są niezwykle ważne dla trenowania lub doskonalenia każdego modelu. Jak wiemy, modele są tak dobre, jak dane, na których są trenowane. Chociaż syntetyczne dane mogą być wspaniałym narzędziem, aby pomóc reprezentować wrażliwe zestawy danych bez ich ujawnienia lub wypełnić luki, które mogą być pominięte w reprezentatywnym zestawie danych, musisz mieć dokumentację, która pokazuje, skąd pochodzą dane i być w stanie udowodnić ich poziom jakości.
Jakie innowacyjne techniki Twoj zespół w Astronomer wprowadza, aby poprawić wydajność i niezawodność rurociągów danych?
Bardzo wiele! Pełnie zarządzana infrastruktura Airflow i Astro Hypervisor wspiera dynamiczne skalowanie i proaktywne monitorowanie za pomocą zaawansowanych wskaźników zdrowia. Zapewnia to, że zasoby są wykorzystywane efektywnie i że systemy są niezawodne w każdym zakresie. Astro zapewnia solidne alertowanie oparte na danych z dostosowanymi powiadomieniami, które mogą być wysyłane przez różne kanały, takie jak Slack i PagerDuty. Zapewnia to terminowe interwencje, zanim problemy eskalują.
Testy walidacji danych, testy jednostkowe i kontrole jakości danych odgrywają istotną rolę w zapewnieniu niezawodności, dokładności i wydajności rurociągów danych i ostatecznie danych, które napędzają Twój biznes. Te kontrole zapewniają, że podczas szybkiego budowania rurociągów danych, aby dotrzymać terminów, aktywnie łapią błędy, poprawiają czasy rozwoju i zmniejszają nieprzewidziane błędy w tle. W Astronomer, zbudowaliśmy narzędzia, takie jak Astro CLI, aby pomóc w łatwym sprawdzaniu funkcjonalności kodu lub identyfikowaniu problemów integracji w ramach Twojego rurociągu danych.
Jak widzisz ewolucję zarządzania generatywną AI, i jakie środki powinny być podjęte, aby wspierać tworzenie większej liczby narzędzi?
Zarządzanie jest niezbędne, jeśli aplikacje Generative AI mają być udane. Chodzi o to, aby być przejrzystym i odtwarzalnym. Czy wiesz, jak uzyskałeś ten wynik, i skąd, i kto to zrobił? Airflow sam w sobie już daje Ci sposób, aby zobaczyć, co konkretnie robią poszczególne rurociągi danych. Jego interfejs użytkownika był jednym z powodów jego szybkiego przyjęcia na początku, a w Astronomer uzupełniliśmy to o widoczność na poziomie zespołów i wdrożeń. Zapewniamy również naszym klientom Raporty z szerszymi informacjami na temat wykorzystania platformy, wydajności i przypisania kosztów do podejmowania świadomych decyzji. Ponadto, API Astro umożliwia zespołom wdrożenie, automatyzację i zarządzanie ich rurociągami Airflow programistycznie, zmniejszając ryzyko związane z procesami ręcznymi i zapewniając bezproblemowe operacje na dużą skalę przy zarządzaniu wieloma środowiskami Airflow. Możliwości linii są wbudowane w platformę.
To są wszystkie kroki w kierunku pomocy w zarządzaniu danymi, i wierzę, że firmy wszystkich rozmiarów uznają znaczenie zarządzania danymi, aby zapewnić zaufanie w aplikacjach AI. To uznanie i świadomość w dużej mierze napędzą popyt na narzędzia zarządzania danymi, i spodziewam się, że tworzenie tych narzędzi przyspieszy, gdy generatywna AI się rozprzestrzenia. Ale muszą one być częścią większego stosu orchestracji, dlatego uważamy to za fundamentalne dla sposobu, w jaki budujemy naszą platformę.
Czy mógłbyś podać przykłady, jak rozwiązania Astronomer poprawiły wydajność operacyjną i produktywność dla klientów?
Procesy generatywnej AI obejmują złożone i wymagające zasobów zadania, które muszą być starannie zoptymalizowane i wielokrotnie wykonywane. Astro, zarządzana platforma Apache Airflow Astronomer, zapewnia ramy w centrum powstającego stosu aplikacji AI, aby pomóc w uproszczeniu tych zadań i zwiększeniu możliwości innowacji.
Orchestracja zadań generatywnej AI pozwala firmom zapewnić, że zasoby obliczeniowe są wykorzystywane efektywnie, a przepływy pracy są zoptymalizowane i dostosowane w czasie rzeczywistym. Jest to szczególnie ważne w środowiskach, w których generatywne modele muszą być często aktualizowane lub ponownie trenowane na podstawie nowych danych.
Wykorzystując zarządzanie przepływem pracy Airflow i możliwości wdrożeniowe Astronomer, zespoły mogą poświęcić mniej czasu na zarządzanie infrastrukturą i skupić się na transformacji danych i rozwoju modelu, co przyspiesza wdrożenie aplikacji Generative AI i poprawia ich wydajność.
W ten sposób platforma Astro Astronomer pomogła klientom poprawić wydajność operacyjną generatywnej AI w szerokim zakresie przypadków użycia. Wśród nich znajdują się odkrywanie produktów e-commerce, analiza ryzyka odejścia klienta, automatyzacja wsparcia, klasyfikacja i podsumowanie dokumentów prawnych, uzyskiwanie informacji o produkcie z recenzji klientów i dynamiczne przydzielanie klastrów do generowania obrazów produktów.
Jaką rolę odgrywa Astronomer w poprawie wydajności i skalowalności aplikacji AI i ML?
Skalowalność jest dużym wyzwaniem dla firm, które wykorzystują generatywną AI w 2024 roku. Gdy przechodzisz od prototypu do produkcji, użytkownicy oczekują, że aplikacje generatywnej AI będą niezawodne i wydajne, a dane wyjściowe, które generują, będą godne zaufania. To musi być zrobione w sposób ekonomiczny, a firmy wszystkich rozmiarów muszą być w stanie wykorzystać jej potencjał. Z tym na uwadze, korzystając z Astronomer, zadania mogą być skalowane poziomo, aby dynamicznie przetwarzać duże ilości źródeł danych. Astro może elastycznie skalować wdrożenia i klastry, na których są one hostowane, a wykonanie zadań oparte na kolejce z dedykowanymi typami maszyn zapewnia większą niezawodność i efektywne wykorzystanie zasobów obliczeniowych. Aby pomóc w kwestiach ekonomicznych, Astro oferuje funkcje skalowania do zera i hibernacji, które pomagają kontrolować koszty i zmniejszać wydatki na chmurę. Zapewniamy również pełną przejrzystość wokół kosztów platformy. Mój zespół ds. danych generuje raporty o zużyciu, które udostępniamy naszym klientom codziennie.
Jakie trendy w AI i data science są Cię najbardziej interesujące, i jak Astronomer przygotowuje się do nich?
Wyjaśnialna AI jest ogromnie ważną i fascynującą dziedziną rozwoju. Można się zastanawiać, jak można zajrzeć do wnętrza bardzo dużych modeli. I jestem również zainteresowany, jak społeczność radzi sobie z wpływem środowiskowym szkolenia i dostosowywania modeli. W Astronomer, nadal aktualizujemy nasz Rejestr o wszystkich najnowszych integracjach, aby zespoły danych i ML mogły połączyć się z najlepszymi usługami modelowymi i najbardziej efektywnymi platformami obliczeniowymi bez większych problemów.
Jak widzisz integrację zaawansowanych narzędzi AI, takich jak LLM, z tradycyjnymi systemami zarządzania danymi w ciągu najbliższych kilku lat?
Widzieliśmy, jak Databricks i Snowflake ogłosiły niedawno, w jaki sposób włączają zarówno użycie, jak i rozwój LLM w ramach swoich platform. Inne systemy zarządzania bazami danych i platformy ML zrobią to samo. Jest wspaniale widzieć, jak inżynierowie danych mają tak łatwy dostęp do tak potężnych metod, bezpośrednio z linii poleceń lub zapytania SQL.
Jestem szczególnie zainteresowany, jak relacyjne bazy danych włączają machine learning. Zawsze czekam, aż metody ML zostaną włączone do standardu SQL, ale z jakiegoś powodu te dwie dyscypliny nigdy nie naprawdę „wypaliły”. Może tym razem będzie inaczej.
Jestem bardzo podekscytowany przyszłością dużych modeli językowych, które pomagają w pracy inżyniera danych. Na początek, LLM są już szczególnie skuteczne w generowaniu kodu, chociaż wczesne próby dostarczania data scientistom sugestii AI były mieszane: Hex jest wspaniały, na przykład, podczas gdy Snowflake jest niesatysfakcjonujący do tej pory. Ale jest ogromny potencjał, aby zmienić naturę pracy zespołów danych, znacznie więcej niż dla deweloperów. Dlaczego? Dla inżynierów oprogramowania, podpowiedź jest nazwą funkcji lub dokumentacją, ale dla inżynierów danych jest również dane. Jest tak wiele kontekstu, z którym modele mogą pracować, aby zrobić użyteczne i dokładne sugestie.
Jakie rady dałbyś osobom, które aspirują do zostania data scientistami i inżynierami AI, aby zrobić wpływ w branży?
Ucz się, robiąc. Jest tak niezwykle łatwo budować aplikacje w dzisiejszych czasach i uzupełniać je o sztuczną inteligencję. Więc zbuduj coś fajnego i wyślij to do znajomego, który pracuje w firmie, którą podziwiasz. Albo wyślij to do mnie, a obiecuję, że wezmę na to spojrzenie!
Szczęście polega na tym, aby znaleźć coś, co Cię pasjonuje, i znaleźć dobry źródło powiązanych danych. Jeden z moich znajomych zrobił fascynującą analizę niezwykłych sezonów baseballowych, sięgając aż do XIX wieku, i odkrył historie, które zasługują na to, aby zostać sfilmowane. I niektórzy inżynierowie Astronomer niedawno spotkali się na weekend, aby zbudować platformę dla samouzdrawiających się rurociągów danych. Nie mogę sobie wyobrazić, że spróbowałbym zrobić coś takiego kilka lat temu, ale zaledwie kilka dni wysiłku wystarczyło, aby wygrać hackathon Cohere i zbudować podstawy nowej, głównej funkcji w naszej platformie.
Dziękuję za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Astronomer.












