Interviuri

Steven Hillion, SVP de Date și AI la Astronomer – Seria de interviuri

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Steven Hillion este Vicepreședintele Senior al Datelor și AI la Astronomer, unde își folosește experiența academică extinsă în matematică și peste 15 ani de experiență în dezvoltarea platformelor de învățare automată din Silicon Valley. La Astronomer, el conduce crearea unor funcții Apache Airflow special concepute pentru echipele de ML și AI și supraveghează echipa internă de știință a datelor. Sub conducerea sa, Astronomer și-a îmbunătățit platforma modernă de orchestrare a datelor, îmbunătățind semnificativ capacitățile de pipeline de date pentru a sprijini o varietate de surse de date și sarcini prin învățare automată.

Puteți împărtăși informații despre călătoria dvs. în știința datelor și AI și cum v-a influențat abordarea conducerii echipelor de inginerie și analitică?

Am avut o pregătire în matematică pură la Berkeley, înainte de a trece pe cealaltă parte a golfului și de a lucra ca inginer într-o serie de start-up-uri de succes. Eram fericit să las în urmă politica și birocrația academiei, dar am găsit că, în câțiva ani, îmi lipsea matematica. Așa că m-am mutat în dezvoltarea de platforme pentru învățare automată și analitică, și asta este, în general, ceea ce am făcut de atunci.

Pregătirea mea în matematică pură a dus la o preferință pentru ceea ce oamenii de știință numesc “parsimonia” – instrumentul potrivit pentru sarcină și nimic mai mult. Deoarece matematicienii tind să favorizeze soluțiile elegante în locul mașinăriilor complexe, am încercat întotdeauna să subliniez simplitatea atunci când aplic învățarea automată problemelor de afaceri. Învățarea profundă este grozavă pentru anumite aplicații – modelele de limbaj mari sunt briliante pentru rezumarea documentelor, de exemplu – dar, uneori, un model de regresie simplu este mai potrivit și mai ușor de explicat.

A fost fascinant să văd schimbarea rolului oamenilor de știință și a inginerilor de software în acești ultimi douăzeci de ani, de când învățarea automată a devenit răspândită. Purțând ambele pălării, sunt foarte conștient de importanța ciclului de viață al dezvoltării software (în special, automatizarea și testarea) aplicat proiectelor de învățare automată.

Care sunt cele mai mari provocări în mutarea, prelucrarea și analiza datelor nestructurate pentru AI și modelele de limbaj mari (LLM)?

În lumea Inteligenței Artificiale Generative, datele dvs. sunt cel mai valoros activ. Modelele sunt din ce în ce mai mult comodificate, așa că diferențierea dvs. este tot ceea ce constituie cunoașterea instituțională câștigată, capturată în seturile de date proprietare și curate.

Livrarea datelor potrivite la momentul potrivit pune cerințe ridicate asupra pipeline-urilor dvs. de date – și acest lucru se aplică pentru datele nestructurate, la fel ca și pentru datele structurate, sau poate mai mult. Adesea ingerați date din multe surse diferite, în multe formate diferite. Aveți nevoie de acces la o varietate de metode pentru a dezambala datele și a le pregăti pentru utilizare în inferența modelului sau în antrenarea modelului. De asemenea, trebuie să înțelegeți proveniența datelor și unde ajung pentru a “arăta munca dvs.”.

Dacă faceți acest lucru doar ocazional pentru a antrena un model, este în regulă. Nu trebuie neapărat să operaționalizați. Dacă utilizați modelul zilnic pentru a înțelege sentimentul clienților din forumurile online sau pentru a rezuma și a direcționa facturile, atunci începe să semene cu orice alt pipeline de date operațional, ceea ce înseamnă că trebuie să vă gândiți la fiabilitate și reproductibilitate. Sau, dacă ajustați modelul în mod regulat, atunci trebuie să vă faceți griji pentru monitorizarea acurateței și a costurilor.

Veștile bune sunt că inginerii de date au dezvoltat o platformă grozavă, Airflow, pentru gestionarea pipeline-urilor de date, care a fost deja aplicată cu succes pentru gestionarea implementării modelului și a monitorizării de către unele dintre cele mai sofisticate echipe de ML din lume. Așa că modelele pot fi noi, dar orchestrarea nu este.

Puteți elabora asupra utilizării datelor sintetice pentru a ajusta modelele mai mici pentru precizie? Cum se compară acest lucru cu antrenarea modelelor mai mari?

Este o tehnică puternică. Puteți considera cele mai bune modele de limbaj mare ca fiind, într-un fel, încapsularea a ceea ce au învățat despre lume și pot transmite acest lucru modelelor mai mici prin generarea de date sintetice. Modelele LLM încapsulează cantități uriașe de cunoștințe învățate din antrenarea extinsă pe seturi de date diverse. Aceste modele pot genera date sintetice care capturează modelele, structurile și informațiile pe care le-au învățat. Aceste date sintetice pot fi utilizate apoi pentru a antrena modele mai mici, transferând, în mod eficient, o parte din cunoștințele din modelele mai mari către cele mai mici. Acest proces este adesea numit “distilare a cunoștințelor” și ajută la crearea unor modele eficiente, mai mici, care încă funcționează bine pe sarcini specifice. Și, cu datele sintetice, puteți evita, de asemenea, problemele de confidențialitate și completați lacunele din datele de antrenare care sunt mici sau incomplete.

Acest lucru poate fi util pentru antrenarea unui model de inteligență artificială generativă mai specific domeniului și poate fi chiar mai eficient decât antrenarea unui “model mai mare”, cu un nivel mai mare de control.

Oamenii de știință au generat date sintetice de ceva timp și imputarea a existat de când au existat seturi de date murdare. Dar trebuia să fiți foarte atenți să nu introduceți prejudecăți sau să faceți presupuneri greșite despre distribuția datelor. Acum, când sintetizarea datelor este atât de ușoară și puternică, trebuie să fiți și mai atenți. Erorile pot fi amplificate.

Lipsa diversității în datele generate poate duce la “prăbușirea modelului”. Modelul crede că funcționează bine, dar asta se datorează faptului că nu a văzut imaginea de ansamblu. Și, în general, lipsa diversității în datele de antrenare este ceva pentru care echipele de date ar trebui să fie întotdeauna atente.

La nivel de bază, indiferent dacă utilizați date sintetice sau organice, linia de sânge și calitatea sunt esențiale pentru antrenarea sau ajustarea oricărui model. Așa cum știm, modelele sunt la fel de bune ca și datele cu care sunt antrenate. În timp ce datele sintetice pot fi un instrument grozav pentru a reprezenta un set de date sensibile fără a le expune sau pentru a completa lacunele care ar putea fi lăsate într-un set de date reprezentativ, trebuie să aveți o dovadă care arată de unde provin datele și să puteți dovedi nivelul de calitate.

Care sunt unele tehnici inovatoare pe care echipa dvs. de la Astronomer le implementează pentru a îmbunătăți eficiența și fiabilitatea pipeline-urilor de date?

Atât de multe! Infrastructura Astro de Airflow complet gestionată și Hypervisorul Astro sprijină scalarea dinamică și monitorizarea proactivă prin metrice de sănătate avansate. Acest lucru asigură că resursele sunt utilizate eficient și că sistemele sunt fiabile la orice scară. Astro oferă alerte robuste bazate pe date, cu notificări personalizabile care pot fi trimise prin diverse canale, cum ar fi Slack și PagerDuty. Acest lucru asigură intervenția la timp înainte ca problemele să escaladeze.

Testele de validare a datelor, testele unitare și verificările calității datelor joacă roluri vitale în asigurarea fiabilității, preciziei și eficienței pipeline-urilor de date și, în cele din urmă, a datelor care alimentează afacerea dvs. Aceste verificări asigură că, în timp ce construiți rapid pipeline-uri de date pentru a îndeplini termenele limită, ele prind activ erorile, îmbunătățesc timpul de dezvoltare și reduc erorile neașteptate din fundal. La Astronomer, am construit instrumente precum Astro CLI pentru a ajuta la verificarea fără efort a funcționalității codului sau la identificarea problemelor de integrare din pipeline-ul dvs. de date.

Cum vedeți evoluția guvernanței Inteligenței Artificiale Generative și care măsuri ar trebui luate pentru a sprijini crearea unor instrumente mai multe?

Guvernanța este imperativă dacă aplicațiile Inteligenței Artificiale Generative urmează să fie de succes. Este vorba despre transparență și reproductibilitate. Știți cum ați obținut acest rezultat, de unde și de cine? Airflow, în sine, vă oferă deja o modalitate de a vedea ce fac pipeline-urile de date individuale. Interfața sa cu utilizatorul a fost unul dintre motivele adoptării sale rapide la început, și la Astronomer am completat-o cu vizibilitatea pe echipe și implementări. De asemenea, oferim clienților noștri panouri de raportare care oferă perspective cuprinzătoare asupra utilizării platformei, performanței și a atribuirii costurilor pentru luarea deciziilor informate. În plus, API-ul Astro permite echipelor să implementeze, să automatizeze și să gestioneze pipeline-urile Airflow în mod programatic, reducând astfel riscurile asociate cu procesele manuale și asigurând operațiuni fără probleme la scară atunci când se gestionează mai multe medii Airflow. Capabilitățile de linie de sânge sunt încorporate în platformă.

Acestea sunt toate pași spre a ajuta la gestionarea guvernanței datelor, și cred că companiile de toate dimensiunile recunosc importanța guvernanței datelor pentru a asigura încrederea în aplicațiile AI. Această recunoaștere și conștientizare vor conduce, în mare măsură, cererea de instrumente de guvernanță a datelor, și anticip că crearea unor astfel de instrumente va accelera pe măsură ce Inteligența Artificială Generativă se răspândește. Dar ele trebuie să facă parte din stiva mai mare de orchestrare, ceea ce ne face să o considerăm fundamentală pentru modul în care construim platforma noastră.

Puteți oferi exemple de modurile în care soluțiile Astronomer au îmbunătățit eficiența operațională și productivitatea pentru clienți?

Procesele de Inteligență Artificială Generativă implică sarcini complexe și consumatoare de resurse care trebuie să fie optimizate și executate cu atenție. Astro, platforma Astronomer gestionată de Apache Airflow, oferă un cadru în centrul stivei de aplicații AI emergente pentru a ajuta la simplificarea acestor sarcini și la îmbunătățirea capacității de a inova rapid.

Prin orchestrarea sarcinilor de Inteligență Artificială Generativă, afacerile pot asigura că resursele de calcul sunt utilizate eficient și că fluxurile de lucru sunt optimizate și ajustate în timp real. Acest lucru este deosebit de important în medii în care modelele generative trebuie să fie actualizate sau reantrenate frecvent pe baza noilor date.

Prin utilizarea gestionării fluxului de lucru Airflow și a capacităților de implementare și scalare Astronomer, echipele pot petrece mai puțin timp gestionând infrastructura și pot concentra atenția asupra transformării datelor și dezvoltării modelului, ceea ce accelerează implementarea aplicațiilor de Inteligență Artificială Generativă și îmbunătățește performanța.

În acest fel, platforma Astro a Astronomer a ajutat clienții să îmbunătățească eficiența operațională a Inteligenței Artificiale Generative într-o gamă largă de cazuri de utilizare. Pentru a numi câteva, cazurile de utilizare includ descoperirea de produse de comerț electronic, analiza riscului de abandon al clienților, automatizarea suportului, clasificarea și rezumarea documentelor juridice, obținerea de informații despre produse din recenziile clienților și provisionarea dinamică a clusterelor pentru generarea de imagini de produse.

Care este rolul Astronomer în îmbunătățirea performanței și scalabilității aplicațiilor de Inteligență Artificială și Învățare Automată?

Scalabilitatea este o provocare majoră pentru afacerile care se bazează pe Inteligența Artificială Generativă în 2024. Când treceți de la prototip la producție, utilizatorii așteaptă ca aplicațiile lor de Inteligență Artificială Generativă să fie fiabile și performante, și ca ieșirile pe care le produc să fie de încredere. Acest lucru trebuie făcut în mod eficient din punct de vedere al costurilor, iar afacerile de toate dimensiunile trebuie să poată valorifica potențialul său. Având în vedere acest lucru, prin utilizarea Astronomer, sarcinile pot fi scalate orizontal pentru a procesa dinamic un număr mare de surse de date. Astro poate scala elastic implementările și clusterul pe care sunt găzduite, iar executarea sarcinilor bazate pe coadă, cu tipuri de mașini dedicate, oferă o fiabilitate și o utilizare eficientă a resurselor de calcul. Pentru a ajuta la piesa puzzle-ului eficienței costurilor, Astro oferă funcții de scalare la zero și de hibernare, care ajută la controlul costurilor care se învârt și la reducerea cheltuielilor cu cloud-ul. De asemenea, oferim transparență completă cu privire la costul platformei. Echipa mea de date generează rapoarte despre consum, pe care le facem disponibile zilnic clienților noștri.

Care sunt unele tendințe viitoare în Inteligența Artificială și știința datelor care vă entuziasmează, și cum se pregătește Astronomer pentru ele?

Inteligența Artificială Explicabilă este o zonă de dezvoltare extrem de importantă și fascinantă. Este ca și cum ați putea privi în funcționarea internă a unor modele foarte mari. Și sunt, de asemenea, interesat să văd cum comunitatea se luptă cu impactul de mediu al antrenării și reglării modelului. La Astronomer, continuăm să actualizăm Registrul nostru cu toate integrările latest, astfel încât echipele de date și de învățare automată să poată conecta cele mai bune servicii de model și cele mai eficiente platforme de calcul fără niciun efort.

Cum vă imaginați integrarea instrumentelor avansate de Inteligență Artificială, cum ar fi LLM, cu sistemele tradiționale de gestionare a datelor, în următorii câțiva ani?

Am văzut atât Databricks, cât și Snowflake, care au făcut anunțuri recente despre modul în care incorporează atât utilizarea, cât și dezvoltarea LLM în cadrul platformelor lor respective. Alte sisteme de gestionare a bazelor de date și platforme de învățare automată vor face același lucru. Este minunat să vedem că inginerii de date au acces atât de ușor la astfel de metode puternice, direct de la linia de comandă sau de la promptul SQL.

Sunt, în special, interesat să văd cum bazele de date relaționale incorporează învățarea automată. Aștept întotdeauna ca metodele de învățare automată să fie incorporate în standardul SQL, dar, pentru oarecare motiv, cele două discipline nu s-au potrivit niciodată. Poate că, de data aceasta, va fi diferit.

Sunt foarte entuziasmat de viitorul modelelor de limbaj mare pentru a ajuta munca inginerului de date. În primul rând, modelele LLM au fost deja deosebit de de succes în generarea de cod, deși eforturile inițiale de a furniza oamenilor de știință sugestii conduse de IA au fost amestecate: Hex este grozav, de exemplu, în timp ce Snowflake este lipsit de inspirație până acum. Dar există un potențial uriaș de a schimba natura muncii pentru echipele de date, mult mai mult decât pentru dezvoltatori. De ce? Pentru inginerii de software, promptul este un nume de funcție sau documentație, dar pentru inginerii de date, există și datele. Există atât de mult context cu care modelele pot lucra pentru a face sugestii utile și precise.

Care este sfatul dvs. pentru oamenii de știință și inginerii de Inteligență Artificială care doresc să aibă un impact în industrie?

Învață prin faptul că o faceți. Este atât de ușor să construiți aplicații în zilele noastre și să le completați cu inteligență artificială. Așa că construiți ceva cool și trimiteți-l unui prieten al unui prieten care lucrează la o companie pe care o admirați. Sau trimiteți-mi-l, și vă promit că o să-l iau în considerare!

Trucul este să găsiți ceva care vă pasionează și să găsiți o sursă bună de date conexe. Un prieten de-al meu a făcut o analiză fascinantă a sezonului anormal de baseball, care datează de la începutul secolului al XIX-lea, și a descoperit povești care merită să aibă un film realizat despre ele. Și unii ingineri de la Astronomer s-au adunat recent într-o zi de week-end pentru a construi o platformă pentru pipeline-uri de date auto-vindecătoare. Nu-mi pot imagina încercând să fac ceva similar cu câțiva ani în urmă, dar, cu doar câteva zile de efort, am câștigat hackathon-ul Cohere și am construit baza unei funcții majore noi în platforma noastră.

Mulțumesc pentru acest interviu grozav, cititorilor care doresc să afle mai multe, le recomand să viziteze Astronomer.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.