Interviuri
Christian Stano, Field CTO la Anyscale – Seria de interviuri

Christian Stano, Field CTO la Anyscale, și-a construit cariera la intersecția infrastructurii de inteligență artificială la scară largă, a platformelor de învățare automată și a calculului distribuit. Înainte de a se alătura Anyscale, el a condus organizația platformei AI/ML de la Attentive, unde a scalat infrastructura care susține personalizarea pentru peste jumătate de miliard de abonați și a ajutat la adoptarea sistemelor de calcul unificate bazate pe Ray, care au îmbunătățit viteza de dezvoltare și au redus costurile operaționale. Mai devreme în cariera sa, el a lucrat în domeniul securității cibernetice, arhitecturii cloud și inițiativelor de inteligență artificială din sectorul public la organizații precum Coalfire și Deloitte, unde a contribuit la una dintre primele platforme de învățare automată ale Departamentului Apărării din Statele Unite. Experiența sa cuprinde ingineria platformelor de inteligență artificială, MLOps, infrastructura nativă cloud, dezvoltarea dezvoltatorilor și scalarea organizațională, oferindu-i o experiență profundă în ajutarea întreprinderilor să operaționalizeze inteligența artificială la scară de producție.
Anyscale este compania din spatele Ray, cadrul de calcul distribuit open-source utilizat pe scară largă pentru escaladarea sarcinilor de inteligență artificială și Python pe cluster de procesoare și unități de procesare grafică. Fondată de creatorii originali ai Ray de la RISELab UC Berkeley, compania se concentrează pe simplificarea implementării, orchestrării și gestionării infrastructurii de inteligență artificială la scară largă pentru antrenament, inferență, prelucrare a datelor și sarcini de inteligență artificială. Platforma sa permite organizațiilor să ruleze sisteme de inteligență artificială distribuite în medii cloud și on-premise, oferind observabilitate, guvernanță și optimizări de performanță concepute pentru aplicațiile moderne de inteligență artificială. Ray a devenit un strat fundamental în stiva de infrastructură de inteligență artificială emergentă, ajutând dezvoltatorii să scaleze sarcinile de la o singură mașină la mii de noduri cu modificări minime ale codului Python existent.
Ați lucrat în domenii precum securitatea cibernetică, platformele de inteligență artificială din sectorul public și sistemele de personalizare la scară largă. Care sunt modelele pe care le-ați observat în mod constant atunci când organizațiile încearcă să treacă de la proiecte-pilot de inteligență artificială la producție?
În toate industriile, trei modele apar în mod regulat. Primul, echipele nu au o cale pavată fiabilă de la dezvoltare la producție. Pot construi un model într-un caiet, dar nu există o modalitate standardizată de a-l face să ruleze în producție. Fiecare implementare devine o operațiune unică, iar fiecare eșec este o surpriză. Al doilea, infrastructura nu poate scala cu nevoile. Sistemul care a funcționat într-un proiect-pilot se prăbușește atunci când îi oferiți volume reale de date sau trafic real. Al treilea, echipele zboară orb. Le lipsește observabilitatea pentru a ști cum funcționează în realitate sistemele lor, unde sunt pe cale să se prăbușească și când să intervină.
Ceea ce leagă toate acestea este aceeași provocare de bază — echipele nu au un model mental solid pentru escaladare. Încearcă să rezolve totul deodată, în loc să fie intenționate cu privire la secvențiere. Mă gândesc la trei faze: fă-o să funcționeze, fă-o corect, fă-o rapid. Aceste faze nu sunt puncte de referință unice — aceste faze sunt iterative. Sunteți mereu prioritate între ceea ce este în prezent defect și ceea ce va fi defect în următoarea etapă. Echipele care reușesc știu în ce fază se află și rămân disciplinate pentru a nu sări înainte înainte de a avea o bază solidă.
La Anyscale, vedem echipe care vin la fiecare etapă. Unele încă încearcă să o facă să funcționeze — au nevoie de o cale fiabilă de la dezvoltare la producție. Altele au aceasta, dar se înecă în complexitatea operațională și au nevoie să o facă corect. Și multe vin la noi pentru că au construit ceva care funcționează, dar nu pot să o escaladeze la nivelul pe care afacerea îl cere. Un strat de calcul unificat ajută la fiecare fază, dar punctul de intrare depinde de unde este cea mai ascuțită durere.
La Attentive, ați ajutat la escaladarea sistemelor de inteligență artificială care susțin sute de milioane de utilizatori. Care au fost cele mai mari blocaje arhitecturale sau organizaționale pe care ați trebuit să le depășiți pentru a ajunge la acest nivel de scalare?
Cel mai mare blocaj a fost curba în forma literei S a complexității infrastructurii. Pe măsură ce am împins modelele noastre pentru a include mai multe date și a servi mai mulți clienți, am ajuns la un punct de inflexiune al calculului unde chiar și nodurile verticale scalate nu mai funcționau și nu puteam să escaladăm orizontal în mod naiv. Calculul nostru nu putea ține pasul cu scala noastră de date.
Răspunsul natural a fost să adăugăm mai multe unelte pentru a lucra în jurul limitărilor. Acesta a fost planul meu intern din experiența anterioară. Fiecare instrument a rezolvat o problemă îngustă, dar a adăugat complexitate operațională. Pipeline-ul nostru de învățare automată s-a confruntat cu faptul că devine o piesă de integrare, iar fiecare nouă utilizare a însemnat mai multă cusătură, mai multe moduri de eșec, costuri mai mari și mai multă supraîncărcare pentru echipa platformei.
Ceea ce ne-a deblocat în cele din urmă scalabilitatea a fost unificarea prelucrării datelor, antrenamentului, inferenței și servirii pe Ray și Anyscale. Impactul a fost imediat: cu costuri de infrastructură dramatic reduse, cicluri de antrenament semnificativ mai rapide, chiar și pe măsură ce volumele de date creșteau, și capacitatea de a scala modele la ordine de mărime mai multe clienți.
Ce v-a motivat decizia de a vă alătura Anyscale în acest stadiu, și cum vedeți rolul de Field CTO în modelarea adoptării inteligenței artificiale la nivel de întreprindere?
Experiența mea de a aduce Anyscale în Attentive a schimbat fundamental planul meu pentru construirea de platforme de învățare automată. Înainte de aceasta, o parte semnificativă a ingineriei platformei a fost costul de a coase sisteme fragmentate. Cu Anyscale, am putut să eliminăm o parte semnificativă din această supraîncărcare și să ne concentrăm în schimb asupra experienței dezvoltatorului, a fiabilității și a performanței. Această schimbare a avut un impact uriaș atât asupra productivității echipei, cât și asupra rezultatelor sistemului. Alăturarea Anyscale a fost o oportunitate de a lucra la această problemă cu normă întreagă și de a ajuta alte organizații să navigheze aceeași tranziție. Ca Field CTO, rolul meu este de fapt să iau aceste lecții din lumea reală și să le transform în modele repetabile pe care clienții noștri le pot aplica pe măsură ce escaladează inteligența artificială.
Multe întreprinderi sunt încă blocate în faza “pilot” a inteligenței artificiale. Din perspectiva dvs., ce se sparge în mod specific atunci când companiile încearcă să escaladeze aceste experimente timpurii în sisteme de producție?
Când companiile trec de la experimente de inteligență artificială la producție, ceea ce se sparge rareori este doar modelul — ci sistemul și operațiunile înconjurătoare. În unele cazuri, echipele lovesc limitele infrastructurii devreme și nu pot antrena sau servi la scala la care doresc. Trebuie să limiteze numărul de clienți sau cazuri de utilizare pe care modelul îi deservește ca urmare. Mai des, problemele apar în producție prin cazuri marginale neașteptate sau schimbări în date. Unul dintre punctele de eșec cel mai frecvente este memoria: pe măsură ce dimensiunea datelor, distribuția sau modalitatea se schimbă, sarcinile rulează fără memorie și eșuează. Aceste probleme sunt dificil de anticipat și și mai greu de recuperat automat. Realitatea este că eșecul este inevitabil în producția de inteligență artificială. Scopul nu este să îl evităm în totalitate, ci să îl detectăm rapid, să îl înțelegem și să construim sisteme autoreparabile pentru a-l rezolva înainte de a afecta afacerea.
Ray, cadrul de calcul distribuit creat de echipa din spatele Anyscale, câștigă teren ca fundament pentru sarcinile de inteligență artificială. De ce executarea distribuită devine un strat atât de critic în infrastructura modernă de inteligență artificială?
Executarea distribuită și gestionarea sarcinilor de lucru au devenit pariuri obligatorii pentru conductele de inteligență artificială. Sarcinile moderne de inteligență artificială sunt în mod inerent paralele și consumatoare de resurse. Antrenamentul, inferența și prelucrarea datelor necesită coordonarea a numeroase sarcini de lucru pe procesoare și unități de procesare grafică, adesea dinamic. În peisajul actual de calcul, complexitatea gestionării acestor sarcini de lucru pe resurse rare este o povară operațională masivă. Sistemele tradiționale nu au fost concepute pentru acest nivel de complexitate sau scară. Cadre precum Ray sunt critice pentru că permit echipelor să scaleze sarcinile de lucru de la o singură mașină la mii de noduri, automatizând coordonarea subiacentă. Această schimbare reflectă o mișcare mai largă către calculul nativ de inteligență artificială, unde infrastructura este concepută în mod special pentru modelele de sarcini de inteligență artificială, și nu adaptată din paradigme mai vechi.
Pe măsură ce mai multe companii adoptă Ray prin platforma Anyscale, ce diferențe observați între organizațiile care se standardizează pe o abordare unificată și cele care coase împreună unelte fragmentate?
Diferența dintre platformele unificate și uneltele fragmentate se reduce în cele din urmă la concentrare și eficiență. Când echipele se bazează pe sisteme desconectate multiple, ele petrec o cantitate semnificativă de timp pentru a coase aceste sisteme împreună, pentru a gestiona incoerențele și pentru a răspunde la eșecuri în medii diferite. Acest lucru creează o supraîncărcare operațională și încetinește experimentarea. În contrast, o abordare unificată permite echipelor să-și concentreze eforturile pe îmbunătățirea unui singur sistem, ceea ce duce la o mai bună fiabilitate, o performanță mai puternică și o experiență a dezvoltatorului mai liniștită. De asemenea, simplifică procesele de chemare și depanare, deoarece modelele sunt consistente și mai ușor de înțeles. Rezultatul nu este doar eficiență tehnică, ci și claritate organizațională.
Pe baza experienței dvs. de a construi platforme de învățare automată de la capăt la capăt, cât de importantă este experiența dezvoltatorului (DevEx) în accelerarea adoptării inteligenței artificiale în echipe?
Experiența dezvoltatorului este una dintre zonele cu cel mai mare impact pentru accelerarea adoptării inteligenței artificiale. Când echipele platformei investesc în facilitarea utilizării sistemelor prin fluxuri de lucru standardizate, șabloane și reducerea fricțiunii infrastructurii, ele amplifică productivitatea fiecărui inginer din organizație. Acest lucru este deosebit de important în inteligența artificială, unde ritmul schimbărilor este extrem de rapid și echipele au nevoie să iterateze rapid pentru a rămâne competitive. Îmbunătățirile experienței dezvoltatorului se traduc direct în experimentarea mai rapidă, timpul mai scurt de ajungere la producție și, în cele din urmă, în impactul mai mare asupra afacerii. Uneltele de codare de inteligență artificială amplifică aceste fundamenturi ale experienței dezvoltatorului. În multe feluri, este cel mai scalabil mod de a crește viteza în întreaga organizație.
Eficiența costurilor devine o preocupare majoră pe măsură ce sarcinile de inteligență artificială se escaladează. Care sunt unele dintre cele mai puțin observate modalități prin care întreprinderile pot reduce costurile infrastructurii fără a sacrifica performanța?
Pe măsură ce sarcinile de inteligență artificială se escaladează, gestionarea costurilor devine atât mai importantă, cât și mai complexă. Una dintre cele mai puțin observate provocări este modul în care costurile pot crește rapid din cauza ineficiențelor, în special cu infrastructura bazată pe unități de procesare grafică. Clusteri mari pot porni mii de noduri, și dacă resursele nu sunt gestionate corespunzător sau oprite, costurile se acumulează rapid. Acest lucru creează o formă de “sprawl” specifică inteligenței artificiale, unde utilizarea calculului crește mai repede decât echipele pot urmări sau controla. Abordarea acestei provocări necesită o combinație de guvernanță puternică, vizibilitate și automatizare, cum ar fi escaladarea automată, terminarea automată și gestionarea centralizată a resurselor. La scară, eficiența costurilor nu este doar o preocupare operațională, ci și o parte fundamentală a proiectării sistemului.
Ați lucrat la tot, de la magazine de caracteristici la sisteme de inferență în timp real. Cum credeți că se evoluează echilibrul dintre sarcinile de inteligență artificială în lot și cele în timp real?
Echilibrul dintre sarcinile de inteligență artificială în lot și cele în timp real nu s-a schimbat fundamental — rămâne o chestiune de cerințe de afaceri. Prelucrarea în lot este, de obicei, mai eficientă din punct de vedere al costurilor și mai ușor de operat, făcând-o potrivită pentru multe cazuri de utilizare. Sistemele în timp real sunt esențiale atunci când latența afectează direct experiența utilizatorului sau rezultatul afacerii, cum ar fi în aplicațiile de chat sau detectarea fraudelor. Ambele abordări vor continua să coexiste, iar cheia pentru organizații este să construiască platforme care să poată susține fiecare în mod eficient. Decizia se reduce în cele din urmă la compromisuri între cost, latență și fiabilitate.
Privind înainte, ce arată o “matură” platformă de inteligență artificială la nivel de întreprindere în 2-3 ani — și cum se încadrează unelte precum Ray și platforme precum Anyscale în acest viitor?
În următorii ani, platformele mature de inteligență artificială la nivel de întreprindere vor fi definite de câteva caracteristici cheie. Ele se vor baza pe infrastructură unificată care susține întregul ciclu de viață al inteligenței artificiale, de la prelucrarea datelor la antrenament și inferență, și nu pe o colecție de unelte desconectate. Vor avea operațiuni Day 2 puternice, cu observabilitate automatizată, fiabilitate și capacitate de depanare rapidă. Gestionarea costurilor va fi previzibilă și guvernată, permițând organizațiilor să se escaladeze în mod durabil. Și, probabil, cel mai important, vor permite o viteză de dezvoltare ridicată a dezvoltatorilor, făcând ușor pentru echipe să treacă de la idee la producție rapid. Platforme precum Ray și Anyscale joacă un rol central în acest viitor, oferind fundația nativă de inteligență artificială care face posibilă acest nivel de scară și eficiență.
Mulțumim pentru acest interviu minunat; cititorii care doresc să afle mai multe pot vizita Anyscale.












