Interviste
Christian Stano, Field CTO di Anyscale – Serie di interviste

Christian Stano, Field CTO di Anyscale, ha costruito la sua carriera all’intersezione di grandi infrastrutture di intelligenza artificiale, piattaforme di apprendimento automatico e calcolo distribuito. Prima di unirsi ad Anyscale, ha guidato l’organizzazione della piattaforma AI/ML di Attentive, dove ha scalato l’infrastruttura per supportare la personalizzazione per oltre mezzo miliardo di utenti e ha contribuito a promuovere l’adozione di sistemi di calcolo unificati basati su Ray, migliorando la velocità di sviluppo e riducendo i costi operativi. In precedenza, ha lavorato in settori come la sicurezza informatica, l’architettura cloud e le iniziative di intelligenza artificiale nel settore pubblico presso organizzazioni come Coalfire e Deloitte, dove ha contribuito a creare una delle prime piattaforme di apprendimento automatico del Dipartimento della Difesa degli Stati Uniti. La sua esperienza copre l’ingegneria delle piattaforme di intelligenza artificiale, MLOps, infrastrutture cloud-native, abilitazione degli sviluppatori e scalabilità organizzativa, fornendogli una profonda esperienza nel aiutare le imprese a operare l’intelligenza artificiale a livello di produzione.
Anyscale è l’azienda dietro Ray, il framework di calcolo distribuito open-source ampiamente utilizzato per scalare carichi di lavoro di intelligenza artificiale e Python su cluster di CPU e GPU. Fondata dai creatori originali di Ray del RISELab di UC Berkeley, l’azienda si concentra sulla semplificazione della distribuzione, dell’orchestrazione e della gestione di grandi infrastrutture di intelligenza artificiale per l’addestramento, l’inferenza, l’elaborazione dei dati e i carichi di lavoro di intelligenza artificiale agente. La sua piattaforma consente alle organizzazioni di eseguire sistemi di intelligenza artificiale distribuiti su ambienti cloud e on-premise, fornendo osservabilità, governance e ottimizzazioni delle prestazioni progettate per applicazioni di intelligenza artificiale moderne. Ray è diventato un livello fondamentale nello stack di infrastrutture di intelligenza artificiale emergente, aiutando gli sviluppatori a scalare carichi di lavoro da una singola macchina a migliaia di nodi con minimi cambiamenti al codice Python esistente.
Ha lavorato in settori come la sicurezza informatica, le piattaforme di apprendimento automatico nel settore pubblico e i sistemi di personalizzazione iperscalari. Quali modelli ha visto costantemente quando le organizzazioni cercano di spostarsi da progetti pilota alla produzione?
In tutti i settori, tre modelli si presentano regolarmente. In primo luogo, le squadre non hanno un percorso affidabile dalla fase di sviluppo alla produzione. Possono costruire un modello in un notebook, ma non c’è un modo standardizzato per metterlo in esecuzione in produzione. Ogni distribuzione diventa un caso unico e ogni fallimento è una sorpresa. In secondo luogo, l’infrastruttura non può scalare con le esigenze. Il sistema che funziona in un progetto pilota si blocca quando si alimenta con volumi di dati reali o traffico reale. In terzo luogo, le squadre sono alla cieca. Mancano dell’osservabilità per sapere come stanno funzionando i loro sistemi, dove stanno per rompersi e quando intervenire.
Ciò che collega tutti e tre è la stessa sfida di base — le squadre non hanno un modello mentale solido per la scalabilità. Cercano di risolvere tutto in una volta invece di essere deliberati nella sequenza. Penso a questo come a tre fasi: farlo funzionare, farlo bene, farlo velocemente. Queste non sono pietre miliari una tantum — queste fasi sono iterative. Si è costantemente impegnati a priorizzare ciò che è rotto in questo momento e ciò che si romperà dopo. Le squadre che hanno successo sanno in quale fase si trovano e rimangono disciplinate nel non saltare in avanti prima che la base sia solida.
In Anyscale, vediamo squadre che entrano a ogni fase. Alcune stanno ancora cercando di farlo funzionare — hanno bisogno di un percorso affidabile dalla fase di sviluppo alla produzione. Altri ce l’hanno, ma sono sommersi dalla complessità operativa e hanno bisogno di farlo bene. E molti vengono da noi perché hanno costruito qualcosa che funziona, ma non possono spingerlo alla scala che l’azienda richiede. Un livello di calcolo unificato aiuta in ogni fase, ma il punto di ingresso dipende da dove è più acuto il dolore.
In Attentive, ha aiutato a scalare i sistemi di intelligenza artificiale che supportano centinaia di milioni di utenti. Quali sono stati i principali collo di bottiglia architettonici o organizzativi che ha dovuto superare per raggiungere quel livello di scalabilità?
Il collo di bottiglia più grande è stata la curva a S della complessità dell’infrastruttura. Mentre spingevamo i nostri modelli per incorporare più dati e servire più clienti, abbiamo raggiunto un punto di inflessione del calcolo in cui anche i nodi più grandi verticalmente erano in errore di memoria e la scalabilità orizzontale ingenua non funzionava. Il nostro calcolo non riusciva a tenere il passo con la scala dei nostri dati.
La risposta naturale è stata quella di aggiungere strati di strumenti per lavorare intorno ai limiti. Questo è stato il mio libro di gioco interno derivato da precedenti esperienze. Ogni strumento risolveva un problema ristretto, ma aggiungeva complessità operativa. La nostra pipeline di apprendimento automatico si stava trasformando in un patchwork di integrazioni e ogni nuovo caso d’uso significava più cuciture, più modi di fallire, costi più alti e più carichi di lavoro per il team della piattaforma.
Ciò che ha sbloccato la scalabilità per noi è stato unificare l’elaborazione dei dati, l’addestramento, l’inferenza e il servizio su Ray e Anyscale. L’impatto è stato immediato: con costi di infrastruttura drasticamente inferiori, cicli di addestramento significativamente più veloci anche mentre i volumi di dati crescevano e la capacità di scalare i modelli per ordini di grandezza più clienti.
Cosa l’ha motivato a unirsi ad Anyscale a questo stadio, e come vede il ruolo di Field CTO nella formazione dell’adozione di intelligenza artificiale aziendale?
La mia esperienza nell’introdurre Anyscale in Attentive ha fondamentalmente cambiato il mio libro di gioco per la costruzione di piattaforme di apprendimento automatico. Prima di allora, una parte significativa dell’ingegneria della piattaforma era il costo di cucire insieme sistemi frammentati. Con Anyscale, siamo stati in grado di eliminare gran parte di quel sovraccarico e concentrarci invece sull’esperienza dello sviluppatore, l’affidabilità e le prestazioni. Quel cambiamento ha avuto un impatto enorme sia sulla produttività del team che sui risultati del sistema. Unirsi ad Anyscale è stata un’opportunità di lavorare a tempo pieno su quel problema e aiutare altre organizzazioni a navigare la stessa transizione. Come Field CTO, il mio ruolo è fondamentalmente quello di prendere quelle lezioni del mondo reale e trasformarle in modelli ripetibili che i nostri clienti possono applicare mentre scalano l’intelligenza artificiale.
Molte aziende sono ancora bloccate nella “fase di progetto pilota” dell’intelligenza artificiale. Dal suo punto di vista, cosa si rompe specificamente quando le aziende cercano di scalare questi primi esperimenti in sistemi di produzione?
Quando le aziende si spostano da esperimenti di intelligenza artificiale alla produzione, ciò che si rompe raramente è solo il modello — è il sistema e le operazioni circostanti. In alcuni casi, le squadre raggiungono i limiti dell’infrastruttura precocemente e non possono addestrare o servire alla scala desiderata. Devono limitare il numero di clienti o di casi d’uso che il loro modello serve di conseguenza. Più spesso, problemi emergono in produzione attraverso casi limite inaspettati o cambiamenti nei dati. Uno dei punti di fallimento più comuni è la memoria: quando la dimensione, la distribuzione o la modalità dei dati cambiano, i lavori esauriscono la memoria e falliscono. Questi problemi sono difficili da anticipare e ancora più difficili da auto-risolvere. La realtà è che il fallimento è inevitabile nella produzione di intelligenza artificiale. L’obiettivo non è quello di evitarlo completamente, ma di rilevarlo rapidamente, comprenderlo e costruire sistemi auto-risananti per risolverlo prima che abbia un impatto sull’azienda.
Ray, il framework di calcolo distribuito creato dal team dietro Anyscale, sta guadagnando popolarità come fondamento per carichi di lavoro di intelligenza artificiale. Perché l’esecuzione distribuita sta diventando un livello così critico nelle infrastrutture di intelligenza artificiale moderne?
L’esecuzione distribuita e la gestione dei carichi di lavoro sono diventate fondamentali per le pipeline di intelligenza artificiale. I carichi di lavoro di intelligenza artificiale moderni sono intrinsecamente paralleli e intensivi in termini di risorse. L’addestramento, l’inferenza e l’elaborazione dei dati richiedono tutti la coordinazione di un gran numero di attività su CPU e GPU, spesso in modo dinamico. Nel paesaggio del calcolo di oggi, la complessità della gestione di questi carichi di lavoro su risorse scarse è un onere operativo massiccio. I sistemi tradizionali non sono stati progettati per questo livello di complessità o scalabilità. Framework come Ray sono critici perché consentono alle squadre di scalare carichi di lavoro in modo trasparente da una singola macchina a migliaia di nodi automatizzando la coordinazione sottostante. Questo cambiamento riflette un passaggio più ampio verso il calcolo nativo dell’intelligenza artificiale, in cui l’infrastruttura è progettata specificamente per i modelli di carichi di lavoro di intelligenza artificiale piuttosto che adattata da paradigmi più vecchi.
Man mano che più aziende adottano Ray attraverso la piattaforma di Anyscale, quali differenze vede tra le organizzazioni che adottano un approccio unificato e quelle che cuciano insieme strumenti frammentati?
La differenza tra piattaforme unificate e strumenti frammentati alla fine si riduce a focus ed efficienza. Quando le squadre si affidano a sistemi non connessi, spendono una quantità significativa di tempo a cucirli insieme, gestire le incoerenze e rispondere ai fallimenti in ambienti diversi. Ciò crea un sovraccarico operativo e rallenta la sperimentazione. In contrasto, un approccio unificato consente alle squadre di concentrare i loro sforzi sull’miglioramento di un singolo sistema, portando a una maggiore affidabilità, prestazioni più solide e un’esperienza dello sviluppatore più fluida. Semplifica anche i processi di on-call e di debug perché i modelli sono coerenti e più facili da comprendere. Il risultato non è solo l’efficienza tecnica, ma anche la chiarezza organizzativa.
Basandosi sulla sua esperienza nella costruzione di piattaforme di apprendimento automatico end-to-end, quanto è importante l’esperienza dello sviluppatore (DevEx) nell’accelerare l’adozione di intelligenza artificiale attraverso le squadre?
L’esperienza dello sviluppatore è una delle aree ad alto rendimento per accelerare l’adozione di intelligenza artificiale. Quando i team di piattaforma investono nel rendere i sistemi più facili da usare attraverso flussi di lavoro standardizzati, modelli, riducendo l’attrito dell’infrastruttura, amplificano la produttività di ogni ingegnere nell’organizzazione. Ciò è particolarmente importante nell’intelligenza artificiale, dove il ritmo del cambiamento è estremamente veloce e le squadre devono iterare rapidamente per rimanere competitive. I miglioramenti dell’esperienza dello sviluppatore si traducono direttamente in una sperimentazione più rapida, un tempo di produzione più veloce e, in definitiva, un maggiore impatto aziendale. Gli strumenti di codifica dell’intelligenza artificiale amplificano questi fondamenti di DevEx. In molti modi, è il modo più scalabile per aumentare la velocità in tutta l’organizzazione.
L’efficienza dei costi sta diventando una preoccupazione maggiore man mano che i carichi di lavoro di intelligenza artificiale si espandono. Quali sono alcuni dei modi più trascurati in cui le aziende possono ridurre i costi di infrastruttura senza sacrificare le prestazioni?
Man mano che i carichi di lavoro di intelligenza artificiale si espandono, la gestione dei costi diventa sia più importante che più complessa. Una delle sfide più trascurate è come i costi possano aumentare rapidamente a causa di inefficienze, specialmente con l’infrastruttura basata su GPU. I grandi cluster possono avviare migliaia di nodi e, se le risorse non sono gestite o chiuse correttamente, i costi si accumulano rapidamente. Ciò crea una forma di sprawl specifica dell’intelligenza artificiale, in cui l’utilizzo del calcolo cresce più velocemente di quanto i team possano tracciare o controllare. Risolvere questo problema richiede una combinazione di governance solida, visibilità e automazione, come l’autoscaling, l’autoterminazione e la gestione delle risorse centralizzata. A livello di scalabilità, l’efficienza dei costi non è solo una preoccupazione operativa, ma un aspetto fondamentale della progettazione del sistema.
Ha lavorato su tutto, dalle librerie di funzionalità ai sistemi di inferenza in tempo reale. Come pensa che si stia evolvendo l’equilibrio tra carichi di lavoro di intelligenza artificiale batch e in tempo reale?
L’equilibrio tra carichi di lavoro di intelligenza artificiale batch e in tempo reale non è fondamentalmente cambiato — rimane una questione di requisiti aziendali. L’elaborazione batch è generalmente più conveniente in termini di costi ed è più facile da gestire, rendendola adatta per molti casi d’uso. I sistemi in tempo reale, d’altra parte, sono essenziali quando la latenza ha un impatto diretto sull’esperienza dell’utente o sul risultato aziendale, come nelle applicazioni di chat o nella rilevazione delle frodi. Entrambi gli approcci continueranno a coesistere e la chiave per le organizzazioni è costruire piattaforme che possano supportare entrambi in modo efficace. La decisione alla fine si riduce ai compromessi tra costo, latenza e affidabilità.
Guardando avanti, cosa assomiglia una “matura” piattaforma di intelligenza artificiale aziendale tra 2-3 anni — e come strumenti come Ray e piattaforme come Anyscale si inseriscono in quel futuro?
Nei prossimi anni, le piattaforme di intelligenza artificiale aziendale mature saranno definite da alcune caratteristiche chiave. Si affideranno a un’infrastruttura unificata che supporti l’intero ciclo di vita dell’intelligenza artificiale, dall’elaborazione dei dati all’addestramento all’inferenza, piuttosto che a una raccolta di strumenti non connessi. Avranno solide operazioni di Day 2, con capacità di osservabilità automatizzata, affidabilità e debug rapido. La gestione dei costi sarà prevedibile e gestita, consentendo alle organizzazioni di scalare in modo sostenibile. E forse più importante, consentiranno una alta velocità degli sviluppatori, rendendo facile per le squadre spostarsi dall’idea alla produzione rapidamente. Piattaforme come Ray e Anyscale svolgono un ruolo centrale in questo futuro fornendo la base nativa dell’intelligenza artificiale che rende possibile questo livello di scalabilità ed efficienza.
Grazie per la grande intervista, i lettori che desiderano saperne di più possono visitare Anyscale.












