Haastattelut
Christian Stano, Field CTO Anyscalella – Haastattelusarja

Christian Stano, Anyscale:n Field CTO, on rakentanut uransa suurten mittakaavojen tekoälyinfrastruktuurin, koneoppimisalustojen ja jakautuneen laskennan leikkauskohdassa. Ennen Anyscaleen liittymistään hän johti Attentiven AI/ML-alustojen organisaatiota, jossa hän mittasi infrastruktuuria, joka tukee yksilöllistämistä yli puolelle miljardille tilaajalle, ja auttoi Ray-pohjaisen yhdistetyn laskenta-järjestelmän omaksumista, joka paransi kehityksen nopeutta ja laski toiminnallisia kustannuksia. Uransa alussa hän työskenteli kyberTurvallisuuden, pilvi-arkkitehtuurin ja julkisen sektorin tekoälyaloitteiden parissa organisaatioissa, kuten Coalfire ja Deloitte, jossa hän osallistui yhteen Yhdysvaltain puolustusministeriön ensimmäisistä tekoälyalustoista. Taustansa kattaa tekoälyalustojen insinööritöitä, MLOps, pilvi-alkuperäisen infrastruktuurin, kehittäjien mahdollistamisen ja organisaatioiden skaalauttamisen, antaen hänelle syvän kokemuksen siitä, miten yritykset voivat ottaa tekoälyn tuotantoon.
Anyscale on yritys, joka on luonut Ray:n, avoimen lähdekoodin jakautuneen laskenta-kehyksen, jota käytetään laajasti tekoälyn ja Python-työkuormien skaalauttamiseen prosessori- ja GPU-klustereissa. Perustettu Ray:n alkuperäisistä luojista UC Berkeley:n RISELab:sta, yritys keskittyy tekoälyinfrastruktuurin käyttöönoton, orkestraation ja hallinnan yksinkertaistamiseen suurten mittakaavojen tekoälyjärjestelmien koulutukseen, inferenceen, datakäsittelyyn ja agenteille tekoälytyökuormiin. Sen alusta mahdollistaa organisaatioiden ajaa jakautuneita tekoälyjärjestelmiä pilvi- ja paikallisympäristöissä tarjoamalla havainnollistamisen, hallinnon ja suorituskyvyn optimoinnit modernille tekoälysovelluksille. Ray on tullut tärkeäksi osaksi kehittyvää tekoälyinfrastruktuurin pinorakennetta, auttaen kehittäjiä skaalauttamaan työkuormia yhdestä koneesta tuhansiin solmuihin vähäisin muutoksin olemassa olevaan Python-koodiin.
Olet työskennellyt kyberTurvallisuuden, julkisen sektorin tekoälyalustojen ja hypermittakaavan henkilökohtaisistamisjärjestelmien parissa. Mitä kaavoja olet havainnut, kun organisaatiot yrittävät siirtyä tekoälykokeilusta tuotantoon?
Teollisuuden ylitse kolme kaavaa ilmestyy jatkuvasti. Ensinnäkin, tiimit eivät ole luotettavaa, valmiita polkuja kehityksestä tuotantoon. He voivat rakentaa mallin muistikirjaan, mutta ei ole standardoitua tapaa saada se toimimaan tuotannossa. Jokainen käyttöönotto on yksittäinen, ja jokainen epäonnistuminen on yllätys. Toiseksi, infrastruktuuri ei pysty skaalautumaan tarpeiden mukaan. Järjestelmä, joka toimi kokeilussa, romahtaa, kun sille syötetään todellisia tietomääriä tai todellista liikennettä. Kolmanneksi, tiimit lentävät sokeina. Heillä ei ole havainnollistamista, jotta he tietäisivät, miten järjestelmänsä todella toimii, missä se on murtumaisillaan ja milloin puuttua.
Kaikki kolme liittyvät samaan juurisyyhyn — tiimit eivät ole vahvaa mentalista mallia skaalautumisesta. He yrittävät ratkaista kaiken kerran, sen sijaan, että olisivat tarkoituksenmukaisia siitä, mitä he järjestyksessä tekevät. Ajattelen sitä kolmena vaiheena: saada se toimimaan, saada se oikein, saada se nopeasti. Nämä eivät ole kertaluonteisia merkkipaaluja — nämä vaiheet ovat toistuvia. Priorisoidaan jatkuvasti sitä, mikä on rikki juuri nyt ja mikä on seuraavaksi rikki. Onnistuneet tiimit tietävät, missä vaiheessa he ovat, ja pysyvät kurissa siitä, ettei he hyppää eteenpäin, ennen kuin perusta on vankka.
Anyscalella näemme tiimejä, jotka tulevat kaikissa vaiheissa. Jotkut yrittävät edelleen saada sen toimimaan — he tarvitsevat luotettavan polun kehityksestä tuotantoon. Toiset ovat saaneet sen, mutta ovat hukkumaisillaan toiminnallisen monimutkaisuuden vuoksi ja tarvitsevat sitä oikein. Ja monet tulevat meidän luo, koska he ovat rakentaneet jotain, mikä toimii, mutta eivät voi työntää sitä skaalaan, mitä liiketoiminta vaatii. Yhdistetty laskentakerros auttaa jokaisessa vaiheessa, mutta sisääntulopiste riippuu siitä, missä kipu on voimakkainta.
Attentivessä auttoit skaalauttamaan tekoälyjärjestelmiä, jotka tukevat satoja miljoonia käyttäjiä. Mitkä olivat suurimmat arkkitehtuuriset tai organisaatiot esteet, joita sinun piti voittaa saavuttaaksesi tuon mittakaavan?
Suurin este oli infrastruktuurin monimutkaisuuden S-käyrä. Kun venytimme mallejamme ottamaan enemmän dataa ja palvelemaan enemmän asiakkaita, osuimme laskennan infektioon, jossa jopa suurimmat pystysuorat solmut heittivät muistivirheitä, ja viattomat vaakasuorat skaalaukset eivät olleet leikkaamassa. Laskentamme ei pystynyt pitämään dataamme skaalaa.
Luonnollinen reaktio oli kerroksittain työkaluja työskennellä rajoitusten ympärillä. Tämä oli minun sisäinen pelikirjani aikaisemmasta kokemuksestani. Jokainen työkalu ratkaisi kapean ongelman, mutta lisäsi toiminnallista monimutkaisuutta. ML-pipeline kohtasi patchworkin integraatioista, ja jokainen uusi käyttötapa merkitsi enemmän ompelemista, enemmän epäonnistumisen muotoja, korkeampia kustannuksia ja enemmän ylläpitoa alustatiimille.
Se, mikä lopulta avasi skaalautumisen meille, oli yhdistää datakäsittely, koulutus, inference ja palvelu Ray:lle ja Anyscalelle. Vaikutus oli välitön: dramaattisesti alhaisemmat infrastruktuurikustannukset, merkittävästi nopeammat koulutusjaksojen, vaikka data-määrät kasvoivat, ja mahdollisuus skaalautua malleja useisiin kymmeniin asiakkaisiin.
Mikä motivoi sinun päätöksesi liittyä Anyscaleen tällä tasolla, ja miten näet Field CTO:n roolin muovautuvan yritysten tekoälyadoption?
Minun kokemukseni Anyscaleen tuomisesta Attentiveen muutti perustavasti minun pelikirjani tekoälyalustojen rakentamisesta. Ennen sitä merkittävä osa alustojen insinööritöistä oli hajautettujen järjestelmien ompelemisen kustannus. Anyscalella pystyimme poistamaan suuren osan siitä ylläpidosta ja keskittyä kehittäjien kokemukseen, luotettavuuteen ja suorituskykyyn. Se muutos vaikutti suuresti sekä tiimin tuottavuuteen että järjestelmän tuloksiin. Liittyminen Anyscaleen oli mahdollisuus työskennellä tämän ongelman parissa täysipainoisesti ja auttaa muita organisaatioita navigoimaan saman siirtymän. Field CTO:na minun roolini on ottaa ne todelliset maailman oppitunnit ja muuttaa ne toistettaviksi kaavoiksi, joita asiakkaamme voivat soveltaa skaalauttaessaan tekoälyä.
Monet yritykset ovat edelleen jumissa “kokeiluvaiheessa” tekoälyssä. Miten näet, mitä nimenomaan murtuu, kun yritykset yrittävät skaalata näitä varhaisia kokeiluja tuotantojärjestelmiin?
Kun yritykset siirtyvät tekoälykokeiluista tuotantoon, se, mikä usein murtuu, ei ole vain malli — se on ympäröivä järjestelmä ja toiminnat. Jossain tapauksissa tiimit osuvat infrastruktuurin rajoituksiin aikaisin eivätkä pysty kouluttamaan tai palvelemaan haluamaansa skaalaa. Heidän on leikattava asiakasmäärää tai käyttötapoja, joita heidän mallinsa palvelee. Useammin ongelmat ilmenevät tuotannossa odottamattomien reunatapauksien tai datan muutosten kautta. Yksi yleisimmistä epäonnistumisen pisteistä on muisti: kun datan koko, jakautuma tai modaalimuoto muuttuu, työt loppuvat muistista ja epäonnistuvat. Nämä ongelmat ovat vaikeita ennakoida ja vielä vaikeampia automaattisesti palauttaa. Todellisuus on, että epäonnistuminen on väistämätöntä tuotantotekoälyssä. Tavoitteena ei ole välttää sitä täysin, vaan havaita se nopeasti, ymmärtää se ja rakentaa itsestään parantavia järjestelmiä ratkaisemaan se, ennen kuin se vaikuttaa liiketoimintaan.
Ray, jakautunut laskenta-kehyksen luonut tiimi Anyscale:n takana, saa jalansijaa perustana tekoälytyökuormille. Miksi jakautunut suoritus on tullut niin kriittiseksi kerrokseksi modernissa tekoälyinfrastruktuurissa?
Jakautunut suoritus ja työkuormien hallinta ovat tulleet pöytälaatikkoon tekoälyputkistoihin. Modernit tekoälytyökuormat ovat luonteeltaan rinnakkaisia ja resursseja vaativia. Koulutus, inference ja datakäsittely vaativat usein suuren määrän tehtävien koordinoimista prosessoreiden ja GPU:iden yli, usein dynaamisesti. Nykyisessä laskentamaailmassa näiden työkuormien hallinnan monimutkaisuus on massiivinen toiminnallinen taakka. Perinteiset järjestelmät eivät olleet suunniteltu tähän tasoon monimutkaisuutta tai skaalautuvuutta varten. Kehykset kuten Ray ovat kriittisiä, koska ne sallivat tiimien skaalautua työkuormia yhdestä koneesta tuhansiin solmuihin automatisoimalla perustavan koordinoinnin. Tämä siirtymä heijastaa laajempaa siirtymää tekoälyominaiselle laskennalle, jossa infrastruktuuri on suunniteltu erityisesti tekoälytyökuormien kaavoja varten, eikä sovellettu vanhemmista paradigmoista.
Kun enemmän yrityksiä ottaa Ray:n käyttöön Anyscale:n kautta, mitä eroja näet yritysten välillä, jotka standardoivat yhdistetyn lähestymistavan ja niiden, jotka ompelevat hajautettuja työkaluja?
Ero yhdistetyiden alustojen ja hajautettujen työkalujen välillä tulee lopulta ajoittamisen ja tehokkuuden eroon. Kun tiimit riippuvat useista erillisistä järjestelmistä, he viettävät merkittävän ajan ompelemassa näitä järjestelmiä, hallitsemassa epäjohdonmukaisuuksia ja reagoimassa epäonnistumisiin eri ympäristöissä. Tämä luo toiminnallisen ylläpidon ja hidastaa kokeilua. Sen sijaan yhdistetty lähestymistapa sallii tiimien keskittyä yhden järjestelmän parantamiseen, mikä johtaa parempaan luotettavuuteen, vahvempiin suorituskykyyn ja sujuvampaan kehittäjien kokemukseen. Se yksinkertaistaa myös vuorokauden ja vianetsintäprosesseja, koska kaavat ovat johdonmukaisia ja helpompia ymmärtää. Tuloksena on ei vain tekninen tehokkuus, vaan myös organisaatioiden selkeys.
Pohjautuen kokemukseesi lopusta-loppuun tekoälyalustojen rakentamisesta, kuinka tärkeää on kehittäjien kokemus (DevEx) tekoälyn omaksumisen kiihdyttämisessä tiimien ympärillä?
Kehittäjien kokemus on yksi korkean vaikuttavuuden alueista tekoälyn omaksumisen kiihdyttämisessä. Kun alustatiimit panostavat järjestelmien helpottamiseen standardoimalla työvirrat, mallipohjat ja vähentämällä infrastruktuurin kitkaa, he moninkertaistavat jokaisen insinöörin tuottavuuden organisaatiossa. Tämä on erityisen tärkeää tekoälyssä, jossa muutoksen vauhti on erittäin nopea ja tiimien on iterationeerattava nopeasti pysyäkseen kilpailukykyisinä. Parannukset kehittäjien kokemuksessa kääntyvät suoraan nopeammaksi kokeiluksi, nopeammaksi tuotantoon siirtymiseksi ja lopulta enemmän liiketoimintavaikutukseksi. Tekoälykoodausvälineet vahvistavat näitä DevEx-perusteita. Monilla tavoilla se on skaalautuvuin tapa lisätä nopeutta koko organisaatiossa.
Kustannustehokkuus on tullut suureksi huolenaiheeksi, kun tekoälytyökuormat skaalautuvat. Mitkä ovat joitain eniten ylitettyjä tapoja, joilla yritykset voivat vähentää infrastruktuurikustannuksiaan ilman suorituskyvyn uhraamista?
Kun tekoälytyökuormat skaalautuvat, kustannushallinta tulee sekä tärkeämmäksi että monimutkaisemmaksi. Yksi eniten ylitetty haaste on, kuinka nopeasti kustannukset voivat kasvaa tehokkuuden puutteen vuoksi, erityisesti GPU-pohjaisessa infrastruktuurissa. Suuret klusterit voivat käynnistää tuhansia solmuja, ja jos resursseja ei hallita oikein tai suljeta, kustannukset kasaantuvat nopeasti. Tämä luo tekoälyyn spesifiin laajentumisen, jossa laskentakäyttö kasvaa nopeammin kuin tiimit voivat seurata tai hallita. Tähän vaaditaan yhdistelmä vahvaa hallintaa, näkyvyyttä ja automaatiota, kuten autoskaalautuminen, auto-päättäminen ja keskitetty resurssien hallinta. Skaalautuvuuden kannalta kustannustehokkuus ei ole vain toiminnallinen huolenaihe, vaan myös perustavanlaatuinen osa järjestelmän suunnittelua.
Olet työskennellyt kaikenlaisilla tekoälysovelluksilla, kuten piirroskaupasta reaaliaikaisiin inference-järjestelmiin. Miten näet tasapainon batch- ja reaaliaikaisen tekoälytyökuormien välillä kehittyvän?
Tasapaino batch- ja reaaliaikaisen tekoälytyökuormien välillä ei ole perimmältään muuttunut — se on edelleen liiketoimintavaatimusten kysymys. Batch-käsittely on tyypillisesti kustannustehokkaampaa ja helpompaa operoida, mikä tekee siitä soveltuvan moniin käyttötarkoituksiin. Reaaliaikaiset järjestelmät ovat välttämättömiä, kun viive vaikuttaa suoraan käyttökokemukseen tai liiketoimintatulokseen, kuten chat-sovelluksissa tai petostentunnistuksessa. Molemmat lähestymistavat jatkavat olemassaoloaan, ja avain organisaatioille on rakentaa alustoja, jotka voivat tukea kumpaakin tehokkaasti. Päätös tulee lopulta kustannuksen, viiveen ja luotettavuuden välisistä tasapainoista.
Etäältä, mitä näet “kypsän” yritysten tekoälyalustan näyttävän 2-3 vuoden päästä — ja miten työkalut kuten Ray ja alustat kuten Anyscale mahtuvat tähän tulevaisuuteen?
Seuraavien vuosien aikana kypsentyneet yritysten tekoälyalustat määritellään muutamilla avainominaisuuksilla. Ne riippuvat yhdistetystä infrastruktuurista, joka tukee koko tekoäly-elinkaarta, alkaen datakäsittelystä, koulutuksesta, inferenceen, eikä kerää hajautettuja työkaluja. Niillä on vahvat päivän 2 toiminnot, joissa on agenttiautomaattinen havainnollistaminen, luotettavuus ja nopea vianetsintä. Kustannushallinta on ennustettavissa ja hallittavissa, jotta organisaatiot voivat skaalautua kestävästi. Ja ehkä tärkeimpänä ne mahdollistavat kehittäjien nopean liikkeen, tekoälyjärjestelmien nopean siirtymisen ideoista tuotantoon. Alustat kuten Ray ja Anyscale ovat keskeisiä tässä tulevaisuudessa, tarjoamalla tekoälyominaisen perustan, joka mahdollistaa tämän tason skaalautuvuuden ja tehokkuuden.
Kiitos hienosta haastattelusta, lukijat, jotka haluavat oppia enemmän, voivat vierailla Anyscale:lla.












