Haastattelut
Kirill Solodskih, TheStage AI:n perustaja ja toimitusjohtaja – Haastattelusarja

Kirill Solodskih, FT, on TheStage AI:n perustaja ja toimitusjohtaja sekä kokenut AI-tutkija ja yrittäjä, jolla on yli kymmenen vuoden kokemus neuroverkkojen optimoinnista liiketoimintaa varten. Vuonna 2024 hän perusti TheStage AI:n, joka sai 4,5 miljoonan dollarin rahoituksen neuroverkkojen kiihdyttämiseen kaikilla laitteistoalustoilla.
Aikaisemmin Huawei:n tiimijohtajana Kirill johti AI-kamerasovellusten kiihdyttämistä Qualcomm (QCOM ) NPUs:lle, mikä vaikutti P50- ja P60-älypuhelinten suorituskykyyn ja toi useita patenteja hänen innovaatioilleen. Hänen tutkimuksensa on esitetty johtavilla konferensseilla, kuten CVPR ja ECCV, joissa se on saanut palkintoja ja alanlaajuista tunnustusta. Hän myös isännöi podcastia AI-optimoinnista ja päätöksenteosta.
Mikä innoitti sinua perustamaan TheStage AI, ja miten siirryit akateemisesta tutkimuksesta ja yrittäjyydestä inference-optimoinnin pariin?
TheStage AI:n perustana oli työni Huawei:lla, jossa olin syventynyt automaattisiin käyttöönottajiin ja neuroverkkojen optimointiin. Nämä aloitteet muodostivat perustan joillekin meidän uraauurtaville innovaatioille, ja siinä näin todellisen haasteen. Mallin kouluttaminen on yksi asia, mutta saada se toimimaan tehokkaasti todellisessa maailmassa ja tehdä se käyttäjille helpoksi on toinen. Käyttöönotto on pullonkaula, joka pitää monia hyviä ideoita eloon. Tehdäkseen jotain yhtä helppoa kuin ChatGPT, taustalla on paljon haasteita. Teknisen näkökulman kannalta neuroverkkojen optimointi on minimoida parametreja säilyttäen suorituskyky korkeana. Se on vaikea matemaattinen ongelma, jossa on runsaasti tilaa innovaatioille.
Manuaalinen inference-optimointi on pitkään ollut pullonkaula AI:ssa. Voitko selittää, miten TheStage AI automatisoi tämän prosessin ja miksi se on pelinmuuttaja?
TheStage AI käsittelee tärkeää pullonkaulaa AI:ssa: manuaalisen neuroverkkojen pakkaamisen ja kiihdyttämisen. Neuroverkoissa on miljardeja parametreja, ja selvittääkseen, mitkä poistaa paremman suorituskyvyn vuoksi, on lähes mahdotonta tehdä käsin. ANNA (Automated Neural Networks Analyzer) automatisoi tämän prosessin, tunnistaa, mitkä kerrokset on syytä jättää optimoinnista, samalla tavoin kuin ZIP-pakkaus automatisoitiin ensimmäisen kerran.
Tämä muuttaa peliä tekemällä AI-omaksumisen nopeammaksi ja edullisemmaksi. Sen sijaan, että luotettaisiin kalliisiin manuaalisiin prosesseihin, startupit voivat optimoida malleja automaattisesti. Teknologia antaa liiketoiminnalle selkeän näkymän suorituskyvystä ja kustannuksista, varmistaen tehokkuuden ja skaalautuvuuden ilman arvauksia.
TheStage AI väittää vähentävänsä inference-kustannuksia jopa 5-kertaisesti — mitä tekee teidän optimointiteknologianne niin tehokkaaksi verrattuna perinteisiin menetelmiin?
TheStage AI leikkaa tulostuskustannuksia jopa 5-kertaisesti optimointimenetelmällä, joka menee perinteisten menetelmien ulkopuolelle. Sen sijaan, että sovellettaisiin samaa algoritmia koko neuroverkkoon, ANNA jakaa sen pienempiin kerroksiin ja päättää, minkä algoritmin soveltaa kunkin osan kohdalla, jotta saavutetaan haluttu pakkaus säilyttäen mallin laadun. Yhdistämällä älykkäitä matemaattisia oivalluksia tehokkaiden approksimointien kanssa, lähestymistapa on erittäin skaalautuva ja tekee AI-omaksumisen helpommaksi liiketoiminnalle kaikissa koissa. Integroimme myös joustavat kääntäjäasetukset optimoidaksemme verkkoja tietyn laitteiston, kuten iPhone- tai NVIDIA GPU:den, kanssa. Tämä antaa meille enemmän valtaa säätää suorituskykyä, lisäten nopeutta ilman laadun menetystä.
Miten TheStage AI:n inference-kiihdytys vertautuu PyTorchin alkuperäiseen kääntäjään, ja mitkä ovat etuja, joita se tarjoaa AI-kehittäjille?
TheStage AI kiihdyttää tulostusta paljon PyTorchin alkuperäistä kääntäjää pidemmälle. PyTorch käyttää “just-in-time”-käännösmenetelmää, jossa malli käännätään jokaisella suorituskerralla. Tämä johtaa pitkiin käynnistysaikoihin, jotka voivat kestää minuutteja tai jopa pidempään. Skaalautuvissa ympäristöissä tämä voi luoda tehokkuutta, erityisesti kun uusia GPU:ita on otettava käyttöön käyttäjämäärän lisääntymisen vuoksi, aiheuttaen viiveitä, jotka vaikuttavat käyttäjäkokemukseen.
Vastakohtaisesti TheStage AI mahdollistaa mallien esikäännöksen, joten kun malli on valmis, se voidaan ottaa käyttöön välittömästi. Tämä johtaa nopeampiin käyttöönottoihin, parantuneeseen palvelutehokkuuteen ja kustannussäästöihin. Kehittäjät voivat ottaa AI-malleja käyttöön ja skaalata niitä nopeammin ilman perinteisten käännösten pullonkauloja, tehden siitä tehokkaamman ja vastaanotettavamman korkean kysynnän käyttötarkoituksiin.
Voitko kertoa enemmän TheStage AI:n QLIP-työkalusta ja siitä, miten se parantaa mallin suorituskykyä säilyttäen laadun?
QLIP, TheStage AI:n työkalu, on Python-kirjasto, joka tarjoaa olennaiset primitiivit nopeasti rakentamaan uusia optimointialgoritmeja, jotka on suunniteltu erilaisille laitteistoille, kuten GPU:ille ja NPU:ille. Työkalu sisältää komponentteja, kuten kvantifioinnin, rajauksen, määrityksen, käännöksen ja palvelun, jotka ovat kaikki kriittisiä tehokkaiden ja skaalautuvien AI-järjestelmien kehittämiseksi.
Se, mikä erottaa QLIPin, on sen joustavuus. Se antaa AI-insinööreille mahdollisuuden luoda ja toteuttaa uusia algoritmeja vain muutamalla koodirivillä. Esimerkiksi äskettäinen AI-konferenssiraportti kvantifioituneista neuroverkoista voidaan muuttaa toimivaksi algoritmiksi QLIPin primitiivien avulla muutamassa minuutissa. Tämä tekee siitä helpon kehittäjille integroida viimeisimmän tutkimuksen malleihinsa ilman, että joustamattomat kehykset sitovat heitä.
Toisin kuin perinteiset avoimet kehykset, jotka rajoittavat sinua kiinteään joukkoon algoritmeja, QLIP antaa kenelle tahansa lisätä uusia optimointitekniikoita. Tämä sopeutuvuus auttaa tiimejä pysymään nopeasti kehittyvän AI-maailman tasolla, parantaen suorituskykyä samalla, kun varmistetaan joustavuus tuleville innovaatioille.
Olet osallistunut AI-kvantifiointirunkoihin, joita käytetään Huawei:n P50- ja P60-kameroissa. Miten tämä kokemus on muovannut lähestymistäsi AI-optimointiin?
Kokemukseni AI-kvantifiointirunkojen parissa Huawei:n P50- ja P60-kameroissa antoi minulle arvokkaita oivalluksia siitä, miten optimointi voidaan suorittaa ja skaalata. Kun aloitin PyTorchilla, työskentely neuroverkkojen täydellisen suorituskuvan kanssa oli jähmeää, ja kvantifiointialgoritmit piti toteuttaa manuaalisesti kerros kerrokselta. Huawei:lla kehittelin kehyksen, joka automatisoi prosessin. Sinun tarvitsee vain syöttää malli, ja se generoi automaattisesti koodin kvantifioinnille, poistaa manuaalisen työn.
Tämä johti minun ymmärtämään, että automaatio AI-optimoinnissa on nopeuden mahdollistamista ilman laadun uhraamista. Yksi algoritmeista, jonka kehittelin ja patentoin, tuli oleelliseksi Huawei:lle, erityisesti kun heidän piti siirtyä Kirin-prosessorien käytöstä Qualcomm-arkkitehtuuriin pakotteiden vuoksi. Se mahdollisti tiimille nopean sovittamisen neuroverkkoja Qualcommin arkkitehtuuriin ilman suorituskyvyn tai tarkin menetystä.
Automaatisoimalla prosessin leikkaamme kehitysaikaa yli vuodesta vain muutamaan kuukauteen. Tämä vaikutti suuresti tuotteeseen, jota miljoonat käyttävät, ja muovasi lähestymistäni optimointiin, keskittyen nopeuteen, tehokkuuteen ja minimaaliseen laadun menetykseen. Se on mentaliteetti, jonka tuon ANNA:han tänään.
Mitä ovat tärkeimmät läpimurrot AI-tehokkuuden saralla, joista olet ylpeä?
Kun minulta kysytään saavutuksistani AI-tehokkuuden saralla, muistan aina takaisin paperiimme, joka valittiin suulliseen esitykseen CVPR 2023 -konferenssissa. Valinta suulliseen esitykseen sellaisessa konferenssissa on harvinaista, koska vain 12 paperia valitaan. Tämä korostaa sitä, että generatiivinen AI hallitsee yleensä valokeilaa, mutta meidän paperimme lähestyi asiaa toisesta näkökulmasta, keskittyen matemaattiseen puoleen, erityisesti neuroverkkojen analyysiin ja pakkaamiseen.
Kehittelimme menetelmän, joka auttoi meitä ymmärtämään, kuinka monta parametriä neuroverkko todella tarvitsee toimia tehokkaasti. Soveltamalla tekniikoita funktionaalianalyysistä ja siirtymällä diskreettisesta jatkuvaan muotoiluun, saimme aikaan hyvät pakkaustulokset säilyttäen samalla kyvyn integroida nämä muutokset takaisin malliin. Paperi esitteli myös useita uusia algoritmeja, joita yhteisö ei ollut aikaisemmin käyttänyt, ja ne löysivät sovelluksia myöhemmin.
Tämä oli yksi ensimmäisistä tutkimuksistani AI-alalla, ja se oli merkittävä merkkipaalu meidän tiimimme uralla, mukaan lukien minun perustajieni. Se oli suuri saavutus meille kaikille.
Voitko selittää, miten Integraalinen Neuroverkko (INN) toimii ja miksi se on tärkeä innovaatio syvällä oppimisessa?
Perinteiset neuroverkot käyttävät kiinteitä matriiseja, samanlaisia kuin Excel-taulukot, joiden koko ja parametrit on ennalta määrätty. INN:t kuvaavat verkkoja jatkuvina funktioina, tarjoten paljon enemmän joustavuutta. Ajattele sitä kuin peittoa, jossa on eri korkeudella olevia neuloja, ja se edustaa jatkuva-aaltoa.
Mikä tekee INN:istä jännittäviä, on niiden kyky dynaamiseen “pakkaukseen” tai “laajentamiseen” saatavilla olevien resurssien mukaan, samalla tavoin kuin analoginen signaali digitoidaan ääneksi. Voit supistaa verkkoa ilman laadun menetystä, ja kun tarve vaatii, laajentaa sen takaisin ilman uudelleen koulutusta.
Testasimme tämän, ja kun perinteiset pakkausmenetelmät johtavat merkittäviin laadun menetyksiin, INN:t säilyttävät lähes alkuperäisen laadun jopa äärimmäisessä pakkaustilassa. Matematiikka sen takana on epäperinteisempää AI-yhteisölle, mutta todellinen arvo piilee sen kyvyssä toimia vankasti ja käytännöllisesti vähäisellä vaivalla.
TheStage AI on työskennellyt kvantti-annealing-algoritmien parissa — miten näet kvanttilaskennan vaikuttavan AI-optimointiin lähitulevaisuudessa?
Kvanttilaskennan ja sen roolin AI-optimoinnissa on otettava huomioon, että kvantijärjestelmät tarjoavat täysin erilaisen lähestymistavan ongelmiin, kuten optimointiin. Vaikka emme keksineet kvantti-annealing-algoritmeja alusta alkaen, yritykset kuten D-Wave tarjoavat Python-kirjastoja kvantti-algoritmien rakentamiseen erityisesti diskreeteille optimointitehtäville, jotka soveltuvat kvanttitietokoneille.
Ideana on, ettemme lataa neuroverkkoa suoraan kvanttitietokoneeseen. Tämä ei ole mahdollista nykyisellä arkkitehtuurilla. Sen sijaan, approksimoidaan, miten neuroverkot käyttäytyvät erilaisissa heikennyksissä, tehdään niistä sopivia järjestelmälle, jonka kvanttipiiri voi prosessoida.
Tulevaisuudessa kvantijärjestelmät voivat skaalata ja optimoida verkkoja tarkkuudella, jota perinteiset järjestelmät kamppailevat saavuttamaan. Kvanttijärjestelmien etu piilee niiden sisäänrakennetussa rinnakkaisuudessa, jonka klassiset järjestelmät voivat vain simuloida lisäresursseilla. Tämä tarkoittaa, että kvanttilaskenta voi merkittävästi nopeuttaa optimointiprosessia, erityisesti kun opimme mallimaan suurempia ja monimutkaisempia verkkoja tehokkaasti.
Todellinen potentiaali piilee kvanttilaskennan käytössä massiivisten, monimutkaisten optimointitehtävien ratkaisemiseen ja parametreja pienempiin, hallitumpiin ryhmiin. Teknologioilla, kuten kvantti- ja optinen laskenta, on valtavat mahdollisuudet AI:n optimoinnille, jotka menevät perinteisen laskennan tarjoaman paljon pidemmälle.
Mikä on pitkän aikavälin visiosi TheStage AI:lle? Mihin suuntaan inference-optimointi on menossa seuraavien 5-10 vuoden aikana?
Pitkällä aikavälillä TheStage AI pyrkii globaaliin Model Hubiin, josta kuka tahansa voi helposti käyttää optimoitua neuroverkkoa haluamillaan ominaisuuksilla, olipa se sitten älypuhelimelle tai muulle laitteelle. Tavoitteena on tarjota raahaa-ja-pudota-kokemus, jossa käyttäjät syöttävät parametrit ja järjestelmä luo automaattisesti verkoston. Jos verkkoa ei ole olemassa, se luodaan automaattisesti ANNA:n avulla.
Tavoittelemme, että neuroverkot toimisivat suoraan käyttäjien laitteilla, mikä leikkaa kustannuksia 20-30-kertaisesti. Tulevaisuudessa tämä voisi melkein poistaa kustannukset kokonaan, koska käyttäjän laite hoitaisi laskennan sen sijaan, että oltaisiin riippuvaisia pilvipalvelimista. Tämä yhdistettynä mallien pakkaamisen ja laitteiston kiihdyttämisen edistymiseen voisi tehdä AI-käyttöönoton merkittävästi tehokkaammaksi.
Suunnittelemme myös integroida teknologiamme laitteistoratkaisujen, kuten antureiden, piirien ja robottiikan, sovelluksiin, kuten itseohjautuvaan ajoon ja robottiikkaan. Esimerkiksi tavoittelemme rakentaa AI-kameroita, jotka voivat toimia millä tahansa ympäristössä, olipa se sitten avaruudessa tai äärimmäisissä olosuhteissa, kuten pimeydessä tai pölyssä. Tämä tekisi AI:sta käytettävissä laajassa sovellusalueessa ja antaisi meille mahdollisuuden luoda mukautettuja ratkaisuja tietyn laitteiston ja käyttötarkoituksen mukaan.
Kiitos haastattelusta, lukijat, jotka haluavat oppia enemmän, voivat vierailla TheStage AI:ssa.












