Intervjuer

Kirill Solodskih, medgrunnlegger og CEO av TheStage AI – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Kirill Solodskih, PhD, er medgrunnlegger og CEO av TheStage AI, samt en erfaren AI-forsker og entrepreneur med over ett tiår med erfaring i å optimalisere neurale nettverk for virkelige forretningsapplikasjoner. I 2024 grunnla han TheStage AI, som sikret 4,5 millioner dollar i finansiering for å fullt ut automatisere akselerasjon av neurale nettverk på alle håndteringplattformer.

Tidligere, som teamleder i Huawei, ledet Kirill akselerasjonen av AI-kamera-applikasjoner for Qualcomm (QCOM ) NPUs, og bidro til ytelsen på P50- og P60-smarttelefonene og tjente flere patenter for sine innovasjoner. Hans forskning har blitt presentert på ledende konferanser som CVPR og ECCV , der den fikk priser og industriell anerkjennelse. Han har også en podcast om AI-optimalisering og inferens.

Hva inspirerte deg til å grunnlegge TheStage AI, og hvordan gikk du fra akademisk forskning til å bli en startup-grunnlegger som fokuserer på inferensoptimalisering?

Bakgrunnen for hva som til slutt ble TheStage AI, startet med min forskning ved Huawei, der jeg dypte meg i å automatisere distribusjon og optimalisere neurale nettverk. Disse initiativene ble grunnlaget for noen av våre banebrytende innovasjoner, og det var der jeg så den virkelige utfordringen. Å trene et modell er en ting, men å få det til å kjøre effektivt i den virkelige verden og gjøre det tilgjengelig for brukerne, er en annen. Distribusjon er flaskenhalen som holder tilbake mange gode ideer fra å bli virkelighet. For å gjøre noe så enkelt som ChatGPT, er det mange bakende utfordringer involvert. Fra et teknisk perspektiv handler neural nettverks-optimalisering om å minimere parametre samtidig som man holder ytelsen høy. Det er et vanskelig matematisk problem med mye rom for innovasjon.

Manuell inferensoptimalisering har lenge vært en flaskenhaler i AI. Kan du forklare hvordan TheStage AI automatiserer denne prosessen og hvorfor det er en game-changer?

TheStage AI løser en stor flaskenhaler i AI: manuell kompresjon og akselerasjon av neurale nettverk. Neurale nettverk har milliarder av parametre, og å finne ut hvilke som skal fjernes for bedre ytelse, er nesten umulig å gjøre manuelt. ANNA (Automated Neural Networks Analyzer) automatiserer denne prosessen, og identifiserer hvilke lag som skal ekskluderes fra optimalisering, på samme måte som ZIP-komprimering ble automatisert for første gang.

Dette endrer spilleregler ved å gjøre AI-tilpasning raskere og mer rimelig. I stedet for å være avhengig av dyre manuelle prosesser, kan startup-bedrifter optimalisere modeller automatisk. Teknologien gir bedrifter en klar oversikt over ytelse og kostnad, og sikrer effisiens og skalerbarhet uten å gjette.

TheStage AI hevder å redusere inferenskostnader med opptil 5 ganger — hva gjør deres optimaliseringsteknologi så effektiv sammenlignet med tradisjonelle metoder?

TheStage AI kutte utgangskostnader med opptil 5 ganger med en optimaliseringstilnærming som går langt utover tradisjonelle metoder. I stedet for å bruke samme algoritme på hele det neurale nettverket, bryter ANNA det ned i mindre lag og bestemmer hvilken algoritme som skal brukes for hvert enkelt del for å levere ønsket kompresjon samtidig som modellens kvalitet maksimeres. Ved å kombinere smarte matematiske heuristiske metoder med effektive approksimasjoner, er vår tilnærming svært skalerbar og gjør det enklere for bedrifter av alle størrelser å ta i bruk AI. Vi integrerer også fleksible kompilatorinnstillinger for å optimalisere nettverk for bestemt maskinvare som iPhones eller NVIDIA-GPU-er. Dette gir oss mer kontroll over å finjustere ytelse, øke hastighet uten å tape kvalitet.

Hvordan sammenligner TheStage AI sin inferensakselerasjon med PyTorch sin native kompilator, og hva fordeler tilbyr den AI-utviklere?

TheStage AI akselerer utgang langt utover PyTorch sin native kompilator. PyTorch bruker en “just-in-time”-kompileringmetode, som kompilere modellen hver gang den kjøres. Dette fører til lange oppstartstider, noen ganger på flere minutter eller enda lengre. I skalerbare miljøer kan dette skape ineffisienser, spesielt når nye GPU-er må kobles inn for å håndtere økt brukerbelastning, noe som kan føre til forsinkelser som påvirker brukeropplevelsen.

Til sammenligning tillater TheStage AI modeller å bli forhåndskompilert, så når en modell er klar, kan den deployes øyeblikkelig. Dette fører til raskere utrullinger, forbedret servicemessig effisiens og kostnadsbesparelser. Utviklere kan deployere og skalerer AI-modeller raskere, uten flaskenhalene fra tradisjonell kompilering, og gjøre det mer effektivt og responsivt for høyt-ettertraktede bruksscenarier.

Kan du dele mer om TheStage AI sin QLIP-verktøy og hvordan den forbedrer modell-ytelse samtidig som den opprettholder kvalitet?

QLIP, TheStage AI sin verktøy, er en Python-bibliotek som tilbyr en essensiell samling av primitiver for å bygge nye optimaliseralgoritmer tilpasset ulik maskinvare, som GPU-er og NPUs. Verktøyet inkluderer komponenter som kvantisering, pruning, spesifikasjon, kompilering og serving, alle kritiske for å utvikle effektive og skalerbare AI-systemer.

Hva som skiller QLIP fra andre er dens fleksibilitet. Den lar AI-ingeniører prototypere og implementere nye algoritmer med bare noen få linjer kode. For eksempel kan en nylig AI-konferanseartikkel om kvantisering av neurale nettverk konverteres til en arbeidsalgoritme ved hjelp av QLIP sine primitiver på noen minutter. Dette gjør det enkelt for utviklere å integrere den siste forskningen i sine modeller uten å bli hindret av stive rammeverk.

I motsetning til tradisjonelle åpne rammeverk som begrenser deg til et fast sett av algoritmer, lar QLIP noen legge til nye optimaliseringsteknikker. Denne tilpasningen hjelper team å holde tritt med den raskt utviklende AI-landskapet, forbedre ytelse samtidig som de sikrer fleksibilitet for fremtidige innovasjoner.

Du har bidratt til AI-kvantiseringsrammeverk brukt i Huaweis P50- og P60-kameraer. Hvordan har denne erfaringen formet din tilnærming til AI-optimalisering?

Min erfaring med å arbeide på AI-kvantiseringsrammeverk for Huaweis P50- og P60-gav meg verdifulle innsikter i hvordan optimalisering kan strømlinjeformes og skaleres. Da jeg først startet med PyTorch, var det å arbeide med den fullstendige kjørende grafen av neurale nettverk stivt, og kvantiseringalgoritmer måtte implementeres manuelt, lag for lag. Hos Huawei bygde jeg et rammeverk som automatiserte prosessen. Du bare måtte innpute modellen, og den ville automatisk generere koden for kvantisering, eliminere manuelt arbeid.

Dette førte meg til å forstå at automatisering i AI-optimalisering handler om å muliggjøre hastighet uten å ofre kvalitet. En av algoritmene jeg utviklet og patenterte, ble essensiell for Huawei, spesielt da de måtte gå over fra Kirin-prosessorer til Qualcomm på grunn av sanktjoner. Det tillot teamet å raskt tilpasse neurale nettverk til Qualcomms arkitektur uten å tape ytelse eller nøyaktighet.

Ved å strømlinjeforme og automatisere prosessen, kutte vi utviklingstiden fra over ett år til bare noen måneder. Dette hadde en enorm innvirkning på et produkt som ble brukt av millioner, og formet min tilnærming til optimalisering, med fokus på hastighet, effisiens og minimal kvalitetstap. Det er tankesettet jeg bringer til ANNA i dag.

Din forskning har blitt presentert på CVPR og ECCV — hva er noen av de viktigste gjennombruddene i AI-effisiens som du er mest stolt av?

Når jeg blir bedt om mine prestasjoner i AI-effisiens, tenker jeg alltid tilbake på vår artikkel som ble valgt for en muntlig presentasjon på CVPR 2023. Å bli valgt for en muntlig presentasjon på en slik konferanse er sjeldent, da bare 12 artikler blir valgt. Dette kommer i tillegg til at generativ AI vanligvis dominerer rampelyset, og vår artikkel tok en annen tilnærming, med fokus på den matematiske siden, spesielt analysen og kompresjonen av neurale nettverk.

Vi utviklet en metode som hjalp oss å forstå hvor mange parametre et neuralt nettverk virkelig trenger for å fungere effektivt. Ved å bruke teknikker fra funksjonsanalyse og gå fra en diskret til en kontinuerlig formulering, var vi i stand til å oppnå gode kompresjonsresultater samtidig som vi beholdt evnen til å integrere disse endringene tilbake i modellen. Artikkelen presenterte også flere nye algoritmer som ikke hadde blitt brukt av samfunnet tidligere og fant videre anvendelse.

Dette var en av mine første artikler i AI-feltet, og viktig, var det et resultat av vårt teams kollektive innsats, inkludert mine medgrunnleggere. Det var en betydelig milepæl for oss alle.

Kan du forklare hvordan Integrale Neurale Nettverk (INN) fungerer og hvorfor de er en viktig innovasjon i dyp læring?

Tradisjonelle neurale nettverk bruker faste matriser, lignende Excel-tabeller, hvor størrelsen og parameterne er forhåndsbestemt. INN-er, derimot, beskriver nettverk som kontinuerlige funksjoner, og tilbyr mye mer fleksibilitet. Tenk på det som en dekke med pinner på ulike høyder, og dette representerer den kontinuerlige bølgen.

Hva som gjør INN-er spennende er deres evne til å dynamisk “kompresere” eller “utvide” seg basert på tilgjengelige ressurser, lignende hvordan en analog signal digitaliseres til lyd. Du kan krympe nettverket uten å ofre kvalitet, og når det er nødvendig, utvide det tilbake uten å måtte trene det på nytt.

Vi testet dette, og mens tradisjonelle kompresjonsmetoder fører til betydelig kvalitetstap, beholder INN-er nesten original kvalitet selv under ekstrem kompresjon. Matematikken bak det er mer uvanlig for AI-samfunnet, men den virkelige verdien ligger i dens evne til å levere solide, praktiske resultater med minimal innsats.

TheStage AI har arbeidet med kvantum-annihilering-algoritmer — hvordan ser du på kvantum-beregningens rolle i AI-optimalisering i nær fremtid?

Når det kommer til kvantum-beregning og dens rolle i AI-optimalisering, er hovedpoenget at kvantum-systemer tilbyr en helt annen tilnærming til å løse problemer som optimalisering. Mens vi ikke oppfant kvantum-annihilering-algoritmer fra scratch, tilbyr selskaper som D-Wave Python-biblioteker for å bygge kvantum-algoritmer spesifikt for diskrete optimaliseringstasks, som er ideelle for kvantum-computere.

Idéen her er at vi ikke direkte laster et neuralt nettverk inn i en kvantum-computer. Det er ikke mulig med dagens arkitektur. I stedet approksimerer vi hvordan neurale nettverk oppfører seg under ulike typer degradering, og gjør dem kompatible med et system som en kvantum-chip kan prosessere.

I fremtiden kunne kvantum-systemer skalerer og optimalisere nettverk med en presisjon som tradisjonelle systemer sliter med å matche. Fordelen med kvantum-systemer ligger i deres innebygde parallellitet, noe klassiske systemer bare kan simulere ved hjelp av ekstra ressurser. Dette kunne bety at kvantum-beregning kunne signifikant akselerere optimaliseringsprosessen, spesielt når vi finner ut hvordan vi kan modellere større og mer komplekse nettverk effektivt.

Den virkelige potensialet ligger i å bruke kvantum-beregning til å løse massive, intrikate optimaliseringstasks og bryte ned parametre i mindre, mer håndterbare grupper. Med teknologier som kvantum og optisk beregning, er det enorme muligheter for å optimalisere AI som går langt utover hva tradisjonell beregning kan tilby.

Hva er din langsiktige visjon for TheStage AI? Hvor ser du inferensoptimaliseringen går i de neste 5-10 årene?

På lang sikt ønsker TheStage AI å bli et globalt Modell-Hub hvor noen kan enkelt få tilgang til et optimalisert neuralt nettverk med ønskede egenskaper, enten for en smartphone eller enhver annen enhet. Målet er å tilby en drag-and-drop-erfaring, hvor brukerne kan innpute sine parametre og systemet automatisk genererer nettverket. Hvis nettverket ikke allerede eksisterer, vil det bli skapt automatisk ved hjelp av ANNA.

Vårt mål er å få neurale nettverk til å kjøre direkte på brukerens enheter, kutte kostnadene med 20 til 30 ganger. I fremtiden kunne dette nesten eliminere kostnadene helt, da brukerens enhet ville håndtere beregningen i stedet for å være avhengig av skytjenester. Dette, kombinert med fremtredende modellkompresjon og maskinvare-akselerasjon, kunne gjøre AI-utvikling betydelig mer effektiv.

Vi planlegger også å integrere vår teknologi med maskinvareløsninger, som sensorer, chip og robotikk, for applikasjoner i felt som autonom kjøring og robotikk. For eksempel ønsker vi å bygge AI-kameraer som kan fungere i enhver miljø, enten i rommet eller under ekstreme forhold som mørke eller støv. Dette ville gjøre AI tilgjengelig i en bred rekke av applikasjoner og tillate oss å skape tilpassede løsninger for bestemt maskinvare og bruksscenarier.

Takk for det flotte intervjuet, lesere som ønsker å lære mer, bør besøke TheStage AI.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.