Intervjuer
Kirill Solodskih, medgrundare och VD för TheStage AI – Intervjuserie

Kirill Solodskih, PhD, är medgrundare och VD för TheStage AI, samt en erfaren AI-forskare och entreprenör med över ett decenniums erfarenhet av att optimera neurala nätverk för verkliga affärsapplikationer. År 2024 co-founderade han TheStage AI, som säkrade 4,5 miljoner dollar i finansiering för att fullt ut automatisera neurala nätverksacceleration över alla hårdvaruplattformar.
Tidigare, som teamledare på Huawei, ledde Kirill accelerationen av AI-kameraapplikationer för Qualcomm (QCOM ) NPUs, vilket bidrog till prestandan hos P50- och P60-smartphones och gav upphov till flera patent för hans innovationer. Hans forskning har presenterats på ledande konferenser som CVPR och ECCV , där den fick priser och branschomfattande erkännande. Han är också värd för en podcast om AI-optimering och inferens.
Vad inspirerade dig att co-grunda TheStage AI, och hur gick du från akademin och forskningen till att tackla inferensoptimering som startup-grundare?
Grundvalarna för vad som så småningom blev TheStage AI började med mitt arbete på Huawei, där jag var djupt involverad i att automatisera distributioner och optimera neurala nätverk. Dessa initiativ blev grunden för några av våra banbrytande innovationer, och det var där jag såg den verkliga utmaningen. Att träna en modell är en sak, men att få den att fungera effektivt i den verkliga världen och göra den tillgänglig för användare är en annan. Distributionen är flaskhalsen som hindrar många bra idéer från att bli verklighet. För att göra något så enkelt att använda som ChatGPT finns det många bakomliggande utmaningar. Från ett tekniskt perspektiv handlar neurala nätverksoptimeringar om att minimera parametrar samtidigt som prestandan hålls hög. Det är ett svårt matematiskt problem med gott om utrymme för innovation.
Manuell inferensoptimering har länge varit en flaskhals i AI. Kan du förklara hur TheStage AI automatiserar denna process och varför det är en spelväxlare?
TheStage AI tacklar en stor flaskhals i AI: manuell komprimering och acceleration av neurala nätverk. Neurala nätverk har miljarder parametrar, och att ta reda på vilka som ska tas bort för bättre prestanda är nästan omöjligt för hand. ANNA (Automated Neural Networks Analyzer) automatiserar denna process, identifierar vilka lager som ska uteslutas från optimering, liknande hur ZIP-komprimering först automatiserades.
Detta förändrar spelet genom att göra AI-antagande snabbare och mer överkomligt. Istället för att förlita sig på dyra manuella processer kan startups optimera modeller automatiskt. Teknologin ger företagen en tydlig vy av prestanda och kostnad, vilket säkerställer effektivitet och skalbarhet utan gissningar.
TheStage AI hävdar att de minskar inferenskostnaderna med upp till 5 gånger — vad gör er optimeringsteknologi så effektiv jämfört med traditionella metoder?
TheStage AI skär utdatakostnaderna med upp till 5 gånger med en optimeringsmetod som går utöver traditionella metoder. Istället för att applicera samma algoritm på hela det neurala nätverket, bryter ANNA ner det i mindre lager och bestämmer vilken algoritm som ska tillämpas för varje del för att leverera önskad komprimering samtidigt som modellens kvalitet maximeras. Genom att kombinera smarta matematiska heuristiker med effektiva approximationer är vår metod högt skalbar och gör det lättare för företag att anta AI.
Hur jämför TheStage AI:s inferensacceleration med PyTorch’s nativa kompilator, och vilka fördelar erbjuder det AI-utvecklare?
TheStage AI accelererar utdata långt bortom PyTorch’s nativa kompilator. PyTorch använder en “just-in-time”-kompilationsmetod, som kompilerar modellen varje gång den körs. Detta leder till långa starttider, ibland på flera minuter eller ännu längre. I skalbara miljöer kan detta skapa ineffektiviteter, särskilt när nya GPU:er behöver kopplas in för att hantera ökad användarbelastning, vilket orsakar fördröjningar som påverkar användarupplevelsen.
I kontrast tillåter TheStage AI modeller att förkompilera, så när en modell är klar kan den distribueras omedelbart. Detta leder till snabbare utrullningar, förbättrad serviceeffektivitet och kostnadsbesparingar. Utvecklare kan distribuera och skala AI-modeller snabbare, utan flaskhalsarna i traditionell kompilering, vilket gör det mer effektivt och responsivt för hög efterfrågade användningsfall.
Kan du berätta mer om TheStage AI:s QLIP-verktyg och hur det förbättrar modellprestanda samtidigt som kvaliteten upprätthålls?
QLIP, TheStage AI:s verktyg, är en Python-bibliotek som tillhandahåller en uppsättning grundläggande primitiver för att snabbt bygga nya optimeringsalgoritmer anpassade till olika hårdvara, som GPU:er och NPUs. Verktyget innehåller komponenter som kvantifiering, beskärning, specifikation, kompilering och servering, alla kritiska för att utveckla effektiva och skalbara AI-system.
Det som särskiljer QLIP är dess flexibilitet. Det låter AI-ingenjörer prototypa och implementera nya algoritmer med bara några rader kod. Till exempel kan en nylig AI-konferensartikel om kvantifieringsneurala nätverk konverteras till en fungerande algoritm med QLIP:s primitiver på några minuter. Detta gör det enkelt för utvecklare att integrera den senaste forskningen i sina modeller utan att begränsas av rigida ramar.
Till skillnad från traditionella öppen källkodsramverk som begränsar dig till en fast uppsättning algoritmer, låter QLIP vem som helst lägga till nya optimeringstekniker. Denna anpassningsförmåga hjälper team att ligga före den snabbt utvecklande AI-landskapet, förbättrar prestanda samtidigt som det säkerställer flexibilitet för framtida innovationer.
Du har bidragit till AI-kvantiseringsramverk som används i Huaweis P50- och P60-kameror. Hur formade den erfarenheten din tillvägagångssätt för AI-optimering?
Min erfarenhet av att arbeta med AI-kvantiseringsramverk för Huaweis P50- och P60-gav mig värdefulla insikter i hur optimering kan strömlinjeformas och skalas. När jag först började med PyTorch var det att arbeta med den fullständiga exekveringsgrafen för neurala nätverk rigida, och kvantiseringsalgoritmer måste implementeras manuellt, lager för lager. På Huawei byggde jag ett ramverk som automatiserade processen. Du behöver bara mata in modellen, och det skulle automatiskt generera koden för kvantifiering, eliminera manuellt arbete.
Detta ledde mig att inse att automatisering i AI-optimering handlar om att möjliggöra hastighet utan att offra kvalitet. En av de algoritmer jag utvecklade och patenterade blev avgörande för Huawei, särskilt när de var tvungna att gå från Kirin-processorer till Qualcomms arkitektur på grund av sanktioner. Det tillät teamet att snabbt anpassa neurala nätverk till Qualcomms arkitektur utan att förlora prestanda eller noggrannhet.
Genom att strömlinjeforma och automatisera processen, skar vi utvecklingstiden från över ett år till bara några månader. Det hade en enorm inverkan på en produkt som användes av miljontals och formade min tillvägagångssätt för optimering, med fokus på hastighet, effektivitet och minimal kvalitetsförlust. Det är den mentaliteten jag tar med mig till ANNA idag.
Din forskning har presenterats på CVPR och ECCV — vad är några av de viktigaste genombrotten i AI-effektivitet som du är mest stolt över?
När jag blir tillfrågad om mina prestationer inom AI-effektivitet, tänker jag alltid tillbaka på vår artikel som valdes för en muntlig presentation på CVPR 2023. Att bli vald för en muntlig presentation på en sådan konferens är ovanligt, eftersom bara 12 artiklar väljs. Detta läggs till faktumet att generativ AI vanligtvis dominerar strålkastarljuset, och vår artikel tog en annan tillvägagångssätt, med fokus på den matematiska sidan, specifikt analysen och komprimeringen av neurala nätverk.
Vi utvecklade en metod som hjälpte oss att förstå hur många parametrar ett neuralt nätverk verkligen behöver för att fungera effektivt. Genom att tillämpa tekniker från funktionsanalys och gå från en diskret till en kontinuerlig formulering, kunde vi uppnå goda komprimeringsresultat samtidigt som vi behöll förmågan att integrera dessa ändringar tillbaka i modellen. Artikeln introducerade också flera nya algoritmer som inte hade använts av samhället tidigare och fann ytterligare tillämpning.
Detta var en av mina första artiklar inom AI-området, och viktigast, det var resultatet av vårt teams kollektiva ansträngning, inklusive mina medgrundare. Det var en betydande milstolpe för oss alla.
Kan du förklara hur Integrala Neurala Nätverk (INN) fungerar och varför de är en viktig innovation inom djupinlärning?
Traditionella neurala nätverk använder fasta matriser, liknande Excel-tabeller, där storleken och parametrarna är förutbestämda. INN, däremot, beskriver nätverk som kontinuerliga funktioner, vilket erbjuder mycket mer flexibilitet. Tänk på det som en filt med nålar i olika höjder, och detta representerar den kontinuerliga vågen.
Det som gör INN spännande är deras förmåga att dynamiskt “komprimera” eller “expandera” baserat på tillgängliga resurser, liknande hur en analog signal digitaliseras till ljud. Du kan krympa nätverket utan att offra kvalitet, och när det behövs, expandera det tillbaka utan omträning.
Vi testade detta, och medan traditionella komprimeringsmetoder leder till betydande kvalitetsförlust, behåller INN nästan ursprunglig kvalitet, även under extrem komprimering. Matematiken bakom det är ovanligare för AI-samhället, men den verkliga värdet ligger i dess förmåga att leverera solida, praktiska resultat med minimal ansträngning.
TheStage AI har arbetat med kvantannealingsalgoritmer — hur ser du på kvantberäkningens roll i AI-optimering i närmaste framtiden?
När det gäller kvantberäkning och dess roll i AI-optimering är den viktigaste slutsatsen att kvantsystem erbjuder en helt annan tillvägagångssätt för att lösa problem som optimering. Medan vi inte uppfann kvantannealingsalgoritmer från scratch, tillhandahåller företag som D-Wave Python-bibliotek för att bygga kvantalgoritmer specifikt för diskreta optimeringsuppgifter, som är idealiska för kvantdatorer.
Idén här är att vi inte direkt laddar ett neuralt nätverk till en kvantdator. Det är inte möjligt med nuvarande arkitektur. Istället approximerar vi hur neurala nätverk beter sig under olika typer av degradering, vilket gör dem anpassade till ett system som en kvantchip kan bearbeta.
I framtiden kunde kvantsystem skala och optimera nätverk med en precision som traditionella system kämpar för att matcha. Fördelen med kvantsystem ligger i deras inbyggda parallelism, något som klassiska system bara kan simulera med hjälp av extra resurser. Detta innebär att kvantberäkning kunde avsevärt påskynda optimeringsprocessen, särskilt när vi lär oss att modellera större och mer komplexa nätverk effektivt.
Det verkliga potentialen ligger i att använda kvantberäkning för att lösa massiva, invecklade optimeringsuppgifter och bryta ner parametrar i mindre, mer hanterbara grupper. Med tekniker som kvant och optisk beräkning finns det enorma möjligheter för att optimera AI som går långt utöver vad traditionell beräkning kan erbjuda.
Vad är din långsiktiga vision för TheStage AI? Var ser du inferensoptimering gående de kommande 5-10 åren?
På lång sikt syftar TheStage AI till att bli en global Modellhub där vem som helst kan enkelt komma åt ett optimerat neuralt nätverk med önskade egenskaper, oavsett om det är för en smartphone eller någon annan enhet. Målet är att erbjuda en dra-och-släpp-upplevelse, där användare anger sina parametrar och systemet automatiskt genererar nätverket. Om nätverket inte redan existerar, kommer det att skapas automatiskt med hjälp av ANNA.
Vårt mål är att få neurala nätverk att köra direkt på användarens enheter, vilket skär kostnaderna med 20 till 30 gånger. I framtiden kunde detta nästan eliminera kostnaderna helt, eftersom användarens enhet skulle hantera beräkningarna istället för att förlita sig på molnservrar. Detta, i kombination med framsteg inom modellkomprimering och hårdvaruacceleration, kunde göra AI-distribution avsevärt mer effektiv.
Vi planerar också att integrera vår teknik med hårdvarulösningar, som sensorer, chip och robotik, för applikationer inom områden som autonom körning och robotik. Till exempel syftar vi till att bygga AI-kameror som kan fungera i vilken miljö som helst, antingen i rymden eller under extrema förhållanden som mörker eller damm. Detta skulle göra AI användbart i en mängd olika applikationer och tillåta oss att skapa anpassade lösningar för specifik hårdvara och användningsfall.
Tack för den underbara intervjun, läsare som vill lära sig mer bör besöka TheStage AI.












