Interviews
Kirill Solodskih, mede-oprichter en CEO van TheStage AI – Interviewreeks

Kirill Solodskih, PhD, is de mede-oprichter en CEO van TheStage AI, evenals een ervaren AI-onderzoeker en ondernemer met meer dan tien jaar ervaring in het optimaliseren van neurale netwerken voor zakelijke toepassingen in de praktijk. In 2024 richtte hij TheStage AI op, dat 4,5 miljoen dollar aan financiering verwierf om neurale netwerkversnelling volledig te automatiseren over elk hardwareplatform.
Voordien was Kirill als Team Lead bij Huawei verantwoordelijk voor de versnelling van AI-camera-toepassingen voor Qualcomm (QCOM ) NPUs, waarmee hij bijdroeg aan de prestaties van de P50- en P60-smartphones en meerdere octrooien verwierf voor zijn innovaties. Zijn onderzoek is gepresenteerd op toonaangevende conferenties zoals CVPR en ECCV , waar het erkenning en prijzen ontving. Hij presenteert ook een podcast over AI-optimalisatie en inferentie.
Wat inspireerde u om TheStage AI op te richten, en hoe bent u overgestapt van academische en onderzoeksactiviteiten naar het aanpakken van inferentie-optimalisatie als oprichter van een startup?
De basis voor wat uiteindelijk TheStage AI werd, lag in mijn werk bij Huawei, waar ik diep in het automatiseren van implementaties en het optimaliseren van neurale netwerken zat. Deze initiatieven vormden de basis voor enkele van onze baanbrekende innovaties, en dat is waar ik de echte uitdaging zag. Het trainen van een model is één ding, maar het zo efficiënt mogelijk laten draaien in de echte wereld en het toegankelijk maken voor gebruikers is iets anders. Implementatie is de bottleneck die veel geweldige ideeën tegenhoudt om tot leven te komen. Om iets te maken dat zo eenvoudig te gebruiken is als ChatGPT, zijn er veel achterkantuitdagingen bij betrokken. Vanuit technisch oogpunt is neurale netwerkoptimalisatie een kwestie van parameters minimaliseren terwijl de prestaties hoog blijven. Het is een moeilijk wiskundig probleem met veel ruimte voor innovatie.
Handmatige inferentie-optimalisatie is al lang een bottleneck in AI. Kunt u uitleggen hoe TheStage AI dit proces automatiseren en waarom het een game-changer is?
TheStage AI lost een belangrijke bottleneck in AI op: handmatige compressie en versnelling van neurale netwerken. Neurale netwerken hebben miljarden parameters, en het is bijna onmogelijk om handmatig uit te zoeken welke parameters verwijderd moeten worden voor betere prestaties. ANNA (Automated Neural Networks Analyzer) automatiseert dit proces, door te bepalen welke lagen uitgesloten moeten worden van optimalisatie, net zoals ZIP-compressie voor het eerst geautomatiseerd werd.
Dit verandert het spel door AI-adoptie sneller en betaalbaarder te maken. In plaats van te vertrouwen op dure handmatige processen, kunnen startups modellen automatisch optimaliseren. De technologie geeft bedrijven een duidelijk beeld van prestaties en kosten, waardoor efficiëntie en schaalbaarheid zonder giswerk gewaarborgd zijn.
TheStage AI beweert de inferentiekosten te verlagen met maximaal 5 keer — wat maakt uw optimalisatietechnologie zo effectief in vergelijking met traditionele methoden?
TheStage AI verlaagt de uitvoerkosten met maximaal 5 keer met een optimalisatiebenadering die verder gaat dan traditionele methoden. In plaats van hetzelfde algoritme toe te passen op het hele neurale netwerk, breekt ANNA het op in kleinere lagen en besluit welk algoritme voor elk deel moet worden toegepast om de gewenste compressie te bereiken terwijl de kwaliteit van het model wordt gemaximaliseerd. Door slimme wiskundige heuristieken te combineren met efficiënte benaderingen, is onze benadering zeer schaalbaar en maakt het AI-adoptie gemakkelijker voor bedrijven van alle maten. We integreren ook flexibele compilerinstellingen om netwerken te optimaliseren voor specifieke hardware zoals iPhones of NVIDIA GPUs. Dit geeft ons meer controle om prestaties te fine-tunen, waardoor de snelheid toeneemt zonder kwaliteitsverlies.
Hoe vergelijkt de inferentieversnelling van TheStage AI met de native compiler van PyTorch, en wat zijn de voordelen voor AI-ontwikkelaars?
TheStage AI versnelt de uitvoer verder dan de native PyTorch-compiler. PyTorch gebruikt een “just-in-time”-compilatiemethode, die het model compileert elke keer dat het wordt uitgevoerd. Dit leidt tot lange opstarttijden, soms minuten of zelfs langer. In schaalbare omgevingen kan dit inefficiënties creëren, vooral wanneer nieuwe GPUs online moeten worden gebracht om de toegenomen gebruikersbelasting te verwerken, waardoor vertragingen ontstaan die de gebruikerservaring beïnvloeden.
In tegenstelling tot TheStage AI, kan het modellen vooraf compileren, zodat zodra een model klaar is, het onmiddellijk kan worden geïmplementeerd. Dit leidt tot snellere implementaties, verbeterde dienstefficiëntie en kostenbesparingen. Ontwikkelaars kunnen AI-modellen sneller implementeren en schalen, zonder de bottlenecks van traditionele compilatie, waardoor het efficiënter en responsiever wordt voor gebruikscases met hoge vraag.
Kunt u meer vertellen over de QLIP-toolkit van TheStage AI en hoe deze de modelprestaties verbetert terwijl de kwaliteit behouden blijft?
QLIP, de toolkit van TheStage AI, is een Python-bibliotheek die een essentiële set primitieven biedt voor het snel opbouwen van nieuwe optimalisatiealgoritmen aangepast aan verschillende hardware, zoals GPUs en NPUs. De toolkit bevat componenten zoals kwantificatie, pruning, specificatie, compilatie en serving, allemaal cruciaal voor het ontwikkelen van efficiënte, schaalbare AI-systemen.
Wat QLIP onderscheidt, is de flexibiliteit. Het laat AI-ingenieurs in staat om nieuwe algoritmen te protyperen en te implementeren met slechts een paar regels code. Bijvoorbeeld, een recente AI-conferentiepaper over kwantificatie neurale netwerken kan worden omgezet in een werkend algoritme met behulp van QLIP’s primitieven in enkele minuten. Dit maakt het gemakkelijk voor ontwikkelaars om de nieuwste onderzoeken in hun modellen te integreren zonder te worden gehinderd door rigide kaders.
In tegenstelling tot traditionele open-source-kaders die u beperken tot een vaste set algoritmen, laat QLIP iedereen toe om nieuwe optimalisatietechnieken toe te voegen. Deze aanpasbaarheid helpt teams om voorop te blijven lopen in de snel evoluerende AI-landschap, prestaties te verbeteren en flexibiliteit te waarborgen voor toekomstige innovaties.
U heeft bijgedragen aan AI-kwantificatiekaders die worden gebruikt in Huawei’s P50- en P60-camera’s. Hoe heeft die ervaring uw aanpak van AI-optimalisatie gevormd?
Mijn ervaring met het werken aan AI-kwantificatiekaders voor Huawei’s P50- en P60-gaf me waardevolle inzichten in hoe optimalisatie kan worden gestroomlijnd en geschaald. Toen ik voor het eerst met PyTorch begon, was het werken met de complete uitvoeringsgrafiek van neurale netwerken rigide, en moesten kwantificatiealgoritmen handmatig worden geïmplementeerd, laag voor laag. Bij Huawei bouwde ik een kader dat het proces automatiseerde. U voert simpelweg het model in, en het genereert automatisch de code voor kwantificatie, waardoor handmatig werk wordt geëlimineerd.
Dit leidde me ertoe om te beseffen dat automatisering in AI-optimalisatie gaat over het mogelijk maken van snelheid zonder kwaliteit te offeren. Een van de algoritmen die ik ontwikkelde en octrooideerde, werd essentieel voor Huawei, vooral toen ze moesten overstappen van Kirin-processoren naar Qualcomm vanwege sancties. Het stelde het team in staat om neurale netwerken snel aan te passen aan Qualcomm’s architectuur zonder prestaties of nauwkeurigheid te verliezen.
Door het proces te stroomlijnen en te automatiseren, verkleinden we de ontwikkeltijd van meer dan een jaar tot slechts een paar maanden. Dit had een enorme impact op een product dat door miljoenen mensen werd gebruikt en vormde mijn aanpak van optimalisatie, met de focus op snelheid, efficiëntie en minimale kwaliteitsverlies. Dat is de mentaliteit die ik vandaag de dag naar ANNA breng.
Uw onderzoek is gepresenteerd op CVPR en ECCV — wat zijn enkele van de belangrijkste doorbraken in AI-efficiëntie waar u het meest trots op bent?
Wanneer ik word gevraagd naar mijn prestaties op het gebied van AI-efficiëntie, denk ik altijd terug aan ons paper dat is geselecteerd voor een mondelinge presentatie op CVPR 2023. Het is zeldzaam om voor een mondelinge presentatie te worden geselecteerd op zo’n conferentie, aangezien slechts 12 papers worden geselecteerd. Dit komt bovenop het feit dat generatieve AI meestal de aandacht trekt, en ons paper nam een andere aanpak, met de focus op de wiskundige kant, in het bijzonder de analyse en compressie van neurale netwerken.
We ontwikkelden een methode die ons hielp om te begrijpen hoeveel parameters een neurale netwerk echt nodig heeft om efficiënt te functioneren. Door technieken uit functionele analyse toe te passen en over te schakelen van een discrete naar een continue formulering, konden we goede compressieresultaten bereiken terwijl we de mogelijkheid behielden om deze veranderingen terug te integreren in het model. Het paper introduceerde ook enkele nieuwe algoritmen die nog niet door de gemeenschap waren gebruikt en die verder toepassing vonden.
Dit was een van mijn eerste papers op het gebied van AI, en belangrijk was dat het het resultaat was van het collectieve inspanning van ons team, inclusief mijn mede-oprichters. Het was een significante mijlpaal voor ons allemaal.
Kunt u uitleggen hoe Integrale Neurale Netwerken (INN’s) werken en waarom ze een belangrijke innovatie zijn in diepe leertheorie?
Traditionele neurale netwerken gebruiken vaste matrices, vergelijkbaar met Excel-tabellen, waarvan de grootte en parameters van tevoren zijn bepaald. INN’s beschrijven netwerken daarentegen als continue functies, wat veel meer flexibiliteit biedt. Denk eraan als een deken met spelden op verschillende hoogtes, en dit vertegenwoordigt de continue golf.
Wat INN’s interessant maakt, is hun vermogen om dynamisch te “compressen” of “uit te breiden” op basis van de beschikbare middelen, net zoals een analoog signaal wordt gedigitaliseerd tot geluid. U kunt het netwerk inkrimpen zonder kwaliteit te verliezen, en wanneer nodig, kan het weer uitbreiden zonder opnieuw te trainen.
We hebben dit getest, en terwijl traditionele compressiemethoden tot aanzienlijk kwaliteitsverlies leiden, behouden INN’s een kwaliteit die dicht bij de oorspronkelijke ligt, zelfs onder extreme compressie. De wiskunde erachter is onconventioneel voor de AI-gemeenschap, maar de echte waarde ligt in de mogelijkheid om solide, praktische resultaten te leveren met minimale inspanning.
TheStage AI heeft gewerkt aan quantum annealing-algoritmen — hoe ziet u quantum computing als een rol in AI-optimalisatie in de nabije toekomst?
Wanneer het gaat om quantum computing en de rol ervan in AI-optimalisatie, is de belangrijkste conclusie dat quantumsystemen een compleet andere aanpak bieden voor het oplossen van problemen zoals optimalisatie. Hoewel we geen quantum annealing-algoritmen van scratch hebben uitgevonden, bieden bedrijven zoals D-Wave Python-bibliotheken om quantumalgoritmen te bouwen voor discrete optimalisatie taken, die ideaal zijn voor quantumcomputers.
Het idee hier is dat we geen neurale netwerk rechtstreeks in een quantumcomputer laden. Dat is niet mogelijk met de huidige architectuur. In plaats daarvan benaderen we hoe neurale netwerken zich gedragen onder verschillende soorten degradatie, waardoor ze passen in een systeem dat een quantumchip kan verwerken.
In de toekomst kunnen quantumsystemen mogelijk netwerken optimaliseren en schalen met een precisie die traditionele systemen moeilijk kunnen evenaren. Het voordeel van quantumsystemen ligt in hun ingebouwde parallelle verwerking, iets wat klassieke systemen alleen kunnen simuleren met extra middelen. Dit kan de optimalisatieproces aanzienlijk versnellen, vooral als we leren hoe we grotere en complexere netwerken effectief kunnen modelleren.
Het echte potentieel ligt in het gebruik van quantum computing om enorme, ingewikkelde optimalisatie taken op te lossen en parameters op te breken in kleinere, beheersbare groepen. Met technologieën zoals quantum en optische computing, zijn er enorme mogelijkheden voor het optimaliseren van AI die verder gaan dan wat traditionele computing kan bieden.
Wat is uw langetermijnvisie voor TheStage AI? Waar ziet u inferentie-optimalisatie naar toe in de komende 5-10 jaar?
Op lange termijn heeft TheStage AI als doel om een wereldwijde Model Hub te worden waar iedereen gemakkelijk toegang heeft tot een geoptimaliseerd neurale netwerk met de gewenste kenmerken, of het nu voor een smartphone of een ander apparaat is. Het doel is om een sleep-en-neerzet-ervaring te bieden, waarbij gebruikers hun parameters invoeren en het systeem het netwerk automatisch genereert. Als het netwerk nog niet bestaat, zal het worden gemaakt met behulp van ANNA.
Ons doel is om neurale netwerken rechtstreeks op gebruikersapparaten te laten draaien, waardoor de kosten met 20 tot 30 keer worden verlaagd. In de toekomst kan dit de kosten bijna volledig elimineren, aangezien het apparaat van de gebruiker de berekeningen zal uitvoeren in plaats van te vertrouwen op cloud-servers. Dit, in combinatie met de vooruitgang in modelcompressie en hardwareversnelling, kan AI-implementatie aanzienlijk efficiënter maken.
We plannen ook om onze technologie te integreren met hardwareoplossingen, zoals sensoren, chips en robots, voor toepassingen in domeinen zoals autonome rijden en robotica. Bijvoorbeeld, we streven ernaar om AI-camera’s te bouwen die kunnen functioneren in elke omgeving, of het nu in de ruimte is of onder extreme omstandigheden zoals duisternis of stof. Dit zou AI toegankelijk maken voor een breed scala aan toepassingen en ons in staat stellen om aangepaste oplossingen te creëren voor specifieke hardware en gebruikscases.
Bedankt voor het geweldige interview, lezers die meer willen leren, kunnen TheStage AI bezoeken.












