Interviews

Kirill Solodskih, medstifter og administrerende direktør for TheStage AI – Interviewserie

mm
Føj Unite.AI til dine foretrukne kilder på Google

Kirill Solodskih, PhD, er medstifter og administrerende direktør for TheStage AI, samt en erfaren AI-forsker og iværksætter med over et årti af erfaring i optimering af neurale netværk til virkelige forretningsformål. I 2024 co-founded han TheStage AI, som sikrede 4,5 millioner dollars i finansiering til at fuldt automatisere acceleration af neurale netværk på tværs af alle hardware-platforme.

Tidligere, som teamleder hos Huawei, ledede Kirill accelerationen af AI-kamera-applikationer til Qualcomm (QCOM ) NPUs, hvilket bidrog til ydeevnen af P50- og P60-smartphones og fik flere patenter for sine innovationer. Hans forskning er blevet præsenteret på førende konferencer som CVPR og ECCV , hvor den fik priser og anerkendelse fra industrien. Han er også vært for en podcast om AI-optimering og inferens.

Hvad inspirerede dig til at co-founder TheStage AI, og hvordan gik du fra akademiet og forskning til at tackle inferens-optimering som iværksætter?

Basis for det, der til sidst blev TheStage AI, startede med mit arbejde hos Huawei, hvor jeg var dybt involveret i automatisering af installationer og optimering af neurale netværk. Disse initiativer blev grundlaget for nogle af vores banebrydende innovationer, og det var her, jeg så den virkelige udfordring. At træne en model er en ting, men at få den til at køre effektivt i den virkelige verden og gøre den tilgængelig for brugere er noget andet. Installation er flaskenhalen, der holder mange gode ideer tilbage fra at blive til virkelighed. For at gøre noget så let at bruge som ChatGPT, er der mange bag-end-udfordringer involveret. Fra et teknisk perspektiv handler neural netværks-optimering om at minimere parametre, mens man holder ydeevnen høj. Det er et svært matematisk problem med masser af plads til innovation.

Manuel inferens-optimering har længe været en flaskenhal i AI. Kan du forklare, hvordan TheStage AI automatiserer denne proces, og hvorfor det er en game-changer?

TheStage AI tackler en stor flaskenhal i AI: manuel kompression og acceleration af neurale netværk. Neurale netværk har milliarder af parametre, og at finde ud af, hvilke af dem, der skal fjernes for bedre ydeevne, er næsten umuligt at gøre manuelt. ANNA (Automated Neural Networks Analyzer) automatiserer denne proces, ved at identificere, hvilke lag der skal ekskluderes fra optimering, ligesom hvordan ZIP-kompression først blev automatiseret.

Dette ændrer spillet ved at gøre AI-adopteringshastighed og omkostninger lavere. I stedet for at afhænge af dyre manuelle processer kan startups optimere modeller automatisk. Teknologien giver virksomhederne en klar oversigt over ydeevne og omkostninger, hvilket sikrer effektivitet og skalerbarhed uden gætteri.

TheStage AI påstår at reducere inferens-omkostninger med op til 5 gange — hvad gør jeres optimeringsteknologi så effektiv i forhold til traditionelle metoder?

TheStage AI reducerer output-omkostningerne med op til 5 gange med en optimeringsmetode, der går ud over traditionelle metoder. I stedet for at anvende den samme algoritme til hele det neurale netværk, bryder ANNA det ned i mindre lag og beslutter, hvilken algoritme der skal anvendes til hvert enkelt del for at levere ønsket kompression, samtidig med at modellens kvalitet maksimeres. Ved at kombinere smarte matematiske heuristikker med effektive approximationer er vores tilgang meget skalerbar og gør det lettere for virksomheder af alle størrelser at adoptere AI. Vi integrerer også fleksible compiler-indstillinger for at optimere netværk til bestemt hardware som iPhones eller NVIDIA-GPU’er. Dette giver os mere kontrol til at finjustere ydeevnen, hvilket øger hastigheden uden at gå på kompromis med kvaliteten.

Hvordan sammenligner TheStage AI’s inferens-acceleration med PyTorch’s native compiler, og hvad fordele tilbyder det AI-udviklere?

TheStage AI accelererer output langt ud over PyTorch’s native compiler. PyTorch bruger en “just-in-time”-kompilationsmetode, der kompiller modellen hver gang den køres. Dette fører til lange starttider, der kan tage minutter eller endda længere. I skalerbare miljøer kan dette skabe ineffektiver, især når nye GPU’er skal kobles på for at håndtere øget brugerbelastning, hvilket kan føre til forsinkelser, der påvirker brugeroplevelsen.

Til gengæld tillader TheStage AI, at modeller kan forkompilieres, så når en model er klar, kan den deployes øjeblikkeligt. Dette fører til hurtigere udgivelser, forbedret serviceeffektivitet og omkostningsbesparelser. Udviklere kan deployere og skale AI-modeller hurtigere uden de traditionelle kompilationsbottlenecks, hvilket gør det mere effektivt og responsivt for høj-krævende brugstilfælde.

Kan du dele mere om TheStage AI’s QLIP-værktøj og hvordan det forbedrer modellens ydeevne, samtidig med at kvaliteten opretholdes?

QLIP, TheStage AI’s værktøj, er en Python-bibliotek, der tilbyder en essentiel samling af primitiver til at bygge nye optimeringsalgoritmer tilpasset forskellige hardware, som GPU’er og NPUs. Værktøjet inkluderer komponenter som kvantificering, beskæring, specifikation, kompilering og servering, alle kritiske for udvikling af effektive og skalerbare AI-systemer.

Hvad adskiller QLIP er dens fleksibilitet. Den tillader AI-ingeniører at prototypere og implementere nye algoritmer med kun få linjer kode. For eksempel kan en ny AI-konference-papir om kvantificering af neurale netværk konverteres til en arbejdende algoritme ved hjælp af QLIP’s primitiver på få minutter. Dette gør det let for udviklere at integrere den seneste forskning i deres modeller uden at blive begrænset af stive rammer.

Til forskel fra traditionelle open-source-rammer, der begrænser dig til en fast samling af algoritmer, tillader QLIP enhver at tilføje nye optimeringsteknikker. Denne tilpasning hjælper hold med at holde trit med den hurtigt udviklende AI-landskab, forbedrer ydeevnen og sikrer fleksibilitet for fremtidige innovationer.

Du har bidraget til AI-kvantificeringsrammer brugt i Huaweis P50 & P60-kameraer. Hvordan formede denne oplevelse din tilgang til AI-optimering?

Min oplevelse med at arbejde på AI-kvantificeringsrammer til Huaweis P50 og P60 gav mig værdifulde indsigt i, hvordan optimering kan strømlines og skaleres. Da jeg først startede med PyTorch, var arbejdet med den komplette eksekveringsgraf for neurale netværk stift, og kvantificeringsalgoritmerne skulle implementeres manuelt, lag for lag. Hos Huawei byggede jeg en ramme, der automatiserede processen. Du indtaster blot modellen, og den genererer automatisk koden til kvantificering, eliminerer manuelt arbejde.

Dette fik mig til at indse, at automatisering i AI-optimering handler om at aktivere hastighed uden at ofre kvalitet. En af de algoritmer, jeg udviklede og patenterede, blev essentiel for Huawei, især da de skulle gå fra Kirin-processorer til Qualcomm på grund af sanktioner. Det tillod holdet at hurtigt tilpasse neurale netværk til Qualcomms arkitektur uden at gå på kompromis med ydeevne eller nøjagtighed.

Ved at strømline og automatisere processen reducerede vi udviklingstiden fra over et år til kun få måneder. Dette havde en enorm indvirkning på et produkt, der blev brugt af millioner, og formede min tilgang til optimering, fokuseret på hastighed, effektivitet og minimal kvalitetstab. Det er den holdning, jeg bringer til ANNA i dag.

Din forskning er blevet præsenteret på CVPR og ECCV — hvad er nogle af de vigtigste gennembrud i AI-effektivitet, du er mest stolt af?

Når jeg bliver bedt om mine præstationer i AI-effektivitet, tænker jeg altid tilbage på vores papir, der blev valgt til en mundtlig præsentation på CVPR 2023. At blive valgt til en mundtlig præsentation på en sådan konference er sjældent, da kun 12 papirer bliver valgt. Dette tilføjer, at generativ AI typisk dominerer rampelyset, og vores papir tog en anden tilgang, fokuseret på den matematiske side, specifikt analysen og kompressionen af neurale netværk.

Vi udviklede en metode, der hjalp os med at forstå, hvor mange parametre et neural netværk virkelig har brug for for at fungere effektivt. Ved at anvende teknikker fra funktionsanalyse og gå fra en diskret til en kontinuert formulering, kunne vi opnå gode kompressionsresultater, samtidig med at vi beholdt evnen til at integrere disse ændringer tilbage i modellen. Papiret introducerede også flere nye algoritmer, der ikke var blevet brugt af fællesskabet før, og fandt yderligere anvendelse.

Dette var et af mine første papirer på AI-området, og vigtigt var, at det var resultatet af vores teams kollektive indsats, herunder mine medstiftere. Det var et betydeligt milepæl for os alle.

Kan du forklare, hvordan Integral Neural Networks (INNs) fungerer, og hvorfor de er en vigtig innovation i dyb læring?

Traditionelle neurale netværk bruger faste matricer, lignende Excel-tabeller, hvor størrelsen og parametrene er forudbestemt. INNs beskriver dog netværk som kontinuerte funktioner, hvilket tilbyder langt mere fleksibilitet. Tænk på det som en blanket med pinde i forskellige højder, og dette repræsenterer den kontinuerte bølge.

Hvad gør INNs spændende er deres evne til dynamisk at “komprimere” eller “udvide” baseret på tilgængelige ressourcer, ligesom en analog signal digitaliseres til lyd. Du kan krympe netværket uden at gå på kompromis med kvaliteten, og når det er nødvendigt, kan du udvide det tilbage uden at skulle gen-træne.

Vi testede dette, og mens traditionelle kompressionsmetoder fører til betydelig kvalitetstab, beholder INNs en næsten original kvalitet, selv under ekstrem kompression. Matematiken bagved er mere usædvanlig for AI-fællesskabet, men den virkelige værdi ligger i dens evne til at levere solide, praktiske resultater med minimal indsats.

TheStage AI har arbejdet på kvant-annekingsalgoritmer — hvordan ser du på kvantecomputers rolle i AI-optimering i den nærmeste fremtid?

Når det kommer til kvantecomputere og deres rolle i AI-optimering, er det vigtigste, at kvant-systemer tilbyder en helt anden tilgang til at løse problemer som optimering. Mens vi ikke opfandt kvant-annekingsalgoritmer fra bunden, tilbyder virksomheder som D-Wave Python-biblioteker til at bygge kvant-algoritmer specifikt til diskrete optimeringsopgaver, der er ideelle for kvant-computere.

Tanken her er, at vi ikke direkte loader et neural netværk ind i en kvant-computer. Det er ikke muligt med den nuværende arkitektur. I stedet approksimerer vi, hvordan neurale netværk opfører sig under forskellige former for degradering, og gør dem klar til at blive behandlet af en kvant-chip.

I fremtiden kunne kvant-systemer skalerer og optimere netværk med en præcision, som traditionelle systemer har svært ved at matche. Fordelene ved kvant-systemer ligger i deres indbyggede parallelisme, noget, som klassiske systemer kun kan simulere ved hjælp af ekstra ressourcer. Dette kunne betydeligt accelerere optimeringsprocessen, især når vi figurerer ud, hvordan vi kan modelere større og mere komplekse netværk effektivt.

Den virkelige potentiale ligger i at bruge kvant-computere til at løse massive, intrikate optimeringsopgaver og bryde parametre ned i mindre, mere håndterbare grupper. Med teknologier som kvant og optisk computing er der enorme muligheder for at optimere AI, der går langt ud over, hvad traditionel computing kan tilbyde.

Hvad er din langsigtede vision for TheStage AI? Hvor ser du inferens-optimering gående i de næste 5-10 år?

På lang sigt sigter TheStage AI mod at blive et globalt Model Hub, hvor enhver kan let få adgang til et optimeret neural netværk med de ønskede egenskaber, enten for en smartphone eller enhver anden enhed. Målet er at tilbyde en drag-and-drop-oplevelse, hvor brugere indtaster deres parametre, og systemet automatisk genererer netværket. Hvis netværket ikke allerede eksisterer, vil det blive oprettet automatisk ved hjælp af ANNA.

Vores mål er at få neurale netværk til at køre direkte på brugernes enheder, hvilket reducerer omkostningerne med 20 til 30 gange. I fremtiden kunne dette næsten eliminere omkostningerne helt, da brugernes enhed ville håndtere beregningen i stedet for at afhænge af cloud-servere. Dette, kombineret med fremskridt i model-kompression og hardware-acceleration, kunne gøre AI-deployment betydeligt mere effektiv.

Vi planlægger også at integrere vores teknologi med hardware-løsninger, såsom sensorer, chip og robotter, til anvendelser i områder som autonome køretøjer og robotter. For eksempel sigter vi mod at bygge AI-kameraer, der kan fungere i enhver omgang, enten i rummet eller under ekstreme forhold som mørke eller støv. Dette ville gøre AI brugbar i et bredt spektrum af anvendelser og tillade os at skabe tilpassede løsninger for specifikke hardware og brugstilfælde.

Tak for det gode interview, læsere, der ønsker at lære mere, skal besøge TheStage AI.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.