Interviews
Neetu Pathak, medstifter og administrerende direktør i Skymel – Intervieuserie

Neetu Pathak, medstifter og administrerende direktør i Skymel, leder virksomheden i at revolutionere AI-inferens med dens innovative NeuroSplit™-teknologi. Sammen med teknisk direktør Sushant Tripathy driver hun Skymels mission om at forbedre AI-applikationsperformance, mens omkostningerne reduceres.
NeuroSplit™ er en adaptiv inferensteknologi, der dynamisk distribuerer AI-arbejdsbyrder mellem slutbrugerens enheder og cloud-servere. Dette tilgangsmåde udnytter inaktive beregningsressourcer på brugerens enhed, hvilket reducerer cloud-infrastrukturkostninger med op til 60%, accelererer inferenshastigheder, sikrer dataprivatliv og muliggør ubrudt skalerbarhed.
Ved at optimere lokal beregningskraft tillader NeuroSplit™, at AI-applikationer kan køre effektivt, selv på ældre GPU’er, hvilket betydeligt reducerer omkostningerne og forbedrer brugeroplevelsen.
Hvad inspirerede dig til at co-founder Skymel, og hvilke nøgleudfordringer i AI-infrastruktur var du på at løse med NeuroSplit?
Inspirationen til Skymel kom fra sammenløbet af vores komplementære erfaringer. Under hans tid i Google (GOOGL ) var min medstifter, Sushant Tripathy, ved at implementere talebaserede AI-modeller på tværs af milliarder af Android-enheder. Han opdagede, at der var en enorm mængde inaktive beregningsressourcer til rådighed på slutbrugerens enheder, men de fleste virksomheder kunne ikke effektivt udnytte dem på grund af de komplekse tekniske udfordringer ved at få adgang til disse ressourcer uden at kompromittere brugeroplevelsen.
Imens gav min erfaring med at arbejde med virksomheder og startups i Redis mig dyb indsigt i, hvor kritisk latency var blevet for virksomheder. Da AI-applikationer blev mere udbredte, var det tydeligt, at vi havde brug for at flytte behandlingen tættere på, hvor data blev genereret, i stedet for konstant at sende data tilbage og frem til datacenter.
Det var da Sushant og jeg indså, at fremtiden ikke handlede om at vælge mellem lokal eller cloud-behandling – det handlede om at skabe en intelligent teknologi, der kunne tilpasse sig selv til lokal, cloud eller hybrid-behandling baseret på hver enkelt inferensanmodning. Denne indsigt førte til, at vi grundlagde Skymel og udviklede NeuroSplit, og gik ud over de traditionelle infrastruktur begrænsninger, der havde holdt AI-innovationen tilbage.
Kan du forklare, hvordan NeuroSplit dynamisk optimerer beregningsressourcer, mens brugerprivatliv og -performance opretholdes?
En af de største faldgruber i lokal AI-inferens har været dens statiske beregningskrav – traditionelt kræver kørsel af en AI-model de samme beregningsressourcer uanset enhedens tilstand eller brugeradfærd. Denne en-size-fits-all-tilgang ignorerer virkeligheden, at enheder har forskellige hardware-kapaciteter, fra forskellige chips (GPU, NPU, CPU, XPU) til varierende netværksbåndbredde, og brugere har forskellige adfærdsformer i forhold til applikationsbrug og opladningsmønstre.
NeuroSplit overvåger kontinuerligt forskellige enhedstelemetri – fra hardware-kapaciteter til nuværende ressourceudnyttelse, batteristatus og netværksforhold. Vi tager også brugeradfærdsformers mønstre i betragtning, som hvor mange andre applikationer der køres og typiske enhedsbrugsformers mønstre. Denne omfattende overvågning giver NeuroSplit mulighed for at dynamisk bestemme, hvor meget inferensberegning der kan køres på slutbrugerens enhed, mens udviklerens nøgleperformanceindikatorer optimeres
Når dataprivatliv er afgørende, sikrer NeuroSplit, at rådata aldrig forlader enheden, og behandlingen af følsomme oplysninger sker lokalt, mens optimal performance opretholdes. Vores evne til at smartt splitte, trimme eller afkoble AI-modeller giver os mulighed for at placere 50-100 AI-stubmodeller i hukommelsesrummet på en slutbrugerens enhed, på samme måde som en enkelt kvantificeret model. I praksis betyder dette, at brugere kan køre betydeligt flere AI-drevne applikationer samtidigt, og behandlingen af følsomme data sker lokalt, i forhold til traditionelle statiske beregningsmetoder.
Hvad er de primære fordele ved NeuroSplits adaptive inferens for AI-virksomheder, især for dem, der arbejder med ældre GPU-teknologi?
NeuroSplit leverer tre transformative fordele for AI-virksomheder. Først reducerer det dramatisk infrastrukturkostninger gennem to mekanismer: virksomheder kan udnytte billigere, ældre GPU’er effektivt, og vores unikke evne til at placere både fulde og stub-modeller på cloud-GPU’er giver mulighed for betydeligt højere GPU-udnyttelsesrater. For eksempel kan en applikation, der typisk kræver multiple NVIDIA A100’er til $2,74 per time, nu køre på enten en enkelt A100 eller multiple V100’er til kun 83 cent per time.
Anden, vi forbedrer betydeligt performance ved at behandle initial rådata direkte på brugerens enhed. Dette betyder, at data, der til sidst sendes til cloud, er betydeligt mindre i størrelse, hvilket reducerer netværkslatency, mens nøjagtigheden opretholdes. Denne hybridtilgang giver virksomheder det bedste af begge verdener – hastigheden af lokal behandling med kraften af cloud-computing.
Tredje, ved at håndtere følsom initial dataprocessing på slutbrugerens enhed, hjælper vi virksomheder med at opretholde stærke brugerprivatlivsbeskyttelser uden at gå på kompromis med performance. Dette er stadig mere afgørende, da privatlivsreguleringer bliver strengere, og brugere bliver mere privatlivsbevidste.
Hvordan reducerer Skymels løsning omkostningerne for AI-inferens uden at gå på kompromis med modelkompleksitet eller nøjagtighed?
Først, ved at splitte enkeltstående AI-modeller, distribuerer vi beregningen mellem brugerens enhed og cloud. Den første del køres på brugerens enhed, og håndterer 5% til 100% af den samlede beregning, afhængigt af tilgængelige enhedsressourcer. Kun den resterende beregning behøver at behandles på cloud-GPU’er.
Dette split betyder, at cloud-GPU’er håndterer en reduceret beregningsbelastning – hvis en model oprindeligt krævede en fuld A100-GPU, ville samme arbejdsbyrde efter split kun kræve 30-40% af GPU’ens kapacitet. Dette giver virksomheder mulighed for at bruge mere kosteffective GPU-forekomster som V100.
Anden, NeuroSplit optimerer GPU-udnyttelse i cloud. Ved at effektivt arrangere både fulde modeller og stub-modeller (de resterende dele af splittede modeller) på samme cloud-GPU, opnår vi betydeligt højere udnyttelsesrater i forhold til traditionelle metoder. Dette betyder, at flere modeller kan køre samtidigt på samme cloud-GPU, hvilket yderligere reducerer omkostningerne per inferens.
Hvad adskiller Skymels hybridtilgang (lokal + cloud) fra andre AI-infrastrukturløsninger på markedet?
AI-landskabet er ved at nå et fascinerende inflexionspunkt. Mens Apple (AAPL ), Samsung og Qualcomm (QCOM ) demonstrerer kraften af hybrid-AI gennem deres økosystemfunktioner, forbliver disse lukkede haver. Men AI bør ikke begrænses af, hvilken slutbrugerens enhed en person tilfældigvis bruger.
NeuroSplit er fundamentalt enheds-agnostisk, cloud-agnostisk og neural-netværks-agnostisk. Dette betyder, at udviklere endelig kan levere konsistente AI-oplevelser uanset, om deres brugere er på en iPhone, en Android-enhed eller en bærbar computer – eller om de bruger AWS, Azure eller Google Cloud.
Tænk over, hvad dette betyder for udviklere. De kan bygge deres AI-applikation én gang og vide, at den vil tilpasse sig intelligent på tværs af enhver enhed, cloud og neural-netværksarkitektur. Ingen mere bygning af forskellige versioner til forskellige platforme eller kompromis med funktioner baseret på enhedskapaciteter.
Vi bringer enterprise-klasse hybrid-AI-kapaciteter ud af lukkede haver og gør dem universelt tilgængelige. Da AI bliver central for hver applikation, er denne fleksibilitet og konsistens ikke kun en fordel – det er afgørende for innovation.
Hvordan komplementerer Orchestrator-agenten NeuroSplit, og hvilken rol spiller den i transformationen af AI-udviklingsstrategier?
Orchestrator-agenten (OA) og NeuroSplit arbejder sammen for at skabe et selvoptimerende AI-udviklingssystem:
1. Udviklerne fastsætter grænserne:
- Begrænsninger: tilladte modeller, versioner, cloud-udbydere, zoner, overholdelsesregler
- Mål: mål-latency, omkostningsgrænser, performanceskrav, privatlivsbehov
2. OA arbejder inden for disse begrænsninger for at opnå målene:
- Beslutter, hvilke modeller/API’er der skal bruges til hver anmodning
- Tilpasser udviklingsstrategier baseret på virkelige performances
- Gør kompromiser for at optimere for specificerede mål
- Kan konfigureres om med det samme, når behovene ændrer sig
3. NeuroSplit udfører OA’s beslutninger:
- Bruger realtidsenhedstelemetri til at optimere udførelse
- Splitter behandling mellem enhed og cloud, når det er fordelagtigt
- Sikrer, at hver inferens køres optimalt, givet aktuelle forhold
Det er som at have et AI-system, der selvoptimerer sig inden for dine fastsatte regler og mål, i stedet for at kræve manuel optimering for hver enkelt situation.
Hvordan vil Orchestrator-agenten forme fremtiden for, hvordan AI udvikles på tværs af industrier?
Den løser tre kritiske udfordringer, der har holdt AI-udvikling og innovation tilbage.
Først giver den virksomheder mulighed for at holde trit med de seneste AI-fremgang. Med Orchestrator-agenten kan du øjeblikkeligt udnytte de nyeste modeller og teknikker uden at skulle omstrukturere din infrastruktur. Dette er en betydelig konkurrencemæssig fordel i en verden, hvor AI-innovation bevæger sig i en rasende tempo.
Anden, det giver mulighed for dynamisk, per-anmodning optimering af AI-modelvalg. Orchestrator-agenten kan intelligent kombinerer modeller fra det store økosystem af muligheder for at levere det bedste mulige resultat for hver brugerinteraktion. For eksempel kunne en kundeservice-AI bruge en specialiseret model til tekniske spørgsmål og en anden til fakturaspgørgsmål, og levere bedre resultater for hver type interaktion.
Tredje, det maksimerer performance, mens omkostningerne minimiseres. Agenten balancerer automatisk mellem at køre AI på brugerens enhed eller i cloud, baseret på hvad der giver mest mening på det pågældende tidspunkt. Når privatliv er vigtigt, behandles data lokalt. Når ekstra beregningskraft er nødvendig, udnyttes cloud. Alt dette sker bag kulisserne, og skaber en glat oplevelse for brugere, mens ressourcer optimeres for virksomheder.
Men det, der virkelig adskiller Orchestrator-agenten, er, hvordan den giver virksomheder mulighed for at skabe næste generations hyper-personlige oplevelser for deres brugere. Tag et e-læringsplatform – med vores teknologi kan de bygge et system, der automatisk tilpasser sin undervisningsmetode baseret på hver enkelt elevs forståelsesniveau. Når en bruger søger efter “machine learning”, viser platformen ikke bare generiske resultater – den kan øjeblikkeligt vurdere deres nuværende forståelse og tilpasse forklaringer, der bruger begreber, de allerede kender.
Ultimo, Orchestrator-agenten repræsenterer fremtiden for AI-udvikling – en skift fra statisk, monolitisk AI-infrastruktur til dynamisk, adaptiv, selvoptimerende AI-orkering. Det handler ikke kun om at gøre AI-udvikling lettere – det handler om at gøre helt nye klasser af AI-applikationer mulige.
Hvad for feedback har du modtaget fra virksomheder, der deltager i den private beta af Orchestrator-agenten?
Feedbacket fra vores private beta-deltagere har været fantastisk! Virksomheder er begejstrede for at opdage, at de kan bryde fri fra infrastruktur-låsning, enten til proprietære modeller eller hosting-tjenester. Evnen til at fremtidssikre enhver udviklingsbeslutning har været en game-changer, og eliminerer de frygtede måneder med omstrukturering, når man skifter tilgang.
Vores NeuroSplit-performance-resultater har været intet mindre end bemærkelsesværdige – vi kan ikke vente med at dele dataene offentligt snart. Det, der er særligt spændende, er, hvordan selv konceptet om adaptiv AI-udvikling har fanget imaginationen. Det faktum, at AI selv udvikler sig, lyder futuristisk og noget, de ikke forventede nu, så blot fra den tekniske fremgang kan folk blive begejstrede for mulighederne og de nye markeder, det kan skabe i fremtiden.
Med de hurtige fremskridt i generativ AI, hvad ser du som de næste store udfordringer for AI-infrastruktur, og hvordan planlægger Skymel at tackle dem?
Vi er på vej mod en fremtid, som de fleste endnu ikke fuldt ud har forstået: der vil ikke være en enkelt dominerende AI-model, men milliarder af dem. Selv hvis vi skaber den mest avancerede generelle AI-model, vil vi stadig have brug for personlige versioner til hver person på jorden, hver tilpasset til unikke kontekster, præferencer og behov. Det er mindst 8 milliarder modeller, baseret på verdens befolkning.
Dette markerer en revolutionerende skift fra i dagens one-size-fits-all-tilgang. Fremtiden kræver intelligent infrastruktur, der kan håndtere milliarder af modeller. Hos Skymel bygger vi ikke kun på i dagens udfordringer – vores teknologivej er allerede under opbygning til, hvad der kommer herefter.
Hvordan forestiller du dig, at AI-infrastrukturen vil udvikle sig over de næste fem år, og hvilken rol ser du for Skymel i denne udvikling?
AI-infrastruktur-landskabet er ved at undergå en fundamental forandring. Mens fokus i dag er på at skala større sprogmodeller i cloud, vil de næste fem år se AI blive dybt personligt og kontekstbevidt. Dette handler ikke kun om finjustering – det handler om AI, der tilpasser sig specifikke brugere, enheder og situationer i realtid.
Dette skift skaber to store infrastruktur-udfordringer. Først bliver den traditionelle tilgang med at køre alt i centraliserede datacenter utilstrækkelig både teknisk og økonomisk. Anden, den øgede kompleksitet af AI-applikationer kræver infrastruktur, der kan dynamisk optimere på tværs af multiple modeller, enheder og beregningslokationer.
Hos Skymel bygger vi infrastruktur, der specifikt løser disse udfordringer. Vores teknologi giver mulighed for, at AI kan køre, hvor det giver mest mening – enten på enheden, hvor data genereres, i cloud, hvor mere beregningskraft er tilgængelig, eller intelligent split mellem de to. Endnu vigtigere er, at den tilpasser disse beslutninger i realtid baseret på ændrede forhold og krav.
I fremtiden vil succesfulde AI-applikationer ikke defineres af modellens størrelse eller mængden af beregningskraft, de kan tilgå. De vil defineres af deres evne til at levere personlige, responsive oplevelser, mens ressourcer håndteres effektivt. Vores mål er at gøre dette niveau af intelligent optimering tilgængeligt for hver AI-applikation, uanset størrelse eller kompleksitet.
Tak for det gode interview, læsere, der ønsker at lære mere, skal besøge Skymel.












