Intervjuer
Neetu Pathak, medgrundare och VD för Skymel – Intervjuserie

Neetu Pathak, medgrundare och VD för Skymel, leder företaget i att revolutionera AI-inferens med sin banbrytande NeuroSplit™-teknik. Tillsammans med CTO Sushant Tripathy driver hon Skymels mission att förbättra AI-applikationsprestanda samtidigt som de minskar beräkningskostnaderna.
NeuroSplit™ är en adaptiv inferensteknik som dynamiskt distribuerar AI-arbetsbelastningar mellan slutanvändarens enheter och molntjänster. Detta tillvägagångssätt utnyttjar outnyttjad beräkningskraft på användarens enheter, vilket minskar molninfrastrukturkostnaderna med upp till 60 %, accelererar inferenstider, säkerställer datasäkerhet och möjliggör sömlös skalbarhet.
Genom att optimera lokal beräkningskraft tillåter NeuroSplit™ AI-applikationer att köras effektivt även på äldre GPU:er, vilket avsevärt minskar kostnaderna samtidigt som användarupplevelsen förbättras.
Vad inspirerade dig att medgrundare Skymel, och vilka viktiga utmaningar inom AI-infrastruktur försökte du lösa med NeuroSplit?
Inspirationen till Skymel kom från sammanflödet av våra kompletterande erfarenheter. Under sin tid på Google (GOOGL ) var min medgrundare, Sushant Tripathy, involverad i distributionen av talbaserade AI-modeller över miljarder Android-enheter. Han upptäckte att det fanns en enorm mängd outnyttjad beräkningskraft tillgänglig på slutanvändarens enheter, men de flesta företag kunde inte utnyttja den effektivt på grund av de komplexa tekniska utmaningarna med att komma åt dessa resurser utan att äventyra användarupplevelsen.
Samtidigt gav min erfarenhet av att arbeta med företag och startups på Redis mig en djup insikt i hur kritisk latens blev för företag. När AI-applikationer blev allt vanligare, stod det klart att vi behövde flytta bearbetningen närmare där data skapades, snarare än att ständigt skicka data tillbaka och fram till datacenter.
Då insåg Sushant och jag att framtiden inte handlade om att välja mellan lokal eller molnbearbetning – det handlade om att skapa en intelligent teknik som kunde anpassa sig sömlöst mellan lokal, moln- eller hybridbearbetning beroende på varje specifik inferensbegäran. Denna insikt ledde oss till att grunda Skymel och utveckla NeuroSplit, och gå utöver de traditionella infrastrukturbegränsningarna som hämmade AI-innovation.
Kan du förklara hur NeuroSplit dynamiskt optimerar beräkningsresurser samtidigt som det upprätthåller användarprivatitet och prestanda?
En av de stora fallgroparna i lokal AI-inferens har varit dess statiska beräkningskrav – traditionellt sett kräver körning av en AI-modell samma beräkningsresurser oavsett enhetens tillstånd eller användarbeteende. Detta “en-storlek-passar-alla”-tillvägagångssätt ignorerar verkligheten att enheter har olika hårdvarukapaciteter, från olika chip (GPU, NPU, CPU, XPU) till varierande nätverksbandbredd, och användare har olika beteenden när det gäller applikationsanvändning och laddningsmönster.
NeuroSplit övervakar kontinuerligt olika enhetstelemetri – från hårdvarukapaciteter till nuvarande resursutnyttjande, batteristatus och nätverksförhållanden. Vi tar också hänsyn till användarbeteendemönster, som hur många andra applikationer som körs och typiska enhetsanvändningsmönster. Denna omfattande övervakning tillåter NeuroSplit att dynamiskt bestämma hur mycket inferensberäkning som kan köras säkert på slutanvändarens enhet samtidigt som det optimerar för utvecklares prestandaindikatorer.
När datasekretess är av största vikt, ser NeuroSplit till att rådata aldrig lämnar enheten, bearbetar känslig information lokalt samtidigt som det upprätthåller optimal prestanda. Vår förmåga att smarta splittra, trimma eller koppla loss AI-modeller tillåter oss att få plats med 50-100 AI-stubmodeller i minnesutrymmet för en enda kvantiserad modell på en slutanvändarens enhet. I praktiken innebär detta att användare kan köra avsevärt fler AI-drivna applikationer samtidigt, bearbeta känslig data lokalt, jämfört med traditionella statiska beräkningstillvägagångssätt.
Vilka är de viktigaste fördelarna med NeuroSplits adaptiva inferens för AI-företag, särskilt de som arbetar med äldre GPU-teknik?
NeuroSplit erbjuder tre revolutionerande fördelar för AI-företag. Först minskar det dramatiskt infrastrukturkostnaderna genom två mekanismer: företag kan utnyttja billigare, äldre GPU:er effektivt, och vår unika förmåga att få plats med både fulla och stubbmodeller på moln-GPU:er möjliggör avsevärt högre GPU-utnyttjandegrad. Till exempel kan en applikation som vanligtvis kräver flera NVIDIA A100 på 2,74 dollar per timme nu köras på antingen en enda A100 eller flera V100 på bara 83 cent per timme.
Andra, vi förbättrar avsevärt prestandan genom att bearbeta initiala rådata direkt på användarens enhet. Detta innebär att data som slutligen skickas till molnet är mycket mindre till storlek, vilket avsevärt minskar nätverksfördröjning samtidigt som det upprätthåller noggrannhet. Detta hybridtillvägagångssätt ger företag det bästa av båda världar – hastigheten på lokal bearbetning med kraften från molnbearbetning.
Tredje, genom att hantera känslig initial data bearbetning på slutanvändarens enhet, hjälper vi företag att upprätthålla starka användarprivatetsskydd utan att offra prestanda. Detta är alltmer avgörande när dataskyddsföreskrifterna blir strängare och användarna mer medvetna om privatliv.
Hur minskar Skymels lösning kostnaderna för AI-inferens utan att kompromissa med modellkomplexitet eller noggrannhet?
Först, genom att splittra enskilda AI-modeller, distribuerar vi beräkning mellan användarens enhet och molnet. Den första delen körs på användarens enhet, hanterar 5 % till 100 % av den totala beräkningen beroende på tillgängliga enhetsresurser. Endast den återstående beräkningen behöver bearbetas på moln-GPU:er.
Denna splittring innebär att moln-GPU:er hanterar en minskad beräkningsbörda – om en modell ursprungligen krävde en full A100-GPU, kan samma arbetsbörda efter splittring kanske bara kräva 30-40 % av GPU:ns kapacitet. Detta tillåter företag att använda mer kostnadseffektiva GPU-instanser som V100.
Andra, NeuroSplit optimerar GPU-utnyttjande i molnet. Genom att effektivt ordna både fulla modeller och stubbmodeller (de återstående delarna av splittrade modeller) på samma moln-GPU, uppnår vi avsevärt högre utnyttjandegrad jämfört med traditionella tillvägagångssätt. Detta innebär att fler modeller kan köras samtidigt på samma moln-GPU, vilket ytterligare minskar kostnaderna per inferens.
Vad skiljer Skymels hybridtillvägagångssätt (lokal + moln) från andra AI-infrastrukturlösningar på marknaden?
AI-landskapet befinner sig vid en fascinerande inflexionspunkt. Medan Apple (AAPL ), Samsung och Qualcomm (QCOM ) visar kraften i hybrid-AI genom sina ekosystemfunktioner, förblir dessa inhägnade trädgårdar. Men AI borde inte begränsas av vilken slutanvändarens enhet som används.
NeuroSplit är grundläggande enhetsagnostisk, molnagnostisk och neuralnätverksagnostisk. Detta innebär att utvecklare slutligen kan leverera konsekventa AI-upplevelser oavsett om deras användare använder en iPhone, en Android-enhet eller en laptop – eller om de använder AWS, Azure eller Google Cloud.
Tänk på vad detta innebär för utvecklare. De kan bygga sin AI-applikation en gång och veta att den kommer att anpassa sig intelligent över alla enheter, alla moln och alla neurala nätverksarkitekturer. Inga fler versioner för olika plattformar eller kompromissa med funktioner baserat på enhetsförmåga.
Vi tar hybrid-AI-funktioner ut ur inhägnade trädgårdar och gör dem universellt tillgängliga. När AI blir central för varje applikation, är denna typ av flexibilitet och konsekvens inte bara en fördel – det är avgörande för innovation.
Hur kompletterar Orchestrator-agenten NeuroSplit, och vilken roll spelar den i att omvandla AI-distributionsstrategier?
Orchestrator-agenten (OA) och NeuroSplit samarbetar för att skapa ett självoptimerande AI-distributionssystem:
1. Utvecklare ställer in gränserna:
- Begränsningar: tillåtna modeller, versioner, molntjänster, zoner, efterlevnadsregler
- Mål: mållatens, kostnadsbegränsningar, prestandakrav, sekretessbehov
2. OA arbetar inom dessa begränsningar för att uppnå målen:
- Beslutar vilka modeller/API:er som ska användas för varje begäran
- Anpassar distributionsstrategier baserat på verklig prestanda
- Gör avvägningar för att optimera för angivna mål
- Kan konfigureras om på nytt när behoven ändras
3. NeuroSplit utför OA:s beslut:
- Använder realtidsenhetstelemetri för att optimera körning
- Delar bearbetning mellan enhet och moln när det är fördelaktigt
- Ser till att varje inferens körs optimalt med tanke på aktuella förhållanden
Det är som att ha ett AI-system som autonomt optimerar sig inom dina definierade regler och mål, snarare än att kräva manuell optimering för varje scenario.
Hur tror du att Orchestrator-agenten kommer att omvandla sättet AI distribueras över branscher?
Den löser tre kritiska utmaningar som har hämmat AI-antagande och innovation.
Först tillåter den företag att hålla jämna steg med de senaste AI-framstegen utan ansträngning. Med Orchestrator-agenten kan du omedelbart dra nytta av de senaste modellerna och teknikerna utan att behöva omkonfigurera din infrastruktur. Detta är en betydande konkurrensfördel i en värld där AI-innovation rör sig i ett rasande tempo.
Andra, det möjliggör dynamisk, per-begäran-optimering av AI-modellval. Orchestrator-agenten kan intelligent blanda och matcha modeller från det stora ekosystemet av alternativ för att leverera de bästa möjliga resultaten för varje användarinteraktion. Till exempel kunde en kundtjänst-AI använda en specialiserad modell för tekniska frågor och en annan för faktureringsförfrågningar, vilket ger bättre resultat för varje typ av interaktion.
Tredje, det maximalt prestanda samtidigt som det minskar kostnaderna. Agenten balanserar automatiskt mellan att köra AI på användarens enhet eller i molnet baserat på vad som är mest meningsfullt för tillfället. När sekretess är viktig, bearbetar det data lokalt. När extra beräkningskraft behövs, utnyttjar det molnet. Allt detta sker bakom kulisserna, skapar en sömlös upplevelse för användare samtidigt som det optimerar resurser för företag.
Men vad som verkligen särskiljer Orchestrator-agenten är hur den möjliggör företag att skapa nästa generations hyperpersonliga upplevelser för sina användare. Ta till exempel en e-lärandeplattform – med vår teknik kan de bygga ett system som automatiskt anpassar sin undervisningsmetod baserat på varje students förståelse nivå. När en användare söker efter “maskinlärning”, visar plattformen inte bara generiska resultat – den kan omedelbart bedöma deras nuvarande förståelse och anpassa förklaringar med hjälp av koncept de redan känner till.
Slutligen representerar Orchestrator-agenten framtiden för AI-distribution – en skiftning från statisk, monolitisk AI-infrastruktur till dynamisk, adaptiv, självoptimerande AI-orchestrering. Det handlar inte bara om att göra AI-distribution enklare – det handlar om att göra helt nya klasser av AI-applikationer möjliga.
Vad för typ av feedback har du fått hittills från företag som deltar i den privata betan av Orchestrator-agenten?
Feedbacken från våra privata betadeltagare har varit utmärkt! Företag är glada över att upptäcka att de kan bryta sig loss från infrastruktur-låsning, antingen till proprietära modeller eller värdtjänster. Förmågan att framtidsäkra alla distributionsbeslut har varit en spelväxlare, eliminerar de ökända månaderna av omkonfiguration när man byter tillvägagångssätt.
Våra NeuroSplit-prestandaresultat har varit ingenting annat än anmärkningsvärda – vi kan inte vänta med att dela data offentligt snart. Vad som är särskilt spännande är hur konceptet med adaptiv AI-distribution har fångat fantasin. Det faktum att AI distribuerar sig själv låter som science fiction och inte något de förväntade sig nu, så bara från den tekniska framstegen blir människor upphetsade över möjligheterna och de nya marknader det kan skapa i framtiden.
Med den snabba utvecklingen inom generativ AI, vad ser du som de nästa stora hindren för AI-infrastruktur, och hur planerar Skymel att ta itu med dem?
Vi är på väg mot en framtid som de flesta ännu inte helt förstått: det kommer inte att finnas en enda dominant AI-modell, utan miljarder. Även om vi skapar den mest kraftfulla allmänna AI-modellen som är tänkbar, kommer vi fortfarande att behöva personliga versioner för varje person på jorden, anpassade till unika sammanhang, preferenser och behov. Det är minst 8 miljarder modeller, baserat på världens befolkning.
Detta markerar en revolutionerande skiftning från dagens “en-storlek-passar-alla”-tillvägagångssätt. Framtiden kräver intelligent infrastruktur som kan hantera miljarder modeller. På Skymel bygger vi inte bara lösningar för dagens distributionsutmaningar – vår teknikutvecklingsplan är redan under uppbyggnad för vad som kommer härnäst.
Hur ser du AI-infrastrukturen utvecklas under de närmaste fem åren, och vilken roll tror du att Skymel kommer att spela i denna utveckling?
AI-infrastrukturlandskapet är på väg att genomgå en grundläggande förändring. Medan dagens fokus ligger på att skala stora språkmodeller i molnet, kommer de närmaste fem åren att se AI bli djupt personligt och kontextmedvetet. Detta är inte bara om finjustering – det handlar om AI som anpassar sig till specifika användare, enheter och situationer i realtid.
Denna skiftning skapar två stora infrastrukturutmaningar. Först blir det traditionella tillvägagångssättet att köra allt i centraliserade datacenter ohållbart, både tekniskt och ekonomiskt. Andra, den ökande komplexiteten i AI-applikationer innebär att vi behöver infrastruktur som kan dynamiskt optimera över flera modeller, enheter och beräkningsplatser.
På Skymel bygger vi infrastruktur som specifikt adresserar dessa utmaningar. Vår teknik möjliggör AI att köras varhelst det är mest meningsfullt – antingen på enheten där data genereras, i molnet där mer beräkningskraft är tillgänglig eller intelligent delat mellan båda. Viktigast, det anpassar dessa beslut i realtid baserat på förändrade förhållanden och krav.
I framtiden kommer framgångsrika AI-applikationer inte att definieras av modellens storlek eller den mängd beräkningskraft de kan komma åt. De kommer att definieras av sin förmåga att leverera personliga, responsiva upplevelser samtidigt som de effektivt hanterar resurser. Vårt mål är att göra denna nivå av intelligent optimering tillgänglig för varje AI-applikation, oavsett skala eller komplexitet. Tack för den underbara intervjun, läsare som vill lära sig mer bör besöka Skymel.












