Intervjuer

Neetu Pathak, medgrunnlegger og CEO av Skymel – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Neetu Pathak, medgrunnlegger og CEO av Skymel, leder selskapet i å revolusjonere AI-inferens med sin innovative NeuroSplit-teknologi. Sammen med CTO Sushant Tripathy, driver hun Skymels misjon om å forbedre AI-applikasjonsytelse samtidig som de reduserer beregningskostnadene.

NeuroSplit er en adaptiv inferensteknologi som dynamisk fordeler AI-arbeidsbyrder mellom slutbrukerens enheter og skytjenere. Denne tilnærmingen utnytter ledige beregningsressurser på brukerens enheter, kutting skyinfrastrukturkostnadene med opptil 60%, akselerer inferenshastighet, sikrer datapersonvern og muliggjør sammenhengende skalerbarhet.

Ved å optimalisere lokal beregningskraft, tillater NeuroSplit AI-applikasjoner å kjøre effektivt selv på eldre GPUer, betydelig reduserer kostnadene samtidig som brukeropplevelsen forbedres.

Hva inspirerte deg til å medgrunnlegge Skymel, og hva var de viktigste utfordringene i AI-infrastruktur som du ønsket å løse med NeuroSplit?

Inspirasjonen til Skymel kom fra konvergeringen av våre komplementære erfaringer. Under sin tid i Google (GOOGL ) var min medgrunnlegger, Sushant Tripathy, med på å distribuere talebaserte AI-modeller på milliarder av Android-enheter. Han oppdaget at det var en enorm mengde ledig beregningskraft tilgjengelig på slutbrukerens enheter, men de fleste selskaper kunne ikke effektivt utnytte denne ressursen på grunn av komplekse ingeniørutfordringer ved å få tilgang til disse ressursene uten å kompromittere brukeropplevelsen.

Sammen med min erfaring fra å arbeide med bedrifter og startup-selskaper i Redis, ga meg en dyp innsikt i hvor kritisk latens var blitt for bedrifter. Ettersom AI-applikasjoner ble mer utbredt, var det klart at vi måtte flytte prosesseringen nærmere der data ble generert, i stedet for å stadig sende data tilbake og frem til datasentre.

Da realiserte Sushant og jeg at fremtiden ikke handlet om å velge mellom lokal eller skyprosesserings-, men om å skape en intelligent teknologi som kunne seamless adaptérer mellom lokal, sky eller hybridprosesseringsbasert på hver enkelt inferensforespørsel. Denne innsikten ledet oss til å grunnlegge Skymel og utvikle NeuroSplit, og gått ut over de tradisjonelle infrastruktur-begrensningene som hadde hindret AI-innovasjon.

Kan du forklare hvordan NeuroSplit dynamisk optimaliserer beregningsressurser samtidig som det opprettholder brukerpersonvern og ytelse?

En av de største fallgruvene i lokal AI-inferens har vært dens statiske beregningskrav – tradisjonelt krever kjøring av en AI-modell de samme beregningsressursene uansett enhetens tilstand eller brukeratferd. Denne en-størrelse-til-alle-tilnærmingen ignorerer realiteten at enheter har forskjellige hardvareegenskaper, fra forskjellige chips (GPU, NPU, CPU, XPU) til variabelt nettverksbandbredde, og at brukerne har forskjellige atferdsmønster i forhold til applikasjonsbruk og ladevaner.

NeuroSplit overvåker kontinuerlig ulike enhetstelemetri – fra hardvareegenskaper til nåværende ressursutnyttelse, batteristatus og nettverksforhold. Vi tar også i betraktning brukeratferdsmønster, som hvor mange andre applikasjoner som kjører og typiske enhetsbruksmønster. Denne omfattende overvåkingen tillater NeuroSplit å dynamisk bestemme hvor mye inferensberegning som kan trygt kjøres på slutbrukerens enhet samtidig som det optimaliserer for utviklerens nøkkel-ytelsesindikatorer.

Når datapersonvern er av største betydning, sikrer NeuroSplit at rådata aldri forlater enheten, prosesserer følsomme opplysninger lokalt samtidig som det opprettholder optimal ytelse. Vår evne til å smarte splitte, kutte eller koble fra AI-modeller tillater oss å plassere 50-100 AI-stubmodeller i minnet på en slutbrukerens enhet i stedet for bare én kvantisert modell. I praksis betyr dette at brukerne kan kjøre betydelig flere AI-drevne applikasjoner samtidig, prosesserer følsomme data lokalt, sammenlignet med tradisjonelle statiske beregningsmetoder.

Hva er de viktigste fordelene med NeuroSplits adaptive inferens for AI-selskaper, særlig de som arbeider med eldre GPU-teknologi?

NeuroSplit leverer tre transformative fordeler for AI-selskaper. Først og fremst reduserer det dramatisk infrastrukturkostnadene gjennom to mekanismer: selskaper kan utnytte billigere, eldre GPUer effektivt, og vår unike evne til å plassere både fullstendige og stub-modeller på sky-GPUer muliggjør betydelig høyere GPU-utnyttelse. For eksempel kan en applikasjon som vanligvis krever flere NVIDIA A100 på $2,74 per time nå kjøres på enten en enkelt A100 eller flere V100 på bare 83 cent per time.

For det andre, forbedrer vi betydelig ytelsen ved å prosessere initial rådata direkte på brukerens enhet. Dette betyr at data som til slutt reiser til skyen er mye mindre i størrelse, noe som betydelig reduserer nettverksforsinkelse samtidig som det opprettholder nøyaktighet. Denne hybridtilnærmingen gir selskaper det beste av begge verdener – hastigheten til lokal prosessering med kraften til skydataprosessering.

Tredje, ved å håndtere følsomme initial dataprosessering på slutbrukerens enhet, hjelper vi selskaper å opprettholde sterke brukerpersonvernbeskyttelser uten å ofre ytelse. Dette er stadig viktigere ettersom personvernreguleringer blir strengere og brukerne blir mer personvernbevisste.

Hvordan reduserer Skymels løsning kostnadene for AI-inferens uten å kompromittere med modellkompleksitet eller nøyaktighet?

Først og fremst, ved å splitte enkelt AI-modeller, fordeler vi beregningen mellom brukerens enhet og skyen. Den første delen kjøres på slutbrukerens enhet, håndterer 5% til 100% av den totale beregningen avhengig av tilgjengelige enhetsressurser. Bare den gjenværende beregningen må prosesseres på sky-GPUer.

Dette splitting betyr at sky-GPUer håndterer en redusert beregningsbelastning – hvis en modell opprinnelig krevde en full A100-GPU, kan samme arbeidsbelastning nå bare kreve 30-40% av GPUens kapasitet. Dette tillater selskaper å bruke mer kostnadseffektive GPU-eksemplarer som V100.

Hva skiller Skymels hybridtilnærming (lokal + sky) fra andre AI-infrastrukturløsninger på markedet?

AI-landskapet er på et spennende vendepunkt. Mens Apples, Samsungs og Qualcomms demonstrerer kraften til hybrid-AI gjennom sine økosystemfunkjoner, forblir disse lukkede hager. Men AI bør ikke begrenses av hvilken slutbrukerens enhet noen tilfeldigvis har.

NeuroSplit er grunnleggende enhetsagnostisk, skyagnostisk og neuralnettverksagnostisk. Dette betyr at utviklere endelig kan levere konsistente AI-erfaringer uansett om brukerne er på en iPhone, Android-enhet eller bærbar PC – eller om de bruker AWS, Azure eller Google Cloud.

Tenker på hva dette betyr for utviklere. De kan bygge sin AI-applikasjon én gang og vite at den vil tilpasse seg intelligent over enhver enhet, sky og neuralnettverksarkitektur. Ingen flere versjoner for forskjellige plattformer eller kompromitterte funksjoner basert på enhetsmuligheter.

Hvordan kompletterer Orchestrator Agent NeuroSplit, og hva rolle spiller den i å transformere AI-distribusjonsstrategier?

Orchestrator Agent (OA) og NeuroSplit arbeider sammen for å skape et selvoptimerende AI-distribusjonssystem:

1. Utviklerne setter grensene:

  • Begrensninger: tillatte modeller, versjoner, skytjenere, soner, retningslinjer for overholdelse
  • Mål: mål for latens, kostnadsgrenser, ytelseskrav, personvernbehov

2. OA arbeider innenfor disse begrensningene for å nå målene:

  • Beslutter hvilke modeller/API-er som skal brukes for hver forespørsel
  • Tilpasser distribusjonsstrategier basert på virkelige ytelsesdata
  • Gjør avveininger for å optimalisere for spesifiserte mål
  • Kan konfigureres på nytt øyeblikkelig når behovene endres

3. NeuroSplit utfører OAs beslutninger:

  • Bruker sanntids enhetstelemetri for å optimalisere utførelse
  • Splitter prosessering mellom enhet og sky når det er gunstig
  • Sikrer at hver inferens kjøres optimalt gitt nåværende forhold

Det er som å ha et AI-system som autonomt optimaliserer seg innenfor dine definerte regler og mål, i stedet for å kreve manuell optimalisering for hver enkelt scenario.

Hvordan tror du Orchestrator Agent vil endre måten AI distribueres over industrier?

Det løser tre kritiske utfordringer som har hindret AI-tilpasning og innovasjon.

Først og fremst, tillater det selskaper å holde tritt med de seneste AI-fremgangene uten anstrengelse. Med Orchestrator Agent kan du øyeblikkelig utnytte de nyeste modellene og teknikker uten å måtte omgjøre infrastrukturen. Dette er en stor konkurransefordel i en verden hvor AI-innovasjon beveger seg i en rasende takt.

For det andre, muliggjør det dynamisk, per-forespørsel-optimalisering av AI-modellvalg. Orchestrator Agent kan intelligent blandet og matchet modeller fra det enorme økosystemet av valgmuligheter for å levere de beste mulige resultater for hver brukerinteraksjon. For eksempel kunne en kundeservice-AI bruke en spesialisert modell for tekniske spørsmål og en annen for fakturaspørsmål, og levere bedre resultater for hver type interaksjon.

Tredje, maksimerer det ytelse samtidig som det minimerer kostnadene. Agenten automatisk balanserer mellom å kjøre AI på brukerens enhet eller i skyen basert på hva som er mest fornuftig på det gitte øyeblikket. Når personvern er viktig, prosesserer den data lokalt. Når ekstra beregningskraft er nødvendig, utnytter den skyen. All dette skjer bak kulissene, og skaper en jevn opplevelse for brukerne samtidig som det optimaliserer ressurser for bedrifter.

Hva slags tilbakemelding har du mottatt så langt fra selskaper som deltar i den private betaen av Orchestrator Agent?

Tilbakemeldingen fra våre private beta-deltagere har vært fantastisk! Selskaper er begeistret for å oppdage at de endelig kan bryte fri fra infrastruktur-lås og proprietære modeller eller hostingtjenester. Evnen til å fremtidssikre enhver distribusjonsbeslutning har vært en game-changer, og har eliminert de fryktede månedene med ombygging når de skifter tilnærming.

Våre NeuroSplit-ytelsesresultater har vært intet mindre enn bemerkelsesverdige – vi gleder oss til å dele dataene offentlig snart. Det som er spesielt spennende er hvordan selve konseptet om adaptiv AI-distribusjon har fanget fantasien. Det faktum at AI selv deployer seg høres futuristisk ut og er ikke noe de forventet nå, så bare fra den teknologiske fremgangen blir folk begeistret over mulighetene og de nye markedene det kan skape i fremtiden.

Med de raske fremgangene i generativ AI, hva ser du som de neste store hindringene for AI-infrastruktur, og hvordan planlegger Skymel å løse dem?

Vi er på vei mot en fremtid som de fleste ennå ikke fullt ut har forstått: det vil ikke være én dominerende AI-modell, men milliarder av dem. Selv om vi skaper den mest powerfulle generelle AI-modellen tenkelig, vil vi likevel trenge personlige versjoner for hver enkelt person på jorden, hver tilpasset unike kontekster, preferanser og behov. Det er minst 8 milliarder modeller, basert på verdens befolkning.

Dette markerer en revolusjonær skifte fra dagens én-størrelse-til-alle-tilnærming. Fremtiden krever intelligent infrastruktur som kan håndtere milliarder av modeller. Hos Skymel bygger vi ikke bare løsninger for dagens distribusjonsutfordringer – vår teknologivei er allerede under bygging for hva som kommer neste.

Hvordan forestiller du deg at AI-infrastrukturen vil utvikle seg de neste fem årene, og hva rolle ser du for Skymel i denne utviklingen?

AI-infrastruktur-landskapet er på vei til å gjennomgå en grunnleggende endring. Mens dagens fokus er på å skalerer generelle store språkmodeller i skyen, vil de neste fem årene se AI bli dypt personlig og kontekst-bevisst. Dette er ikke bare om finjustering – det handler om AI som tilpasser seg spesifikke brukere, enheter og situasjoner i sanntid.

Dette skiftet skaper to store infrastruktur-utfordringer. Først og fremst blir den tradisjonelle tilnærmingen til å kjøre alt i sentraliserte datasentre utilgjengelig både teknisk og økonomisk. For det andre betyr den økende kompleksiteten til AI-applikasjoner at vi trenger infrastruktur som kan dynamisk optimalisere over flere modeller, enheter og beregningslokasjoner.

Hos Skymel bygger vi infrastruktur som spesifikt løser disse utfordringene. Vår teknologi muliggjør AI å kjøre hvor det gjør mest fornuft – enten på enheten hvor data genereres, i skyen hvor mer beregningskraft er tilgjengelig, eller intelligent delt mellom de to. Viktigere, den tilpasser disse beslutningene i sanntid basert på endrede forhold og krav.

I fremtiden vil suksessfulle AI-applikasjoner ikke defineres av modellens størrelse eller mengden beregningskraft de kan nå. De vil defineres av deres evne til å levere personlige, responsive erfaringer samtidig som de effektivt håndterer ressurser. Vårt mål er å gjøre dette nivået av intelligent optimalisering tilgjengelig for hver AI-applikasjon, uansett skala eller kompleksitet. Takket være evnen til å levere personlige, responsive erfaringer samtidig som de effektivt håndterer ressurser. Vårt mål er å gjøre dette nivået av intelligent optimalisering tilgjengelig for hver AI-applikasjon, uansett skala eller kompleksitet. Takk for det flotte intervjuet, lesere som ønsker å lære mer bør besøke Skymel.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.