Intervjuer

Jason Knight er medstifter og VP for ML i OctoAI – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Jason Knight er medstifter og visepresident for maskinlæring i OctoAI, plattformen leverer en komplett stak for app-utviklere å kjøre, finjustere og skalerer sine AI-applikasjoner i skyen eller på lokale maskiner.

OctoAI ble spunnet ut fra University of Washington av de opprinnelige skaperne av Apache TVM, en åpen kildekode-stak for ML-portabilitet og ytelse. TVM gjør det mulig for ML-modeller å kjøre effektivt på alle hårdvarubakender, og har raskt blitt en viktig del av arkitekturen for populære forbrukerenheter som Amazon Alexa.

Kan du dele inspirasjonen bak å grunnlegge OctoAI og det kjerneproblemet du ønsket å løse?

AI har tradisjonelt vært et komplekst felt som bare er tilgjengelig for de som er komfortable med matematikken og høy-ytelsesregningen som kreves for å lage noe med det. Men AI låser opp de ultimate datagrensesnittene, det vil si tekst, tale og bilde programmerbart med eksempler og tilbakemeldinger, og bringer full kraft av datamaskinen til alle på jorden. Før AI var det bare programmere som kunne få datamaskiner til å gjøre hva de ville ved å skrive arkaiske programmeringsspråkstekster.

OctoAI ble skapt for å akselerere vår vei til denne virkeligheten, slik at flere mennesker kan bruke og dra nytte av AI. Og mennesker, igjen, kan bruke AI til å skape enda flere fordeler ved å akselerere vitenskap, medisin, kunst og mer.

Reflekterer over din erfaring i Intel (INTC ), hvordan forberedte dine tidligere roller deg for å grunnlegge og lede utviklingen i OctoAI?

Intel og AI-hardware- og bioteknologiselskapene før det ga meg perspektivet til å se hvor hardt AI er for selv de mest sofistikerte teknologiselskapene, og likevel hvor verdifullt det kan være for de som har figurd ut hvordan de kan bruke det. Og å se at gapet mellom de som drar nytte av AI sammenlignet med de som ikke ennå er primært et infrastruktur-, regnings- og beste praksis-problem – ikke magi.

Hva skiller OctoStack fra andre AI-utviklingsløsninger som er tilgjengelige i markedet i dag?

OctoStack er den første komplette teknologistaken som er designet spesifikt for å betjene generative AI-modeller overalt. Den tilbyr en turnkey-produksjonsplattform som gir høyt optimeret inferens, modelltilpasning og ressursforvaltning i en bedriftsskala.

OctoStack lar organisasjoner oppnå AI-ujavhengighet ved å kjøre noen modell i deres foretrukne miljø med full kontroll over data, modeller og maskinvare. Den leverer også ubetinget ytelse og kostnadseffektivitet, med besparelser på opptil 12X sammenlignet med andre løsninger som GPT-4.

Kan du forklare fordelen med å distribuere AI-modeller i en privat miljø ved hjelp av OctoStack?

Modellene i dag er allment tilgjengelige, men å samle riktig infrastruktur for å kjøre disse modellene og bruke dem med din egen data er der hvor forretnings-verdi-hjulet virkelig begynner å spinne. Ved å bruke disse modellene på din mest sensitive data, og deretter omdanne det til innsikt, bedre prompt-engineering, RAG-pipelines og finjustering er der hvor du kan få mest verdi ut av generativ AI. Men det er fortsatt vanskelig for alle bortsett fra de mest sofistikerte selskapene å gjøre dette alene, som er der hvor en turnkey-løsning som OctoStack kan akselerere deg og bringe beste praksis sammen på ett sted for dine praktikere.

Distribusjon av AI-modeller i en privat miljø ved hjelp av OctoStack tilbyr flere fordeler, inkludert forbedret sikkerhet og kontroll over data og modeller. Kunder kan kjøre generative AI-applikasjoner innenfor deres egne VPC-er eller på lokale maskiner, og sikre at deres data forblir sikker og innenfor deres valgte miljøer. Dette tilnærmingen gir også bedrifter mulighet til å kjøre noen modell, enten det er åpen kildekode, tilpasset eller proprietær, mens de nyter godt av kostnadsreduksjoner og ytelsesforbedringer.

Hva utfordringer møtte du i å optimalisere OctoStack for å støtte en rekke ulike maskinvare, og hvordan ble disse utfordringene overvunnet?

Optimalisering av OctoStack for å støtte en rekke ulike maskinvare innebar å sikre kompatibilitet og ytelse over ulike enheter, som NVIDIA (NVDA ) og AMD-GPU-er og AWS Inferentia. OctoAI overvant disse utfordringene ved å utnytte sin dype AI-system-ekspertise, utviklet gjennom år med forskning og utvikling, for å skape en plattform som kontinuerlig oppdaterer og støtter tilleggs-hårdvaretyper, GenAI-brukstilfeller og beste praksis. Dette gjør det mulig for OctoAI å levere markedsledende ytelse og kostnadseffektivitet.

I tillegg til å få de siste kapasitetene i generativ AI, som multi-modality, funksjonskall, streng JSON-skjema-følging, effektiv finjustering og mer, i hendene på dine interne utviklere vil akselerere din AI-takoff-punkt.

OctoAI har en rik historie med å utnytte Apache TVM. Hvordan har denne rammen påvirket plattformens kapasiteter?

Vi skapte Apache TVM for å gjøre det enkelt for sofistikerte utviklere å skrive effektive AI-biblioteker for GPU-er og akseleratorer mer enkelt. Vi gjorde dette fordi å få mest ytelse fra GPU- og akselerator-hårdvaruen var kritisk for AI-inferens da som det er nå.

Vi har siden utnyttet samme mindset og ekspertise for hele Gen AI-serving-staken for å levere automatisering for en bredere sett av utviklere.

Kan du diskutere noen betydelige ytelsesforbedringer som OctoStack tilbyr, som for eksempel 10x ytelsesforbedring i stor-skala-utviklinger?

OctoStack tilbyr betydelige ytelsesforbedringer, inkludert opptil 12X besparelser sammenlignet med andre modeller som GPT-4 uten å ofre hastighet eller kvalitet. Den tilbyr også 4X bedre GPU-utnyttelse og en 50 prosent-reduksjon i driftskostnader, som gjør det mulig for organisasjoner å kjøre stor-skala-utviklinger effektivt og kostnadseffektivt.

Kan du dele noen bemerkelsesverdige brukstilfeller hvor OctoStack har betydelig forbedret AI-utvikling for dine kunder?

En bemerkelsesverdig brukstilfelle er Apate.ai, en global tjeneste som bekjemper telefon-svindel ved hjelp av generativ konversasjons-AI. Apate.ai utnyttet OctoStack for å effektivt kjøre deres samling av språkmodeller over flere geografier, og nytt godt av OctoStacks fleksibilitet, skala og sikkerhet. Denne utviklingen gjorde det mulig for Apate.ai å levere tilpassede modeller som støtter flere språk og regionale dialekter, og møtte deres ytelses- og sikkerhets-sensitive krav.

I tillegg tjener vi hundrevis av finjusteringer for vår kunde OpenPipe. Hvis de skulle spinne opp dedikerte instanser for hver av disse, ville deres kunders brukstilfeller være uegnet når de vokser og utvikler deres brukstilfeller og kontinuerlig om-trener deres parameter-efektive finjusteringer for maksimalt utgangskvalitet til kostnadseffektive priser.

Takk for det flotte intervjuet, lesere som ønsker å lære mer kan besøke OctoAI.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.