Interviews
Jason Knight er medstifter og VP of ML hos OctoAI – Interview Serie

Jason Knight er medstifter og vicepræsident for Machine Learning hos OctoAI, platformen leverer en komplet stack til app-udviklere til at køre, tune og skala deres AI-applikationer i skyen eller på lokale servere.
OctoAI blev udskilt fra University of Washington af de oprindelige skabere af Apache TVM, en open source-stack til ML-portabilitet og ydeevne. TVM giver mulighed for, at ML-modeller kan køre effektivt på enhver hardware-backend, og er hurtigt blevet en nøglekomponent i arkitekturen af populære forbrugerenheder som Amazon Alexa.
Kan du dele inspirationen bag grundlæggelsen af OctoAI og det centrale problem, du havde til hensigt at løse?
AI har traditionelt været et komplekst felt, der kun er tilgængeligt for dem, der er komfortable med matematikken og høj-ydeevne-computing, der kræves for at lave noget med det. Men AI låser den ultimative computing-grænseflade op, nemlig tekst, tale og billedprogrammering programmeret af eksempler og feedback, og bringer den fulde kraft af computing til alle på jorden. Før AI kunne kun programmører få computere til at gøre, hvad de ville, ved at skrive arkane programmeringssprogstekster.
OctoAI blev skabt for at accelerere vores vej til denne virkelighed, så mere mennesker kan bruge og nyde godt af AI. Og mennesker kan igen bruge AI til at skabe endnu flere fordele ved at accelerere videnskaben, medicinen, kunsten og mere.
Hvad lærte du af din tid hos Intel (INTC ), og hvordan forberedte dine tidligere roller dig på at være medstifter og leder af udviklingen hos OctoAI?
Intel og de AI-hardware- og biotech-startups før det gav mig perspektivet til at se, hvor svært AI er, selv for de mest avancerede teknologivirksomheder, og hvor værdifuldt det kan være for dem, der har figureret ud, hvordan de kan bruge det. Og at se, at gapet mellem dem, der nyder godt af AI, og dem, der ikke endnu er, primært er et spørgsmål om infrastruktur, compute og bedste praksis – ikke magi.
Hvad adskiller OctoStack fra andre AI-deploy-løsninger, der er tilgængelige på markedet i dag?
OctoStack er branchens første komplette teknologi-stack, der er designet specifikt til at betjene generative AI-modeller overalt. Det tilbyder en turnkey-produktionsplatform, der giver højtydende inferens, modeltilpasning og asset-management i enterprise-skala.
OctoStack giver organisationer mulighed for at opnå AI-autonomi ved at køre enhver model i deres foretrukne miljø med fuld kontrol over data, modeller og hardware. Det giver også en ubesværet ydeevne og omkostningseffektivitet, med besparelser op til 12X sammenlignet med andre løsninger som GPT-4.
Kan du forklare fordelene ved at deploye AI-modeller i en privat miljø ved hjælp af OctoStack?
Modeller i dag er almindelige, men at samle den rigtige infrastruktur til at køre disse modeller og anvende dem med jeres eget data er, hvor business-værdien virkelig begynder at spinne. Ved at bruge disse modeller på jeres mest følsomme data og derefter omdanne det til indsigt, bedre prompt-engineering, RAG-pipelines og finjustering er, hvor du kan få mest værdi ud af generativ AI. Men det er stadig svært for alle andre end de mest avancerede virksomheder at gøre dette alene, hvilket er, hvor en turnkey-løsning som OctoStack kan accelerere og bringe bedste praksis sammen på ét sted for jeres praktikere.
At deploye AI-modeller i en privat miljø ved hjælp af OctoStack giver flere fordele, herunder forbedret sikkerhed og kontrol over data og modeller. Kunder kan køre generative AI-applikationer inden for deres egne VPC’er eller på lokale servere, hvilket sikrer, at deres data forbliver sikre og inden for deres valgte miljøer. Dette giver også virksomhederne mulighed for at køre enhver model, enten det er open-source, brugerdefineret eller proprietær, samtidig med at de nyder godt af omkostningsreduktioner og ydeevneforbedringer.
Hvad var udfordringerne, du mødte, da du optimerede OctoStack til at understøtte en bred vifte af hardware, og hvordan overvandede du disse udfordringer?
At optimere OctoStack til at understøtte en bred vifte af hardware indebærer at sikre kompatibilitet og ydeevne på tværs af forskellige enheder, såsom NVIDIA (NVDA ) – og AMD-GPU’er og AWS Inferentia. OctoAI overvandt disse udfordringer ved at udnytte deres dybe AI-systems-ekspertise, der er udviklet gennem års forskning og udvikling, til at skabe en platform, der kontinuerligt opdaterer og understøtter yderligere hardware-typer, GenAI-brugstilfælde og bedste praksis. Dette giver OctoAI mulighed for at levere markedsledende ydeevne og omkostningseffektivitet.
Desuden giver det at få de seneste funktioner i generativ AI, såsom multi-modalitet, funktion-kald, streng JSON-skema-overholdelse, effektiv finjustering-vært og mere, i hænderne på dine interne udviklere, mulighed for at accelerere jeres AI-takeoff-punkt.
OctoAI har en rig historie med at udnytte Apache TVM. Hvordan har denne ramme påvirket jeres platforms kapaciteter?
Vi skabte Apache TVM for at gøre det let for avancerede udviklere at skrive effektive AI-biblioteker til GPU’er og acceleratorer mere let. Vi gjorde dette, fordi at få den bedste ydeevne fra GPU- og accelerator-hardware var kritisk for AI-inferens dengang, ligesom det er nu.
Vi har herefter udnyttet samme mindset og ekspertise til hele Gen AI-serving-stack for at levere automation til en bredere gruppe af udviklere.
Kan du diskutere nogle betydelige ydeevne-forbedringer, som OctoStack tilbyder, såsom den 10-gange ydeevne-forbedring i store skala-deployments?
OctoStack tilbyder betydelige ydeevne-forbedringer, herunder op til 12X besparelser sammenlignet med andre modeller som GPT-4 uden at ofre hastighed eller kvalitet. Det giver også 4X bedre GPU-udnyttelse og en 50-procent reduktion i driftsomkostninger, hvilket giver virksomheder mulighed for at køre store skala-deployments effektivt og omkostningseffektivt.
Kan du dele nogle bemærkelsesværdige brugstilfælde, hvor OctoStack har forbedret AI-deployment betydeligt for dine kunder?
Et bemærkelsesværdigt brugstilfælde er Apate.ai, en global tjeneste, der bekæmper telefon-svindel ved hjælp af generativ konversations-AI. Apate.ai udnyttede OctoStack til at effektivt køre deres samling af sprogmodeller på tværs af multiple geografier, og nydt godt af OctoStacks fleksibilitet, skala og sikkerhed. Denne deployment gav Apate.ai mulighed for at levere brugerdefinerede modeller, der understøtter multiple sprog og regionale dialekter, og opfyldt deres ydeevne- og sikkerhedsfølsomme krav.
Desuden betjener vi hundredvis af finjusteringer for vores kunde OpenPipe. Hvis de skulle spinde op dedikeret instanser for hver af disse, ville deres kunders brugstilfælde være ufeasible, da de vokser og udvikler deres brugstilfælde og kontinuerligt gen-træner deres parameter-effektive finjusteringer for maksimalt output-kvalitet til omkostningseffektive priser.
Tak for det store interview, læsere, der ønsker at lære mere, skal besøge OctoAI.












