Intervjuer

Jason Knight är medgrundare och VP för ML på OctoAI – Intervjuserie

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Jason Knight är medgrundare och vice VD för maskinlärning på OctoAI, plattformen levererar en komplett stack för app-byggare att köra, justera och skala sina AI-applikationer i molnet eller på plats.

OctoAI spinns ut från University of Washington av de ursprungliga skaparna av Apache TVM, en öppen källkodsstack för ML-portabilitet och prestanda. TVM möjliggör att ML-modeller kan köras effektivt på alla hårdvarubackends och har snabbt blivit en viktig del av arkitekturen för populära konsumentenheter som Amazon Alexa.

Kan du dela inspirationen bakom att grunda OctoAI och det centrala problem du syftade till att lösa?

AI har traditionellt sett varit ett komplext område som endast varit tillgängligt för dem som var bekväma med matematiken och högpresterande beräkningar som krävs för att skapa något med det. Men AI låser upp de ultimata gränssnitten för datorer, det vill säga text, röst och bild programmerade med exempel och feedback, och bringar den fulla kraften av datorer till alla på jorden. Innan AI kunde endast programmerare få datorer att göra vad de ville genom att skriva arkaiska programmeringsspråkstexter.

OctoAI skapades för att påskynda vår väg till den verkligheten så att fler människor kan använda och dra nytta av AI. Och människor, i sin tur, kan använda AI för att skapa ännu fler fördelar genom att påskynda vetenskap, medicin, konst och mer.

Med tanke på din erfarenhet på Intel (INTC ), hur förberedde dina tidigare roller dig för att medgrundande och leda utvecklingen på OctoAI?

Intel och de AI-hårdvaru- och bioteknikstarter som föregick det gav mig perspektivet att se hur svårt AI är för även de mest sofistikerade teknikföretagen, och ändå hur värdefullt det kan vara för dem som har lyckats med att använda det. Och att se att gapet mellan de som drar nytta av AI jämfört med de som inte är det ännu är primärt en fråga om infrastruktur, beräkningar och bästa praxis – inte magi.

Vad skiljer OctoStack från andra AI-distributionslösningar som finns på marknaden idag?

OctoStack är den första kompletta tekniska stacken som är specifikt utformad för att serva generativa AI-modeller överallt. Den erbjuder en färdig produktionsplattform som tillhandahåller högt optimerad inferens, modellanpassning och tillgångshantering i företagsskala.

OctoStack tillåter organisationer att uppnå AI-självständighet genom att köra valfri modell i sin föredragna miljö med full kontroll över data, modeller och hårdvara. Den levererar också obesegrat prestanda och kostnadseffektivitet, med besparingar på upp till 12X jämfört med andra lösningar som GPT-4.

Kan du förklara fördelarna med att distribuera AI-modeller i en privat miljö med hjälp av OctoStack?

Modeller är idag allmänt tillgängliga, men att montera rätt infrastruktur för att köra dessa modeller och applicera dem med din egen data är där affärs-värdet börjar snurra. Att använda dessa modeller på din mest känsliga data och sedan omvandla dem till insikter, bättre promptteknik, RAG-pipelines och finjustering är där du kan få ut mest värde av generativ AI. Men det är fortfarande svårt för alla utom de mest sofistikerade företagen att göra detta på egen hand, vilket är där en färdig lösning som OctoStack kan påskynda och samla bästa praxis på ett ställe för dina praktiker.

Att distribuera AI-modeller i en privat miljö med hjälp av OctoStack erbjuder flera fördelar, inklusive förbättrad säkerhet och kontroll över data och modeller. Kunder kan köra generativa AI-applikationer inom sina egna VPC:er eller på plats, vilket säkerställer att deras data förblir säker och inom deras valda miljöer. Detta tillvägagångssätt ger också företag flexibiliteten att köra valfri modell, antingen öppen källkod, anpassad eller proprietär, samtidigt som de drar nytta av kostnadsreduceringar och prestandaförbättringar.

Vilka utmaningar mötte du när du optimerade OctoStack för att stödja en stor mängd hårdvara, och hur övervanns dessa utmaningar?

Att optimera OctoStack för att stödja en stor mängd hårdvara innebar att säkerställa kompatibilitet och prestanda över olika enheter, såsom NVIDIA (NVDA ) – och AMD-GPU:er och AWS Inferentia. OctoAI övervann dessa utmaningar genom att utnyttja sin djupa AI-systemexperthet, som utvecklats genom år av forskning och utveckling, för att skapa en plattform som kontinuerligt uppdaterar och stöder ytterligare hårdvarutyper, GenAI-användningsfall och bästa praxis. Detta möjliggör för OctoAI att leverera marknadsledande prestanda och kostnadseffektivitet.

Att få de senaste funktionerna i generativ AI, såsom multimodalitet, funktionsanrop, strikt JSON-schema, effektiv finjustering och mer, i händerna på dina interna utvecklare kommer att påskynda din AI-startpunkt.

OctoAI har en rik historia av att utnyttja Apache TVM. Hur har detta ramverk påverkat din plattforms förmågor?

Vi skapade Apache TVM för att göra det lätt för sofistikerade utvecklare att skriva effektiva AI-bibliotek för GPU:er och acceleratorer mer lätt. Vi gjorde detta eftersom att få ut mest prestanda från GPU- och acceleratorhårdvara var kritiskt för AI-inferens då liksom nu.

Vi har sedan dess utnyttjat samma mindset och expertis för hela Gen AI-servingsstacken för att leverera automatisering för en bredare uppsättning utvecklare.

Kan du diskutera några betydande prestandaförbättringar som OctoStack erbjuder, såsom den 10-faldiga prestandaförbättringen i storskaliga distributioner?

OctoStack erbjuder betydande prestandaförbättringar, inklusive upp till 12X besparingar jämfört med andra modeller som GPT-4 utan att offra hastighet eller kvalitet. Den erbjuder också 4X bättre GPU-användning och en 50-procentig minskning av driftskostnader, vilket möjliggör för organisationer att köra storskaliga distributioner effektivt och kostnadseffektivt.

Kan du dela några betydande användningsfall där OctoStack har förbättrat AI-distributionen för dina kunder?

Ett betydande användningsfall är Apate.ai, en global tjänst som bekämpar telefonbedrägeri med hjälp av generativ konversations-AI. Apate.ai utnyttjade OctoStack för att effektivt köra sin uppsättning språkmodeller över flera geografiska områden, och drog nytta av OctoStacks flexibilitet, skala och säkerhet. Denna distribution möjliggjorde för Apate.ai att leverera anpassade modeller som stöder flera språk och regionala dialekt, och mötte deras prestanda- och säkerhetskrävande krav.

Dessutom tjänar vi hundratals finjusteringar för vår kund OpenPipe. Om de skulle starta dedikerade instanser för var och en av dessa, skulle deras kunders användningsfall vara omöjliga när de växer och utvecklar sina användningsfall och kontinuerligt omtränar sina parameter-effektiva finjusteringar för maximal utdatakvalitet till kostnadseffektiva priser.

Tack för den underbara intervjun, läsare som vill lära sig mer kan besöka OctoAI.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.