Rozhovory
Jason Knight je spoluzakladatel a viceprezident pro strojové učení ve společnosti OctoAI – Interview Series

Jason Knight je spoluzakladatel a viceprezident pro strojové učení ve společnosti OctoAI, platforma, která nabízí kompletní sadu nástrojů pro vývojáře aplikací, aby mohli spouštět, ladit a škálovat své aplikace umělé inteligence v cloudu nebo na místních zařízeních.
OctoAI vznikla z University of Washington původními tvůrci Apache TVM, otevřené sady nástrojů pro přenositelnost a výkon strojového učení. TVM umožňuje modelům strojového učení běžet efektivně na libovolném hardwarovém backendu a stal se rychle klíčovou součástí architektury populárních spotřebitelských zařízení, jako je Amazon Alexa.
Můžete sdílet inspiraci za založením OctoAI a jádrem problémem, který jste se snažili vyřešit?
Umělá inteligence tradičně byla složitým oborem, přístupným pouze těm, kteří byli komfortní s matematikou a vysokovýkonným výpočtem, potřebným pro vytvoření něčeho s ní. Ale umělá inteligence odemyká ultimátní výpočetní rozhraní, to je text, hlas a obraz programovaný příklady a zpětnou vazbou, a přináší plnou sílu výpočtu všem na Zemi. Před umělou inteligencí mohli pouze programátoři dostat počítače, aby dělaly to, co chtěli, psaním arkánštinou programovacích jazyků.
OctoAI byla vytvořena, aby urychlila naši cestu k této realitě, aby více lidí mohlo využívat a těžit z umělé inteligence. A lidé, naopak, mohou využívat umělou inteligenci, aby vytvořili ještě více výhod, urychlením věd, medicíny, umění a dalšího.
Copak jste se naučili ze své zkušenosti v Intelu, a jak vás vaše předchozí role připravily na spoluzaložení a vedení vývoje v OctoAI?
Intel (INTC ) a umělá inteligence a biotechnologické startupy předtím mi daly perspektivu, aby vidět, jak těžká je umělá inteligence i pro nejsofistikovanější technologické společnosti, a přece, jak cenná může být pro ty, kteří se naučili, jak ji používat. A vidět, že mezera mezi těmi, kteří těží z umělé inteligence, a těmi, kteří ještě nejsou, je primárně otázka infrastruktury, výpočtu a nejlepších praktik – ne magie.
Co odlišuje OctoStack od ostatních řešení pro nasazení umělé inteligence dostupných na trhu dnes?
OctoStack je první kompletní technologická sada navržená speciálně pro nasazení generativních modelů umělé inteligence kdekoli. Nabízí kompletní platformu pro produkci, která poskytuje vysoce optimalizovanou inferenci, přizpůsobení modelů a správu aktiv v podnikovém měřítku.
OctoStack umožňuje organizacím dosáhnout autonomie umělé inteligence, běh jakýchkoli modelů ve svém preferovaném prostředí s plnou kontrolou nad daty, modely a hardwarovým vybavením. Také poskytuje nezřetelnou výkonnost a nákladovou efektivitu, s úsporami až 12x ve srovnání s jinými řešeními, jako je GPT-4.
Můžete vysvětlit výhody nasazení modelů umělé inteligence v soukromém prostředí pomocí OctoStack?
Modely dnes jsou všudypřítomné, ale sestavení správné infrastruktury pro běh těchto modelů a jejich použití s vašimi vlastními daty je místo, kde se začíná otáčet business-hodnoty. Používání těchto modelů na vašich nejcitlivějších datech a poté převádění toho na poznatky, lepší inženýrství promptů, RAG管道 a jemné ladění je místo, kde můžete získat nejvíce hodnoty z generativní umělé inteligence. Ale je to stále obtížné pro všechny, kromě nejsofistikovanějších společností, udělat to sami, což je místo, kde může OctoStack urychlit a přinést nejlepší praktiky dohromady na jednom místě pro vaše praktiky.
Nasazení modelů umělé inteligence v soukromém prostředí pomocí OctoStack nabízí několik výhod, včetně zvýšené bezpečnosti a kontroly nad daty a modely. Zákazníci mohou spouštět aplikace generativní umělé inteligence ve svých vlastních VPC nebo na místních zařízeních, zajišťují, že jejich data zůstávají zabezpečena a ve svém zvoleném prostředí. Tento přístup také poskytuje podnikům flexibilitu běhu jakýchkoli modelů, ať už otevřených, vlastních nebo proprietárních, a to při zachování nákladových úspor a zlepšení výkonnosti.
Jaké výzvy jste čelili při optimalizaci OctoStack pro podporu širokého spektra hardwaru, a jak byly tyto výzvy překonány?
Optimalizace OctoStack pro podporu širokého spektra hardwaru zahrnovala zajištění kompatibility a výkonu napříč různými zařízeními, jako jsou NVIDIA (NVDA ) a AMD GPU a AWS Inferentia. OctoAI překonala tyto výzvy využitím hluboké odbornosti v oblasti systémů umělé inteligence, vyvinuté prostřednictvím let výzkumu a vývoje, aby vytvořila platformu, která průběžně aktualizuje a podporuje další typy hardwaru, použití generativní umělé inteligence a nejlepší praktiky. To umožňuje OctoAI dodávat špičkovou výkonnost a nákladovou efektivitu.
Navíc, získání nejnovějších schopností v generativní umělé inteligenci, jako je multimodalita, volání funkcí, přísné dodržování schématu JSON, efektivní hostování jemného ladění a další, do rukou vašich interních vývojářů, urychlí váš start umělé inteligence.
OctoAI má bohatou historii využití Apache TVM. Jak tento framework ovlivnil schopnosti vaší platformy?
Vytvořili jsme Apache TVM, aby bylo snadné pro sofistikované vývojáře psát efektivní knihovny umělé inteligence pro GPU a akcelerátory více snadno. Učinili jsme to, protože získání nejlepších výkonů z hardwaru GPU a akcelerátorů bylo kritické pro inferenci umělé inteligence tehdy, stejně jako je tomu dnes.
Poté jsme využili stejnou mentalitu a odbornost pro celou technologickou sadu generativní umělé inteligence, aby dodat automatizaci pro širší sadu vývojářů.
Můžete diskutovat o významných zlepšeních výkonu, které OctoStack nabízí, jako je 10x zlepšení výkonu ve velkých nasazeních?
OctoStack nabízí významná zlepšení výkonu, včetně úspor až 12x ve srovnání s jinými modely, jako je GPT-4, bez obětování rychlosti nebo kvality. Také poskytuje 4x lepší využití GPU a 50% snížení provozních nákladů, umožňující organizacím spouštět velké nasazení efektivně a nákladově efektivně.
Můžete sdílet některé významné použití, kde OctoStack významně zlepšil nasazení umělé inteligence pro vaše klienty?
Jedním z významných použití je Apate.ai, globální služba, která bojuje proti telefonním podvodům pomocí generativní konverzační umělé inteligence. Apate.ai využila OctoStack, aby efektivně spustila sadu jazykových modelů napříč několika geografickými oblastmi, využívající flexibilitu, škálovatelnost a bezpečnost OctoStack. Toto nasazení umožnilo Apate.ai dodávat přizpůsobené modely podporující několik jazyků a regionálních dialektů, splňující jejich požadavky na výkon a bezpečnost.
Kromě toho, poskytujeme stovky jemných ladění pro našeho zákazníka OpenPipe. Pokud by museli spustit dedikované instance pro každé z nich, jejich zákaznické použití by bylo nemožné, protože rostou a vyvíjejí svá použití a průběžně přeškolují svá parametricky efektivní jemná ladění pro maximální kvalitu výstupu za nákladově efektivní ceny.
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit OctoAI.












