Rozhovory
Saurabh Vij, CEO & Co-Founder of MonsterAPI – Rozhovorová série

Saurabh Vij je CEO a spoluzakladatel MonsterAPI. Předtím pracoval jako fyzik částic v CERN a rozpoznal potenciál decentralizovaného výpočetního zpracování z projektů, jako je LHC@home.
MonsterAPI využívá levnější komoditní GPU z krypto-mining farem až po menší nečinné datové centrum, aby poskytoval škálovatelnou a dostupnou GPU infrastrukturu pro strojové učení, což umožňuje vývojářům přístup, jemné ladění a nasazení modelů AI při výrazně nižších nákladech bez nutnosti psát jediný řádek kódu.
Před MonsterAPI vedl dvě startupy, včetně jednoho, který vyvinul nositelné bezpečnostní zařízení pro ženy v Indii ve spolupráci s indickou vládou a IIT Delhi.
Můžete sdílet příběh vzniku MonsterGPT?
Náš cíl vždy byl “pomoci softwarovým vývojářům jemně ladit a nasadit modely AI rychleji a nejjednodušším způsobem.” Rozpoznali jsme, že existují多 komplexní výzvy, kterým vývojáři čelí, když chtějí jemně ladit a nasadit model AI.
Od řešení kódu až po nastavení kontejnerů Docker na GPU a škálování na vyžádání
A tempo, jakým se ekosystém pohybuje, pouze jemné ladění nestačí. Musí být provedeno správným způsobem: vyhnout se podladění, přeladění, optimalizaci hyperparametrů, začlenění nejnovějších metod, jako je LORA a Q-LORA, pro rychlejší a ekonomičtější jemné ladění. Jakmile je model jemně laděn, musí být nasazen efektivně.
To nás vedlo k závěru, že nabízet pouze nástroj pro malou část potrubí nestačí. Vývojář potřebuje celý optimalizovaný potrubí spojený s skvělým rozhraním, se kterým je familiarizován. Od jemného ladění až po vyhodnocení a konečnou instalaci svých modelů.
Zeptal jsem se sám sebe: Jako bývalý fyzik částic, chápu hluboký dopad, který může mít AI na vědeckou práci, ale nevím, kde začít. Mám inovativní nápady, ale chybí mi čas se naučit všechny dovednosti a nuance strojového učení a infrastruktury.
Co kdybych mohl jednoduše mluvit s AI, poskytnout své požadavky a nechat ho postavit celý potrubí pro mě, dodávat požadovaný API koncový bod?
To vedlo k myšlence chatovacího systému, který pomůže vývojářům jemně ladit a nasadit bez námahy.
MonsterGPT je náš první krok na této cestě.
Existují miliony softwarových vývojářů, inovátorů a vědců, jako jsme my, kteří by mohli využít tento přístup k budování více doménově specifických modelů pro své projekty.
Můžete vysvětlit základní technologii za nasazením agenta Monster API’s GPT?
MonsterGPT využívá pokročilé technologie pro efektivní nasazení a jemné ladění open source Large Language Models (LLM) jako Phi3 od Microsoftu a Llama 3 od Meta.
- RAG s kontextovou konfigurací: Automaticky připravuje konfigurace s pravými hyperparametry pro jemné ladění LLM nebo nasazení modelů pomocí škálovatelných REST API z MonsterAPI.
- LoRA (Low-Rank Adaptation): Umožňuje efektivní jemné ladění aktualizací pouze podmnožiny parametrů, snižuje výpočetní režii a paměťové požadavky.
- Techniky kvantizace: Využívá GPT-Q a AWQ k optimalizaci výkonu modelu snížením přesnosti, což snižuje paměťový otisk a urychluje inference bez významné ztráty přesnosti.
- vLLM Engine: Poskytuje vysoký výkon LLM se službami, jako je kontinuální dávkování, optimalizované CUDA jádra a paralelní dekódovací algoritmy pro efektivní velkoobjemovou inferenci.
- Decentralizované GPU pro škálovatelnost a dostupnost: Naše úkoly jemného ladění a nasazení běží na síti low-cost GPU z více dodavatelů z menších datových center až po vznikající GPU cloudy, jako je coreweave, poskytující nižší náklady, vysokou flexibilitu a dostupnost GPU pro zajištění škálovatelného a efektivní zpracování.
Zkontrolujte nejnovější blog pro nasazení Llama 3 pomocí MonsterGPT:
Jak streamuje proces jemného ladění a nasazení?
MonsterGPT poskytuje chatovací rozhraní s možností porozumět instrukcím v přirozeném jazyce pro spuštění, sledování a správu kompletních úloh jemného ladění a nasazení. Tato schopnost abstrahuje mnoho složitých kroků, jako jsou:
- Vytvoření datové pipeline
- Určení správné GPU infrastruktury pro úlohu
- Konfigurace vhodných hyperparametrů
- Nastavení ML prostředí se slučitelnými rámci a knihovnami
- Implementace skriptů pro jemné ladění LoRA/QLoRA s kvantizačními strategiemi.
- Ladění problémů, jako je nedostatek paměti a chyby kódu.
- Navržení a implementace multi-uzlového auto-škálování s vysokým výkonem službami, jako je vLLM pro nasazení LLM.
Jaký druh uživatelského rozhraní a příkazů mohou vývojáři očekávat při interakci s chatovacím rozhraním Monster API?
Uživatelské rozhraní je jednoduché chatovací rozhraní, ve kterém uživatelé mohou pověřit agenta jemně ladit LLM pro konkrétní úkoly, jako je shrnutí, dokončení chatu, generování kódu, psaní blogů atd. a poté, co je jemně laděn, GPT může být dále instruován k nasazení LLM a dotazování nasazeného modelu z GPT rozhraní samotného. Některé příklady příkazů zahrnují:
- Jemné ladění LLM pro generování kódu na X datasetu
- Chci model jemně ladit pro psaní blogů
- Dejte mi API koncový bod pro Llama 3 model.
- Nasazení malého modelu pro použití případu psaní blogů
To je extrémně užitečné, protože nalezení správného modelu pro váš projekt může často být časově náročným úkolem. S novými modely, které vznikají denně, může to vést k mnoha zmatkům.
Jak se řešení Monster API liší v uživatelské přívětivosti a efektivitě ve srovnání s tradičními metodami nasazení modelů AI?
Rozhodnutí Monster API významně zlepšuje uživatelskou přívětivost a efektivitu ve srovnání s tradičními metodami nasazení modelů AI.
Pro uživatelskou přívětivost:
- Automatizovaná konfigurace: Tradiční metody často vyžadují rozsáhlé manuální nastavení hyperparametrů a konfigurací, které mohou být chybové a časově náročné. MonsterAPI automatizuje tento proces pomocí RAG s kontextem, což zjednodušuje nastavení a snižuje pravděpodobnost chyb.
- Škálovatelné REST API: MonsterAPI poskytuje intuitivní REST API pro nasazení a jemné ladění modelů, což z něj činí přístupný i pro uživatele s omezenými znalostmi strojového učení. Tradiční metody často vyžadují hluboké technické znalosti a komplexní kódování pro nasazení.
- Jednotná platforma: Integruje celý pracovní postup, od jemného ladění až po nasazení, do jedné platformy. Tradiční přístupy mohou zahrnovat nesourodé nástroje a platformy, což vede k neefektivitě a problémům s integrací.
Pro efektivitu:
MonsterAPI nabízí streamovaný potrubí pro LoRA jemné ladění s vestavěnou kvantizací pro efektivní využití paměti a vLLM motor pro LLM službu pro dosažení vysokého výkonu s kontinuálním dávkováním a optimalizovanými CUDA jádry, na vrcholu nákladově efektivní, škálovatelné a vysoce dostupné decentralizované GPU cloudy se zjednodušeným monitorováním a protokolováním.
Celé toto potrubí zlepšuje produktivitu vývojářů tím, že umožňuje vytvářet produkční aplikace s vlastními LLM, zatímco snižuje potřebu komplexních technických dovedností.
Můžete poskytnout příklady použití případů, ve kterých Monster API významně snížil čas a zdroje potřebné pro nasazení modelu?
Společnost IT poradenství potřebovala jemně ladit a nasadit model Llama 3, aby splnila obchodní potřeby svých klientů. Bez MonsterAPI by potřebovala tým 2-3 MLOps inženýrů s hlubokým porozuměním hyperparametrického ladění, aby zlepšili kvalitu modelu na poskytovaných datech, a poté hostit jemně laděný model jako škálovatelný REST API koncový bod pomocí auto-škálování a orchestrace, pravděpodobně na Kubernetes. Kromě toho chtěli využít rámce, jako je LoRA pro jemné ladění a vLLM pro službu modelu, aby zlepšili ekonomiku služby modelu, zatímco snižovali spotřebu paměti. To může být komplexní výzva pro mnoho vývojářů a může trvat týdny nebo dokonce měsíce, než se dosáhne produkční verze. S MonsterAPI mohli experimentovat s několika běhy jemného ladění během dne a hostit jemně laděný model s nejlepšími vyhodnocenými skóre během několika hodin, bez nutnosti několika inženýrů s hlubokými MLOps znalostmi.
Jakým způsobem přístup Monster API demokratizuje přístup k generativním modelům AI pro menší vývojáře a startupy?
Malí vývojáři a startupy často bojují s produkcí a použitím vysoce kvalitních modelů AI kvůli nedostatku kapitálu a technických dovedností. Naše řešení je posilují tím, že snižují náklady, zjednodušují procesy a poskytují robustní nástroje bez kódu/low-kódu pro implementaci produkčních AI potrubí.
Pomocí naší decentralizované GPU cloudy nabízíme dostupné a škálovatelné GPU zdroje, což významně snižuje nákladovou bariéru pro nasazení vysoce výkonných modelů. Automatizovaná konfigurace a hyperparametrické ladění zjednodušují proces, eliminují potřebu hlubokých technických znalostí.
Naše uživatelsky přívětivá REST API a integrovaný pracovní postup kombinují jemné ladění a nasazení do jednoho, koherentního procesu, což činí pokročilé AI technologie dostupné i pro ty, kteří mají omezené zkušenosti. Kromě toho použití efektivní LoRA jemného ladění a kvantizačních technik, jako je GPT-Q a AWQ, zajišťuje optimální výkon na méně nákladném hardwaru, což dále snižuje vstupní náklady.
Tento přístup umožňuje menším vývojářům a startupům implementovat a spravovat pokročilé generativní modely AI efektivně a účinně.
Co vidíte jako další hlavní pokrok nebo funkci, kterou Monster API přinese komunitě AI vývojářů?
Pracujeme na několika inovativních produktech, aby dále rozvinuli naši tezi: Pomoci vývojářům přizpůsobit a nasadit modely rychleji, jednodušeji a ekonomičtěji.
Okamžitá další věc je plnohodnotný MLOps AI asistent, který provádí výzkum nových optimalizačních strategií pro LLMOps a integruje je do stávajících pracovních postupů, aby snížil úsilí vývojářů při budování nových a lepších kvalitních modelů, zatímco také umožňuje kompletní přizpůsobení a nasazení produkčních LLM potrubí.
Představte si, že potřebujete generovat 1 milion obrázků za minutu pro váš případ použití. To může být extrémně nákladné. Tradičně byste použili model Stable Diffusion a strávili hodiny hledáním a testováním optimalizačních rámců, jako je TensorRT, aby zlepšili propustnost bez kompromisů kvality a latence výstupu.
Ale s MLOps agentem MonsterAPI nebudete muset plýtvat všemi těmito zdroji. Agent najde nejlepší rámec pro vaše požadavky, využije optimalizací, jako je TensorRT, přizpůsobených vašemu konkrétnímu použití.
Jak Monster API plánuje pokračovat v podpoře a integraci nových open-source modelů, jakmile se objeví?
Třemi hlavními způsoby:
- Přinést přístup k nejnovějším open-source modelům
- Poskytnout nejjednodušší rozhraní pro jemné ladění a nasazení
- Optimalizovat celý stack pro rychlost a náklady s nejnovějšími a nejmocnějšími rámci a knihovnami
Naše mise je pomoci vývojářům všech úrovní adoptovat Gen AI rychleji, snižovat jejich čas od myšlenky po dokončený a škálovatelný API koncový bod.
Budeme pokračovat v našich úsilích, aby poskytli přístup k nejnovějším a nejmocnějším rámcům a knihovnám, integrovaným do bezproblémového pracovního postupu pro implementaci koncového LLMOps. Jsme odhodláni snižovat složitost pro vývojáře našimi nástroji bez kódu, čímž zvyšujeme jejich produktivitu při budování a nasazování modelů AI.
Chceme-li dosáhnout tohoto cíle, budeme nadále podporovat a integrovat nové open-source modely, optimalizační rámce a knihovny monitorováním pokroku v AI komunitě. Udržujeme škálovatelnou decentralizovanou GPU cloud a aktivně se zapojujeme s vývojáři pro raný přístup a zpětnou vazbu. Díky automatizovaným potrubím pro bezproblémovou integraci, vylepšením flexibilních API a strategickými partnerstvími s AI výzkumnými organizacemi zajišťujeme, aby naše platforma zůstala špičková.
Kromě toho poskytujeme komplexní dokumentaci a robustní technickou podporu, aby vývojáři mohli rychle adoptovat a využívat nejnovější modely. MonsterAPI udržuje vývojáře v čele generativní AI technologie, umožňující jim inovovat a prosperovat.
Jaké jsou dlouhodobé cíle Monster API z hlediska technologického rozvoje a dosahu trhu?
Dlouhodobě chceme pomoci 30 milionům softwarových inženýrů stát se MLOps vývojáři s pomocí našeho MLOps agenta a všech nástrojů, které stavíme.
To bude vyžadovat, abychom postavili nejen plnohodnotného agenta, ale také mnoho základních proprietárních technologií kolem optimalizačních rámců, metod kontejnerizace a orchestrace.
Věříme, že kombinace skvělých, jednoduchých rozhraní, 10x více propustnosti a low-cost decentralizovaných GPU má potenciál transformovat produktivitu vývojáře a tím urychlit přijetí GenAI.
Všechny naše výzkumy a úsilí směřují tímto směrem.
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit MonsterAPI.












