Interviews
Saurabh Vij, CEO & Co-Founder of MonsterAPI – Interview Serie

Saurabh Vij er CEO og medstifter af MonsterAPI. Han arbejdede tidligere som partikelfysiker på CERN og erkendte potentialet for decentraliseret beregning fra projekter som LHC@home.
MonsterAPI udnytter lavere omkostninger ved commodity-GPU’er fra kryptovaluta-minedrift til mindre inaktive datacentre for at levere skalerbar, billig GPU-infrastruktur til maskinlæring, så udviklere kan få adgang til, finjustere og implementere AI-modeller til betydeligt reducerede omkostninger uden at skrive en enkelt linje kode.
Før MonsterAPI, drev han to startups, herunder en, der udviklede en bærbart sikkerhedsenhed til kvinder i Indien i samarbejde med den indiske regering og IIT Delhi.
Kan du dele historien bag MonsterGPT?
Vores mission har altid været “at hjælpe softwareudviklere med at finjustere og implementere AI-modeller hurtigere og på den nemmeste måde mulig.” Vi indså, at de står over for multiple komplekse udfordringer, når de vil finjustere og implementere en AI-model.
Fra at håndtere kode til at konfigurere Docker-containere på GPU’er og skalerer dem på krav
Og det tempo, hvormed økosystemet bevæger sig, er blot finjustering ikke nok. Det skal gøres på den rigtige måde: Undgå underfitting, overfitting, hyperparameteroptimering, integration af seneste metoder som LORA og Q-LORA til at udføre hurtigere og mere økonomisk finjustering. Når først finjusteret, skal modellen implementeres effektivt.
Det gjorde os klar over, at blot at tilbyde et værktøj til en lille del af pipelineen ikke er nok. En udvikler har brug for hele den optimerede pipeline kombineret med et godt interface, de er fortrolige med. Fra finjustering til evaluering og endelig implementering af deres modeller.
Jeg spurgte mig selv: Som en tidligere partikelfysiker, forstår jeg den dybe indvirkning, AI kan have på videnskabeligt arbejde, men jeg ved ikke, hvor jeg skal starte. Jeg har innovative ideer, men mangler tiden til at lære alle færdigheder og nuancer af maskinlæring og infrastruktur.
Hvis jeg kunne tale med en AI, give mine krav og få den til at bygge hele pipelineen for mig, leverer den nødvendige API-endpoint?
Dette førte til idéen om et chat-baseret system til at hjælpe udviklere med at finjustere og implementere uden besvær.
MonsterGPT er vores første skridt på denne rejse.
Der er millioner af softwareudviklere, innovatører og videnskabsmænd som os, der kan udnytte denne tilgang til at bygge mere domænespecifikke modeller til deres projekter.
Kan du forklare den underliggende teknologi bag Monster API’s GPT-baserede implementeringsagent?
MonsterGPT udnytter avancerede teknologier til effektivt at implementere og finjustere open source Large Language Models (LLM’er) som Phi3 fra Microsoft og Llama 3 fra Meta.
- RAG med kontekstkonfiguration: Automatisk forbereder konfigurationer med de rigtige hyperparametre for finjustering af LLM’er eller implementering af modeller ved hjælp af skalerbare REST-API’er fra MonsterAPI.
- LoRA (Low-Rank Adaptation): Muliggør effektiv finjustering ved at opdatere kun en undermængde af parametre, reducerer beregningsomkostninger og hukommelseskrav.
- Kvantificeringsteknikker: Udnytter GPT-Q og AWQ til at optimere modelpræstation ved at reducere præcision, hvilket reducerer hukommelsesaftryk og accelererer inferens uden betydelig tab af nøjagtighed.
- vLLM-motor: Tilbyder høj-gennemstrømning LLM-servering med funktioner som kontinuerlig batchning, optimerede CUDA-kerner og parallele afkodningsalgoritmer til effektiv storstilet inferens.
- Decentraliserede GPU’er til skala og billighed: Vores finjusterings- og implementeringsarbejdsbelastninger kører på et netværk af lavprisede GPU’er fra multiple leverandører fra mindre datacentre til fremvoksende GPU-skyer som coreweave for, hvilket giver lavere omkostninger, høj valgfrihed og tilgængelighed af GPU’er for at sikre skalerbar og effektiv bearbejdning.
Se dette seneste blogindlæg for Llama 3-implementering ved hjælp af MonsterGPT:
Hvordan strømlinerer det finjusterings- og implementeringsprocessen?
MonsterGPT tilbyder en chat-grænseflade med evnen til at forstå instruktioner i naturligt sprog til lancering, sporing og administration af komplet finjusterings- og implementeringsjob. Denne evne abstraherer mange komplekse trin som:
- Opbygning af en datapipeline
- At finde den rigtige GPU-infrastruktur til jobbet
- Konfiguration af passende hyperparametre
- Opsætning af ML-miljø med kompatible rammer og biblioteker
- Implementering af finjusterings-skripter for LoRA/QLoRA-effektiv finjustering med kvantificeringsstrategier.
- Fejlfinding af problemer som løber tør for hukommelse og kodefejl.
- Design og implementering af multi-nodes auto-skaleringsmed høj-gennemstrømningsservere som vLLM til LLM-implementering.
Hvad forventer udviklere sig af brugergrænsefladen og kommandoer, når de interagerer med Monster API’s chat-grænseflade?
Brugergrænsefladen er en simpel Chat-UI, hvor brugere kan bede agenten om at finjustere en LLM for en bestemt opgave som sammenfatning, chat-afslutning, kodegenerering, blogskrivning osv. og derefter, når først finjusteret, kan GPT yderligere instrueres til at implementere LLM’en og spørgeskemaet om den implementerede model fra GPT-grænsefladen selv. Nogle eksempler på kommandoer inkluderer:
- Finjuster en LLM for kodegenerering på X-datasæt
- Jeg ønsker en model finjusteret for blogskrivning
- Giv mig en API-endpoint for Llama 3-modellen.
- Implementer en lille model for blogskrivningsbrugstilfælde
Dette er ekstremt nyttigt, fordi det at finde den rigtige model til dit projekt ofte kan blive en tidskrævende opgave. Med nye modeller, der dukker op dagligt, kan det føre til meget forvirring.
Hvordan sammenligner Monster API’s løsning med traditionelle metoder til implementering af AI-modeller i forhold til brugervenlighed og effektivitet?
Monster API’s løsning forbedrer betydeligt brugervenlighed og effektivitet i forhold til traditionelle metoder til implementering af AI-modeller.
For Brugervenlighed:
- Automatisk konfiguration: Traditionelle metoder kræver ofte omfattende manuel opsætning af hyperparametre og konfigurationer, hvilket kan være fejlbehæftet og tidskrævende. MonsterAPI automatiserer denne proces ved hjælp af RAG med kontekst, hvilket simplificerer opsætning og reducerer sandsynligheden for fejl.
- Skalerbare REST-API’er: MonsterAPI tilbyder intuitive REST-API’er til implementering og finjustering af modeller, hvilket gør det tilgængeligt selv for brugere med begrænsede maskinlæringsfærdigheder. Traditionelle metoder kræver ofte dyb teknisk viden og kompleks kodning til implementering.
- Samlet platform: Den integrerer hele arbejdsprocessen, fra finjustering til implementering, inden for en enkelt platform. Traditionelle tilgange kan involvere forskellige værktøjer og platforme, hvilket kan føre til ineffektivitet og integrationsudfordringer.
For Effektivitet:
MonsterAPI tilbyder en strømlinet pipeline for LoRA-finjustering med indbygget kvantificering til effektiv hukommelsesudnyttelse og vLLM-motor-dreven LLM-servering til at opnå høj gennemstrømning med kontinuerlig batchning og optimerede CUDA-kerner, på toppen af en kosteffektiv, skalerbar og højtilgængelig decentraliseret GPU-cloud med simplificeret overvågning og logføring.
Denne hele pipeline forbedrer udviklerproduktiviteten ved at enable udvikling af produktionsklare brugervenlige LLM-applikationer, samtidig med at den reducerer behovet for komplekse tekniske færdigheder.
Kan du give eksempler på brugstilfælde, hvor Monster API har betydeligt reduceret den tid og ressourcer, der er nødvendige for modelimplementering?
Et IT-konsulentfirma havde brug for at finjustere og implementere Llama 3-modellen for at betjene deres klients forretningsbehov. Uden MonsterAPI, ville de have krævet et hold af 2-3 MLOps-ingeniører med en dyb forståelse af hyperparameter-justering til at forbedre modellens kvalitet på det leverede datasæt, og derefter hoste den finjusterede model som en skalerbar REST-API-endpoint ved hjælp af auto-skalerings- og orkestrering, sandsynligvis på Kubernetes. Desuden ville de have ønsket at bruge rammer som LoRA til finjustering og vLLM til modelservering til at forbedre økonomiske mål, samtidig med at de reducerer hukommelsesforbrug. Dette kan være en kompleks udfordring for mange udviklere og kan tage uger eller endda måneder at opnå en produktionsklar løsning. Med MonsterAPI, kunne de eksperimentere med multiple finjusteringskørsler inden for en dag og hoste den finjusterede model med den bedste evalueringsscore inden for få timer, uden at kræve multiple tekniske ressourcer med dybe MLOps-færdigheder.
På hvilke måder gør Monster API’s tilgang demokratiserer adgangen til generative AI-modeller for mindre udviklere og startups?
Mindre udviklere og startups kæmper ofte med at producere og bruge højkvalitets AI-modeller på grund af manglende kapital og tekniske færdigheder. Vores løsninger giver dem mulighed for at reducere omkostningerne, simplificere processen og give robuste no-code/low-code-værktøjer til at implementere produktionsklare AI-pipelines.
Ved at udnytte vores decentraliserede GPU-cloud, tilbyder vi billige og skalerbare GPU-resurser, hvilket reducerer omkostningsbarrieren for højpræstationsmodelimplementering. Platformens automatiske konfiguration og hyperparameter-justering simplificerer processen, eliminerer behovet for dyb teknisk ekspertise.
Vores brugervenlige REST-API’er og integrerede arbejdsproces kombinerer finjustering og implementering i en enkelt, samlet proces, hvilket gør avancerede AI-teknologier tilgængelige selv for dem med begrænsede erfaringer. Desuden sikrer brugen af effektive LoRA-finjustering og kvantificeringsteknikker som GPT-Q og AWQ optimal præstation på mindre dyre hardware, hvilket yderligere reducerer indgangsbarrieren.
Denne tilgang giver mindre udviklere og startups mulighed for at implementere og administrere avancerede generative AI-modeller effektivt.
Hvad ser du som den næste store fremskridt eller funktion, som Monster API vil bringe til AI-udviklingsfællesskabet?
Vi arbejder på et par innovative produkter for at fremme vores teses: Hjælpe udviklere med at tilpasse og implementere modeller hurtigere, lettere og på den mest økonomiske måde.
Det næste er en fuld MLOps AI-assistent, der udfører forskning i nye optimeringsstrategier for LLMOps og integrerer dem i eksisterende arbejdsprocesser for at reducere udviklerindsatsen på at bygge nye og bedre kvalitetsmodeller, samtidig med at det enable fuld tilpasning og implementering af produktionsklare LLM-pipelines.
Lad os sige, du har brug for at generere 1 million billeder per minut til dit brugstilfælde. Dette kan være ekstremt dyrt. Traditionelt ville du bruge Stable Diffusion-modellen og bruge timer på at finde og teste optimeringsrammer som TensorRT for at forbedre din gennemstrømning uden at gå på kompromis med kvaliteten og latentiden af output.
Men med MonsterAPI’s MLOps-agent, behøver du ikke at spilde alle disse ressourcer. Agenten finder den bedste ramme til dine krav, udnyttende optimeringer som TensorRT tilpasset dit specifikke brugstilfælde.
Hvordan planlægger Monster API at fortsætte med at støtte og integrere nye open-source-modeller, når de opstår?
På 3 store måder:
- Bring adgang til de seneste open source-modeller
- Tilbyd den mest simple grænseflade for finjustering og implementering
- Optimer hele stakken for hastighed og omkostning med de mest avancerede og kraftfulde rammer og biblioteker
Vores mission er at hjælpe udviklere af alle niveauer med at adoptere Gen AI hurtigere, reducerer deres tid fra en idé til en velpoleret og skalerbar API-endpoint.
Vi vil fortsætte vores bestræbelser på at give adgang til de seneste og mest kraftfulde rammer og biblioteker, integreret i en samlet arbejdsproces for at implementere end-to-end LLMOps. Vi er dedikeret til at reducere kompleksiteten for udviklere med vores no-code-værktøjer, hvilket øger deres produktivitet i bygning og implementering af AI-modeller.
For at opnå dette, overvåger vi kontinuerligt fremskridt i AI-fællesskabet. Vi opretholder en skalerbar decentraliseret GPU-cloud og engagerer aktivt med udviklere for tidlig adgang og feedback. Ved at udnytte automatiserede pipelines for samlet integration, forbedring af fleksible API’er og dannelsen af strategiske partnerskaber med AI-forskningsorganisationer, sikrer vi, at vores platform forbliver på forkant med teknologien.
Desuden tilbyder vi omfattende dokumentation og robust teknisk support, hvilket giver udviklere mulighed for hurtigt at adoptere og udnytte de seneste modeller. MonsterAPI holder udviklere på forkant med generativ AI-teknologi, hvilket giver dem mulighed for at innovere og lykkes.
Hvad er de lange sigte-mål for Monster API i forhold til teknologiudvikling og markedstilgang?
På længe sigt vil vi hjælpe de 30 millioner software-ingeniører med at blive MLOps-udviklere med hjælp af vores MLOps-agent og alle de værktøjer, vi bygger.
Dette vil kræve, at vi bygger ikke blot en fuldgyldig agent, men også mange grundlæggende proprietære teknologier omkring optimeringsrammer, containeriseringsmetode og orkestrering.
Vi tror, at en kombination af gode, simple grænseflader, 10 gange mere gennemstrømning og lavomkostnings-decentraliserede GPU’er har potentialet til at transformere en udviklers produktivitet og dermed accelerere GenAI-adopteringsprocessen.
Alt vores forskning og indsats er rettet mod dette mål.
Tak for det gode interview, læsere, der ønsker at lære mere, skal besøge MonsterAPI.












