Interviews

Saurabh Vij, CEO en mede-oprichter van MonsterAPI – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Saurabh Vij is de CEO en mede-oprichter van MonsterAPI. Hij werkte eerder als deeltjesfysicus bij CERN en herkende het potentieel voor gedecentraliseerd rekenen van projecten zoals LHC@home.

MonsterAPI maakt gebruik van goedkope commodity-GPU’s van crypto-mijnbouwbedrijven tot kleinere idle datacentra om schaalbare, betaalbare GPU-infrastructuur voor machine learning te bieden, waardoor ontwikkelaars toegang hebben tot, fijn afstemmen en AI-modellen kunnen implementeren tegen aanzienlijk lagere kosten zonder één regel code te schrijven.

Voordat hij bij MonsterAPI kwam, richtte hij twee startups op, waaronder een bedrijf dat een draagbaar veiligheidsapparaat voor vrouwen in India ontwikkelde, in samenwerking met de regering van India en IIT Delhi.

Kunt u het verhaal achter MonsterGPT delen?

Onze missie is altijd geweest “om software-ontwikkelaars te helpen AI-modellen sneller en op de eenvoudigste manier mogelijk te fine-tunen en te implementeren.” We realiseerden ons dat er meerdere complexe uitdagingen zijn die ze tegenkomen wanneer ze een AI-model willen fine-tunen en implementeren.

Van het omgaan met code tot het instellen van Docker-containers op GPU’s en het schalen ervan op aanvraag

En het tempo waarin het ecosysteem beweegt, is alleen fine-tunen niet genoeg. Het moet op de juiste manier worden gedaan: onderfitting, overfitting, hyperparameter-optimalisatie, het opnemen van de nieuwste methoden zoals LORA en Q-LORA om sneller en economischer fine-tunen uit te voeren. Zodra het model is gefine-tuned, moet het efficiënt worden geïmplementeerd.

Het maakte ons realiseer dat het aanbieden van alleen een tool voor een klein deel van de pijplijn niet genoeg is. Een ontwikkelaar heeft de hele geoptimaliseerde pijplijn nodig, gekoppeld aan een geweldige interface die hij kent. Van fine-tunen tot evaluatie en uiteindelijke implementatie van hun modellen.

Ik vroeg mezelf een vraag: Als voormalig deeltjesfysicus begrijp ik het diepgaande effect dat AI op wetenschappelijk werk kan hebben, maar ik weet niet waar ik moet beginnen. Ik heb innovatieve ideeën, maar ik heb geen tijd om alle vaardigheden en nuances van machine learning en infrastructuur te leren.

Wat als ik gewoon met een AI kon praten, mijn vereisten kon geven en het hele pijplijn kon laten bouwen, met levering van het vereiste API-eindpunt?

Dit leidde tot het idee van een chat-gebaseerd systeem om ontwikkelaars te helpen moeiteloos te fine-tunen en te implementeren.

MonsterGPT is onze eerste stap op deze reis.

Er zijn miljoenen software-ontwikkelaars, innovators en wetenschappers zoals wij die deze aanpak kunnen gebruiken om meer domeinspecifieke modellen voor hun projecten te bouwen.

Kunt u de onderliggende technologie achter de GPT-gebaseerde implementatieagent van Monster API uitleggen?

MonsterGPT maakt gebruik van geavanceerde technologieën om open source Large Language Models (LLM’s) zoals Phi3 van Microsoft en Llama 3 van Meta efficiënt te implementeren en te fine-tunen.

  1. RAG met contextconfiguratie: bereidt automatisch configuraties voor met de juiste hyperparameters voor het fine-tunen van LLM’s of het implementeren van modellen met schaalbare REST-API’s van MonsterAPI.
  2. LoRA (Low-Rank Adaptation): maakt efficiënt fine-tunen mogelijk door alleen een subset van parameters bij te werken, waardoor de rekenkundige overhead en geheugeneisen worden verlaagd.
  3. Quantization-technieken: maakt gebruik van GPT-Q en AWQ om modelprestaties te optimaliseren door precisie te verlagen, waardoor de geheugenvoetafdruk wordt verlaagd en inferentie wordt versneld zonder aanzienlijk verlies van nauwkeurigheid.
  4. vLLM Engine: biedt hoge doorvoer LLM-serving met functies zoals continue batching, geoptimaliseerde CUDA-kernels en parallelle decoderingsalgoritmen voor efficiënte grootschalige inferentie.
  5. Decentrale GPU’s voor schaalbaarheid en betaalbaarheid: onze fine-tune- en implementatieworkloads worden uitgevoerd op een netwerk van goedkope GPU’s van meerdere leveranciers van kleinere datacentra tot opkomende GPU-clouds zoals coreweave, waardoor lagere kosten, hoge optie en beschikbaarheid van GPU’s worden geboden om schaalbare en efficiënte verwerking te garanderen.

Bekijk deze nieuwste blog voor Llama 3-implementatie met MonsterGPT:

Hoe stroomlijnt het de fine-tune- en implementatieprocessen?

MonsterGPT biedt een chat-interface met de mogelijkheid om instructies in natuurlijke taal te begrijpen voor het starten, bijhouden en beheren van complete fine-tune- en implementatiejobs. Deze mogelijkheid abstracteert veel complexe stappen weg, zoals:

  • Het bouwen van een datapijplijn
  • Het vinden van de juiste GPU-infrastructuur voor de job
  • Het configureren van de juiste hyperparameters
  • Het instellen van een ML-omgeving met compatibele frameworks en bibliotheken
  • Het implementeren van fine-tune-scripts voor LoRA/QLoRA-efficiënt fine-tunen met quantization-strategieën.
  • Het oplossen van problemen zoals uitgeputte geheugen en code-niveau fouten.
  • Het ontwerpen en implementeren van multi-node auto-scaling met hoge doorvoer serving-engines zoals vLLM voor LLM-implementaties.

Wat voor soort gebruikersinterface en opdrachten kunnen ontwikkelaars verwachten bij het interactie met de chat-interface van Monster API?

De gebruikersinterface is een eenvoudige Chat-UI waarin gebruikers de agent kunnen opdragen om een LLM voor een specifieke taak te fine-tunen, zoals samenvatting, chat-completie, codegeneratie, blogschrijven, enz., en vervolgens, zodra het is gefine-tuned, kan de GPT worden geïnstrueerd om het model te implementeren en de geïmplementeerde model te ondervragen vanuit de GPT-interface zelf. Enkele voorbeelden van opdrachten zijn:

  • Fine-tune een LLM voor codegeneratie op X-dataset
  • Ik wil een model fine-tunen voor blogschrijven
  • Geef me een API-eindpunt voor Llama 3-model.
  • Implementeer een klein model voor blogschrijven.

Dit is extreem nuttig omdat het vinden van het juiste model voor uw project vaak een tijdrovende taak kan worden. Met nieuwe modellen die dagelijks verschijnen, kan dit leiden tot veel verwarring.

Hoe vergelijkt de oplossing van Monster API zich in termen van gebruiksvriendelijkheid en efficiëntie met traditionele methoden voor het implementeren van AI-modellen?

De oplossing van Monster API verbetert de gebruiksvriendelijkheid en efficiëntie aanzienlijk in vergelijking met traditionele methoden voor het implementeren van AI-modellen.

Wat betreft gebruiksvriendelijkheid:

  1. Automatische configuratie: traditionele methoden vereisen vaak uitgebreide handmatige configuratie van hyperparameters en configuraties, wat tijdrovend en foutgevoelig kan zijn. MonsterAPI automatiseert dit proces met RAG met context, waardoor de instelling wordt vereenvoudigd en de kans op fouten wordt verlaagd.
  2. Schaalbare REST-API’s: MonsterAPI biedt intuïtieve REST-API’s voor het implementeren en fine-tunen van modellen, waardoor het toegankelijk wordt voor gebruikers met beperkte machine learning-kennis. Traditionele methoden vereisen vaak diepgaande technische kennis en complexe codering voor implementatie.
  3. Unified Platform: het integreert de hele workflow, van fine-tunen tot implementatie, binnen één platform. Traditionele benaderingen kunnen afzonderlijke tools en platforms vereisen, wat leidt tot inefficiënties en integratie-uitdagingen.

Wat betreft efficiëntie:

MonsterAPI biedt een gestroomlijnde pijplijn voor LoRA Fine-Tuning met ingebouwde quantization voor efficiënte geheugengebruik en vLLM Engine-gepowered LLM-serving voor het bereiken van hoge doorvoer met continue batching en geoptimaliseerde CUDA-kernels, op basis van een kosteneffectieve, schaalbare en hoge beschikbaarheid van decentrale GPU-cloud met vereenvoudigd monitoren en loggen.

Deze hele pijplijn verbetert de productiviteit van ontwikkelaars door de creatie van productieklare aangepaste LLM-toepassingen mogelijk te maken, terwijl het de behoefte aan complexe technische vaardigheden vermindert.

Kunt u voorbeelden geven van use cases waarin Monster API de tijd en middelen die nodig zijn voor modelimplementatie aanzienlijk heeft verminderd?

Een IT-consultancybedrijf moest Llama 3 fine-tunen en implementeren om aan de zakelijke behoeften van hun klant te voldoen. Zonder MonsterAPI zouden ze een team van 2-3 MLOps-engineers hebben nodig gehad met een diepgaand begrip van hyperparameter-tuning om de kwaliteit van het model op de verstrekte dataset te verbeteren, en vervolgens het gefine-tune model als een schaalbare REST-API-eindpunt hosten met auto-scaling en orkestratie, waarschijnlijk op Kubernetes. Bovendien wilden ze de economie van het serveren van het model optimaliseren door frameworks zoals LoRA voor fine-tunen en vLLM voor model-serving te gebruiken om kostenmetrieken te verbeteren en geheugengebruik te verminderen. Dit kan een complexe uitdaging zijn voor veel ontwikkelaars en kan weken of zelfs maanden duren om een productieklare oplossing te bereiken. Met MonsterAPI konden ze binnen een dag meerdere fine-tune-runs uitproberen en het gefine-tune model met de beste evaluatiescore binnen enkele uren hosten, zonder meerdere engineering-resources met diepgaande MLOps-vaardigheden nodig te hebben.

Op welke manieren democratiseert Monster API de toegang tot generatieve AI-modellen voor kleinere ontwikkelaars en startups?

Kleine ontwikkelaars en startups hebben vaak moeite om hoge kwaliteit AI-modellen te produceren en te gebruiken vanwege een gebrek aan kapitaal en technische vaardigheden. Onze oplossingen empoweren hen door de kosten te verlagen, processen te vereenvoudigen en robuuste no-code/low-code-tools te bieden om productieklare AI-pijplijnen te implementeren.

Door onze decentrale GPU-cloud te gebruiken, bieden we betaalbare en schaalbare GPU-bronnen, waardoor de kostenbarrière voor hoge prestatie-modelimplementatie aanzienlijk wordt verlaagd. De platformautomatische configuratie en hyperparameter-tuning vereenvoudigen het proces, waardoor de behoefte aan diepgaande technische expertise wordt geëlimineerd.

Onze gebruikersvriendelijke REST-API’s en geïntegreerde workflow combineren fine-tunen en implementatie in één enkel, samenhangend proces, waardoor geavanceerde AI-technologieën toegankelijk worden voor iedereen, zelfs voor diegenen met beperkte ervaring. Bovendien zorgt het gebruik van efficiënte LoRA-fine-tunen en quantization-technieken zoals GPT-Q en AWQ ervoor dat de prestaties optimaal zijn op minder dure hardware, waardoor de toegangskosten verder worden verlaagd.

Deze aanpak empoweren kleine ontwikkelaars en startups om geavanceerde generatieve AI-modellen efficiënt en effectief te implementeren en te beheren.

Wat zijn uw visies op de volgende grote vooruitgang of functie die Monster API zal brengen aan de AI-ontwikkelingsgemeenschap?

We werken aan een paar innovatieve producten om onze these verder te ontwikkelen: help ontwikkelaars modellen sneller, eenvoudiger en op de meest economische manier aan te passen en te implementeren.

Onmiddellijk hierna is een Full MLOps AI-assistent die onderzoek doet naar nieuwe optimalisatiestrategieën voor LLMOps en deze integreert in bestaande workflows om de inspanning van ontwikkelaars te verminderen bij het bouwen van nieuwe en betere kwaliteit modellen, terwijl het ook complete aanpassing en implementatie van productieklare LLM-pijplijnen mogelijk maakt.

Stel dat u 1 miljoen afbeeldingen per minuut moet genereren voor uw use case. Dit kan extreem duur zijn. Traditioneel zou u het Stable Diffusion-model gebruiken en uren besteden aan het vinden en testen van optimalisatieframeworks zoals TensorRT om uw doorvoer te verbeteren zonder de kwaliteit en latentie van de output te compromitteren.

Maar met de MLOps-agent van MonsterAPI hoeft u al die middelen niet te verspillen. De agent vindt het beste framework voor uw vereisten, waardoor optimalisaties zoals TensorRT worden aangepast aan uw specifieke use case.

Hoe plant Monster API om nieuwe open-source-modellen te blijven ondersteunen en integreren naarmate ze verschijnen?

Op drie belangrijke manieren:

  1. Toegang bieden tot de nieuwste open-source-modellen
  2. De eenvoudigste interface bieden voor fine-tunen en implementatie
  3. De hele stack optimaliseren voor snelheid en kosten met de meest geavanceerde en krachtige frameworks en bibliotheken

Onze missie is om ontwikkelaars van alle niveaus te helpen Gen AI sneller te adopteren, waardoor hun tijd van een idee tot een goed gepolijst en schaalbaar API-eindpunt wordt verminderd.

We zullen onze inspanningen voortzetten om toegang te bieden tot de nieuwste en krachtigste frameworks en bibliotheken, geïntegreerd in een naadloze workflow voor het implementeren van end-to-end LLMOps. We zijn toegewijd aan het verminderen van complexiteit voor ontwikkelaars met onze no-code-tools, waardoor hun productiviteit bij het bouwen en implementeren van AI-modellen wordt verhoogd.

Om dit te bereiken, ondersteunen en integreren we voortdurend nieuwe open-source-modellen, optimalisatieframeworks en bibliotheken door de vooruitgang in de AI-gemeenschap te volgen. We onderhouden een schaalbare decentrale GPU-cloud en engageren ons actief met ontwikkelaars voor vroegtijdige toegang en feedback. Door gebruik te maken van geautomatiseerde pijplijnen voor naadloze integratie, het verbeteren van flexibele API’s en het aangaan van strategische partnerships met AI-onderzoeksorganisaties, zorgen we ervoor dat ons platform state-of-the-art blijft.

Bovendien bieden we uitgebreide documentatie en robuuste technische ondersteuning, waardoor ontwikkelaars de nieuwste modellen snel kunnen adopteren en gebruiken. MonsterAPI houdt ontwikkelaars aan de voorlopige positie van generatieve AI-technologie, waardoor ze kunnen innoveren en slagen.

Wat zijn de langetermijndoelen van Monster API in termen van technologieontwikkeling en marktbereik?

Langetermijn, willen we helpen de 30 miljoen software-engineers om MLOps-ontwikkelaars te worden met behulp van onze MLOps-agent en alle tools die we aan het bouwen zijn.

Dit zal ons ertoe brengen niet alleen een full-fledged agent te bouwen, maar ook veel fundamentele propriëtaire technologieën rond optimalisatieframeworks, containerisatiemethoden en orkestratie.

We geloven dat een combinatie van geweldige, eenvoudige interfaces, 10x meer doorvoer en lage kosten decentrale GPU’s het potentieel heeft om de productiviteit van een ontwikkelaar te transformeren en zo GenAI-adoptie te versnellen.

Al onze onderzoek en inspanningen zijn in deze richting.

Bedankt voor het geweldige interview, lezers die meer willen leren, moeten MonsterAPI bezoeken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.