Interviuri

Saurabh Vij, CEO și Co-Fondator al MonsterAPI – Seria de Interviuri

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Saurabh Vij este CEO și co-fondator al MonsterAPI. El a lucrat anterior ca fizician particule la CERN și a recunoscut potențialul calculului descentralizat din proiecte precum LHC@home.

MonsterAPI folosește GPU-uri cu costuri mai mici din ferme de minerit de criptomonede și centre de date mici pentru a oferi o infrastructură de GPU escalabilă și accesibilă pentru învățarea automată, permițând dezvoltatorilor să acceseze, să ajusteze și să implementeze modele de inteligență artificială la costuri semnificativ reduse, fără a scrie o singură linie de cod.

Înainte de MonsterAPI, el a condus două startup-uri, inclusiv una care a dezvoltat un dispozitiv de siguranță purtabil pentru femei în India, în colaborare cu Guvernul Indiei și IIT Delhi.

Puteți împărtăși povestea din spatele MonsterGPT?

Misiunea noastră a fost întotdeauna “să ajutăm dezvoltatorii de software să ajusteze și să implementeze modele de inteligență artificială mai rapid și în cel mai ușor mod posibil.” Am realizat că există multiple provocări complexe cu care se confruntă atunci când doresc să ajusteze și să implementeze un model de inteligență artificială.

De la gestionarea codului la configurarea containerelor Docker pe GPU și escaladarea lor la cerere

Și ritmul la care se mișcă ecosistemul, doar ajustarea nu este suficientă. Trebuie făcută în mod corect: evitarea subajustării, supraajustării, optimizarea hiperparametrilor, integrarea celor mai recente metode, cum ar fi LORA și Q-LORA, pentru a efectua ajustări mai rapide și mai economice. Odată ajustat, modelul trebuie implementat în mod eficient.

Ne-a făcut să realizăm că oferirea doar a unui instrument pentru o mică parte a pipeline-ului nu este suficientă. Un dezvoltator are nevoie de întregul pipeline optimizat, cuplat cu o interfață excelentă cu care este familiarizat. De la ajustare la evaluare și implementare finală a modelelor lor.

M-am întrebat: Ca fost fizician particule, înțeleg impactul profund pe care inteligența artificială îl poate avea asupra lucrărilor științifice, dar nu știu de unde să încep. Am idei inovatoare, dar îmi lipsesc timpul pentru a învăța toate abilitățile și nuanțele învățării automate și infrastructurii.

Ce-ar fi dacă aș putea pur și simplu să vorbesc cu o inteligență artificială, să-i ofer cerințele și să o fac să construiască întregul pipeline pentru mine, oferindu-mi punctul de terminare al API-ului necesar?

Acest lucru a condus la ideea unui sistem bazat pe chat pentru a ajuta dezvoltatorii să ajusteze și să implementeze fără efort.

MonsterGPT este primul nostru pas către această călătorie.

Există milioane de dezvoltatori de software, inovatori și oameni de știință ca noi care ar putea să folosească această abordare pentru a construi mai multe modele specifice de domeniu pentru proiectele lor.

Puteți explica tehnologia subiacentă din spatele agentului de implementare GPT al Monster API?

MonsterGPT folosește tehnologii avansate pentru a implementa și ajusta în mod eficient modele de limbă mari deschise (LLM) precum Phi3 de la Microsoft și Llama 3 de la Meta.

  1. RAG cu configurare de context: pregătește automat configurațiile cu hiperparametrii potriviți pentru ajustarea LLM sau implementarea modelului utilizând API-urile REST escalabile de la MonsterAPI.
  2. LoRA (Adaptare de rang scăzut): permite ajustarea eficientă prin actualizarea doar a unei submulțimi de parametri, reducând suprasarcina computațională și cerințele de memorie.
  3. Tehnici de cuantificare: utilizează GPT-Q și AWQ pentru a optimiza performanța modelului prin reducerea preciziei, ceea ce reduce amprenta de memorie și accelerează inferența fără o pierdere semnificativă de acuratețe.
  4. Motor vLLM: oferă servire LLM de înaltă performanță cu caracteristici precum batch-urile continue, kernel-urile CUDA optimizate și algoritmii de decodare paralelă pentru inferență eficientă la scară largă.
  5. GPU descentralizate pentru scalabilitate și accesibilitate: sarcinile noastre de ajustare și implementare rulează pe o rețea de GPU-uri cu costuri reduse de la multiple furnizori, de la centre de date mici la nori de GPU emergenți, cum ar fi coreweave, oferind costuri mai mici, opțiuni mai mari și disponibilitate a GPU-urilor pentru a asigura procesarea eficientă și escalabilă.

Verificați acest blog recent pentru implementarea Llama 3 utilizând MonsterGPT:

Cum simplifică procesul de ajustare și implementare?

MonsterGPT oferă o interfață de chat cu capacitatea de a înțelege instrucțiuni în limbaj natural pentru lansarea, urmărirea și gestionarea completă a sarcinilor de ajustare și implementare. Această capacitate abstrage multe pași complexi, cum ar fi:

  • Construirea unui pipeline de date
  • Aflarea infrastructurii GPU potrivite pentru sarcină
  • Configurarea hiperparametrilor adecvați
  • Setarea mediului ML cu cadre și biblioteci compatibile
  • Implementarea scripturilor de ajustare pentru LoRA/QLoRA pentru ajustarea eficientă cu strategii de cuantificare.
  • Debogarea problemelor precum memoria insuficientă și erorile de cod.
  • Proiectarea și implementarea auto-escalării multi-nod cu motoare de servire de înaltă performanță, cum ar fi vLLM pentru implementarea LLM.

Ce fel de interfață de utilizator și comenzi pot aștepta dezvoltatorii atunci când interacționează cu interfața de chat a Monster API?

Interfața de utilizator este o interfață de chat simplă în care utilizatorii pot solicita agentului să ajusteze un LLM pentru o sarcină specifică, cum ar fi rezumat, completare de chat, generare de cod, scriere de blog etc., și apoi, odată ajustat, GPT poate fi instruit ulterior să implementeze LLM și să interogheze modelul implementat din interfața GPT însăși. Exemple de comenzi includ:

  • Ajustați un LLM pentru generarea de cod pe setul de date X
  • Vreau un model ajustat pentru scrierea de bloguri
  • Dați-mi un punct de terminare al API-ului pentru modelul Llama 3.
  • Implementați un model mic pentru cazul de utilizare a scrierii de bloguri

Acest lucru este extrem de util, deoarece găsirea modelului potrivit pentru proiectul dvs. poate deveni adesea o sarcină care consumă timp. Cu modele noi care apar zilnic, poate duce la multă confuzie.

Cum se compară soluția Monster API în ceea ce privește ușurința de utilizare și eficiența cu metodele tradiționale de implementare a modelelor de inteligență artificială?

Soluția Monster API îmbunătățește semnificativ ușurința de utilizare și eficiența în comparație cu metodele tradiționale de implementare a modelelor de inteligență artificială.

Pentru Ușurința de Utilizare:

  1. Configurare automată: metodele tradiționale necesită adesea o configurare manuală extinsă a hiperparametrilor și configurațiilor, ceea ce poate fi supus erorilor și consumator de timp. MonsterAPI automatizează acest proces utilizând RAG cu context, simplificând configurarea și reducând probabilitatea erorilor.
  2. API-urile REST escalabile: MonsterAPI oferă API-uri REST intuitive pentru implementarea și ajustarea modelului, făcându-le accesibile chiar și pentru utilizatorii cu experiență limitată în învățarea automată. Metodele tradiționale necesită adesea cunoștințe tehnice profunde și codare complexă pentru implementare.
  3. Platformă unificată: integrează întregul flux de lucru, de la ajustare la implementare, într-o singură platformă. Abordările tradiționale pot implica instrumente și platforme disparate, ceea ce duce la ineficiențe și provocări de integrare.

Pentru Eficiență:

MonsterAPI oferă un pipeline optimizat pentru ajustarea LoRA cu cuantificare încorporată pentru utilizarea eficientă a memoriei și motorul vLLM pentru servirea LLM, care atinge o producție ridicată cu batch-urile continue și kernel-urile CUDA optimizate, pe o rețea de GPU descentralizată cu costuri reduse, escalabilă și cu disponibilitate ridicată, asigurând procesarea eficientă și escalabilă.

Acest întreg pipeline îmbunătățește productivitatea dezvoltatorilor, permițând crearea de aplicații personalizate de înaltă calitate, în timp ce reduce nevoia de abilități tehnice complexe.

Puteți oferi exemple de cazuri de utilizare în care Monster API a redus semnificativ timpul și resursele necesare pentru implementarea modelului?

O companie de consultanță IT a avut nevoie să ajusteze și să implementeze modelul Llama 3 pentru a satisface nevoile afacerii clientului său. Fără MonsterAPI, ar fi necesitat o echipă de 2-3 ingineri MLOps cu o înțelegere profundă a ajustării hiperparametrilor pentru a îmbunătăți calitatea modelului pe setul de date furnizat și apoi să găzduiască modelul ajustat ca un punct de terminare al API-ului escalabil, utilizând orchestrare și auto-escalare, probabil pe Kubernetes. În plus, pentru a optimiza economia servirii modelului, au dorit să utilizeze cadre precum LoRA pentru ajustarea eficientă și vLLM pentru servirea modelului, pentru a îmbunătăți metricile de cost, reducând în același timp consumul de memorie. Acest lucru poate fi o provocare complexă pentru mulți dezvoltatori și poate dura săptămâni sau chiar luni pentru a obține o soluție de producție. Cu MonsterAPI, au putut experimenta cu multiple rulări de ajustare într-o singură zi și au găzduit modelul ajustat cu cel mai bun scor de evaluare în câteva ore, fără a necesita resurse de inginerie multiple cu abilități MLOps profunde.

În ce moduri abordează Monster API accesul democratizat la modelele de inteligență artificială generativă pentru dezvoltatori și startup-uri mai mici?

Dezvoltatorii și startup-urile mici adesea se confruntă cu dificultăți în a produce și a utiliza modele de inteligență artificială de înaltă calitate din cauza lipsei de capital și abilități tehnice. Soluțiile noastre îi împuternicesc prin reducerea costurilor, simplificarea proceselor și oferirea de instrumente robuste și fără cod/low-code pentru implementarea de pipeline-uri de inteligență artificială gata de producție.

Prin utilizarea norului nostru de GPU descentralizat, oferim resurse de GPU accesibile și escalabile, reducând semnificativ bariera de cost pentru implementarea modelului de înaltă performanță. Configurarea automată și ajustarea hiperparametrilor simplifică procesul, eliminând nevoia de experiență tehnică profundă.

API-urile noastre REST intuitive și fluxul de lucru integrat combină ajustarea și implementarea într-un singur proces coerent, făcând tehnologiile avansate de inteligență artificială accesibile chiar și pentru cei cu experiență limitată. În plus, utilizarea tehnicilor de ajustare eficientă LoRA și a tehnicilor de cuantificare, cum ar fi GPT-Q și AWQ, asigură o performanță optimă pe hardware mai puțin costisitor, reducând și mai mult costurile de intrare.

Acestă abordare împuternicește dezvoltatorii și startup-urile mici să implementeze și să gestioneze modele avansate de inteligență artificială generativă în mod eficient și eficace.

Ce reprezintă următoarea avansare majoră sau funcție pe care Monster API o va aduce comunității de dezvoltare a inteligenței artificiale?

Lucrăm la câteva produse inovatoare pentru a avansa și mai mult teza noastră: ajutați dezvoltatorii să personalizeze și să implementeze modele mai rapid, mai ușor și în cel mai economic mod.

Următorul pas imediat este un asistent de inteligență artificială complet care efectuează cercetări asupra noilor strategii de optimizare pentru LLMOps și le integrează în fluxurile de lucru existente pentru a reduce efortul dezvoltatorilor de a construi noi modele de calitate și pentru a permite personalizarea și implementarea completă a pipeline-urilor LLM de producție.

Să spunem că aveți nevoie să generați 1 milion de imagini pe minut pentru cazul dvs. de utilizare. Acest lucru poate fi extrem de costisitor. În mod tradițional, ați utiliza modelul Stable Diffusion și ați petrece ore pentru a găsi și testa cadrele de optimizare, cum ar fi TensorRT, pentru a îmbunătăți producția fără a compromite calitatea și latența ieșirii.

Însă, cu agentul MLOps al MonsterAPI, nu veți mai avea nevoie să irosiți toate aceste resurse. Agentul va găsi cel mai bun cadru pentru cerințele dvs., utilizând optimizări precum TensorRT, personalizate pentru cazul dvs. de utilizare specific.

Cum plănuiți să continuați să susțineți și să integrați noi modele deschise, pe măsură ce acestea apar?

În trei moduri principale:

  1. Aduceți accesul la cele mai recente modele deschise
  2. Oferiți cea mai simplă interfață pentru ajustare și implementare
  3. Optimizați întregul stivuit pentru viteză și cost, cu cele mai avansate și puternice cadre și biblioteci

Misiunea noastră este să ajutăm dezvoltatorii de toate nivelurile să adopte inteligența artificială generativă mai rapid, reducând timpul de la o idee la un punct de terminare al API-ului bine lustruit și escalabil.

Vom continua eforturile noastre pentru a oferi acces la cele mai recente și mai puternice cadre și biblioteci, integrate într-un flux de lucru fără cusur pentru implementarea end-to-end LLMOps. Suntem dedicați reducerii complexității pentru dezvoltatori cu instrumentele noastre fără cod, îmbunătățind astfel productivitatea lor în construirea și implementarea modelelor de inteligență artificială.

Pentru a realiza acest lucru, monitorizăm în mod constant progresele din comunitatea inteligenței artificiale, menținem un nor de GPU descentralizat escalabil și ne implicăm activ cu dezvoltatorii pentru accesul timpuriu și feedback. Prin utilizarea pipeline-urilor automate pentru integrarea fără cusur, îmbunătățirea API-urilor flexibile și formarea de parteneriate strategice cu organizațiile de cercetare a inteligenței artificiale, ne asigurăm că platforma noastră rămâne în avangardă.

În plus, oferim documentație cuprinzătoare și suport tehnic robust, permițând dezvoltatorilor să adopte și să utilizeze rapid cele mai recente modele. MonsterAPI menține dezvoltatorii în fruntea tehnologiei inteligenței artificiale generative, împuternicindu-i să inoveze și să reușească.

Care sunt obiectivele pe termen lung pentru Monster API în ceea ce privește dezvoltarea tehnologică și acoperirea pieței?

Pe termen lung, dorim să ajutăm cei 30 de milioane de ingineri software să devină dezvoltatori MLOps cu ajutorul agentului nostru MLOps și al tuturor instrumentelor pe care le construim.

Acest lucru va necesita ca noi să construim nu doar un agent complet, ci și multe tehnologii fundamentale proprietare în jurul cadrelor de optimizare, containerizării și orchestrării.

Credem că o combinație de interfețe excelente, simple, cu o producție de 10 ori mai mare și GPU-uri descentralizate cu costuri reduse are potențialul de a transforma productivitatea unui dezvoltator și, prin urmare, de a accelera adoptarea inteligenței artificiale generative.

Toate cercetările și eforturile noastre sunt în această direcție.

Mulțumim pentru acest interviu minunat; cititorii care doresc să afle mai multe despre MonsterAPI ar trebui să viziteze MonsterAPI.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.