Interviste

Saurabh Vij, CEO e Co-Fondatore di MonsterAPI – Serie di Interviste

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Saurabh Vij è il CEO e co-fondatore di MonsterAPI. In precedenza, ha lavorato come fisico delle particelle al CERN e ha riconosciuto il potenziale del calcolo decentralizzato grazie a progetti come LHC@home.

MonsterAPI sfrutta GPU a basso costo provenienti da farm di mining di criptovalute e da piccoli data center inattivi per fornire un’infrastruttura GPU scalabile e accessibile per l’apprendimento automatico, consentendo agli sviluppatori di accedere, ottimizzare e distribuire modelli di intelligenza artificiale a costi significativamente ridotti senza dover scrivere una sola riga di codice.

Prima di MonsterAPI, ha gestito due startup, tra cui una che ha sviluppato un dispositivo di sicurezza indossabile per le donne in India, in collaborazione con il governo indiano e l’IIT Delhi.

Può condividere la storia dietro MonsterGPT?

La nostra missione è sempre stata “aiutare gli sviluppatori di software a ottimizzare e distribuire modelli di intelligenza artificiale più velocemente e nel modo più semplice possibile”. Ci siamo resi conto che ci sono molte sfide complesse che gli sviluppatori affrontano quando vogliono ottimizzare e distribuire un modello di intelligenza artificiale.

Dal gestire il codice all’impostare contenitori Docker su GPU e scalarli su richiesta

E il ritmo al quale si muove l’ecosistema, solo l’ottimizzazione non è sufficiente. Deve essere fatto nel modo giusto: evitare il sottoadattamento, il sovradattamento, l’ottimizzazione degli iperparametri, incorporare metodi più recenti come LORA e Q-LORA per eseguire un’ottimizzazione più veloce e più economica. Una volta ottimizzato, il modello deve essere distribuito in modo efficiente.

Ciò ci ha fatto capire che offrire solo uno strumento per una piccola parte della pipeline non è sufficiente. Uno sviluppatore ha bisogno dell’intera pipeline ottimizzata abbinata a un’interfaccia semplice con cui è familiare. Dall’ottimizzazione alla valutazione e alla distribuzione finale dei modelli.

Ho chiesto a me stesso una domanda: come ex fisico delle particelle, capisco l’impatto profondo che l’intelligenza artificiale potrebbe avere sul lavoro scientifico, ma non so da dove iniziare. Ho idee innovative, ma mi manca il tempo per imparare tutte le competenze e le sfumature dell’apprendimento automatico e dell’infrastruttura.

Cosa succederebbe se potessi semplicemente parlare con un’intelligenza artificiale, fornire i miei requisiti e farle costruire l’intera pipeline per me, consegnando il punto di accesso API richiesto?

Questo ha portato all’idea di un sistema basato su chat per aiutare gli sviluppatori a ottimizzare e distribuire senza sforzo.

MonsterGPT è il nostro primo passo verso questo viaggio.

Ci sono milioni di sviluppatori di software, innovatori e scienziati come noi che potrebbero sfruttare questo approccio per costruire modelli di intelligenza artificiale più specifici per i loro progetti.

Può spiegare la tecnologia sottostante all’agente di distribuzione basato su GPT di Monster API?

MonsterGPT sfrutta tecnologie avanzate per distribuire e ottimizzare in modo efficiente modelli di linguaggio grandi (LLM) open source come Phi3 di Microsoft e Llama 3 di Meta.

  1. RAG con configurazione del contesto: prepara automaticamente le configurazioni con gli iperparametri giusti per l’ottimizzazione degli LLM o la distribuzione dei modelli utilizzando API REST scalabili di MonsterAPI.
  2. LoRA (Low-Rank Adaptation): consente un’ottimizzazione efficiente aggiornando solo un subset di parametri, riducendo il sovraccarico computazionale e le esigenze di memoria.
  3. Tecniche di quantizzazione: utilizza GPT-Q e AWQ per ottimizzare le prestazioni del modello riducendo la precisione, il che riduce l’impronta di memoria e accelera l’inferenza senza una perdita significativa di accuratezza.
  4. Motori vLLM: fornisce un servizio LLM ad alta velocità con funzionalità come batch continuo, kernel CUDA ottimizzati e algoritmi di decodifica paralleli per un’inferenza efficiente su larga scala.
  5. GPU decentralizzate per scala e accessibilità: i nostri carichi di lavoro di ottimizzazione e distribuzione vengono eseguiti su una rete di GPU a basso costo provenienti da più fornitori, da piccoli data center a nuvole di GPU emergenti come coreweave, offrendo costi inferiori, opzioni più ampie e disponibilità di GPU per garantire un’elaborazione scalabile ed efficiente.

Controlla questo ultimo blog per la distribuzione di Llama 3 utilizzando MonsterGPT:

Come semplifica il processo di ottimizzazione e distribuzione?

MonsterGPT fornisce un’interfaccia di chat con la capacità di comprendere istruzioni in linguaggio naturale per lanciare, monitorare e gestire i lavori di ottimizzazione e distribuzione completi. Questa capacità astrae molte operazioni complesse come:

  • Costruire una pipeline di dati
  • Trovare la giusta infrastruttura GPU per il lavoro
  • Configurare gli iperparametri appropriati
  • Configurare l’ambiente ML con framework e librerie compatibili
  • Implementare script di ottimizzazione per LoRA/QLoRA con strategie di quantizzazione.
  • Risolvere problemi come la mancanza di memoria e gli errori di codice.
  • Progettare e implementare un autoscaling multiplo con motori di servizio ad alta velocità come vLLM per la distribuzione degli LLM.

Quali sono l’interfaccia utente e i comandi che gli sviluppatori possono aspettarsi quando interagiscono con l’interfaccia di chat di Monster API?

L’interfaccia utente è una semplice interfaccia di chat in cui gli utenti possono richiedere all’agente di ottimizzare un LLM per un compito specifico come la sintesi, il completamento della chat, la generazione di codice, la scrittura di blog, ecc. e poi, una volta ottimizzato, il GPT può essere ulteriormente istruito per distribuire il modello e interrogare il modello distribuito dall’interfaccia GPT stessa. Alcuni esempi di comandi includono:

  • Ottimizzare un LLM per la generazione di codice su un set di dati X
  • Voglio un modello ottimizzato per la scrittura di blog
  • Fornisci un punto di accesso API per il modello Llama 3.
  • Distribuisci un modello piccolo per un caso d’uso di scrittura di blog

Ciò è estremamente utile perché trovare il modello giusto per il proprio progetto può spesso diventare un compito lungo e noioso. Con nuovi modelli che emergono quotidianamente, può portare a molta confusione.

Come si confronta la soluzione di Monster API in termini di facilità d’uso e efficienza rispetto ai metodi tradizionali di distribuzione dei modelli di intelligenza artificiale?

La soluzione di Monster API migliora notevolmente la facilità d’uso e l’efficienza rispetto ai metodi tradizionali di distribuzione dei modelli di intelligenza artificiale.

Per la facilità d’uso:

  1. Configurazione automatica: i metodi tradizionali richiedono spesso un’ampia configurazione manuale degli iperparametri e delle configurazioni, che può essere soggetta a errori e lunga. MonsterAPI automatizza questo processo utilizzando RAG con contesto, semplificando l’impostazione e riducendo la probabilità di errori.
  2. API REST scalabili: MonsterAPI fornisce API REST intuitive per la distribuzione e l’ottimizzazione dei modelli, rendendola accessibile anche per gli utenti con limitate competenze di apprendimento automatico. I metodi tradizionali spesso richiedono una profonda conoscenza tecnica e codifica complessa per la distribuzione.
  3. Piattaforma unificata: integra l’intero flusso di lavoro, dall’ottimizzazione alla distribuzione, all’interno di una singola piattaforma. Gli approcci tradizionali possono coinvolgere strumenti e piattaforme disparate, portando a inefficienze e sfide di integrazione.

Per l’efficienza:

MonsterAPI offre una pipeline semplificata per l’ottimizzazione LoRA con quantizzazione incorporata per un utilizzo efficiente della memoria e un motore vLLM per il servizio LLM ad alta velocità con funzionalità come batch continuo e kernel CUDA ottimizzati, su una nuvola di GPU decentralizzata a basso costo e altamente disponibile con monitoraggio e registrazione semplificati.

Questa intera pipeline migliora la produttività degli sviluppatori consentendo la creazione di applicazioni personalizzate LLM di produzione mentre riduce la necessità di competenze tecniche complesse.

Può fornire esempi di casi d’uso in cui Monster API ha notevolmente ridotto il tempo e le risorse necessarie per la distribuzione dei modelli?

Un’azienda di consulenza IT aveva bisogno di ottimizzare e distribuire il modello Llama 3 per soddisfare le esigenze commerciali del proprio cliente. Senza MonsterAPI, avrebbe richiesto un team di 2-3 ingegneri MLOps con una profonda comprensione dell’ottimizzazione degli iperparametri per migliorare la qualità del modello sul set di dati fornito, e poi ospitare il modello ottimizzato come un punto di accesso API scalabile utilizzando l’orchestrazione e l’auto-scaling, probabilmente su Kubernetes. Inoltre, per ottimizzare l’economia della distribuzione del modello, avrebbero voluto utilizzare framework come LoRA per l’ottimizzazione e vLLM per la distribuzione del modello per migliorare i metriche di costo mentre riducono il consumo di memoria. Ciò può essere una sfida complessa per molti sviluppatori e può richiedere settimane o addirittura mesi per raggiungere una soluzione pronta per la produzione. Con MonsterAPI, sono stati in grado di sperimentare con più esecuzioni di ottimizzazione all’interno di un giorno e ospitare il modello ottimizzato con il punteggio di valutazione migliore all’interno di poche ore, senza richiedere risorse ingegneristiche multiple con competenze MLOps approfondite.

In che modo l’approccio di Monster API democratizza l’accesso ai modelli di intelligenza artificiale generativa per gli sviluppatori e le startup più piccole?

Gli sviluppatori e le startup più piccole spesso lottano per produrre e utilizzare modelli di intelligenza artificiale di alta qualità a causa della mancanza di capitale e competenze tecniche. Le nostre soluzioni li potenziano riducendo i costi, semplificando i processi e fornendo strumenti no-code/low-code robusti per implementare pipeline di intelligenza artificiale pronte per la produzione.

Utilizzando la nostra nuvola di GPU decentralizzata, offriamo risorse GPU accessibili e scalabili, riducendo notevolmente la barriera dei costi per la distribuzione dei modelli ad alta prestazione. La configurazione automatizzata e l’ottimizzazione degli iperparametri semplificano il processo, eliminando la necessità di competenze tecniche approfondite.

Le nostre API REST intuitive e il flusso di lavoro integrato combinano l’ottimizzazione e la distribuzione in un unico processo coerente, rendendo le tecnologie di intelligenza artificiale avanzate accessibili anche a coloro con esperienza limitata. Inoltre, l’utilizzo di tecniche di ottimizzazione efficienti come LoRA e quantizzazione come GPT-Q e AWQ garantisce prestazioni ottimali su hardware meno costoso, riducendo ulteriormente i costi di ingresso.

Questo approccio potenzia gli sviluppatori e le startup più piccole per implementare e gestire modelli di intelligenza artificiale generativa in modo efficiente ed efficace.

Cosa si prevede come il prossimo grande progresso o funzionalità che Monster API porterà alla comunità di sviluppo di intelligenza artificiale?

Stiamo lavorando a diversi prodotti innovativi per avanzare ulteriormente la nostra tesi: aiutare gli sviluppatori a personalizzare e distribuire modelli più velocemente, più facilmente e nel modo più economico.

Il prossimo passo immediato è un assistente AI MLOps completo che esegue ricerche su nuove strategie di ottimizzazione per LLMOps e le integra nei flussi di lavoro esistenti per ridurre lo sforzo degli sviluppatori nella costruzione di modelli nuovi e migliori, consentendo anche la personalizzazione completa e la distribuzione di pipeline LLM di produzione.

Supponiamo che tu debba generare 1 milione di immagini al minuto per il tuo caso d’uso. Ciò può essere estremamente costoso. Tradizionalmente, useresti il modello Stable Diffusion e spenderesti ore cercando e testando framework di ottimizzazione come TensorRT per migliorare la tua velocità senza compromettere la qualità e la latenza dell’output.

Tuttavia, con l’agente MLOps di MonsterAPI, non dovrai sprecare tutte quelle risorse. L’agente troverà il miglior framework per le tue esigenze, sfruttando ottimizzazioni come TensorRT personalizzate per il tuo caso d’uso specifico.

Come Monster API pianifica di continuare a supportare e integrare nuovi modelli open source man mano che emergono?

In 3 modi principali:

  1. Fornire l’accesso ai modelli open source più recenti
  2. Fornire l’interfaccia più semplice per l’ottimizzazione e la distribuzione
  3. Ottimizzare l’intero stack per velocità e costo con i framework e le librerie più avanzati e potenti

La nostra missione è aiutare gli sviluppatori di tutte le competenze ad adottare l’intelligenza artificiale generativa più velocemente, riducendo il tempo dall’idea al punto di accesso API finale levigato.

Continueremo i nostri sforzi per fornire l’accesso ai framework e alle librerie più recenti e potenti, integrate in un flusso di lavoro senza soluzione di continuità per l’implementazione di LLMOps end-to-end. Siamo impegnati a ridurre la complessità per gli sviluppatori con i nostri strumenti no-code, aumentando così la loro produttività nella costruzione e nella distribuzione dei modelli di intelligenza artificiale.

Per raggiungere questo obiettivo, monitoriamo costantemente i progressi nella comunità di intelligenza artificiale. Manteniamo una nuvola di GPU decentralizzata e ci impegniamo attivamente con gli sviluppatori per l’accesso anticipato e il feedback. Sfruttando pipeline di integrazione automatiche, migliorando API flessibili e formando partnership strategiche con organizzazioni di ricerca sull’intelligenza artificiale, garantiamo che la nostra piattaforma rimanga all’avanguardia.

Inoltre, forniamo documentazione completa e supporto tecnico robusto, consentendo agli sviluppatori di adottare e utilizzare rapidamente i modelli più recenti. MonsterAPI mantiene gli sviluppatori all’avanguardia della tecnologia di intelligenza artificiale generativa, potenziandoli per innovare e avere successo.

Quali sono gli obiettivi a lungo termine per Monster API in termini di sviluppo tecnologico e presenza sul mercato?

A lungo termine, vogliamo aiutare i 30 milioni di ingegneri del software a diventare sviluppatori MLOps con l’aiuto del nostro agente MLOps e di tutti gli strumenti che stiamo costruendo.

Ciò richiederà di costruire non solo un agente completo, ma anche molte tecnologie fondamentali proprietarie relative ai framework di ottimizzazione, alla containerizzazione e all’orchestrazione.

Crediamo che una combinazione di grandi interfacce semplici, 10 volte più velocità e GPU decentralizzate a basso costo abbia il potenziale di trasformare la produttività di uno sviluppatore e quindi accelerare l’adozione di GenAI.

Tutti i nostri sforzi e ricerche sono in questa direzione.

Grazie per la grande intervista, i lettori che desiderano saperne di più possono visitare MonsterAPI.

Antoine è un leader visionario e socio fondatore di Unite.AI, guidato da una passione incrollabile per plasmare e promuovere il futuro dell'AI e della robotica. Un imprenditore seriale, crede che l'AI sarà così disruptiva per la società come l'elettricità, e spesso si lascia trasportare dall'entusiasmo per il potenziale delle tecnologie disruptive e dell'AGI.

Come futurista, è dedicato a esplorare come queste innovazioni plasmeranno il nostro mondo. Inoltre, è il fondatore di Securities.io, una piattaforma focalizzata sugli investimenti in tecnologie all'avanguardia che stanno ridefinendo il futuro e riplasmando interi settori.