Entretiens
Saurabh Vij, PDG et co-fondateur de MonsterAPI – Série d’entretiens

Saurabh Vij est le PDG et co-fondateur de MonsterAPI. Il a précédemment travaillé comme physicien des particules au CERN et a reconnu le potentiel de l’informatique décentralisée à partir de projets comme LHC@home.
MonsterAPI utilise des GPU de commodité à faible coût provenant de fermes de crypto-monnaies pour fournir une infrastructure GPU évolutives et abordables pour l’apprentissage automatique, permettant aux développeurs d’accéder, de mettre à jour et de déployer des modèles d’IA à des coûts considérablement réduits sans écrire une seule ligne de code.
Avant MonsterAPI, il a dirigé deux startups, dont une qui a développé un dispositif de sécurité portable pour les femmes en Inde, en collaboration avec le gouvernement indien et l’IIT Delhi.
Pouvez-vous partager l’histoire de la genèse de MonsterGPT ?
Notre mission a toujours été “d’aider les développeurs de logiciels à mettre à jour et à déployer des modèles d’IA plus rapidement et de la manière la plus simple possible.” Nous avons réalisé qu’il existe de multiples défis complexes auxquels ils sont confrontés lorsqu’ils veulent mettre à jour et déployer un modèle d’IA.
De la gestion du code à la configuration de conteneurs Docker sur des GPU et à leur mise à l’échelle sur demande
Et le rythme auquel l’écosystème évolue, la simple mise à jour ne suffit pas. Il faut le faire de la bonne manière : éviter la sous-ajustement, la sur-ajustement, l’optimisation des hyperparamètres, l’intégration des dernières méthodes comme LORA et Q-LORA pour effectuer une mise à jour plus rapide et plus économique. Une fois la mise à jour effectuée, le modèle doit être déployé de manière efficace.
Cela nous a fait réaliser que proposer uniquement un outil pour une petite partie de la chaîne de traitement n’est pas suffisant. Un développeur a besoin de l’ensemble de la chaîne de traitement optimisée, couplée à une interface utilisateur qu’il connaît. De la mise à jour à l’évaluation et au déploiement final de leurs modèles.
Je me suis posé une question : en tant qu’ancien physicien des particules, je comprends l’impact profond que l’IA pourrait avoir sur les travaux scientifiques, mais je ne sais pas par où commencer. J’ai des idées innovantes, mais je n’ai pas le temps d’apprendre toutes les compétences et les nuances de l’apprentissage automatique et de l’infrastructure.
Et si je pouvais simplement discuter avec un IA, fournir mes exigences et qu’il construise l’ensemble de la chaîne de traitement pour moi, en me fournissant le point de terminaison d’API requis ?
Cela a conduit à l’idée d’un système basé sur le chat pour aider les développeurs à mettre à jour et à déployer sans effort.
MonsterGPT est notre premier pas vers ce voyage.
Il existe des millions de développeurs de logiciels, d’innovateurs et de scientifiques comme nous qui pourraient utiliser cette approche pour construire des modèles spécifiques à leur domaine pour leurs projets.
Pouvez-vous expliquer la technologie sous-jacente à l’agent de déploiement basé sur GPT de Monster API ?
MonsterGPT utilise des technologies avancées pour déployer et mettre à jour de manière efficace des modèles de langage grand ouvert (LLM) open source tels que Phi3 de Microsoft et Llama 3 de Meta.
- RAG avec configuration de contexte : Prépare automatiquement les configurations avec les bons hyperparamètres pour la mise à jour des LLM ou le déploiement de modèles à l’aide d’API REST évolutives de MonsterAPI.
- LoRA (Low-Rank Adaptation) : Permet une mise à jour efficace en mettant à jour uniquement un sous-ensemble de paramètres, réduisant les coûts de calcul et les exigences de mémoire.
- Techniques de quantification : Utilise GPT-Q et AWQ pour optimiser les performances du modèle en réduisant la précision, ce qui réduit l’empreinte mémoire et accélère l’inférence sans perte significative de précision.
- Moteur vLLM : Fournit un service LLM à haut débit avec des fonctionnalités telles que le batchage continu, des noyaux CUDA optimisés et des algorithmes de décodage parallèles pour une inférence efficace à grande échelle.
- GPU décentralisés pour l’évolutivité et l’abordabilité : Nos charges de travail de mise à jour et de déploiement s’exécutent sur un réseau de GPU à faible coût de plusieurs fournisseurs à partir de petits centres de données à des nuages de GPU émergents comme coreweave, offrant des coûts inférieurs, une grande flexibilité et une disponibilité de GPU pour assurer un traitement évolutif et efficace.
Consultez ce dernier blog pour le déploiement de Llama 3 à l’aide de MonsterGPT :
Comment cela rationalise-t-il le processus de mise à jour et de déploiement ?
MonsterGPT fournit une interface de chat avec la capacité de comprendre les instructions en langage naturel pour lancer, suivre et gérer des travaux de mise à jour et de déploiement complets. Cette capacité abstrait de nombreuses étapes complexes telles que :
- Construire un pipeline de données
- Déterminer la bonne infrastructure GPU pour le travail
- Configurer les hyperparamètres appropriés
- Configurer l’environnement ML avec des frameworks et des bibliothèques compatibles
- Mettre en œuvre des scripts de mise à jour pour une mise à jour efficace LoRA/QLoRA avec des stratégies de quantification.
- Déboguer les problèmes tels que les erreurs de mémoire et les erreurs de code.
- Concevoir et mettre en œuvre une mise à l’échelle automatique avec des moteurs de service à haut débit tels que vLLM pour les déploiements de LLM.
Quel type d’interface utilisateur et de commandes les développeurs peuvent-ils attendre lors de l’interaction avec l’interface de chat de Monster API ?
L’interface utilisateur est une interface de chat simple dans laquelle les utilisateurs peuvent inciter l’agent à mettre à jour un LLM pour une tâche spécifique telle que la résumé, la complétion de chat, la génération de code, la rédaction de blog, etc. et une fois la mise à jour effectuée, le GPT peut être davantage instruit pour déployer le LLM et interroger le modèle déployé à partir de l’interface GPT elle-même. Voici quelques exemples de commandes :
- Mettre à jour un LLM pour la génération de code sur le jeu de données X
- Je veux un modèle mis à jour pour la rédaction de blog
- Fournir un point de terminaison d’API pour le modèle Llama 3.
- Déployer un petit modèle pour un cas d’utilisation de rédaction de blog
Ceci est extrêmement utile car trouver le bon modèle pour votre projet peut souvent devenir une tâche chronophage.
Comment la solution de Monster API se compare-t-elle en termes d’utilisabilité et d’efficacité par rapport aux méthodes traditionnelles de déploiement de modèles d’IA ?
La solution de Monster API améliore considérablement l’utilisabilité et l’efficacité par rapport aux méthodes traditionnelles de déploiement de modèles d’IA.
Pour l’utilisabilité :
- Configuration automatique : Les méthodes traditionnelles nécessitent souvent une configuration manuelle extensive des hyperparamètres et des configurations, ce qui peut être sujet à erreurs et chronophage. MonsterAPI automatise ce processus à l’aide de RAG avec contexte, simplifiant la configuration et réduisant la probabilité d’erreurs.
- API REST évolutives : MonsterAPI fournit des API REST intuitives pour le déploiement et la mise à jour de modèles, les rendant accessibles même pour les utilisateurs ayant des connaissances limitées en apprentissage automatique. Les méthodes traditionnelles nécessitent souvent des connaissances techniques approfondies et un codage complexe pour le déploiement.
- Plateforme unifiée : Il intègre l’ensemble du flux de travail, de la mise à jour au déploiement, dans une seule plateforme. Les approches traditionnelles peuvent impliquer des outils et des plateformes disparates, conduisant à des inefficacités et à des défis d’intégration.
Pour l’efficacité :
MonsterAPI offre une chaîne de traitement rationalisée pour la mise à jour LoRA avec une quantification intégrée pour une utilisation efficace de la mémoire et un moteur vLLM pour le service LLM, permettant d’atteindre un débit élevé avec un batchage continu et des noyaux CUDA optimisés, sur un cloud de GPU décentralisé à faible coût et hautement disponible avec une surveillance et une journalisation simplifiées.
Cette chaîne de traitement entière améliore la productivité des développeurs en leur permettant de créer des applications LLM personnalisées de qualité de production tout en réduisant le besoin de compétences techniques complexes.
Pouvez-vous fournir des exemples de cas d’utilisation où Monster API a considérablement réduit le temps et les ressources nécessaires pour le déploiement de modèles ?
Une société de conseil en IT devait mettre à jour et déployer le modèle Llama 3 pour répondre aux besoins commerciaux de son client. Sans MonsterAPI, ils auraient nécessité une équipe de 2-3 ingénieurs MLOps ayant une connaissance approfondie de la mise à jour des hyperparamètres pour améliorer la qualité du modèle sur le jeu de données fourni, puis héberger le modèle mis à jour en tant que point de terminaison d’API REST évolutif en utilisant une mise à l’échelle automatique et une orchestration, probablement sur Kubernetes. De plus, pour optimiser l’économie du service du modèle, ils souhaitaient utiliser des frameworks tels que LoRA pour la mise à jour et vLLM pour le service de modèle pour améliorer les métriques de coût tout en réduisant la consommation de mémoire. Cela peut être un défi complexe pour de nombreux développeurs et peut prendre des semaines ou même des mois pour atteindre une solution prête pour la production. Avec MonsterAPI, ils ont pu expérimenter avec plusieurs mises à jour dans la journée et héberger le modèle mis à jour avec le meilleur score d’évaluation en quelques heures, sans nécessiter plusieurs ressources d’ingénierie avec des compétences MLOps approfondies.
De quelle manière l’approche de Monster API démocratise-t-elle l’accès aux modèles d’IA génératifs pour les développeurs et les startups plus petits ?
Les petits développeurs et les startups ont souvent du mal à produire et à utiliser des modèles d’IA de haute qualité en raison d’un manque de capital et de compétences techniques. Nos solutions les rendent puissants en réduisant les coûts, en simplifiant les processus et en fournissant des outils robustes sans code/à faible code pour mettre en œuvre des pipelines d’IA prêts pour la production.
En exploitant notre cloud de GPU décentralisé, nous offrons des ressources GPU abordables et évolutives, réduisant considérablement la barrière de coûts pour le déploiement de modèles à haute performance. La configuration automatique et la mise à jour des hyperparamètres de la plateforme simplifient le processus, éliminant le besoin de compétences techniques approfondies.
Nos API REST intuitives et notre flux de travail intégré combinent la mise à jour et le déploiement en un seul processus cohérent, rendant les technologies d’IA avancées accessibles même à ceux ayant une expérience limitée. De plus, l’utilisation de techniques de mise à jour efficaces LoRA et de quantification telles que GPT-Q et AWQ assure des performances optimales sur du matériel moins coûteux, réduisant encore les coûts d’accès.
Cette approche rend les petits développeurs et les startups capables de mettre en œuvre et de gérer des modèles d’IA génératifs avancés de manière efficace.
Qu’est-ce que vous envisagez comme la prochaine grande avancée ou fonctionnalité que Monster API apportera à la communauté de développement d’IA ?
Nous travaillons sur plusieurs produits innovants pour faire progresser notre thèse : Aider les développeurs à personnaliser et à déployer des modèles plus rapidement, plus facilement et de la manière la plus économique.
Le prochain est un assistant MLOps AI complet qui effectue des recherches sur de nouvelles stratégies d’optimisation pour LLMOps et les intègre dans les flux de travail existants pour réduire les efforts des développeurs pour construire de nouveaux modèles de meilleure qualité tout en permettant une personnalisation et un déploiement complets de pipelines LLM de qualité de production.
Disons que vous devez générer 1 million d’images par minute pour votre cas d’utilisation. Cela peut être extrêmement coûteux. Traditionnellement, vous utiliseriez le modèle Stable Diffusion et passeriez des heures à rechercher et à tester des frameworks d’optimisation comme TensorRT pour améliorer votre débit sans compromettre la qualité et la latence de la sortie.
Cependant, avec l’agent MLOps de MonsterAPI, vous n’aurez pas besoin de gaspiller toutes ces ressources. L’agent trouvera le meilleur framework pour vos exigences, en exploitant des optimisations comme TensorRT adaptées à votre cas d’utilisation spécifique.
Comment Monster API prévoit-il de continuer à prendre en charge et à intégrer de nouveaux modèles open source à mesure qu’ils émergent ?
De trois manières majeures :
- Fournir l’accès aux derniers modèles open source
- Fournir l’interface la plus simple pour la mise à jour et le déploiement
- Optimiser l’ensemble de la pile pour la vitesse et le coût avec les frameworks et les bibliothèques les plus avancés et les plus puissants
Notre mission est d’aider les développeurs de tous niveaux à adopter l’IA générative plus rapidement, en réduisant leur temps d’une idée à un point de terminaison d’API poli et évolutif.
Nous continuerons nos efforts pour fournir l’accès aux derniers frameworks et bibliothèques les plus puissants, intégrés dans un flux de travail fluide pour la mise en œuvre de LLMOps de bout en bout. Nous sommes déterminés à réduire la complexité pour les développeurs avec nos outils sans code, augmentant ainsi leur productivité dans la construction et le déploiement de modèles d’IA.
Pour atteindre cet objectif, nous continuons à soutenir et à intégrer de nouveaux modèles open source, des frameworks d’optimisation et des bibliothèques en suivant les progrès de la communauté d’IA. Nous maintenons un cloud de GPU décentralisé évolutif et nous engageons activement avec les développeurs pour un accès précoce et des commentaires. En exploitant des pipelines automatisés pour une intégration fluide, en améliorant les API flexibles et en formant des partenariats stratégiques avec des organisations de recherche en IA, nous nous assurons que notre plateforme reste à la pointe de la technologie.
De plus, nous fournissons une documentation complète et un support technique robuste, permettant aux développeurs d’adopter et d’utiliser rapidement les derniers modèles. MonsterAPI maintient les développeurs à la pointe de la technologie d’IA générative, les rendant capables d’innover et de réussir.
Quels sont les objectifs à long terme de Monster API en termes de développement technologique et de portée du marché ?
À long terme, nous voulons aider les 30 millions de développeurs de logiciels à devenir des développeurs MLOps avec l’aide de notre agent MLOps et de tous les outils que nous construisons.
Cela nécessitera que nous construisions non seulement un agent complet mais également de nombreuses technologies fondamentales propriétaires autour des frameworks d’optimisation, des méthodes de conteneurisation et de l’orchestration.
Nous croyons qu’une combinaison de grandes interfaces, de 10 fois plus de débit et de coûts de GPU décentralisés à faible coût a le potentiel de transformer la productivité d’un développeur et d’accélérer ainsi l’adoption de l’IA générative.
Toutes nos recherches et nos efforts sont dans cette direction.
Merci pour cette grande interview, les lecteurs qui souhaitent en savoir plus devraient visiter MonsterAPI.












