Entrevistas
Saurabh Vij, CEO y cofundador de MonsterAPI – Serie de entrevistas

Saurabh Vij es el CEO y cofundador de MonsterAPI. Anteriormente, trabajó como físico de partículas en CERN y reconoció el potencial de la computación descentralizada en proyectos como LHC@home.
MonsterAPI aprovecha los GPUs de bajo costo de las granjas de minería de criptomonedas y los centros de datos inactivos para proporcionar una infraestructura de GPU escalable y asequible para el aprendizaje automático, lo que permite a los desarrolladores acceder, ajustar y desplegar modelos de IA a un costo significativamente reducido sin tener que escribir una sola línea de código.
Antes de MonsterAPI, dirigió dos startups, incluyendo una que desarrolló un dispositivo de seguridad wearable para mujeres en la India, en colaboración con el Gobierno de la India y el IIT Delhi.
¿Puede compartir la historia detrás de MonsterGPT?
Nuestra misión siempre ha sido “ayudar a los desarrolladores de software a ajustar y desplegar modelos de IA de manera más rápida y sencilla posible”. Nos dimos cuenta de que existen múltiples desafíos complejos que enfrentan cuando desean ajustar y desplegar un modelo de IA.
Desde lidiar con el código hasta configurar contenedores de Docker en GPUs y escalarlos según sea necesario
Y el ritmo al que se mueve el ecosistema, solo ajustar no es suficiente. Debe hacerse de la manera correcta: evitando la subajuste, la sobreajuste, la optimización de hiperparámetros, incorporando los últimos métodos como LORA y Q-LORA para realizar un ajuste más rápido y económico. Una vez ajustado, el modelo debe desplegarse de manera eficiente.
Nos dimos cuenta de que ofrecer solo una herramienta para una pequeña parte de la canalización no es suficiente. Un desarrollador necesita toda la canalización optimizada, junto con una gran interfaz con la que esté familiarizado. Desde el ajuste hasta la evaluación y el despliegue final de sus modelos.
Me hice una pregunta: como ex físico de partículas, entiendo el impacto profundo que la IA podría tener en el trabajo científico, pero no sé por dónde empezar. Tengo ideas innovadoras, pero me falta el tiempo para aprender todas las habilidades y matices del aprendizaje automático y la infraestructura.
¿Qué pasaría si pudiera simplemente hablar con una IA, proporcionar mis requisitos y que ella construya toda la canalización para mí, entregando el punto final de la API requerida?
Esto me llevó a la idea de un sistema basado en chat para ayudar a los desarrolladores a ajustar y desplegar sin esfuerzo.
MonsterGPT es nuestro primer paso hacia este viaje.
Hay millones de desarrolladores de software, innovadores y científicos como nosotros que podrían aprovechar este enfoque para construir modelos más específicos de dominio para sus proyectos.
¿Puede explicar la tecnología subyacente detrás del agente de despliegue de GPT de Monster API?
MonsterGPT aprovecha tecnologías avanzadas para desplegar y ajustar de manera eficiente modelos de lenguaje grande de código abierto (LLM) como Phi3 de Microsoft y Llama 3 de Meta.
- RAG con configuración de contexto: prepara automáticamente configuraciones con los hiperparámetros correctos para ajustar LLM o desplegar modelos utilizando API de REST escalables de MonsterAPI.
- LoRA (adaptación de bajo rango): permite un ajuste eficiente actualizando solo un subconjunto de parámetros, reduciendo la sobrecarga computacional y los requisitos de memoria.
- Técnicas de cuantificación: utiliza GPT-Q y AWQ para optimizar el rendimiento del modelo reduciendo la precisión, lo que reduce la huella de memoria y acelera la inferencia sin una pérdida significativa de precisión.
- Motor vLLM: proporciona un servicio de LLM de alta capacidad con características como procesamiento por lotes continuo, núcleos CUDA optimizados y algoritmos de decodificación paralela para una inferencia a gran escala eficiente.
- GPUs descentralizadas para escalabilidad y asequibilidad: nuestras cargas de trabajo de ajuste y despliegue se ejecutan en una red de GPUs de bajo costo de varios proveedores, desde centros de datos más pequeños hasta nubes de GPU emergentes como coreweave, lo que proporciona costos más bajos, mayor flexibilidad y disponibilidad de GPUs para garantizar un procesamiento escalable y eficiente.
Consulte este último blog para la implementación de Llama 3 utilizando MonsterGPT:
¿Cómo simplifica el proceso de ajuste y despliegue?
MonsterGPT proporciona una interfaz de chat con la capacidad de entender instrucciones en lenguaje natural para lanzar, rastrear y administrar trabajos de ajuste y despliegue completos. Esta capacidad abstrae muchos pasos complejos, como:
- Construir una canalización de datos
- Determinar la infraestructura de GPU adecuada para el trabajo
- Configurar hiperparámetros adecuados
- Configurar el entorno de ML con marcos y bibliotecas compatibles
- Implementar scripts de ajuste para LoRA/QLoRA con estrategias de cuantificación.
- Depurar problemas como memoria agotada y errores de código.
- Diseñar e implementar un escalado automático de varios nodos con motores de servicio de alta capacidad como vLLM para despliegues de LLM.
¿Qué tipo de interfaz de usuario y comandos pueden esperar los desarrolladores al interactuar con la interfaz de chat de Monster API?
La interfaz de usuario es una interfaz de chat simple en la que los usuarios pueden solicitar al agente que ajuste un LLM para una tarea específica, como resumen, completar chat, generación de código, escritura de blogs, etc., y una vez ajustado, el GPT puede recibir instrucciones adicionales para desplegar el LLM y consultar el modelo desplegado desde la interfaz de GPT en sí. Algunos ejemplos de comandos incluyen:
- Ajustar un LLM para la generación de código en el conjunto de datos X
- Quiero un modelo ajustado para la escritura de blogs
- Proporciona un punto final de API para el modelo Llama 3.
- Desplegar un modelo pequeño para el caso de uso de escritura de blogs
Esto es extremadamente útil porque encontrar el modelo adecuado para su proyecto puede convertirse en una tarea que consume mucho tiempo. Con nuevos modelos que surgen a diario, puede generar mucha confusión.
¿Cómo se compara la solución de Monster API en términos de usabilidad y eficiencia con los métodos tradicionales de despliegue de modelos de IA?
La solución de Monster API mejora significativamente la usabilidad y la eficiencia en comparación con los métodos tradicionales de despliegue de modelos de IA.
Para la usabilidad:
- Configuración automatizada: los métodos tradicionales a menudo requieren una configuración manual extensa de hiperparámetros y configuraciones, lo que puede ser propenso a errores y consume mucho tiempo. MonsterAPI automatiza este proceso utilizando RAG con contexto, simplificando la configuración y reduciendo la probabilidad de errores.
- API de REST escalables: MonsterAPI proporciona API de REST intuitivas para desplegar y ajustar modelos, lo que la hace accesible incluso para usuarios con experiencia limitada en aprendizaje automático. Los métodos tradicionales a menudo requieren un conocimiento técnico profundo y codificación compleja para el despliegue.
- Plataforma unificada: integra toda la canalización, desde el ajuste hasta el despliegue, dentro de una sola plataforma. Los enfoques tradicionales pueden involucrar herramientas y plataformas dispares, lo que lleva a ineficiencias y desafíos de integración.
Para la eficiencia:
MonsterAPI ofrece una canalización simplificada para el ajuste de LoRA con cuantificación integrada para una utilización de memoria eficiente y un motor vLLM impulsado por el servicio de LLM para lograr un alto rendimiento con procesamiento por lotes continuo y núcleos CUDA optimizados, sobre una nube de GPU descentralizada rentable, escalable y con alta disponibilidad para garantizar un procesamiento escalable y eficiente.
Esta canalización completa mejora la productividad del desarrollador al permitir la creación de aplicaciones personalizadas de LLM de grado de producción mientras reduce la necesidad de habilidades técnicas complejas.
¿Puede proporcionar ejemplos de casos de uso en los que Monster API ha reducido significativamente el tiempo y los recursos necesarios para el despliegue de modelos?
Una empresa de consultoría de TI necesitaba ajustar y desplegar el modelo Llama 3 para satisfacer las necesidades comerciales de su cliente. Sin MonsterAPI, habrían necesitado un equipo de 2-3 ingenieros de MLOps con un conocimiento profundo de la optimización de hiperparámetros para mejorar la calidad del modelo en el conjunto de datos proporcionado, y luego alojar el modelo ajustado como un punto final de API de REST escalable utilizando escalado automático y orquestación, probablemente en Kubernetes. Además, para optimizar la economía del servicio del modelo, querían utilizar marcos como LoRA para el ajuste y vLLM para el servicio del modelo para mejorar los métricos de costo mientras reducen el consumo de memoria. Esto puede ser un desafío complejo para muchos desarrolladores y puede tardar semanas o incluso meses en lograr una solución lista para producción. Con MonsterAPI, pudieron experimentar con múltiples ejecuciones de ajuste en un día y alojar el modelo ajustado con la mejor puntuación de evaluación en cuestión de horas, sin necesidad de múltiples recursos de ingeniería con habilidades profundas en MLOps.
¿De qué manera la aproximación de Monster API democratiza el acceso a los modelos de IA generativos para los desarrolladores y startups más pequeños?
Los desarrolladores y startups más pequeños a menudo luchan para producir y utilizar modelos de IA de alta calidad debido a la falta de capital y habilidades técnicas. Nuestras soluciones los empoderan al reducir los costos, simplificar los procesos y proporcionar herramientas de código bajo/no código robustas para implementar canalizaciones de IA listas para producción.
Al aprovechar nuestra nube de GPU descentralizada, ofrecemos recursos de GPU asequibles y escalables, reduciendo significativamente la barrera de costo para el despliegue de modelos de alta capacidad. La configuración automatizada y el ajuste de hiperparámetros de la plataforma simplifican el proceso, eliminando la necesidad de habilidades técnicas profundas.
Nuestras API de REST integradas y la canalización combinan el ajuste y el despliegue en un proceso único y coherente, lo que hace que las tecnologías de IA avanzadas sean accesibles incluso para aquellos con experiencia limitada. Además, el uso de técnicas de ajuste eficientes de LoRA y cuantificación como GPT-Q y AWQ garantiza un rendimiento óptimo en hardware menos costoso, lo que reduce aún más los costos de entrada.
Este enfoque permite a los desarrolladores y startups más pequeños implementar y administrar modelos de IA generativos avanzados de manera eficiente y efectiva.
¿Qué vislumbra como el próximo gran avance o característica que Monster API aportará a la comunidad de desarrollo de IA?
Estamos trabajando en algunos productos innovadores para avanzar aún más en nuestra tesis: ayudar a los desarrolladores a personalizar y desplegar modelos más rápido, más fácil y de la manera más económica.
El inmediato es un asistente de MLOps de IA completo que realiza investigaciones sobre nuevas estrategias de optimización para LLMOps e integra estas en las canalizaciones existentes para reducir el esfuerzo del desarrollador en la creación de modelos nuevos y mejores, al mismo tiempo que permite la personalización y despliegue completo de canalizaciones de LLM de grado de producción.
Supongamos que necesita generar 1 millón de imágenes por minuto para su caso de uso. Esto puede ser extremadamente costoso. Tradicionalmente, utilizaría el modelo de difusión estable y pasaría horas buscando y probando marcos de optimización como TensorRT para mejorar el rendimiento sin comprometer la calidad y la latencia de la salida.
Sin embargo, con el agente MLOps de MonsterAPI, no necesitará desperdiciar todos esos recursos. El agente encontrará el mejor marco para sus requisitos, aprovechando optimizaciones como TensorRT adaptadas a su caso de uso específico.
¿Cómo planea Monster API continuar apoyando e integrando nuevos modelos de código abierto a medida que surgen?
De tres maneras importantes:
- Proporcionar acceso a los últimos modelos de código abierto
- Ofrecer la interfaz más simple para el ajuste y el despliegue
- Optimizar toda la pila para velocidad y costo con los marcos y bibliotecas más avanzados y potentes
Nuestra misión es ayudar a los desarrolladores de todos los niveles a adoptar la IA generativa más rápido, reduciendo su tiempo desde una idea hasta un punto final de API pulido y escalable.
Continuaremos nuestros esfuerzos para proporcionar acceso a los marcos y bibliotecas más recientes y potentes, integrados en una canalización sin problemas para implementar LLMOps de extremo a extremo. Estamos comprometidos con reducir la complejidad para los desarrolladores con nuestras herramientas de código bajo, lo que aumenta su productividad al construir y desplegar modelos de IA.
Para lograr esto, monitoreamos continuamente los avances en la comunidad de IA. Mantenemos una nube de GPU descentralizada escalable y nos involucramos activamente con los desarrolladores para el acceso temprano y la retroalimentación. Al aprovechar canalizaciones automatizadas para una integración sin problemas, mejorar API flexibles y formar asociaciones estratégicas con organizaciones de investigación de IA, garantizamos que nuestra plataforma permanece en la vanguardia.
Además, proporcionamos documentación completa y un sólido soporte técnico, lo que permite a los desarrolladores adoptar y utilizar los últimos modelos rápidamente. MonsterAPI mantiene a los desarrolladores a la vanguardia de la tecnología de IA generativa, lo que les permite innovar y tener éxito.
¿Cuáles son los objetivos a largo plazo para Monster API en términos de desarrollo tecnológico y alcance del mercado?
A largo plazo, queremos ayudar a los 30 millones de ingenieros de software a convertirse en desarrolladores de MLOps con la ayuda de nuestro agente de MLOps y todas las herramientas que estamos construyendo.
Esto requeriría que construyamos no solo un agente completo, sino también muchas tecnologías fundamentales y propietarias sobre marcos de optimización, métodos de contenerización y orquestación.
Creamos que una combinación de grandes, sencillas interfaces, 10 veces más rendimiento y GPUs descentralizadas de bajo costo tiene el potencial de transformar la productividad de un desarrollador y, por lo tanto, acelerar la adopción de la IA generativa.
Todos nuestros esfuerzos y investigaciones están en esta dirección.
Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar MonsterAPI.












