Entrevistas

Saurabh Vij, CEO e Co-Fundador da MonsterAPI – Série de Entrevistas

mm
Adicione Unite.AI às suas fontes preferidas no Google

Saurabh Vij é o CEO e co-fundador da MonsterAPI. Ele trabalhou anteriormente como físico de partículas no CERN e reconheceu o potencial de computação descentralizada em projetos como o LHC@home.

A MonsterAPI aproveita GPUs de baixo custo de fazendas de mineração de criptomoedas e centros de dados menores para fornecer infraestrutura de GPU escalável e acessível para aprendizado de máquina, permitindo que os desenvolvedores acessem, ajustem e implantem modelos de IA a custos significativamente reduzidos sem precisar escrever uma única linha de código.

Antes da MonsterAPI, ele dirigiu duas startups, incluindo uma que desenvolveu um dispositivo de segurança portátil para mulheres na Índia, em colaboração com o Governo da Índia e a IIT Delhi.

Pode compartilhar a história por trás do MonsterGPT?

Nossa missão sempre foi “ajudar os desenvolvedores a ajustar e implantar modelos de IA de forma mais rápida e fácil possível”. Nós percebemos que existem vários desafios complexos que eles enfrentam quando desejam ajustar e implantar um modelo de IA.

Desde lidar com código até configurar contêineres Docker em GPUs e escalá-los sob demanda

E o ritmo ao qual o ecossistema está se movendo, apenas ajustar não é suficiente. É necessário fazer da maneira certa: evitar subajuste, superajuste, otimização de hiperparâmetros, incorporar métodos mais recentes como LORA e Q-LORA para realizar ajustes mais rápidos e econômicos. Uma vez ajustado, o modelo precisa ser implantado de forma eficiente.

Isso nos fez perceber que oferecer apenas uma ferramenta para uma pequena parte do pipeline não é suficiente. Um desenvolvedor precisa de todo o pipeline otimizado, juntamente com uma interface simples com a qual ele está familiarizado. Desde o ajuste até a avaliação e implantação final de seus modelos.

Perguntei a mim mesmo: como um ex-físico de partículas, entendo o impacto profundo que a IA pode ter no trabalho científico, mas não sei por onde começar. Tenho ideias inovadoras, mas falta tempo para aprender todas as habilidades e nuances do aprendizado de máquina e infraestrutura.

E se eu pudesse simplesmente conversar com uma IA, fornecer meus requisitos e tê-la construir todo o pipeline para mim, entregando o ponto de extremidade da API necessário?

Isso levou à ideia de um sistema baseado em chat para ajudar os desenvolvedores a ajustar e implantar sem esforço.

O MonsterGPT é o nosso primeiro passo nessa jornada.

Há milhões de desenvolvedores de software, inovadores e cientistas como nós que poderiam aproveitar essa abordagem para construir modelos mais específicos para seus projetos.

Pode explicar a tecnologia por trás do agente de implantação baseado em GPT da Monster API?

O MonsterGPT aproveita tecnologias avançadas para implantar e ajustar de forma eficiente modelos de linguagem grandes de código aberto (LLMs) como o Phi3 da Microsoft e o Llama 3 da Meta.

  1. RAG com Configuração de Contexto: Prepara automaticamente configurações com os hiperparâmetros certos para ajustar LLMs ou implantar modelos usando APIs REST escaláveis da MonsterAPI.
  2. LoRA (Adaptação de Baixo Nível): Permite ajuste eficiente atualizando apenas um subconjunto de parâmetros, reduzindo a sobrecarga computacional e os requisitos de memória.
  3. Técnicas de Quantização: Utiliza GPT-Q e AWQ para otimizar o desempenho do modelo, reduzindo a precisão, o que diminui a pegada de memória e acelera a inferência sem perda significativa de precisão.
  4. Motor vLLM: Fornece servir LLM de alta taxa com recursos como batch contínuo, núcleos CUDA otimizados e algoritmos de decodificação paralela para inferência em grande escala eficiente.
  5. GPUs Descentralizados para Escala e Acessibilidade: Nossos trabalhos de ajuste e implantação são executados em uma rede de GPUs de baixo custo de vários fornecedores, desde centros de dados menores até nuvens de GPU emergentes como a coreweave, fornecendo menores custos, alta opção e disponibilidade de GPUs para garantir processamento escalável e eficiente.

Confira o nosso último artigo sobre a implantação do Llama 3 usando o MonsterGPT:

Como ele simplifica o processo de ajuste e implantação?

O MonsterGPT fornece uma interface de chat com a capacidade de entender instruções em linguagem natural para lançar, rastrear e gerenciar trabalhos de ajuste e implantação completos. Essa capacidade abstrai muitas etapas complexas, como:

  • Construir um pipeline de dados
  • Determinar a infraestrutura de GPU certa para o trabalho
  • Configurar hiperparâmetros apropriados
  • Configurar o ambiente de ML com frameworks e bibliotecas compatíveis
  • Implementar scripts de ajuste para LoRA/QLoRA para ajuste eficiente com estratégias de quantização.
  • Depurar problemas como falta de memória e erros de código.
  • Projetar e implementar auto-escalabilidade multi-nó com motores de servir de alta taxa, como o vLLM para implantações de LLM.

Que tipo de interface de usuário e comandos os desenvolvedores podem esperar ao interagir com a interface de chat da Monster API?

A interface de usuário é uma interface de chat simples na qual os usuários podem solicitar ao agente que ajuste um LLM para uma tarefa específica, como resumo, conclusão de chat, geração de código, redação de blog, etc., e, uma vez ajustado, o GPT pode ser instruído a implantar o LLM e consultar o modelo implantado a partir da interface GPT em si. Alguns exemplos de comandos incluem:

  • Ajustar um LLM para geração de código no conjunto de dados X
  • Quero um modelo ajustado para redação de blog
  • Dê-me um ponto de extremidade de API para o modelo Llama 3.
  • Implante um modelo pequeno para o caso de uso de redação de blog

Isso é extremamente útil porque encontrar o modelo certo para o seu projeto pode ser uma tarefa demorada. Com novos modelos surgindo diariamente, pode levar a muita confusão.

Como a solução da Monster API se compara em termos de usabilidade e eficiência aos métodos tradicionais de implantação de modelos de IA?

A solução da Monster API melhora significativamente a usabilidade e a eficiência em comparação com os métodos tradicionais de implantação de modelos de IA.

Para Usabilidade:

  1. Configuração Automática: Os métodos tradicionais frequentemente exigem uma configuração manual extensiva de hiperparâmetros e configurações, o que pode ser propenso a erros e demorado. A MonsterAPI automatiza esse processo usando RAG com contexto, simplificando a configuração e reduzindo a probabilidade de erros.
  2. APIs REST Escaláveis: A MonsterAPI fornece APIs REST intuitivas para implantar e ajustar modelos, tornando-a acessível mesmo para usuários com conhecimento limitado de aprendizado de máquina. Os métodos tradicionais frequentemente exigem conhecimento técnico profundo e codificação complexa para implantação.
  3. Plataforma Unificada: Ela integra todo o fluxo de trabalho, desde o ajuste até a implantação, dentro de uma única plataforma. As abordagens tradicionais podem envolver ferramentas e plataformas dispersas, levando a ineficiências e desafios de integração.

Para Eficiência:

A MonsterAPI oferece um pipeline otimizado para ajuste LoRA com quantização incorporada para utilização eficiente de memória e motor vLLM para servir LLM com alta taxa, com recursos como batch contínuo e núcleos CUDA otimizados, em cima de uma nuvem de GPU descentralizada de baixo custo e alta opção, garantindo processamento escalável e eficiente.

Todo esse pipeline melhora a produtividade do desenvolvedor, permitindo a criação de aplicações personalizadas de LLM de nível de produção, reduzindo a necessidade de habilidades técnicas complexas.

Pode fornecer exemplos de casos de uso nos quais a Monster API reduziu significativamente o tempo e os recursos necessários para a implantação de modelos?

Uma empresa de consultoria em TI precisava ajustar e implantar o modelo Llama 3 para atender às necessidades de negócios de seus clientes. Sem a MonsterAPI, eles teriam precisado de uma equipe de 2 a 3 engenheiros de MLOps com um conhecimento profundo de ajuste de hiperparâmetros para melhorar a qualidade do modelo no conjunto de dados fornecido, e então hospedar o modelo ajustado como um ponto de extremidade de API REST escalável usando auto-escalabilidade e orquestração, provavelmente no Kubernetes. Além disso, para otimizar a economia de servir o modelo, eles queriam usar frameworks como LoRA para ajuste e vLLM para servir o modelo para melhorar métricas de custo, reduzindo o consumo de memória. Isso pode ser um desafio complexo para muitos desenvolvedores e pode levar semanas ou até meses para alcançar uma solução pronta para produção. Com a MonsterAPI, eles conseguiram experimentar com várias execuções de ajuste dentro de um dia e hospedar o modelo ajustado com a melhor pontuação de avaliação dentro de horas, sem precisar de vários recursos de engenharia com habilidades de MLOps profundas.

De que maneira a abordagem da Monster API democratiza o acesso a modelos de IA gerativos para desenvolvedores e startups menores?

Desenvolvedores e startups menores frequentemente lutam para produzir e usar modelos de IA de alta qualidade devido à falta de capital e habilidades técnicas. Nossas soluções os capacitam, reduzindo custos, simplificando processos e fornecendo ferramentas robustas de nível de produção para implementar pipelines de IA.

Ao aproveitar nossa nuvem de GPU descentralizada, oferecemos recursos de GPU escaláveis e acessíveis, reduzindo significativamente a barreira de custo para a implantação de modelos de alto desempenho. A configuração automatizada e o ajuste de hiperparâmetros simplificam o processo, eliminando a necessidade de conhecimento técnico profundo.

Nossas APIs REST intuitivas e o fluxo de trabalho integrado combinam ajuste e implantação em um único processo coeso, tornando tecnologias de IA avançadas acessíveis mesmo para aqueles com experiência limitada. Além disso, o uso de técnicas de ajuste LoRA eficientes e quantização, como GPT-Q e AWQ, garante desempenho ótimo em hardware menos caro, reduzindo ainda mais os custos de entrada.

Essa abordagem capacita desenvolvedores e startups menores a implementar e gerenciar modelos de IA gerativos de forma eficiente e eficaz.

Qual é a próxima grande inovação ou recurso que a Monster API trará para a comunidade de desenvolvimento de IA?

Estamos trabalhando em alguns produtos inovadores para avançar ainda mais nossa tese: ajudar os desenvolvedores a personalizar e implantar modelos mais rápido, de forma mais fácil e econômica.

O próximo passo imediato é um Assistente de MLOps de IA completo que realiza pesquisas sobre novas estratégias de otimização para LLMOps e as integra aos fluxos de trabalho existentes para reduzir o esforço do desenvolvedor na construção de modelos novos e melhores, permitindo também a personalização e implantação completa de pipelines de LLM de nível de produção.

Digamos que você precise gerar 1 milhão de imagens por minuto para o seu caso de uso. Isso pode ser extremamente caro. Tradicionalmente, você usaria o modelo de Difusão Estável e gastaria horas encontrando e testando frameworks de otimização como o TensorRT para melhorar a taxa de transferência sem comprometer a qualidade e a latência da saída.

No entanto, com o agente MLOps da MonsterAPI, você não precisará desperdiçar todos esses recursos. O agente encontrará o melhor framework para os seus requisitos, aproveitando otimizações como o TensorRT personalizado para o seu caso de uso específico.

Como a Monster API planeja continuar apoiando e integrando novos modelos de código aberto à medida que surgem?

De três maneiras principais:

  1. Oferecer acesso aos modelos de código aberto mais recentes
  2. Fornecer a interface mais simples para ajuste e implantação
  3. Otimizar toda a pilha para velocidade e custo com os frameworks e bibliotecas mais avançados e poderosos

Nossa missão é ajudar os desenvolvedores de todos os níveis de habilidade a adotar a IA gerativa mais rápido, reduzindo o tempo de uma ideia até um ponto de extremidade de API polido e escalável.

Continuaremos nossos esforços para fornecer acesso aos frameworks e bibliotecas mais recentes e poderosos, integrados em um fluxo de trabalho sem interrupções para implementar LLMOps de ponta a ponta. Estamos dedicados a reduzir a complexidade para os desenvolvedores com nossas ferramentas de nível de produção, impulsionando sua produtividade na construção e implantação de modelos de IA.

Para alcançar isso, monitoramos continuamente os avanços na comunidade de IA. Mantemos uma nuvem de GPU descentralizada escalável e nos engajamos ativamente com os desenvolvedores para acesso antecipado e feedback. Aproveitando pipelines automatizados para integração sem interrupções, melhorando APIs flexíveis e formando parcerias estratégicas com organizações de pesquisa de IA, garantimos que nossa plataforma permaneça de ponta.

Além disso, fornecemos documentação abrangente e suporte técnico robusto, permitindo que os desenvolvedores adotem e utilizem os modelos mais recentes rapidamente. A MonsterAPI mantém os desenvolvedores à frente da tecnologia de IA gerativa, capacitando-os a inovar e ter sucesso.

Quais são os objetivos de longo prazo para a Monster API em termos de desenvolvimento de tecnologia e alcance de mercado?

A longo prazo, queremos ajudar os 30 milhões de engenheiros de software a se tornarem desenvolvedores de MLOps com a ajuda de nosso agente de MLOps e de todas as ferramentas que estamos construindo.

Isso exigirá que construamos não apenas um agente completo, mas também muitas tecnologias fundamentais proprietárias em torno de frameworks de otimização, métodos de contêiner e orquestração.

Acreditamos que a combinação de interfaces simples, 10 vezes mais taxa de transferência e GPUs descentralizadas de baixo custo tem o potencial de transformar a produtividade de um desenvolvedor e, portanto, acelerar a adoção da IA gerativa.

Todos os nossos pesquisas e esforços estão nessa direção.

Obrigado pela grande entrevista, leitores que desejam aprender mais devem visitar MonsterAPI.

Antoine é um líder visionário e sócio-fundador da Unite.AI, impulsionado por uma paixão inabalável por moldar e promover o futuro da IA e da robótica. Um empreendedor serial, ele acredita que a IA será tão disruptiva para a sociedade quanto a eletricidade, e é frequentemente pego falando sobre o potencial das tecnologias disruptivas e da AGI.

Como um futurista, ele está dedicado a explorar como essas inovações moldarão nosso mundo. Além disso, ele é o fundador da Securities.io, uma plataforma focada em investir em tecnologias de ponta que estão redefinindo o futuro e remodelando setores inteiros.