Интервью
Саурабх Видж, генеральный директор и сооснователь MonsterAPI – Интервью

Саурабх Видж является генеральным директором и сооснователем MonsterAPI. Ранее он работал физиком-частиц в ЦЕРН и осознал потенциал децентрализованной вычислительной техники благодаря проектам, таким как LHC@home.
MonsterAPI использует более дешевые коммодитные GPU из криптовалютных ферм до небольших простаивающих центров обработки данных, чтобы обеспечить масштабируемую и доступную инфраструктуру GPU для машинного обучения, позволяя разработчикам получать доступ, тонко настраивать и развертывать модели ИИ при значительно сниженных затратах без написания единой строки кода.
До MonsterAPI он возглавлял два стартапа, включая один, который разработал носимое устройство безопасности для женщин в Индии в сотрудничестве с правительством Индии и ИИТ Дели.
Можете ли вы поделиться историей создания MonsterGPT?
Наша миссия всегда заключалась в том, чтобы “помочь разработчикам программного обеспечения тонко настраивать и развертывать модели ИИ быстрее и в наиболее простой форме”. Мы поняли, что существуют множество сложных проблем, с которыми они сталкиваются, когда хотят тонко настроить и развернуть модель ИИ.
От работы с кодом до настройки контейнеров Docker на GPU и масштабирования их по требованию
И темп, с которым движется экосистема, просто тонкая настройка недостаточно. Это должно быть сделано правильно: избегая недообучения, переобучения, оптимизации гиперпараметров, включения последних методов, таких как LORA и Q-LORA, для более быстрой и экономичной тонкой настройки. Как только модель тонко настроена, ее необходимо эффективно развернуть.
Это заставило нас понять, что предложение только инструмента для небольшой части процесса недостаточно. Разработчику нужен весь оптимизированный процесс, в сочетании с отличным интерфейсом, с которым он знаком. От тонкой настройки до оценки и окончательного развертывания своих моделей.
Я задал себе вопрос: как бывший физик-частиц, я понимаю глубокое влияние, которое ИИ может оказать на научную работу, но я не знаю, с чего начать. У меня есть инновационные идеи, но мне не хватает времени, чтобы изучить все навыки и нюансы машинного обучения и инфраструктуры.
Что, если бы я мог просто поговорить с ИИ, предоставить ему свои требования и иметь его построить весь процесс для меня, доставив необходимый API-интерфейс?
Это привело к идее чат-основанной системы, чтобы помочь разработчикам тонко настраивать и развертывать без усилий.
MonsterGPT является нашим первым шагом на этом пути.
Существуют миллионы разработчиков программного обеспечения, инноваторов и ученых, как мы, которые могли бы использовать этот подход, чтобы построить более специфические модели для своих проектов.
Можете ли вы объяснить основную технологию, лежащую в основе агента развертывания GPT Monster API?
MonsterGPT использует передовые технологии для эффективного развертывания и тонкой настройки открытых языковых моделей (LLM) таких, как Phi3 от Microsoft и Llama 3 от Meta.
- RAG с контекстной конфигурацией: автоматически готовит конфигурации с правильными гиперпараметрами для тонкой настройки LLM или развертывания моделей с помощью масштабируемых REST-API от MonsterAPI.
- LoRA (Низкоранговая адаптация): позволяет эффективно тонко настраивать, обновляя только подмножество параметров, снижая вычислительную нагрузку и требования к памяти.
- Техники квантования: используют GPT-Q и AWQ для оптимизации производительности модели, снижая точность, что снижает размер памяти и ускоряет вывод без значительной потери точности.
- Двигатель vLLM: обеспечивает высокопроизводительное обслуживание LLM с функциями, такими как непрерывная пакетная обработка, оптимизированные ядра CUDA и параллельные алгоритмы декодирования для эффективного крупномасштабного вывода.
- Децентрализованные GPU для масштабируемости и доступности: наши задачи тонкой настройки и развертывания работают на сети низкозатратных GPU от нескольких поставщиков, от небольших центров обработки данных до новых GPU-облаков, таких как coreweave, обеспечивая более низкие затраты, высокую опционность и доступность GPU для обеспечения масштабируемой и эффективной обработки.
Ознакомьтесь с последним блогом о развертывании Llama 3 с помощью MonsterGPT:
Как это упрощает процесс тонкой настройки и развертывания?
MonsterGPT предоставляет чат-интерфейс с возможностью понимать инструкции в естественном языке для запуска, отслеживания и управления полными задачами тонкой настройки и развертывания. Эта возможность абстрагирует многие сложные шаги, такие как:
- Создание конвейера данных
- Определение правильной инфраструктуры GPU для задачи
- Настройка соответствующих гиперпараметров
- Настройка среды машинного обучения с совместимыми фреймворками и библиотеками
- Реализация скриптов тонкой настройки для эффективной тонкой настройки LoRA/QLoRA с стратегиями квантования.
- Отладка проблем, таких как нехватка памяти и ошибки кода.
- Проектирование и реализация многонодовой автоматической масштабируемости с высокопроизводительными двигателями обслуживания, такими как vLLM для развертывания LLM.
Какой интерфейс и команды могут ожидать разработчики при взаимодействии с чат-интерфейсом Monster API?
Интерфейс представляет собой простой чат-интерфейс, в котором пользователи могут побудить агента тонко настроить LLM для конкретной задачи, такой как суммаризация, завершение чата, генерация кода, написание блогов и т. д., а затем, как только тонко настроено, GPT может быть далее инструктирован на развертывание LLM и запрос развернутой модели из интерфейса GPT. Некоторые примеры команд включают:
- Тонко настроить LLM для генерации кода на наборе данных X
- Я хочу модель, тонко настроенную для написания блогов
- Дайте мне API-интерфейс для модели Llama 3.
- Развернуть небольшую модель для случая использования написания блогов
Это чрезвычайно полезно, поскольку поиск правильной модели для вашего проекта может часто стать затратным по времени заданием. С новыми моделями, появляющимися ежедневно, это может привести к большому количеству путаницы.
Как решение Monster API сравнивается с традиционными методами развертывания моделей ИИ в плане удобства использования и эффективности?
Решение Monster API значительно улучшает удобство использования и эффективность по сравнению с традиционными методами развертывания моделей ИИ.
Для удобства использования:
- Автоматическая конфигурация: традиционные методы часто требуют обширной ручной настройки гиперпараметров и конфигураций, что может быть ошибочным и затратным по времени. MonsterAPI автоматизирует этот процесс с помощью RAG с контекстом, упрощая настройку и снижая вероятность ошибок.
- Масштабируемые REST-API: MonsterAPI предоставляет интуитивно понятные REST-API для развертывания и тонкой настройки моделей, что делает его доступным даже для пользователей с ограниченным опытом в области машинного обучения. Традиционные методы часто требуют глубоких технических знаний и сложного кодирования для развертывания.
- Унифицированная платформа: она интегрирует весь процесс, от тонкой настройки до развертывания, в единую платформу. Традиционные подходы могут включать разрозненные инструменты и платформы, что приводит к неэффективности и проблемам интеграции.
Для эффективности:
MonsterAPI предлагает оптимизированный процесс для тонкой настройки LoRA с встроенным квантованием для эффективного использования памяти и двигателем vLLM для обслуживания LLM для достижения высокого пропускного потока с непрерывной пакетной обработкой и оптимизированными ядрами CUDA, на основе децентрализованного GPU-облака с упрощенным мониторингом и ведением журнала.
Этот весь процесс повышает производительность разработчиков, позволяя создавать приложения LLM производственного уровня, снижая потребность в сложных технических навыках.
Можете ли вы предоставить примеры случаев использования, когда Monster API значительно сократил время и ресурсы, необходимые для развертывания модели?
Компания по консалтингу в области информационных технологий нуждалась в тонкой настройке и развертывании модели Llama 3 для удовлетворения деловых потребностей своего клиента. Без MonsterAPI им потребовалась бы команда из 2-3 инженеров MLOps с глубоким пониманием настройки гиперпараметров для улучшения качества модели на предоставленном наборе данных, а затем хостинг тонко настроенной модели в качестве масштабируемого API-интерфейса с помощью автомасштабирования и оркестровки, вероятно, на Kubernetes. Кроме того, для оптимизации экономики обслуживания модели они хотели использовать фреймворки, такие как LoRA для тонкой настройки, и vLLM для обслуживания модели для улучшения метрик стоимости, снижая потребление памяти. Это может быть сложной задачей для многих разработчиков и может занять недели или даже месяцы для достижения решения, готового к производству. С MonsterAPI они смогли экспериментировать с несколькими запусками тонкой настройки в течение дня и хостить тонко настроенную модель с лучшим баллом оценки в течение нескольких часов, не требуя нескольких инженерных ресурсов с глубокими навыками MLOps.
Каким образом подход Monster API демократизирует доступ к генеративным моделям ИИ для более мелких разработчиков и стартапов?
Малые разработчики и стартапы часто испытывают трудности с производством и использованием высококачественных моделей ИИ из-за отсутствия капитала и технических навыков. Наши решения укрепляют их, снижая затраты, упрощая процессы и предоставляя прочные инструменты без кода/с низким кодом для реализации готовых к производству процессов ИИ.
Используя наш децентрализованный GPU-облако, мы предлагаем доступные и масштабируемые ресурсы GPU, значительно снижая барьер стоимости для развертывания моделей высокого производительного класса. Автоматическая конфигурация платформы и настройка гиперпараметров упрощают процесс, исключая необходимость глубоких технических знаний.
Наши удобные REST-API и интегрированный процесс объединяют тонкую настройку и развертывание в единый, сплоченный процесс, делая передовые технологии ИИ доступными даже для тех, у кого ограниченный опыт. Кроме того, использование эффективных методов тонкой настройки LoRA и методов квантования, таких как GPT-Q и AWQ, обеспечивает оптимальную производительность на менее дорогом оборудовании, еще больше снижая первоначальные затраты.
Этот подход укрепляет малых разработчиков и стартапов, позволяя им эффективно и результативно реализовывать и управлять передовыми генеративными моделями ИИ.
Что вы видите как следующий основной прорыв или функцию, которую Monster API принесет в сообщество разработчиков ИИ?
Мы работаем над несколькими инновационными продуктами, чтобы еще больше продвинуть нашу концепцию: помочь разработчикам настраивать и развертывать модели быстрее, проще и наиболее экономично.
Немедленное следующее – это полный помощник MLOps AI, который выполняет исследования новых стратегий оптимизации для LLMOps и интегрирует их в существующие процессы для снижения усилий разработчиков по созданию новых и лучших моделей, а также обеспечивает полную настройку и развертывание производственных процессов LLM.
Допустим, вам нужно сгенерировать 1 миллион изображений в минуту для вашего случая использования. Это может быть чрезвычайно дорого. Традиционно вы бы использовали модель Stable Diffusion и потратили часы на поиск и тестирование оптимизационных фреймворков, таких как TensorRT, для улучшения вашего пропускного потока без компрометации качества и задержки вывода.
Однако с помощью помощника MLOps от MonsterAPI вам не придется тратить все эти ресурсы. Помощник найдет лучший фреймворк для ваших требований, используя оптимизации, такие как TensorRT, адаптированные к вашему конкретному случаю использования.
Как Monster API планирует продолжать поддержку и интеграцию новых открытых моделей, когда они появляются?
Тремя основными способами:
- Предоставить доступ к последним открытым моделям
- Предоставить наиболее простой интерфейс для тонкой настройки и развертывания
- Оптимизировать весь стек для скорости и стоимости с использованием наиболее передовых и мощных фреймворков и библиотек
Наша миссия – помочь разработчикам всех уровней принять Gen AI быстрее, снижая время от идеи до готового и масштабируемого API-интерфейса.
Мы продолжим наши усилия по предоставлению доступа к последним и наиболее мощным фреймворкам и библиотекам, интегрированным в бесшовный процесс для реализации процессов LLMOps от начала до конца. Мы посвящены снижению сложности для разработчиков с помощью наших инструментов без кода, тем самым повышая их производительность при построении и развертывании моделей ИИ.
Для достижения этого мы постоянно поддерживаем и интегрируем новые открытые модели, фреймворки оптимизации и библиотеки, отслеживая достижения в области ИИ. Мы поддерживаем масштабируемое децентрализованное GPU-облако и активно взаимодействуем с разработчиками для раннего доступа и обратной связи. Используя автоматические процессы для бесшовной интеграции, улучшая гибкие API и заключая стратегические партнерства с организациями ИИ-исследований, мы гарантируем, что наша платформа остается передовой.
Кроме того, мы предоставляем полную документацию и прочную техническую поддержку, позволяя разработчикам быстро принять и использовать последние модели. MonsterAPI держит разработчиков на переднем крае технологий генеративного ИИ, наделяя их возможностью инноваций и успеха.
Каковы долгосрочные цели Monster API в плане развития технологий и охвата рынка?
В долгосрочной перспективе мы хотим помочь 30 миллионам инженерам по программному обеспечению стать разработчиками MLOps с помощью нашего помощника MLOps и всех инструментов, которые мы строим.
Это потребует от нас построения не только полноценного помощника, но и многих фундаментальных проприетарных технологий, связанных с фреймворками оптимизации, методами контейнеризации и оркестровкой.
Мы считаем, что сочетание отличных, простых интерфейсов, увеличение пропускного потока в 10 раз и низкозатратные децентрализованные GPU имеет потенциал трансформировать производительность разработчика и тем самым ускорить принятие GenAI.
Все наши исследования и усилия направлены в этом направлении.
Спасибо за отличное интервью, читатели, которые хотят узнать больше, должны посетить MonsterAPI.












