Интервью

Саурабх Видж, генеральный директор и сооснователь MonsterAPI – Интервью

mm
Добавьте Unite.AI в избранные источники в Google

Саурабх Видж является генеральным директором и сооснователем MonsterAPI. Ранее он работал физиком-частиц в ЦЕРН и осознал потенциал децентрализованной вычислительной техники благодаря проектам, таким как LHC@home.

MonsterAPI использует более дешевые коммодитные GPU из криптовалютных ферм до небольших простаивающих центров обработки данных, чтобы обеспечить масштабируемую и доступную инфраструктуру GPU для машинного обучения, позволяя разработчикам получать доступ, тонко настраивать и развертывать модели ИИ при значительно сниженных затратах без написания единой строки кода.

До MonsterAPI он возглавлял два стартапа, включая один, который разработал носимое устройство безопасности для женщин в Индии в сотрудничестве с правительством Индии и ИИТ Дели.

Можете ли вы поделиться историей создания MonsterGPT?

Наша миссия всегда заключалась в том, чтобы “помочь разработчикам программного обеспечения тонко настраивать и развертывать модели ИИ быстрее и в наиболее простой форме”. Мы поняли, что существуют множество сложных проблем, с которыми они сталкиваются, когда хотят тонко настроить и развернуть модель ИИ.

От работы с кодом до настройки контейнеров Docker на GPU и масштабирования их по требованию

И темп, с которым движется экосистема, просто тонкая настройка недостаточно. Это должно быть сделано правильно: избегая недообучения, переобучения, оптимизации гиперпараметров, включения последних методов, таких как LORA и Q-LORA, для более быстрой и экономичной тонкой настройки. Как только модель тонко настроена, ее необходимо эффективно развернуть.

Это заставило нас понять, что предложение только инструмента для небольшой части процесса недостаточно. Разработчику нужен весь оптимизированный процесс, в сочетании с отличным интерфейсом, с которым он знаком. От тонкой настройки до оценки и окончательного развертывания своих моделей.

Я задал себе вопрос: как бывший физик-частиц, я понимаю глубокое влияние, которое ИИ может оказать на научную работу, но я не знаю, с чего начать. У меня есть инновационные идеи, но мне не хватает времени, чтобы изучить все навыки и нюансы машинного обучения и инфраструктуры.

Что, если бы я мог просто поговорить с ИИ, предоставить ему свои требования и иметь его построить весь процесс для меня, доставив необходимый API-интерфейс?

Это привело к идее чат-основанной системы, чтобы помочь разработчикам тонко настраивать и развертывать без усилий.

MonsterGPT является нашим первым шагом на этом пути.

Существуют миллионы разработчиков программного обеспечения, инноваторов и ученых, как мы, которые могли бы использовать этот подход, чтобы построить более специфические модели для своих проектов.

Можете ли вы объяснить основную технологию, лежащую в основе агента развертывания GPT Monster API?

MonsterGPT использует передовые технологии для эффективного развертывания и тонкой настройки открытых языковых моделей (LLM) таких, как Phi3 от Microsoft и Llama 3 от Meta.

  1. RAG с контекстной конфигурацией: автоматически готовит конфигурации с правильными гиперпараметрами для тонкой настройки LLM или развертывания моделей с помощью масштабируемых REST-API от MonsterAPI.
  2. LoRA (Низкоранговая адаптация): позволяет эффективно тонко настраивать, обновляя только подмножество параметров, снижая вычислительную нагрузку и требования к памяти.
  3. Техники квантования: используют GPT-Q и AWQ для оптимизации производительности модели, снижая точность, что снижает размер памяти и ускоряет вывод без значительной потери точности.
  4. Двигатель vLLM: обеспечивает высокопроизводительное обслуживание LLM с функциями, такими как непрерывная пакетная обработка, оптимизированные ядра CUDA и параллельные алгоритмы декодирования для эффективного крупномасштабного вывода.
  5. Децентрализованные GPU для масштабируемости и доступности: наши задачи тонкой настройки и развертывания работают на сети низкозатратных GPU от нескольких поставщиков, от небольших центров обработки данных до новых GPU-облаков, таких как coreweave, обеспечивая более низкие затраты, высокую опционность и доступность GPU для обеспечения масштабируемой и эффективной обработки.

Ознакомьтесь с последним блогом о развертывании Llama 3 с помощью MonsterGPT:

Как это упрощает процесс тонкой настройки и развертывания?

MonsterGPT предоставляет чат-интерфейс с возможностью понимать инструкции в естественном языке для запуска, отслеживания и управления полными задачами тонкой настройки и развертывания. Эта возможность абстрагирует многие сложные шаги, такие как:

  • Создание конвейера данных
  • Определение правильной инфраструктуры GPU для задачи
  • Настройка соответствующих гиперпараметров
  • Настройка среды машинного обучения с совместимыми фреймворками и библиотеками
  • Реализация скриптов тонкой настройки для эффективной тонкой настройки LoRA/QLoRA с стратегиями квантования.
  • Отладка проблем, таких как нехватка памяти и ошибки кода.
  • Проектирование и реализация многонодовой автоматической масштабируемости с высокопроизводительными двигателями обслуживания, такими как vLLM для развертывания LLM.

Какой интерфейс и команды могут ожидать разработчики при взаимодействии с чат-интерфейсом Monster API?

Интерфейс представляет собой простой чат-интерфейс, в котором пользователи могут побудить агента тонко настроить LLM для конкретной задачи, такой как суммаризация, завершение чата, генерация кода, написание блогов и т. д., а затем, как только тонко настроено, GPT может быть далее инструктирован на развертывание LLM и запрос развернутой модели из интерфейса GPT. Некоторые примеры команд включают:

  • Тонко настроить LLM для генерации кода на наборе данных X
  • Я хочу модель, тонко настроенную для написания блогов
  • Дайте мне API-интерфейс для модели Llama 3.
  • Развернуть небольшую модель для случая использования написания блогов

Это чрезвычайно полезно, поскольку поиск правильной модели для вашего проекта может часто стать затратным по времени заданием. С новыми моделями, появляющимися ежедневно, это может привести к большому количеству путаницы.

Как решение Monster API сравнивается с традиционными методами развертывания моделей ИИ в плане удобства использования и эффективности?

Решение Monster API значительно улучшает удобство использования и эффективность по сравнению с традиционными методами развертывания моделей ИИ.

Для удобства использования:

  1. Автоматическая конфигурация: традиционные методы часто требуют обширной ручной настройки гиперпараметров и конфигураций, что может быть ошибочным и затратным по времени. MonsterAPI автоматизирует этот процесс с помощью RAG с контекстом, упрощая настройку и снижая вероятность ошибок.
  2. Масштабируемые REST-API: MonsterAPI предоставляет интуитивно понятные REST-API для развертывания и тонкой настройки моделей, что делает его доступным даже для пользователей с ограниченным опытом в области машинного обучения. Традиционные методы часто требуют глубоких технических знаний и сложного кодирования для развертывания.
  3. Унифицированная платформа: она интегрирует весь процесс, от тонкой настройки до развертывания, в единую платформу. Традиционные подходы могут включать разрозненные инструменты и платформы, что приводит к неэффективности и проблемам интеграции.

Для эффективности:

MonsterAPI предлагает оптимизированный процесс для тонкой настройки LoRA с встроенным квантованием для эффективного использования памяти и двигателем vLLM для обслуживания LLM для достижения высокого пропускного потока с непрерывной пакетной обработкой и оптимизированными ядрами CUDA, на основе децентрализованного GPU-облака с упрощенным мониторингом и ведением журнала.

Этот весь процесс повышает производительность разработчиков, позволяя создавать приложения LLM производственного уровня, снижая потребность в сложных технических навыках.

Можете ли вы предоставить примеры случаев использования, когда Monster API значительно сократил время и ресурсы, необходимые для развертывания модели?

Компания по консалтингу в области информационных технологий нуждалась в тонкой настройке и развертывании модели Llama 3 для удовлетворения деловых потребностей своего клиента. Без MonsterAPI им потребовалась бы команда из 2-3 инженеров MLOps с глубоким пониманием настройки гиперпараметров для улучшения качества модели на предоставленном наборе данных, а затем хостинг тонко настроенной модели в качестве масштабируемого API-интерфейса с помощью автомасштабирования и оркестровки, вероятно, на Kubernetes. Кроме того, для оптимизации экономики обслуживания модели они хотели использовать фреймворки, такие как LoRA для тонкой настройки, и vLLM для обслуживания модели для улучшения метрик стоимости, снижая потребление памяти. Это может быть сложной задачей для многих разработчиков и может занять недели или даже месяцы для достижения решения, готового к производству. С MonsterAPI они смогли экспериментировать с несколькими запусками тонкой настройки в течение дня и хостить тонко настроенную модель с лучшим баллом оценки в течение нескольких часов, не требуя нескольких инженерных ресурсов с глубокими навыками MLOps.

Каким образом подход Monster API демократизирует доступ к генеративным моделям ИИ для более мелких разработчиков и стартапов?

Малые разработчики и стартапы часто испытывают трудности с производством и использованием высококачественных моделей ИИ из-за отсутствия капитала и технических навыков. Наши решения укрепляют их, снижая затраты, упрощая процессы и предоставляя прочные инструменты без кода/с низким кодом для реализации готовых к производству процессов ИИ.

Используя наш децентрализованный GPU-облако, мы предлагаем доступные и масштабируемые ресурсы GPU, значительно снижая барьер стоимости для развертывания моделей высокого производительного класса. Автоматическая конфигурация платформы и настройка гиперпараметров упрощают процесс, исключая необходимость глубоких технических знаний.

Наши удобные REST-API и интегрированный процесс объединяют тонкую настройку и развертывание в единый, сплоченный процесс, делая передовые технологии ИИ доступными даже для тех, у кого ограниченный опыт. Кроме того, использование эффективных методов тонкой настройки LoRA и методов квантования, таких как GPT-Q и AWQ, обеспечивает оптимальную производительность на менее дорогом оборудовании, еще больше снижая первоначальные затраты.

Этот подход укрепляет малых разработчиков и стартапов, позволяя им эффективно и результативно реализовывать и управлять передовыми генеративными моделями ИИ.

Что вы видите как следующий основной прорыв или функцию, которую Monster API принесет в сообщество разработчиков ИИ?

Мы работаем над несколькими инновационными продуктами, чтобы еще больше продвинуть нашу концепцию: помочь разработчикам настраивать и развертывать модели быстрее, проще и наиболее экономично.

Немедленное следующее – это полный помощник MLOps AI, который выполняет исследования новых стратегий оптимизации для LLMOps и интегрирует их в существующие процессы для снижения усилий разработчиков по созданию новых и лучших моделей, а также обеспечивает полную настройку и развертывание производственных процессов LLM.

Допустим, вам нужно сгенерировать 1 миллион изображений в минуту для вашего случая использования. Это может быть чрезвычайно дорого. Традиционно вы бы использовали модель Stable Diffusion и потратили часы на поиск и тестирование оптимизационных фреймворков, таких как TensorRT, для улучшения вашего пропускного потока без компрометации качества и задержки вывода.

Однако с помощью помощника MLOps от MonsterAPI вам не придется тратить все эти ресурсы. Помощник найдет лучший фреймворк для ваших требований, используя оптимизации, такие как TensorRT, адаптированные к вашему конкретному случаю использования.

Как Monster API планирует продолжать поддержку и интеграцию новых открытых моделей, когда они появляются?

Тремя основными способами:

  1. Предоставить доступ к последним открытым моделям
  2. Предоставить наиболее простой интерфейс для тонкой настройки и развертывания
  3. Оптимизировать весь стек для скорости и стоимости с использованием наиболее передовых и мощных фреймворков и библиотек

Наша миссия – помочь разработчикам всех уровней принять Gen AI быстрее, снижая время от идеи до готового и масштабируемого API-интерфейса.

Мы продолжим наши усилия по предоставлению доступа к последним и наиболее мощным фреймворкам и библиотекам, интегрированным в бесшовный процесс для реализации процессов LLMOps от начала до конца. Мы посвящены снижению сложности для разработчиков с помощью наших инструментов без кода, тем самым повышая их производительность при построении и развертывании моделей ИИ.

Для достижения этого мы постоянно поддерживаем и интегрируем новые открытые модели, фреймворки оптимизации и библиотеки, отслеживая достижения в области ИИ. Мы поддерживаем масштабируемое децентрализованное GPU-облако и активно взаимодействуем с разработчиками для раннего доступа и обратной связи. Используя автоматические процессы для бесшовной интеграции, улучшая гибкие API и заключая стратегические партнерства с организациями ИИ-исследований, мы гарантируем, что наша платформа остается передовой.

Кроме того, мы предоставляем полную документацию и прочную техническую поддержку, позволяя разработчикам быстро принять и использовать последние модели. MonsterAPI держит разработчиков на переднем крае технологий генеративного ИИ, наделяя их возможностью инноваций и успеха.

Каковы долгосрочные цели Monster API в плане развития технологий и охвата рынка?

В долгосрочной перспективе мы хотим помочь 30 миллионам инженерам по программному обеспечению стать разработчиками MLOps с помощью нашего помощника MLOps и всех инструментов, которые мы строим.

Это потребует от нас построения не только полноценного помощника, но и многих фундаментальных проприетарных технологий, связанных с фреймворками оптимизации, методами контейнеризации и оркестровкой.

Мы считаем, что сочетание отличных, простых интерфейсов, увеличение пропускного потока в 10 раз и низкозатратные децентрализованные GPU имеет потенциал трансформировать производительность разработчика и тем самым ускорить принятие GenAI.

Все наши исследования и усилия направлены в этом направлении.

Спасибо за отличное интервью, читатели, которые хотят узнать больше, должны посетить MonsterAPI.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.