Інтерв’ю
Саурабх Відж, генеральний директор та співзасновник MonsterAPI – Серія інтерв’ю

Саурабх Відж – генеральний директор та співзасновник MonsterAPI. Раніше він працював фізиком частинок у ЦЕРНі та визнав потенціал децентралізованих обчислень у проектах, таких як LHC@home.
MonsterAPI використовує більш дешеві комодітні GPU з криптовалютних ферм до менших ідл-дата-центрів, щоб забезпечити масштабовану, доступну інфраструктуру GPU для машинного навчання, дозволяючи розробникам отримувати доступ, налаштовувати та розгортати моделі штучного інтелекту при значно знижених витратах без написання жодної лінії коду.
До MonsterAPI він керував двома стартапами, включаючи один, який розробив носимий безпековий пристрій для жінок в Індії у співпраці з урядом Індії та ІІТ Делі.
Чи можете ви поділитися історією походження MonsterGPT?
Наша місія завжди була “допомогти розробникам програмного забезпечення налаштовувати та розгортати моделі штучного інтелекту швидше та найлегшим чином можливим”. Ми розуміли, що існує кілька складних проблем, з якими вони стикаються, коли хочуть налаштовувати та розгортати модель штучного інтелекту.
Від роботи з кодом до налаштування контейнерів Docker на GPU та масштабування їх за запитом
І темп, з яким рухається екосистема, просто налаштування недостатньо. Воно повинно бути зроблено правильним способом: уникання недообучення, переобучення, оптимізації гіперпараметрів, включення останніх методів, таких як LORA та Q-LORA, для виконання швидшого та більш економічного налаштування. Як тільки модель налаштована, її потрібно ефективно розгорнути.
Це змусило нас зрозуміти, що надання лише інструменту для малої частини процесу не достатньо. Розробник потребує всього оптимізованого процесу, поєднаного з великим інтерфейсом, з яким він знайомий. Від налаштування до оцінки та остаточного розгортання своїх моделей.
Я поставив собі питання: як фізик частинок, я розумію глибокий вплив штучного інтелекту на наукові роботи, але я не знаю, з чого почати. У мене є інноваційні ідеї, але мені бракує часу, щоб вивчити всі навички та нюанси машинного навчання та інфраструктури.
Що, якщо я міг просто поговорити зі штучним інтелектом, надати йому свої вимоги та мати його побудувати весь процес для мене, надавши необхідну кінцеву точку API?
Це привело до ідеї чат-основаної системи для допомоги розробникам у налаштуванні та розгортанні без зусиль.
MonsterGPT – наш перший крок у цьому напрямку.
Є мільйони розробників програмного забезпечення, інноваторів та вчених, як ми, які могли б скористатися цим підходом для створення більш спеціалізованих моделей для своїх проектів.
Чи можете ви пояснити технологію, що лежить в основі агента розгортання GPT-based Monster API?
MonsterGPT використовує передові технології для ефективного розгортання та налаштування відкритих моделей великих мов (LLM) таких як Phi3 від Microsoft та Llama 3 від Meta.
- RAG з контекстною конфігурацією: автоматично підготував конфігурації з правильними гіперпараметрами для налаштування LLM або розгортання моделей за допомогою масштабованих REST API з MonsterAPI.
- LoRA (Низькорангове адаптування): дозволяє ефективне налаштування шляхом оновлення лише підмножини параметрів, знижуючи обчислювальне навантаження та вимоги до пам’яті.
- Техніки кванталізації: використовують GPT-Q та AWQ для оптимізації продуктивності моделі шляхом зниження точності, що знижує пам’ять та прискорює висновок без суттєвої втрати точності.
- vLLM Engine: забезпечує високу продуктивність служб LLM з функціями, такими як безперервне пакетування, оптимізовані ядра CUDA та паралельні алгоритми декодування для ефективної великомасштабної інференції.
- Децентралізовані GPU для масштабованості та доступності: наш процес налаштування та розгортання працює на мережі низьковартісних GPU від різних виробників з менших центрів даних до нових GPU-хмар, таких як coreweave, забезпечуючи нижчі витрати, високу опціональність та доступність GPU для забезпечення масштабованого та ефективного оброблення.
Перегляньте цю останню статтю про розгортання Llama 3 за допомогою MonsterGPT;
Як це спрощує процес налаштування та розгортання?
MonsterGPT забезпечує чат-інтерфейс з можливістю розуміти інструкції природною мовою для запуску, відстеження та керування повним процесом налаштування та розгортання. Ця можливість абстрагує багато складних кроків, таких як:
- Будування конвеєра даних
- Визначення правильної інфраструктури GPU для завдання
- Налаштування відповідних гіперпараметрів
- Налаштування середовища машинного навчання з сумісними фреймворками та бібліотеками
- Реалізація скриптів налаштування для ефективного налаштування LoRA/QLoRA з стратегіями кванталізації.
- Вирішення проблем, таких як вихід за межі пам’яті та помилки рівня коду.
- Проєктування та реалізація багатовікової автомасштабування з високопродуктивними службами, такими як vLLM для розгортання LLM.
Який інтерфейс та команди можуть очікувати розробники при взаємодії з чат-інтерфейсом Monster API?
Інтерфейс – це простий чат-інтерфейс, у якому користувачі можуть просити агент налаштувати LLM для конкретного завдання, такого як підсумовування, завершення чату, генерація коду, написання блогу тощо, а потім, після налаштування, GPT можна інструктувати розгорнути LLM і запитувати розгорнуту модель з інтерфейсу GPT. Приклади команд включають:
- Налаштувати LLM для генерації коду на основі набору даних X
- Я хочу модель, налаштовану для написання блогу
- Дайте мені кінцеву точку API для моделі Llama 3.
- Розгорніть невелику модель для випадку використання блогу
Це дуже корисно, оскільки пошук правильної моделі для вашого проекту може часто стати часоємним завданням. З появою нових моделей щодня це може привести до великої плутанини.
Як рішення Monster API порівнюється за цієюстю та ефективністю з традиційними методами розгортання моделей штучного інтелекту?
Рішення Monster API суттєво підвищує цілість та ефективність порівняно з традиційними методами розгортання моделей штучного інтелекту.
Для цілісності:
- Автоматична конфігурація: традиційні методи часто вимагають великої ручної конфігурації гіперпараметрів та конфігурацій, що може бути помилковим та часоємним. MonsterAPI автоматизує цей процес за допомогою RAG з контекстом, спрощуючи налаштування та знижуючи ймовірність помилок.
- Масштабовані REST API: MonsterAPI забезпечує інтуїтивні REST API для розгортання та налаштування моделей, роблячи його доступним навіть для користувачів з обмеженими знаннями машинного навчання. Традиційні методи часто вимагають глибоких технічних знань та складного кодування для розгортання.
- Єдина платформа: вона інтегрує весь робочий процес, від налаштування до розгортання, у рамках однієї платформи. Традиційні підходи можуть включати окремі інструменти та платформи, що призводить до неефективності та проблем інтеграції.
Для ефективності:
MonsterAPI пропонує оптимізований процес налаштування з вбудованою кванталізацією для ефективного використання пам’яті та двигуном vLLM для забезпечення високої продуктивності з безперервним пакетуванням та оптимізованими ядрами CUDA, а також децентралізовану GPU-хмару з спрощеним моніторингом та журналюванням.
Цей весь процес підвищує продуктивність розробників, забезпечуючи створення програмних додатків з моделями LLM рівня виробництва, одночасно знижуючи потребу у складних технічних навичках.
Чи можете ви надати приклади випадків використання, у яких Monster API суттєво зменшила час та ресурси, необхідні для розгортання моделей?
ІТ-консалтингова компанія потребувала налаштувати та розгорнути модель Llama 3 для задоволення потреб клієнта. Без MonsterAPI їм би потрібно було команда з 2-3 інженерів MLOps з глибоким розумінням налаштування гіперпараметрів для покращення якості моделі на наданому наборі даних, а потім розмістити налаштовану модель як масштабовану кінцеву точку REST API за допомогою авто-масштабування та оркестрації, ймовірно, на Kubernetes. Крім того, для оптимізації економіки обслуговування моделі їм хотіли використовувати фреймворки, такі як LoRA для налаштування, та vLLM для обслуговування моделі для покращення метрик витрат, одночасно знижуючи споживання пам’яті. Це може бути складною проблемою для багатьох розробників і може зайняти тижні або навіть місяці для досягнення рішення, готового до виробництва. З MonsterAPI їм вдалося експериментувати з декількома запусками налаштування протягом дня та розмістити налаштовану модель з найкращим оціночним балом протягом декількох годин, без потреби у декількох інженерних ресурсах з глибокими знаннями MLOps.
Якими способами підхід Monster API демократизує доступ до генераційних моделей штучного інтелекту для менших розробників та стартапів?
Малі розробники та стартапи часто борються з створенням та використанням високоякісних моделей штучного інтелекту через брак капіталу та технічних навичок. Наші рішення надають їм силу, знижуючи витрати, спрощуючи процеси та забезпечуючи надійні інструменти без коду/із низьким кодом для реалізації програмних додатків з моделями штучного інтелекту рівня виробництва.
Використовуючи нашу децентралізовану GPU-хмару, ми пропонуємо доступні та масштабовані ресурси GPU, суттєво знижуючи бар’єр витрат для високопродуктивного розгортання моделей. Автоматична конфігурація платформи та налаштування гіперпараметрів спрощують процес, ліквідуючи потребу у глибоких технічних знаннях.
Наші інтуїтивні REST API та інтегрований робочий процес поєднують налаштування та розгортання у єдиний, цілісний процес, роблячи передові технології штучного інтелекту доступними навіть для тих, хто має обмежений досвід. Крім того, використання ефективного налаштування LoRA та технік кванталізації, таких як GPT-Q та AWQ, забезпечує оптимальну продуктивність на менш дорогому обладнанні, ще більше знижуючи витрати на входження.
Цей підхід надає малим розробникам та стартапам можливість реалізовувати та керувати генераційними моделями штучного інтелекту ефективно та ефективно.
Що ви бачите як наступний великий крок або функцію, яку Monster API принесе спільноті розробників штучного інтелекту?
Ми працюємо над декількома інноваційними продуктами для подальшого розвитку нашої тези: допомогти розробникам налаштовувати та розгортати моделі швидше, легше та найекономічніше.
Найближчим часом – повний агент MLOps, який проводить дослідження нових стратегій оптимізації для LLMOps та інтегрує їх у існуючі робочі процеси для зниження зусиль розробників при створенні нових та кращих моделей, а також забезпечує повну налаштовність та розгортання програмних додатків з моделями LLM рівня виробництва.
Наприклад, якщо вам потрібно генерувати 1 мільйон зображень на хвилину для вашого випадку використання. Це може бути дуже дорого. Традиційно ви б використали модель Stable Diffusion та провели години, шукаючи та тестуючи фреймворки оптимізації, такі як TensorRT, для покращення вашого пропускної здатності без компрометації якості та затримки виводу.
Однак з агентом MLOps MonsterAPI вам не потрібно буде марнувати всі ці ресурси. Агент знайде найкращий фреймворк для ваших вимог, використовуючи оптимізації, такі як TensorRT, адаптовані до вашого конкретного випадку використання.
Як Monster API планує продовжувати підтримку та інтеграцію нових відкритих моделей, оскільки вони з’являються?
У трьох основних напрямках:
- Надання доступу до останніх відкритих моделей
- Надання найбільш простого інтерфейсу для налаштування та розгортання
- Оптимізація всього стеку для швидкості та витрат з найбільш передовими та потужними фреймворками та бібліотеками
Наша місія – допомогти розробникам усіх рівнів навичок приймати генераційний штучний інтелект швидше, знижуючи час від ідеї до готової кінцевої точки API.
Ми продовжимо наші зусилля щодо забезпечення доступу до останніх та найпотужніших фреймворків та бібліотек, інтегрованих у безперервний робочий процес для реалізації кінцевих LLMOps. Ми присвячені зниженню складності для розробників нашими інструментами без коду, підвищуючи їх продуктивність при створенні та розгортанні моделей штучного інтелекту.
Для досягнення цього ми постійно підтримуємо та інтегруємо нові відкриті моделі, фреймворки оптимізації та бібліотеки, відстежуючи розвиток у спільноті штучного інтелекту. Ми підтримуємо масштабовану децентралізовану GPU-хмару та активно взаємодіємо з розробниками для раннього доступу та зворотного зв’язку. Використовуючи автоматизовані конвеєри для безперешкодної інтеграції, підвищуючи гнучкість API та формуючи стратегічні партнерства з організаціями досліджень штучного інтелекту, ми забезпечуємо, щоб наша платформа залишалася на рівні технологій.
Крім того, ми забезпечуємо комплексну документацію та надійну технічну підтримку, дозволяючи розробникам швидко приймати та використовувати останні моделі. MonsterAPI тримає розробників на рівні технологій генераційного штучного інтелекту, надають їм можливість інновувати та досягати успіху.
Які довгострокові цілі у Monster API щодо технологічного розвитку та ринку?
У довгостроковій перспективі ми хочемо допомогти 30 мільйонам інженерам програмного забезпечення стати розробниками MLOps за допомогою нашого агента MLOps та всіх інструментів, які ми будемо створювати.
Це вимагатиме від нас створення не лише повноцінного агента, але й багатьох фундаментальних власних технологій щодо фреймворків оптимізації, методів контейнеризації та оркестрації.
Ми віримо, що поєднання великих, простих інтерфейсів, у 10 разів більша продуктивність та низьковартісні децентралізовані GPU мають потенціал перетворити продуктивність розробника та прискорити прийняття генераційного штучного інтелекту.
Всі наші дослідження та зусилля спрямовані в цьому напрямку.
Дякуємо за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати MonsterAPI.












