Haastattelut

Saurabh Vij, MonsterAPI:n CEO ja co-perustaja – Haastattelusarja

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Saurabh Vij on MonsterAPI:n CEO ja co-perustaja. Hän työskenteli aiemmin CERN:issä hiukkassfyysikkona ja tunnisti hajautetun laskennan potentiaalin projekteista kuten LHC@home.

MonsterAPI hyödyntää edullisia, kaivosfarmeista peräisin olevia GPU:ita pienemmistä käyttämättömistä datakeskuksista, jotta se voi tarjota skaalautuvaa, edullista GPU-infrastruktuuria koneoppimiselle, jolloin kehittäjät voivat käyttää, hienosäätää ja ottaa käyttöön tekoälymallit merkittävästi alennettuilla kustannuksilla ilman yhden rivin koodin kirjoittamista.

Ennen MonsterAPI:ta hän johti kahta startup-yritystä, mukaan lukien yhtä, joka kehitti naisten turvallisuuslaitteen Intiassa yhteistyössä Intian hallituksen ja IIT Delhin kanssa.

Voitko kertoa MonsterGPT:n syntytarinaa?

Meidän tehtävämme on aina ollut “auttaa ohjelmistokehittäjiä hienosäätämään ja ottaa käyttöön tekoälymallit nopeasti ja helpoimmalla tavalla mahdollisella”. Me tajusimme, että he kohtaavat useita monimutkaisia haasteita, kun he haluavat hienosäätää ja ottaa käyttöön tekoälymallin.

Siitä, miten he kohtaavat koodia, asettavat Docker-containereita GPU:ille ja skaalauttavat niitä tarpeen mukaan

Ja siitä, kuinka nopeasti ekosysteemi on kehittymässä, pelkästään hienosäätäminen ei riitä. Se on tehtävä oikein: välttämällä alihienosäätöä, ylihienosäätöä, hyperparametrien optimointia, sisällyttämällä uusimmat menetelmät kuten LORA ja Q-LORA nopeamman ja taloudellisemman hienosäätämisen suorittamiseksi. Kun malli on hienosäätetty, se on otettava käyttöön tehokkaasti.

Se sai meidät tajumaan, että tarjoaminen vain työkalua prosessin pienelle osalle ei ole tarpeeksi. Kehittäjä tarvitsee koko optimoidun prosessin yhdistettynä suurella käyttöliittymällä, johon he ovat tottuneet. Hienosäätämisestä arviointiin ja lopulliseen mallin käyttöönottoon.

Kysyin itseltäni kysymyksen: Entinen hiukkassfyysikko, ymmärrän, miten suurta vaikutusta tekoäly voi olla tieteellisessä työssä, mutta en tiedä, mihin ryhtyä. Minulla on innovatiivisia ideoita, mutta minulla ei ole aikaa oppia kaikkia koneoppimisen taitoja ja nyansseja.

Mikä, jos voisin vain puhua tekoälylle, antaa vaatimukset ja saada sen rakentamaan koko prosessin minulle, toimittamaan tarvittavan API-päätepisteen?

Tämä johti chat-pohjaisen järjestelmän ideaan, joka auttaa kehittäjiä hienosäätämään ja ottaa käyttöön helposti.

MonsterGPT on ensimmäinen askel tällä matkalla.

On olemassa miljoonia ohjelmistokehittäjiä, innovaattoreita ja tutkijoita, jotka voivat hyödyntää tätä lähestymistapaa luodakseen enemmän alakohtaisia malleja omiin projekteihinsa.

Voitko selittää Monster API:n GPT-pohjaisen käyttöönottoagentin taustalla olevan teknologian?

MonsterGPT hyödyntää edistyneitä teknologioita avataksesi ja hienosäätääksesi tehokkaasti avoimen lähdekoodin suuria kielen malleja (LLM) kuten Phi3 Microsoftilta ja Llama 3 Metalta.

  1. RAG kontekstikonfiguraatiolla: Valmistaa automaattisesti konfiguraatiot oikeilla hyperparametreillä LLM:ien hienosäätämiseksi tai mallien käyttöönotolle MonsterAPI:n skaalautuvien REST-rajapintojen avulla.
  2. LoRA (Low-Rank Adaptation): Mahdollistaa tehokkaan hienosäätämisen päivittämällä vain osan parametreja, mikä vähentää laskennallista kuormitusta ja muistivaatimuksia.
  3. Quantization-tekniikat: Käyttää GPT-Q:ta ja AWQ:ta mallin suorituskyvyn optimoimiseksi vähentämällä tarkkuutta, mikä laskee muistinjalanjäljen ja nopeuttaa inferenceä ilman merkittävää tarkkuuden menetystä.
  4. vLLM-moottori: Tarjoaa suuren läpäisyn LLM-palvelun jatkuvalla batchauksella, optimoiduilla CUDA-ytimillä ja rinnakkaisilla dekoodausalgoritmeilla tehokkaan suuren mittakaavan inferenceä varten.
  5. Hajautetut GPU:t skaalautuvuuden ja edullisuuden vuoksi: Hienosäätämis- ja käyttöönotto työmme suoritetaan useiden toimittajien alhaisen kustannuksen GPU-verkostossa pienemmistä datakeskuksista uusiin GPU-pilviin kuten coreweaveen, tarjoten alhaisemmat kustannukset, korkeamman valinnan ja GPU:iden saatavuuden, jotta voidaan varmistaa skaalautuva ja tehokas prosessi.

Tutustu tämän uusimman blogiin Llama 3:n käyttöönotosta MonsterGPT:n avulla:

Miten se suorittaa hienosäätämisen ja käyttöönoton prosessin?

MonsterGPT tarjoaa chat-liittymän, joka ymmärtää luonnollisen kielen ohjeita käynnistääksesi, seuraaksesi ja hallitaksesi koko hienosäätämis- ja käyttöönottoprosessin. Tämä kyky abstrahoi useita monimutkaisia vaiheita, kuten:

  • Rakentaa data-pipeline
  • Määrittää oikea GPU-infrastruktuuri työlle
  • Määrittää sopivat hyperparametrit
  • Aseta ML-ympäristö yhteensopivilla kehyksillä ja kirjastoilla
  • Toteuta hienosäätämisohjelma LoRA/QLoRA:n tehokkaalle hienosäätämiselle kvantisaatiotekniikoilla.
  • Virheiden korjaus, kuten muistin loppumisen ja koodin tasolla olevat virheet.
  • Suunnittele ja toteuta monisolmuisen automaattisen skaalautuvuuden korkean läpäisyn palvelimilla, kuten vLLM:llä LLM-käyttöönottoon.

Millaisen käyttöliittymän ja komennot kehittäjät voivat odottaa Monster API:n chat-liittymästä?

Käyttöliittymä on yksinkertainen Chat UI, jossa käyttäjät voivat kehottaa agenttia hienosäätämään LLM:ää tiettyyn tehtävään, kuten tiivistämiseen, keskustelun täydentämiseen, koodin generointiin, blogikirjoittamiseen jne. ja sitten, kun se on hienosäätetty, GPT voidaan ohjata käyttöönottoon ja mallin kuuluminen käyttöönotetusta mallista GPT-liittymästä itsestään. Joitain esimerkkejä komennoista ovat:

  • Hienosäädä LLM koodin generointiin X-aineistolla
  • Haluan mallin, joka on hienosäätetty blogikirjoittamiseen
  • Anna minulle API-päätepiste Llama 3 -mallille.
  • Ottaa käyttöön pieni malli blogikirjoittamisen käyttötarkoituksiin

Tämä on erittäin hyödyllistä, koska oikean mallin löytäminen projektiin voi usein olla aikaa vievä tehtävä. Uusien mallien ilmestyessä päivittäin se voi johtaa paljon sekaannusta.

Miten Monster API:n ratkaisu vertautuu perinteisiin menetelmiin tekoälymallien käyttöönotossa?

Monster API:n ratkaisu parantaa merkittävästi käytettävyyttä ja tehokkuutta verrattuna perinteisiin menetelmiin tekoälymallien käyttöönotossa.

Käytettävyyden osalta:

  1. Automaattinen konfiguraatio: Perinteiset menetelmät vaativat usein laajaa manuaalista hyperparametrien ja konfiguraatioiden asettamista, mikä voi olla virhealtis ja aikaa vievää. MonsterAPI automatisoi tämän prosessin RAG:in avulla kontekstissa, yksinkertaistaen asetuksen ja vähentäen virheiden todennäköisyyttä.
  2. Skaalautuvat REST-rajapinnat: MonsterAPI tarjoaa intuitiiviset REST-rajapinnat mallien käyttöönotolle ja hienosäätämiselle, mikä tekee siitä helpomman myös niille, joilla on rajoitettu koneoppimisen osaaminen. Perinteiset menetelmät vaativat usein syvää teknistä osaamista ja monimutkaista koodaamista käyttöönottoa varten.
  3. Yhdistetty alusta: Se integroi koko työnkulun hienosäätämisestä käyttöönottoon yhdelle alustalle. Perinteiset lähestymistavat voivat vaatia erillisiä työkaluja ja alustoja, mikä johtaa tehokkuuden ja integrointiongelmien puutteeseen.

Tehokkuuden osalta:

MonsterAPI tarjoaa suoristetun prosessin LoRA-hienosäätämiselle sisäänrakennetulla kvantisaatiolla tehokkaan muistin käytölle ja vLLM-moottorin voimalla LLM-palvelulle saavuttaen korkean läpäisyn jatkuvalla batchauksella ja optimoiduilla CUDA-ytimillä. Tämä koko prosessi parantaa kehittäjien tuottavuutta mahdollistaen tuotantokelpoisten mukautettujen LLM-sovellusten luomisen vähentäen samalla tarvetta monimutkaisiin teknisiin taitoihin.

Voitko antaa esimerkkejä käyttötapausten, joissa Monster API on merkittävästi vähentänyt aikaa ja resursseja mallin käyttöönotossa?

IT-konsulttiyhtiö tarvitsi hienosäätää ja ottaa käyttöön Llama 3 -mallin asiakkaan liiketoiminnan tarpeisiin. Ilman MonsterAPI:ta heidän olisi tarvittu 2-3 MLOps-insinööriä, joilla on syvä ymmärrys hyperparametrien säätämisestä parantamaan mallin laatua annetulla aineistolla, ja sitten isännöidä hienosäätetty malli skaalautuvana REST-rajapintana käyttäen auto-skaalautuvuutta ja orkestraatiota, todennäköisesti Kubernetesissa. Lisäksi he halusivat käyttää kehyksiä kuten LoRA hienosäätämiseen ja vLLM mallin palveluun kustannusmittareiden parantamiseksi muistin käytön vähentämiseksi. Tämä voi olla monimutkainen haaste monille kehittäjille ja voi kestää viikkoja tai jopa kuukausia saavuttaa tuotantovalmis ratkaisu. MonsterAPI:n avulla he pystyivät kokeilemaan useita hienosäätöajoja päivän aikana ja isännöivät hienosäätetyn mallin parhaan arviointipistemäärän muutamassa tunnissa ilman, että heidän tarvitsi useita insinöörejä syvällä MLOps-taidoilla.

Miten Monster API:n lähestymistapa demokratisoi pääsyn generatiivisiin tekoälymalliin pienemmille kehittäjille ja startup-yrityksille?

Pienet kehittäjät ja startup-yritykset kamppailevat usein tuottaa ja käyttää laadukkaita tekoälymalleja pääomansa ja teknisten taitojensa puutteen vuoksi. Ratkaisumme valtuuttaa heitä alentamalla kustannuksia, yksinkertaistamalla prosesseja ja tarjoamalla vankat no-code/low-code-työkalut tuotantokelpoisten tekoälyprosessien toteuttamiseen.

Hajautetun GPU-pilven avulla tarjoamme edullisia ja skaalautuvia GPU-resursseja, mikä vähentää merkittävästi kustannusesteitä korkean suorituskyvyn mallin käyttöönotolle. Alustan automaattinen konfiguraatio ja hyperparametrien säätö yksinkertaistavat prosessin, poistamalla tarpeen syvälle tekniseen asiantuntemukseen.

Meidän käyttäjäystävälliset REST-rajapinnat ja integroidut työnkulut yhdistävät hienosäätämisen ja käyttöönoton yhteen prosessiin, mikä tekee edistyneistä tekoälytekniikoista käytettävissä olevan myös niille, joilla on rajoitettu kokemus. Lisäksi LoRA-hienosäätämisen ja kvantisaatiotekniikoiden kuten GPT-Q:n ja AWQ:n käyttäminen varmistaa optimaalisen suorituskyvyn vähemmän kalliilla laitteilla, mikä laskisi sisäänpyrkimiskustannuksia entisestään.

Tämä lähestymistapa valtuuttaa pienemmät kehittäjät ja startup-yritykset toteuttamaan ja hallitsemaan edistyneitä generatiivisia tekoälymalleja tehokkaasti ja tehokkaasti.

Mitä Monster API:n pitkän aikavälin tavoitteita on teknologisen kehityksen ja markkinoiden saavuttamisen suhteen?

Pitkällä aikavälillä haluamme auttaa 30 miljoonaa ohjelmistoinsinööriä tulemaan MLOps-kehittäjiksi avulla MonsterAPI:n MLOps-agentti ja kaikki työkalut, joita olemme rakentamassa.

Tämä edellyttää, että rakennamme ei vain täydellisen agentin, vaan myös paljon perustavaa omistautunutta teknologiaa optimointirunkoja, konteyneröintimenetelmiä ja orkestraatiota varten.

Uskomme, että yhdistelmä suurella, yksinkertaisilla liittymillä, 10-kertaisella läpäisyllä ja edullisilla hajautetuilla GPU:illa voi muuttaa kehittäjän tuottavuutta ja kiihdyttää siten GenAI:n omaksumista.

Kaikki tutkimuksemme ja ponnistelumme ovat tämän suunnan mukaisia.

Kiitos haastattelusta, lukijat, jotka haluavat oppia lisää, voivat vierailla MonsterAPI:ssa.

Antoine on visionäärisellä johtajalla ja Unite.AI:n perustajakumppani, joka on intohimoisesti omistautunut tulevaisuuden älyteknologian ja robotiikan muotoiluun ja edistämiseen. Sarjayrittäjänä hän uskoo, että älyteknologia tulee olemaan yhtä mullistava yhteiskunnalle kuin sähkö, ja hän on usein innostunut puhumaan älyteknologian ja AGI:n mahdollisuuksista.

Hän on tulevaisuudentutkija, joka on omistautunut tutkimiseen, miten nämä innovaatiot muotoilevat maailmaamme. Lisäksi hän on Securities.io:n perustaja, joka on keskittynyt sijoittamiseen älykkäisiin teknologioihin, jotka määrittelevät tulevaisuutta ja muokkaavat koko toimialoja.