Haastattelut

Ben Koska, SF Tensorin perustaja ja toimitusjohtaja – Haastattelusarja

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Ben Koska, SF Tensorin perustaja ja toimitusjohtaja, on tekoälytutkija ja järjestelmäinsinööri, joka on tunnettu työstään korkean suorituskyvyn laskennassa, ytimen optimoinnissa ja tehokkaassa mallin koulutuksessa. Hänen taustansa kattaa matalan tason tekoälyinfrastruktuurin kehittämisen, koulutusläpimenojen parantamisen ja työkalujen suunnittelun, jotka tekevät edistyneen mallikehityksen helpoksi ilman raskasta insinööritöitä. Hän keskittyy järjestelmien rakentamiseen, jotka puskevat nopeuden, siirrettävyyden ja luotettavuuden rajoja heterogeenisessa laitteistossa.

SF Tensor on yhtiö, jota hän johtaa filosofian käytännölliseksi alustaksi. Se esittelee yhdenmukaisen ohjelmointimallin, ytimen optimoijan ja pilviarkkitehtuurin, joka on suunniteltu poistamaan tekoälytyön jakamisen monimutkaisuus. Alusta on tarkoitettu antamaan insinööreille puhdas, laitteistoriippumaton ympäristö, jossa he voivat kirjoittaa kerran, ottaa käyttöön missä tahansa ja saavuttaa automaattisesti korkean suorituskyvyn. SF Tensorin tehtävä on tehdä tekoälylaskelema merkittävästi nopeammaksi, helpommaksi hallita ja vapauttaa toimittajien riippuvuudesta.

Perustit SF Tensorin 19-vuotiaana johtamalla jo useita startup-yrityksiä. Mikä innoitti sinua ottamaan haasteen tekoälyinfrastruktuurin uudelleenluomisesta urasi alussa?

Ongelma, jota ratkaisemme, on sellainen, josta olen syvästi kiinnostunut, koska se on ongelma, johon itse olen törmännyt. Kun kehittelimme sitä, mikä on nyt SF Tensorin ydinrakennus, emme työskennelleet kaupallisessa hankkeessa, vaan se oli itse asiassa akateeminen hanke. Olimme saaneet avustuksen joillekin mielenkiintoisille tutkimuksille, mutta käytimme suurimman osan ajastamme infrastruktuurin ja optimointien kanssa painimiseen, sen sijaan, että olisimme tehneet itse tutkimusta. Huomasimme, että ihmiset olivat yleisesti kiinnostuneita infrastruktuuriteknologiastamme, ei itse tutkimushankkeestamme.

SF Tensor ottaa yhden tekoälyn vaikeimmista ongelmista – irtautuminen Nvidian CUDAn hallinnasta. Miten lähestyit järjestelmän suunnittelua, joka voisi saavuttaa oikean laitteiston siirrettävyyden ilman suorituskyvyn heikentymistä

Lopulta kaikki tekoälylaskelema voidaan laskea yksinkertaisiin matemaattisiin ongelmiin. Jokainen malli on perimmältään joukko matemaattisia operaatioita, joiden tuloksia meidän on laskettava. Käsittämällä sen ensisijaisesti matemaattisena ongelmana, emme niinkään tietojenkäsittelytieteellisenä ongelmana, voimme tunnistaa pienimmän joukon rajoituksia laskuille, ja sitten luoda miljoonia tai jopa miljardeja eri tapoja muuttaa laskuja konekieleksi, ja löytää nopein tapa. Se on helpommin sanottu kuin tehty, koska emme voi todella ajaa miljoonia eri ohjelmia, jotta löytäisimme nopeimman, joten meidän on leikattava hakutilaamme, ja keksittävä tarkka matemaattinen malli, joka arvioi ohjelman nopeuden tietylle laitteistolle, mikä on yksi keskeisimmistä innovaatioista, jotka mahdollistavat sen, mitä teemme tänään.

Yhtiön blogi korostaa innovaatioita kääntäjäoptimoissa ja pilviarkkitehtuurissa. Voitko selittää, miten SF Tensorin lähestymistapa eroaa olemassa olevista kehyksistä, kuten PyTorch tai JAX?

Emme ole kirjoittaneet siitä vielä teknistä blogia, mutta tukemme itse asiassa kehyksiä, kuten PyTorch ja JAX, ja sallimme koodin, joka on kirjoitettu niissä, optimoida meidän pinon kautta. On useita arkkitehtuurisia päätöksiä, jotka JAX ja PyTorch ovat tehneet, jotka erottavat ne meidän pinostamme, mutta merkittävin niistä on, että käsittämme koko mallin yhtenä laskuna, jonka on ratkaistava, sen sijaan, että käsittäisimme yksittäisiä moduuleja, jotka on optimoitava yksin ja sitten yhdessä. Tästä syystä emme sovellakaan perinteisiä kääntäjäoptimoita, vaan luomme hakutilan, joka kattaa miljoonia tai jopa miljardeja mahdollisia ytimiä, ja väitämme, että ei ole mahdollista, että ihminen voisi keksiä sääntöjoukon, joka muuttaa minkä tahansa koodin nopeimmaksi, joten meidän on luotava kaikki yhdistelmät, ja tunnistettava nopein.

Monet startup-yritykset keskittyvät koulutus tehokkuuteen, mutta olet korostanut “infrastruktuuriveroa” – aikaa, jonka tutkijat menettävät laskennan hallinnassa sen sijaan, että keksisivät uutta. Miten SF Tensor tasapainottaa tämän epätasapainon?

Uskomme, että molemmat ongelmat on ratkaistava, ja suuri osa työstämme on koulutus tehokkuuden parantamisessa, mutta akuutin ongelman, jonka voimme ratkaista ilman, että odotamme tulevia innovaatioita, on infrastruktuurivero, koska se on ongelma, jonka olemme itse jo ratkaisseet.

Olet maininnut jopa 80 prosentin laskun koulutuskustannuksissa. Mitkä tietyt optimoinnit tai arkkitehtuuriset läpimurrot mahdollistavat tämän?

Koko ohjelmistopinomme perustuu ajatukselle, että hakuperusteinen kääntäjä voittaa aina ihmisen luomat säännöt. Tähän asti suurin rajoitus näille kääntäjille on ollut se, ettei ole mahdollista testata ja arvioida miljoonia tai jopa miljardeja ytimiä. Olisi siis välttämätöntä luoda matemaattinen malli laskennasta, joka pystyy arvioimaan tarkasti ajan, jonka tietty lasku tai joukko laskuja vie tietylle laitteistolle. Tekemällä tämän, voimme laajentaa hakutilaamme, ja sitten leikata sen alas, mikä on välttämätöntä, jos haluamme löytää nopeimmat ytimet johdonmukaisesti.

Miten taustasi Emmassa ohjelmointikielellä vaikuttaa SF Tensorin arkkitehtuuriin ja filosofiaan suorituskyvyn ja abstraktion suhteen?

Älä kerro sijoittajilleni, mutta olen edelleen sydämeni perustalta kääntäjäinsinööri. Olen aina ollut kiinnostunut löytämään eri tavoja tehdä asioita vain hieman nopeammaksi. Kehittäessämme Emmaa heittäydyimme kääntäjän uudelleen 4-5 kertaa; aloimme alusta, jokaisella kerralla, koska törmäsimme optimointiin, jonka emme voineet toteuttaa annetuilla rajoituksilla, mikä pakotti meidät uudelleen suunnittelemaan järjestelmän yleiseksi, ja sallimaan meidän laskeutua alimmalle optimointitasolle, kun se oli tarpeen, usein vastoin yleisiä periaatteita kääntäjän ja kielen suunnittelussa. Nämä oppimukset ja tuloksena oleva arkkitehtuuri ovat kaksi vuotta sitten kompensoidu yhdistelmäksi, joka sallii meidän iteroida nopeammin ja optimoida paremmin kuin järjestelmät, jotka seurasivat yleisiä periaatteita, koska ne periaatteet on suunniteltu CPU:lle, ei GPU:ille ja tekoälymalleille.

Olet työskennellyt suurimittakaavaisissa koulutusajoissa yli 4000 GPU:n kanssa – mitkä olivat joitain suurimmista oppimista hallitsemisesta laskentaa tässä mittakaavassa? 

Yksi suuri oppiminen on, että laitteiston virhe on paljon yleisempi ja ongelmallisempi, kuin mitä voisi olettaa. Oltuaan paljon aikaa perinteisten ohjelmien ja kääntäjien parissa, yleensä ottaen tietokone tekee täsmälleen sen, mitä sille on käsketty, ja jos jotain menee pieleen, se on lähes aina henkilön, joka kirjoitti koodin, virhe. GPU:illa toisaalta laitteiston virhe on yleinen ilmiö, erityisesti jakamisessa koulutusajoissa erittäin suurilla klustereilla. Tämä on yhteydessä siihen, että toisin kuin CPU, joka toimii yleensä deterministisesti ja ennustettavasti, GPU:t voivat toisinaan selittämättömästi tehdä asioita, kuten laskea kellotaajuutta ilman ilmeistä syytä, hidastaen koko koulutusprosessia, koska yksittäinen piiri on hitaampi.

Y Combinator on tukenut joitain teknologian muuttavimmista infrastruktuuriyrityksistä. Miten tämä kokemus on muokannut lähestymistäsi SF Tensorin tuotteen ja visoin kasvattamiseen? 

Mennä Y Combinatoriin ajattelin, että panoksemme oli ambisiomainen. Muutaman viikon jälkeen määritelmämme ambisiosta oli muuttunut dramaattisesti, ja panoksemme oli kasvanut. Toisaalta yhteisön ja oppimisen tunne, jonka voin ottaa puhelimella tai lähettää sähköpostia melkein mihin tahansa yritykseen tai henkilöön, ja saada vastauksen ja neuvon muutamassa tunnissa, on muuttanut tapaamme lähestyä ongelmia ja omaksua merkittävästi yhteistyökykyisemmän lähestymistavan.

Etenevässä olet ilmaissut kiinnostuksesi ei-LLM-malleihin, robottiikkaan ja synteettisiin tietoihin. Miten nämä alueet sopivat yhtiön pitkän aikavälin visioon? 

LLM:t ovat ehdottomasti mielenkiintoinen teknologia, ja ne tulevat olemaan olennainen osa tulevaisuuden maailmaa, mutta syy, miksi ne ovat niin paljon edistyneempiä kuin mikään muu tekoälyalue, johtuu pääasiassa siitä, että niiden kehittämiseen on panostettu paljon rahaa, ja on riittävästi ihmisiä, jotka työskentelevät yhdessä ongelman parissa, ja ne ovat saaneet melko hyvän optimoinnin. Jos voimme alentaa esteitä, ja sallia tutkijoille ympäri maailmaa, jopa niille, joilla on rajalliset resurssit ja vähän tai ei ollenkaan tietoa optimoinnista, tehdä tutkimusta mahdollisimman edullisesti ja tehokkaasti, uskon, että näemme uuden sukupolven malleja, jotka tulevat ratkaisemaan ongelmia, joita LLM:t eivät sovellu, joko koska ne vuorovaikuttavat fyysiseen maailmaan tai koska ne ovat ongelmia, jotka eivät voida olla oikein ilmaistuina kielellä.

Miten arvelet tekoälyinfrastruktuurin tulevan näyttämään viiden vuoden kuluttua – ja missä roolissa SF Tensor on siinä?

Viiden vuoden kuluttua toivon, että monia muita yrityksiä on kehittänyt ja julkaissut omat erikoispiirinsä, ja että tutkijat voivat hyödyntää ja käyttää niitä ilman, että heidän on kirjoitettava koodia nimenomaan niiden käyttöön, ja toiveena, ettei heidän edes tarvitse tietää niiden olemassaoloa. Tämä on tulevaisuus, jota olemme rakentamassa, ja uskon, että meillä on merkittävä rooli sen muotoilussa.

Kiitos haastattelusta, lukijoille, jotka haluavat oppia lisää, suosittelemme vierailemaan SF Tensor -sivustolla.

Antoine on visionäärisellä johtajalla ja Unite.AI:n perustajakumppani, joka on intohimoisesti omistautunut tulevaisuuden älyteknologian ja robotiikan muotoiluun ja edistämiseen. Sarjayrittäjänä hän uskoo, että älyteknologia tulee olemaan yhtä mullistava yhteiskunnalle kuin sähkö, ja hän on usein innostunut puhumaan älyteknologian ja AGI:n mahdollisuuksista.

Hän on tulevaisuudentutkija, joka on omistautunut tutkimiseen, miten nämä innovaatiot muotoilevat maailmaamme. Lisäksi hän on Securities.io:n perustaja, joka on keskittynyt sijoittamiseen älykkäisiin teknologioihin, jotka määrittelevät tulevaisuutta ja muokkaavat koko toimialoja.