AI-mallit ja alustat
Kuinka DeepSeek mursi kustannuseston 5,6 miljoonalla dollarilla
Perinteinen tekoälyviisaus sanoo, että suurten kielen mallien (LLM) rakentamiseen tarvitaan syvät taskut – tyypillisesti miljardeja sijoitusta. Mutta DeepSeek, kiinalainen tekoälystart-up, rikkoi tämän paradigman viimeisimmällä saavutuksellaan: kehittämällä maailmanluokan tekoälymallin vain 5,6 miljoonalla dollarilla.
DeepSeekin V3-malli voi kilpailla teollisuusjättien kuten Google Gemini (GOOGL ) ja OpenAI:n uusimmat tarjoomat kanssa, käyttäen vain murto-osan tyypillisistä laskentaresursseista. Saavutus herätti monien teollisuusjohtajien huomion, ja mikä tekee tästä erityisen merkittävää, on se, että yritys onnistui tässä huolimatta Yhdysvaltain vientirajoituksista, jotka rajoittivat heidän pääsyään uusimpiin Nvidian piireihin.
Tekoälyn taloustiede
Luvut kertovat vakuuttavan tarinan tehokkuudesta. Kun useimmat edistyneet tekoälymallit vaativat 16 000 ja 100 000 GPU:ta koulutukseen, DeepSeek onnistui vain 2 048 GPU:lla, jotka pyörittiin 57 päivää. Mallin koulutus kulutti 2,78 miljoonaa GPU-tuntia Nvidia H800 -piireillä – hämmästyttävän vaatimattomasti 671 miljardin parametrin mallille.
Vertailun vuoksi Meta tarvitsi noin 30,8 miljoonaa GPU-tuntia – noin 11 kertaa enemmän laskentatehoa – kouluttaakseen Llama 3 -mallinsa, jolla on vain 405 miljardia parametrejä. DeepSeekin lähestymistapa muistuttaa mestariluokan optimointia rajoituksissa. Työskennellessään H800-GPU:iden kanssa – tekoälypiirejä, jotka on suunniteltu Nvidia erityisesti kiinalaiselle markkinalle vähennetyillä ominaisuuksilla – yritys muutti mahdolliset rajoitukset innovaatioksi. Sen sijaan, että olisi käyttänyt valmiita ratkaisuja prosessorien viestintään, he kehittivät mukautettuja ratkaisuja, jotka maksimoivat tehokkuuden.
Kun kilpailijat jatkavat toimintaa oletuksella, että massiiviset sijoitukset ovat välttämättömiä, DeepSeek osoittaa, että älykkyys ja resurssien tehokas käyttö voivat tasoittaa pelikenttää.

Kuva: Artificial Analysis
Mahdottoman insinöörinti
DeepSeekin saavutus on innovatiivinen tekninen lähestymistapa, joka osoittaa, että joskus merkittävimmät läpimurrot tulevat työskentelemällä rajoituksissa sen sijaan, että heittäisiin rajattomia resursseja ongelmaan.
Tässä innovaatiossa on strategia, jota kutsutaan “auxiliary-loss-free load balancing” -tekniikaksi. Ajattele sitä kuin massiivista rinnakkaislaskentajärjestelmää, jossa perinteisesti tarvittaisiin monimutkaisia sääntöjä ja rangaistuksia, jotta kaikki toimisi sileästi. DeepSeek käänsi tämän perinteisen viisauden päälaelleen kehittämällä järjestelmän, joka ylläpitää tasapainoa ilman perinteisten lähestymistapojen kuormitusta.
Tiimi kehitti myös niin kutsutun “Multi-Token Prediction” (MTP) -tekniikan – menetelmän, joka antaa mallille etukäteen ajattelemisen mahdollisuuden ennustamalla useita tokenia kerran. Käytännössä tämä kääntyy vaikuttavaan 85-90 prosentin hyväksymisnopeuteen näille ennusteille eri aiheista, tarjoamalla 1,8 kertaa nopeamman laskentanopeuden aiempiin lähestymistapoihin verrattuna.
Tekninen arkkitehtuuri itsessään on tehokkuuden mestariteos. DeepSeekin V3 käyttää asiantuntijoiden sekoitusta 671 miljardia parametrejä, mutta tässä on älykäs osa – se aktivoi vain 37 miljardia jokaiselle tokenille. Tämä valikoiva aktivaatio tarkoittaa, että he saavat massiivisen mallin hyödyt ylläpitäen samalla käytännöllistä tehokkuutta.
Heidän valintansa FP8 sekaisin tarkkuuden koulutuskehyksessä on toinen askel eteenpäin. Sen sijaan, että hyväksyisivät vähennetyn tarkkuuden rajoitukset, he kehittivät mukautettuja ratkaisuja, jotka ylläpitävät tarkkuutta vähentäen merkittävästi muistin ja laskennan vaatimukset.
Aaltojen vaikutus tekoälyn ekosysteemiin
DeepSeekin saavutuksen vaikutus ulottuu paljon yli yhden onnistuneen mallin.
Euroopan tekoälykehitykselle tämä läpimurto on erityisen merkittävä. Monet edistyneet mallit eivät pääse EU: hun, koska yritykset kuten Meta ja OpenAI joko eivät voi tai eivät halua sopeutua EU:n tekoälylaissa vaadittuihin muutoksiin. DeepSeekin lähestymistapa osoittaa, että kehittämällä huipputason tekoälyä ei välttämättä tarvita massiivisia GPU-klustereita – se on enemmän kyse resurssien tehokkaasta käytöstä.
Tämä kehitys osoittaa myös, miten vientirajoitukset voivat itse asiassa ajaa innovaatiota. DeepSeekin rajoitettu pääsy korkean tason laitteistoon pakotti heidät ajattelemaan toisin, mikä johti ohjelmistoparempiin, jotka saattavat ei olisi koskaan ilmestyneet resursseilla rikkaassa ympäristössä. Tämä periaate voi muuttaa, miten lähestymme tekoälykehitystä maailmanlaajuisesti.
Demokratisoimisen vaikutukset ovat syvät. Kun teollisuusjätit jatkavat miljardien paloa, DeepSeek on luonut viitekehyksen tehokkaalle, kustannustehokkaalle tekoälykehitykselle. Tämä voisi avata ovia pienemmille yrityksille ja tutkimuslaitoksille, jotka eivät aiemmin voineet kilpailla resurssirajoitusten vuoksi.
Tämä ei kuitenkaan tarkoita, että suurten mittakaavojen laskenta-infrastruktuuri on vanhenemassa. Teollisuus on siirtymässä laskennan ajan mittaukseen – kuinka kauan malli tarvitsee vastaamaan. Kun tämä suuntaus jatkuu, merkittävät laskentaresurssit ovat edelleen välttämättömiä, luultavasti jopa enemmän tulevaisuudessa.
Mutta DeepSeek on muuttanut perustavanlaatuisesti keskustelun. Pitkän aikavälin vaikutukset ovat selvät: meillä on edessämme aikakausi, jossa innovatiivinen ajattelu ja resurssien tehokas käyttö voivat olla tärkeämpää kuin pelkästään laskentateho. Tekoälyyhteisölle tämä tarkoittaa, että keskitymme ei vain resursseihimme, vaan siihen, miten luovasti ja tehokkaasti käytämme niitä.












