Ajatusjohtajat
Kiinan AI-harha: Miten “avoin lähdekoodi” piilottaa tärkeimmän asian

Isot teknologia-alan toimijat, kuten Google, Microsoft ja Meta, kilpailevat AI-markkinoiden hallinnasta, ja Kiinan High Flyer, Baidu, Moonshot ja Alibaba ovat herättäneet huomiota julkaisemalla avoimen lähdekoodin DeepSeek-, ERNIE 4.5-, Kimi K2- ja Qwen3-suuret kielen mallit. Tämä siirtyminen varattujen, omistajiin perustuvien GenAI-mallien julkaisusta on nähty merkkinä siitä, että Kiinan AI-teollisuus omaksuu avoimen lähdekoodin voiman democratisoimaan AI-kehitystä ja edistämään innovaatioita.
Kuten monet toimijat, jotka mainostavat tuotteitaan avoimena lähdekoodina ja jopa laittavat sen yrityksensä nimeen, High Flyer, Baidu ja Moonshot eivät kuitenkaan ole jakaneet kriittisiä osia, kuten tietoja, jotka ovat mallien ytimessä. Näiden suurten mallien pyrkiessä muuttumaan kommoditeiteiksi, joista kehittäjät riippuvat, avoimen lähdekoodin läpinäkyvyydestä, joka voidaan testata, tutkia ja iteroida, on keskeistä luodaksesi luotettavaa, eettistä ja hyödyllistä teknologiaa, johon voimme luottaa. Kaikki nämä “avoin lähdekoodi” -mallit ovat itse asiassa “avoin paino”, mikä tarkoittaa, että niitä voidaan ladata ja käyttää, mutta niitä ei voida tarkastella mielekkäästi ilman tietoja.
Kun Yhdysvaltalaiset toimijat, kuten Open AI ja Meta, näyttävät vetäytyvän avoimen lähdekoodin käytöstä, Baidun avoin kutsu hyödyntää vapaasti saatavilla olevaa ERNIE 4.5 -mallien sarjaa voi kuitenkin edistää innovaatioita ja yhteistyötä kehittäjien kanssa, jotka haluavat luoda pienempiä, voimakkaita sovelluksia. Samalla yritys, joka on Kiinan Googlea vastaava, on antanut itselleen kilpailuedun kannustamalla omien malliensa käyttöä ja juurtamalla ne kasvavaan AI-ekosysteemiin.
Sama voidaan sanoa DeepSeekistä, edullisesta Kimi K2:sta ja päivitetyistä Qwen3:sta, joiden suorituskyky haastaa suljettuja malleja, kuten Claude Opus 4 ja GPT-4o-0327.
Nämä AI-toimijat ovat asettaneet itsensä hyvin kilpailuun tulla kommoditeettimalliksi, ja Qwen3:n viimeisin innovatiivinen päivitys oli jopa inspiroitu avoimen lähdekoodin yhteisön palautteesta.
Kuten monet, jotka mainostavat suuria AI-mallejaan avoimena lähdekoodina, Kiinan AI-yhteisö ei kuitenkaan ole jakanut tietoja tai muita kriittisiä osia AI-järjestelmistään. Sen sijaan he pyytävät maailmanlaajuisia kehittäjiä luottamaan sokeasti malleihin, joita he eivät voi todella ymmärtää tai tutkia.
Vaatinut tulevaisuuden avoimella lähdekoodilla varustetuilla AI-malleilla
Kun iPhone ilmestyi markkinoille vuonna 2007, jotkut olettivat, että Mac hallitsisi älypuhelinten peliä iOS:llä, mutta avoin lähdekoodin osallistuminen on olennainen start-upeille, ja se edistää myös yrittäjyyttä ja taloudellista kasvua maailmanlaajuisesti – ja Android, joka oli startup, jonka Google hankki vuonna 2005, seurasi tätä polkua menestyksekkäästi.
Julkaistessaan avoimen lähdekoodin ohjelmistoja, jotka voitiin tarkastella, muuttaa, omaksua ja jakaa, Android kutsui akateemikkoja, kehittäjiä ja jopa kilpailijoita yhteistyöhön ohjelmiston kehittämiseen. Tämä kiihdytti innovaatioprosessia, demokratisoi pelikenttää ja lopulta laskeutui hintoja. Android tuli markkinoille vuosi iPhonea myöhemmin, ja vuoden alussa se kattoi 71,88 prosenttia maailmanlaajuisesta markkinasta iOS:n 27,65 prosentin sijaan.
Teknologisessa vallankumouksessa, joka näytti tapahtuvan yötä päiväkäyttöön, älypuhelimet tulivat jokapäiväisiksi, ja vaikka ohjelmisto-, laitteisto- ja käyttöliittymän parannukset jatkuvat, teollisuus on kasvanut paljon siitä, mitä älypuhelimet tekevät. Nykyään innovaatio on sovelluksissa, jotka pyöriävät niissä, ja älypuhelinvalmistajien on ylläpidettävä ekosysteemi, joka kutsuu kehittäjiä.
Ei ole kulunut kolmea vuotta ChatGPT:n julkaisemisesta, ja AI-teollisuus on samalla kannaksella. Jokainen pelaaja globaalissa AI-teollisuudessa pyrkii saamaan mallinsa seuraavaksi Androidiksi tai iOS:ksi, ja julkaistessaan avoimen lähdekoodin DeepSeek-, ERNIE 4.5- ja Kimi K2 -malleilla Kiinalaiset innovaattorit pyrkivät vaatimaan paikkansa kasvavassa ekosysteemissä.
Vaikka tämä voisi toimia heidän hyväkseen, se ei kuitenkaan edistä avoimen lähdekoodin todellista läpinäkyvyyttä, joka on ollut olennainen innovaation luomiselle, johon voimme luottaa.
Tieto on puuttuva palanen useimmissa avoimissa AI-malleissa
AI-mallien luominen on paljon monimutkaisempaa kuin perinteisen ohjelmiston jakaminen, ja avoimen lähdekoodin vaatimus ei ole pieni asia. Sen sijaan, että vain yksinkertainen lähdekoodi, AI-järjestelmät koostuvat seitsemästä osasta, mukaan lukien lähdekoodi, malliparametrit, tietojoukko, hyperparametrit, koulutuslähdekoodi, satunnaislukugeneraattori ja ohjelmistokehykset.
Jokainen osa on toiminnallinen, jotta malli toimisi halutulla tavalla, mikä tarkoittaa, että kehittäjien on oltava täysin näkyvissä jaettavaksi, muokattavaksi ja sovellettavaksi järjestelmää ja ymmärtääkseen, mitä tapahtuu. Koska toistettavuus on tieteellisen menetelmän perusta, AI-teollisuudella on tapa käyttää avoimen lähdekoodin termiä viitatessaan ilmaisiin tai edullisiin julkaisuihin, joissa on pääsy joillekin palapelin osiin.
Esimerkiksi Baidu julkaisi kymmenen ERNIE 4.5 -mallia. Jakamalla mallin ja parametreja, yritys julkaisi myös avoimen lähdekoodin ERNIEKitin ja FastDeploy -julkaisutyökalut. Nämä mahdollistavat kehittäjille luoda voimakkaita AI-sovelluksia antamalla teollisuuden luokan ominaisuuksia, resurssitehokkaita koulutus- ja päätöksentekoprosesseja ja monenlaista laitteiston yhteensopivuutta.
Toisin sanoen Baidu on antanut kehittäjille innostavia työkaluja, jotka mahdollistavat innovaation nopeamman hyödyntämisen, mikä toivotaan houkuttelevan heidät valitsemaan ERNIE 4.5 kilpailijoiden sijaan.
Kehittäjät, jotka hyödyntävät ERNIE 4.5:ää, pyydetään kuitenkin luottamaan malliin sokeasti, koska Baidu on pitänyt paljon piilossa, mukaan lukien tietojoukot, jotka muokkaavat ja opettavat sen malleja.
Avoin lähdekoodin läpinäkyvien AI-mallien voima
Vaikka jokainen AI-palapelin osa on kriittinen mallin toiminnalle, 80 prosenttia AI-projekteista epäonnistuu, ja tieto on sydämessä ongelmaa. Epätarkat, epätäydelliset ja vinoutuneet tietojoukot johtavat malleihin, jotka eivät käyttäydy ennustettavasti tai toivotulla tavalla.
Äskettäin julkaistu kuolemaan johtanut Tesla Full-Self-Driving (FSD) -onnettomuusvideo esimerkiksi paljasti pahimman skenaarion, mitä voi tapahtua, kun tietojoukko ja malli eivät ole riittäviä. Kun Tesla Model Y ajoi kohti kirkkaita, laskettuja auringon säteitä, osittain automaattinen järjestelmä ei voinut ymmärtää tai reagoida asianmukaisesti siihen, mitä sen kamerat näkivät – tai eivät nähneet. Vaikka ihmisvoimin ajetut autot hidastivat ja pysähtyivät, FSD:n sekaannus johti naisen kuolemaan.
Tämä tuhoisa epäonnistuminen heijasti visuaalisen tiedon puutetta sekä turvallisuusmekanismin puutetta, joka olisi otettu huomioon tällaiset sokeat pisteet. Kun kehittäjillä ei ole näkymää tietoihinsa, he eivät voi havaita, miten se vuorovaikuttaa mallin kanssa, mikä tarkoittaa, etteivät he voi paljastaa virheitä ja iteroida robustia suorituskykyä.
Entistä enemmän huolestuttaa, että ilman tietoja, jotka syöttävät mallia, heidän on pakko luottaa siihen sokeasti.
Kun tietojoukot ovat avoimia, AI-yhteisö on osoittanut, että se paljastaa ongelmalliset ongelmat, kuten se teki paljastamalla yli 1 000 URL-osoitetta, jotka sisälsivät vahvistettua lasten seksuaalista hyväksikäyttöä LAION 5B:ssä. Koska AI-tekstistä kuviin -mallien luomiseen käytetty tietojoukko on perustavanlaatuinen sovellusten, kuten Stable Diffusion ja Midjourney, luomisessa, olisi ollut tuhoisaa, jos käyttäjät alkoivat tuottaa laittomia fotorealistisia kuvia. Sen sijaan tietojoukon avoimuus mahdollisti yhteisön paljastaa vaarallisen sisällön ja motivoi korjausta, Liaison B: n.
Lisäksi suurin osa alkuperäisestä tietojoukosta perustui verkkokävelyyn, jota suoritti valtava Common Crawl, jota myös käytettiin ChatGPT- ja LLAMA-malleissa. Vaikka AI-kävelyt herättävät edelleen huolta tekijänoikeuksista, yksityisyydestä ja vinoutuneista ja rasistisista merkinnöistä, AI-yhteisön kehittäjät työskentelevät parantamaan Common Crawl -tietojoukon kasvavaa avoimen lähdekoodin osaa turvallisempaan käyttöön.
Kun kehittäjät pyrkivät luomaan voimakasta AI:ta, johon voidaan luottaa, sekä käyttäjät että teollisuus suojellaan avoimen lähdekoodin läpinäkyvyydellä ja yhteistyöllä.
Avoin lähdekoodin polkuun
Monet ovat edelleen epävarmoja tästä kehittyvästä teknologiasta, ja kilpailu tulla suureksi AI-kommoditeettimalliksi on käynnissä – ja kun globaali AI-yhteisö kirjaimellisesti luo tulevaisuuden standardia ja AI-järjestelmät jo ohjaavat autoja ja tarjoavat lääketieteellisiä arvioita, luottamuksen luominen luomalla luotettavaa, turvallista ja luotettavaa AI:ta on koskaan oleellisempaa.
Kiinan AI-yhteisön yrittäessä asettaa itsensä avoimen innovaation edelläkävijöiksi, turvallisen AI-polun löytyy vain avoimen lähdekoodin läpinäkyvyydestä, joka on osoittautunut vuosikymmeninä ohjelmistokehityksessä. Heittämällä avoimen lähdekoodin termejä järjestelmiin, jotka eivät jaa kriittisiä osia, kuten tietoja, ei kehittäjille anna mahdollisuutta tutkia, toistaa ja iteroida. Vaikka valmiiden mallien, kuten DeepSeek, ERNIE 4.5, Kimi K2 ja Qwen3, saatavuus on kiistaton, kehittäjät, jotka hyödyntävät niitä, kauppaavat läpinäkyvyyden, joka edistää yhteistyötä ja innovaatioita, mukavuuden vuoksi.
AI-yhteisön on valittava: omaksua radikaali läpinäkyvyys aidoilla avoimilla lähdekoodilla tai riski rakentaa huomisen kriittiset järjestelmät tänään mustiin laatikoihin.












