Thought leaders
China’s AI-mirage: Hoe “open source” het meest belangrijke verbergt

Met Big Tech-spelers zoals Google, Microsoft en Meta die strijden om de AI-markt te domineren, hebben China’s High Flyer, Baidu, Moonshot en Alibaba de koppen gehaald met het uitbrengen van hun DeepSeek, ERNIE 4.5, Kimi K2 en Qwen3 grote taalmodellen als open source. Deze verschuiving van het uitbrengen van beschermde, propriëtaire GenAI-modellen is ontvangen als een teken dat China’s AI-industrie de kracht van open source omarmt om AI-ontwikkeling te democratiseren en innovatie te stimuleren.
Net als veel spelers die hun aanbod als open source aanprijzen en het zelfs in hun bedrijfsnaam vermelden, hebben High Flyer, Baidu en Moonshot echter niet daadwerkelijk kritieke onderdelen zoals datasets gedeeld die aan de basis liggen van hun modellen. Aangezien deze grote modellen proberen om tot commodity’s te worden waarop ontwikkelaars vertrouwen, is de transparantie van echte open source die getest, onderzocht en geïtereerd kan worden, cruciaal om onbevooroordeelde, ethische en nuttige technologie te creëren die we allemaal kunnen vertrouwen. Al deze “open source”-modellen zijn eigenlijk “open weight”, wat betekent dat ze kunnen worden gedownload en gebruikt, maar niet op een zinvolle manier geïnspecteerd kunnen worden zonder de data.
Terwijl Amerikaanse spelers zoals Open AI en Meta lijken af te zien van open source, kan Baidu’s open uitnodiging om zijn vrij beschikbare suite van ERNIE 4.5-modellen te gebruiken, innovatie en samenwerking stimuleren met ontwikkelaars die kleine, krachtige applicaties willen creëren. Tegelijkertijd heeft het bedrijf, dat vergelijkbaar is met China’s Google, zichzelf een concurrentievoordeel gegeven door adoptie te stimuleren en zijn modellen in de groeiende AI-ecosysteem te verankeren.
Hetzelfde kan gezegd worden van DeepSeek, de goedkope Kimi K2 en de bijgewerkte Qwen3 – die benchmarks heeft die gesloten modellen zoals Claude Opus 4 en GPT-4o-0327 uitdagen.
Deze AI-spelers hebben zich goed gepositioneerd in de race om de commodity-model van keuze te worden en Qwen3’s laatste innovatieve update was zelfs geïnspireerd door feedback van de open source-gemeenschap.
Net als veelgenen die hun grote AI-model als open source aanprijzen, deelt de Chinese AI-gemeenschap echter niet daadwerkelijk de data of andere kritieke onderdelen van hun AI-systemen. In plaats daarvan vragen ze wereldwijde ontwikkelaars om blindelings te vertrouwen op modellen die ze niet echt kunnen begrijpen of onderzoeken.
Een aanspraak op de toekomst met open source-commodity AI-modellen
Toen de iPhone in 2007 op de markt kwam, dachten sommigen dat Mac de smartphone-markt zou domineren met iOS, maar open-source-deelname is essentieel voor start-ups, terwijl het ook ondernemings- en economische groei wereldwijd stimuleert – en Android, een start-up die in 2005 door Google werd overgenomen, volgde deze route naar succes.
Door open source-software uit te brengen die bekeken, gewijzigd, geadopteerd en gedeeld kon worden, nodigde Android academici, ontwikkelaars en zelfs concurrenten uit om samen te werken aan de software. Dit versnelde het innovatieproces, democratiseerde het speelveld en zorgde uiteindelijk voor lagere prijzen. Android kwam een jaar na de eerste iPhone op de markt en tegen het begin van dit jaar had het 71,88 procent van de wereldmarkt tegenover 27,65 procent voor iOS.
In een technologische revolutie die leek te gebeuren in één nacht, werden smartphones alomtegenwoordig en zelfs als de software-, hardware- en gebruikersinterfaceverbeteringen doorgaan, is de industrie verder gegroeid dan het proberen te revolutioneren hoe smartphones werken. Met mobiele telefoons nu een commodity, is de innovatie die nu aan de orde is in de apps die erop draaien, en om concurrerend te zijn, moeten smartphone-aanbieders een ecosysteem in stand houden dat ontwikkelaars aantrekt.
Niet meer dan drie jaar na de lancering van ChatGPT bevindt de AI-industrie zich op een soortgelijke drempel. Ieder speler in de wereldwijde AI-industrie probeert zijn modellen te laten worden de volgende Android of zelfs iOS, en door open source te gaan met DeepSeek-, ERNIE 4.5- en Kimi K2-modellen, proberen Chinese innovators hun aanspraak op een groeiend ecosysteem te leggen.
Hoewel dit in hun voordeel kan werken, stimuleert het echter niet de ware transparantie van open source die essentieel is geweest voor niet alleen het kweken van innovatie, maar ook innovatie die we kunnen vertrouwen.
De ontbrekende schakel in de meeste open source AI
Met AI-modellen die veel ingewikkelder zijn om te creëren en te delen dan traditionele software, is de oproep tot volledig open source AI geen kleine bestelling. In plaats van alleen een eenvoudige broncode, bestaan AI-systemen uit zeven componenten – waaronder de broncode, modelparameters, dataset, hyperparameters, trainingsbroncode, willekeurige nummergeneratie en softwareframeworks.
Elk onderdeel moet samenwerken om een model te laten werken zoals gewenst, wat betekent dat ontwikkelaars volledige zichtbaarheid nodig hebben om een systeem te delen, te wijzigen en te adopteren en om te begrijpen wat er gebeurt. Met reproduceerbaarheid als fundament van de wetenschappelijke methode, heeft de AI-industrie echter de gewoonte om de term open source te gebruiken om te verwijzen naar gratis of goedkope releases die beschikbaar worden gesteld met toegang tot een paar stukjes van de puzzel.
Baidu heeft bijvoorbeeld tien ERNIE 4.5-modellen vrij beschikbaar gemaakt. Naast het delen van het model en de parameters, heeft het bedrijf ook ERNIEKit en de FastDeploy-deploymenttoolkits als open source vrijgegeven. Deze bieden ontwikkelaars krachtige AI-toepassingen door industriële capaciteiten, resource-efficiënte trainings- en inferentie-workflows en multi-hardware-compatibiliteit te bieden.
Met andere woorden, Baidu heeft ontwikkelaars voorzien van spannende tools die hen in staat stellen innovatie sneller los te laten, wat hen hopelijk zal aanzetten tot het kiezen van ERNIE 4.5 boven de concurrentie.
Ontwikkelaars die ERNIE 4.5 gebruiken, worden echter gevraagd om blindelings te vertrouwen op het model, omdat Baidu veel heeft verborgen, waaronder de datasets die zijn modellen informeren en onderwijzen.
De kracht van transparante open source AI-modellen
Terwijl elk onderdeel van de AI-puzzel kritiek is om een model te laten werken, faalt 80 procent van de AI-projecten, en ligt de data aan de basis van het probleem. Onnauwkeurige, onvolledige en bevooroordeelde datasets leiden tot modellen die niet voorspelbaar of zoals gewenst gedragen.
De recent vrijgegeven dodelijke Tesla Full-Self-Driving (FSD)-crashvideo van 2023 bijvoorbeeld, onthulde het ergste scenario van wat kan gebeuren wanneer een dataset en model tekortschieten. Toen de Tesla Model Y met hoge snelheid in een heldere, ondergaande zon reed, kon het gedeeltelijk geautomatiseerde systeem de camerabeelden niet begrijpen of adequaat reageren. Terwijl auto’s bestuurd door mensen vertraagden en aan de kant gingen, resulteerde de verwarring van de FSD in de dood van een vrouw.
Dit devastatieuze falen weerspiegelde onvolledige visuele data, evenals het ontbreken van een veiligheidsmechanisme dat rekening hield met dergelijke blinde vlekken. Wanneer ontwikkelaars geen zicht hebben in hun data, kunnen ze niet zien hoe het interacteert met het model, wat betekent dat ze dergelijke fouten niet kunnen ontdekken en itereren voor robuuste prestaties.
Nog bezorgwekkender, zonder de data die het model aandrijft, worden ze gedwongen om het blindelings te vertrouwen.
Wanneer datasets open source zijn, heeft de AI-gemeenschap echter aangetoond dat ze problematische kwesties zal aanpakken, zoals het ontdekken van meer dan 1.000 URLs met bevestigd kindermisbruik in LAION 5B. Met de dataset die wordt gebruikt voor AI-tekst-naar-afbeelding-modellen, die fundamenteel is voor het creëren van apps zoals Stable Diffusion en Midjourney, zou het devastatieuze gevolgen hebben gehad voor de AI-industrie als gebruikers waren begonnen met het produceren van illegale fotorealistische afbeeldingen. In plaats daarvan stelde de open aard van deze dataset de gemeenschap in staat om de gevaarlijke inhoud te ontdekken en een oplossing te motiveren, Liaison B.
Bovendien is een groot deel van die eerste dataset gebaseerd op web scraping die is uitgevoerd door de enorme Common Crawl, die ook is gebruikt voor ChatGPT- en LLAMA-modellen. Terwijl AI-crawlers nog steeds zorgen wekken over auteursrechten, privacy en bevooroordeelde en racistische etikettering, werken ontwikkelaars in de AI-gemeenschap aan manieren om stukken van Common Crawl’s groeiende open source-dataset te reinigen voor veiliger gebruik.
Terwijl ontwikkelaars proberen niet alleen krachtige AI te bouwen, maar ook AI die we kunnen vertrouwen, worden zowel gebruikers als de industrie beschermd door de transparantie en samenwerking van echte open source.
De open source-pad omarmen
Met veel mensen die nog steeds voorzichtig zijn met deze opkomende technologie, is de race om de iOS of Android van grote AI-commodity-modellen gaande – en terwijl de wereldwijde AI-gemeenschap letterlijk de standaard voor de toekomst en AI-systemen bouwt die al auto’s besturen en medische beoordelingen aanbieden, is het creëren van vertrouwen door het maken van onbevooroordeelde, betrouwbare en veilige AI nog nooit zo kritiek geweest.
Met China’s AI-gemeenschap die probeert zichzelf te positioneren als de kampioenen van open innovatie, is de weg naar veilige AI alleen te vinden in de transparantie van echte open source die is bewezen door decennia van software-innovatie. Het gooien van de term op systemen die geen kritieke onderdelen zoals data delen, laat ontwikkelaars niet toe om te onderzoeken, te repliceren en te itereren. Terwijl de aantrekkingskracht van gemakkelijk beschikbare modellen zoals DeepSeek, ERNIE 4.5, Kimi K2 en Qwen3 onmiskenbaar is, ruilen ontwikkelaars die ze gebruiken de transparantie in die samenwerking en innovatie stimuleert voor gemak.
De AI-gemeenschap moet kiezen: omarm radicale transparantie door echte open source, of riskeren dat de kritieke systemen van morgen worden gebouwd op de black boxes van vandaag.












