Thought leaders

De nieuwe GPAI-sjabloon van de Europese Commissie – Wat betekent dit voor AI-training?

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

In juli heeft de Europese Commissie (EC) een nieuwe algemene doelstelling voor kunstmatige intelligentie (GPAI) sjabloon vrijgegeven. Dit betekent dat aanbieders van AI hun modellen moeten trainen met gegevens die openbaar zijn gemaakt. Dit gebeurt na maanden van koppen over makers die beweren dat hun inhoud zonder toestemming is gebruikt om AI te trainen.

Met deze nieuwe sjabloon heeft de EU haar standpunt duidelijk gemaakt: transparantie is nu niet meer onderhandelbaar. Black box-training, waarbij iets wordt gemaakt zonder de interne werking te onthullen, is geen optie meer voor AI-ontwikkelaars. Dit markeert een significante verschuiving, aangezien het opereren in Europa nu volledige zichtbaarheid van modelinputs en trainingsgegevens vereist, waardoor een herbeoordeling van gegevensverzameling en -gebruik noodzakelijk is.

Velen hebben opgemerkt dat er een groot verschil is tussen deze en de onlangs vrijgegeven US AI Actieplan, dat sterk de focus legt op deregulering. Net als bij elke nieuwe wet of regelgeving, moeten bedrijven nu inventariseren en beoordelen hoe de GPAI-sjabloon hun operaties zal beïnvloeden.

Als ze opereren in meerdere regio’s, zullen ze hetzelfde doen met het US AI Actieplan, waardoor de situatie nog verwarrender wordt. Vanwege de complexe aard van deze en het feit dat het reguleren van AI-ontwikkeling op deze manier onverkend terrein is, zullen de uitvoer van ontwikkelaars waarschijnlijk sterk verschillen.

De GPAI-modelsjabloon ontleed

In juli van dit jaar heeft de Europese Commissie een verplichte sjabloon voor GPAI-aanbieders gepubliceerd, zodat ze een openbare samenvatting van de gegevens kunnen publiceren die zijn gebruikt om hun modellen te trainen. Als onderdeel van de EU AI-wet moeten aanbieders gegevenscategorieën zoals openbaar beschikbare datasets, privé-geлиценциeerde gegevens, webinhoud, gebruikersgegevens en synthetische gegevens onthullen. Het doel is om auteursrechthebbenden, gebruikers en downstream-ontwikkelaars in staat te stellen hun wettelijke rechten uit te oefenen onder EU-wetgeving.

GPT’s worden getraind met grote hoeveelheden gegevens; echter, op de huidige markt is er beperkte informatie beschikbaar over de oorsprong van deze gegevens. De openbare samenvatting die deze sjabloon beschrijft, zal een uitgebreide overzicht geven van de gegevens die zijn gebruikt om een model te trainen, de belangrijkste gegevensverzamelingen opsommen en andere bronnen uitleggen.

Vergelijk en contrasteer, US AI Actieplan

In vergelijking is de VS ervan overtuigd dat het de AI-race zal winnen en zijn concurrentievoordeel boven China zal behouden, aangezien de Trump-administratie eerder deze zomer haar AI Actieplan aankondigde. Dit nieuwe AI-kader heeft tot doel de bouw van energie-intensieve datacentra die AI-systemen aandrijven te versnellen door milieureglementeringen te versoepelen. Tegelijkertijd streeft het ernaar de wereldwijde export van Amerikaanse AI-technologieën te vergroten. Met 90 aanbevelingen weerspiegelt het plan de groeiende inspanningen van de VS om voorop te blijven lopen in de wereldwijde concurrentie.

Het plan is gebaseerd op drie kernpijlers – innovatie versnellen, Amerika’s AI-infrastructuur opbouwen en leiderschap in internationale AI-diplomatie en -beveiliging.

Als onderdeel hiervan benadrukt een belangrijke conclusie uit het plan de ‘open-source’-push van Amerika om zowel innovatie als toegankelijkheid te stimuleren. Evenzo benadrukt het plan hoe de Amerikaanse regering ‘voorbeeldig zal leiden’ bij AI-groei – door training, talentuitwisselingen en de uitbreiding van adoptie over industrieën heen.

Met dit plan streeft de VS ernaar alle huidige technologie-reglementeringen te stroomlijnen, met name milieureglementeringen, om ervoor te zorgen dat wetgeving de groei niet vertraagt, en tegelijkertijd de wereldwijde distributie van Amerikaanse AI-software en -hardware te bevorderen. Deze ‘anti-regulerings’-aanpak markeert een duidelijke verschuiving van eerdere kaders die waren gericht op ethiek, transparantie en verantwoorde innovatie – en beweegt zich in de richting van een meer agressieve ‘innovatie-eerst’-actieplan.

Het ontbrekende stuk

Het is de moeite waard om op dit punt een stap terug te doen en te overwegen of deze handelingen, hoewel verschillend, kunnen lijden aan dezelfde fouten die ontwikkelaars ertoe zullen brengen om een gebrek aan waarde te zien in het naleven ervan. De EU- en US-benaderingen laten een kritische kloof achter rondom intellectueel eigendom in AI-trainingsdatasets. De EU AI-wet vereist trainingsgegevenssamenvattingen en een auteursrechtbeleid, maar stelt geen schaalbaar kader vast voor het identificeren of licentiëren van auteursrechtelijk beschermde werken.

In de VS bestaan er geen specifieke regels – waardoor AI-bedrijven een evoluerend juridisch kader moeten navigeren dat wordt gevormd door rechterlijke uitspraken en lopende geschillen met rechthebbenden. Voorbij de juridische tekst, wat ontbreekt is de praktische kant; geen van beide benaderingen biedt haalbare, breed gedragen methoden voor het detecteren van beschermd materiaal op grote schaal, het verifiëren van wettig gebruik of het stroomlijnen van licenties. Totdat dergelijke oplossingen zijn gedefinieerd, zal de onzekerheid rondom auteursrecht in AI-training een significante uitdaging voor de industrie blijven.

De verborgen kosten van bedrijven die AI-traceerbaarheid overslaan

Ondanks enkele van de fouten in deze reglementeringen, zal ervan worden uitgegaan dat ze AI-ontwikkelaars ertoe zullen brengen om zich sterk te concentreren op hoe ze legaal kunnen overleven – maar dat is niet altijd het geval. In feite is de echte kloof in AI op dit moment niet tussen EU- en US-reglementering, maar tussen bedrijven die vandaag in traceerbaarheid investeren en diegenen die erop gokken dat ze het niet hoeven te doen. Dit is een herhaling van wat we jaren geleden zagen met de implementatie van de Algemene Verordening Gegevensbescherming (AVG) – bedrijven die vroeg privacy-by-design bouwden, vermijdden niet alleen boetes, maar verkregen ook consumentenvertrouwen en soepeler toegang tot andere markten die later de AVG-normen volgden.

Hetzelfde patroon kan zich nu ontwikkelen met AI. Traceerbaarheid van trainingsgegevens en modelbeslissingen zal waarschijnlijk een wereldwijde basislijn worden, en bedrijven die vertragen, moeten hun systemen in de toekomst opnieuw ontwerpen. Terugkeren om documentatie, herkomstvolging en auditfuncties toe te voegen aan een bestaand systeem is veel duurder en complexer dan ze vanaf het begin op te bouwen, waardoor de focus wordt afgeleid van meer rendabele uitbreidingen die het bedrijf wil voltooien.

Met andere woorden, traceerbaarheid en transparantie zijn geen optionele toevoegingen; ze moeten vanaf het begin in AI-systemen worden ingebed. Bedrijven die ze als nasleep behandelen, riskeren innovatie te stagneren, regulatorische backlash te krijgen en de race onbeperkt te verliezen.

Ethische AI heeft mondiale eenheid nodig

Vanuit een macro-perspectief creëren deze gepolariseerde benaderingen een echt probleem voor mondiale bedrijven. Bedrijven in lichtere markten zoals de VS kunnen zich in de korte termijn sneller ontwikkelen, maar wanneer ze besluiten de EU te betreden, worden ze geconfronteerd met een compliance-muur: de AI-wetgeving van de EU vereist traceerbaarheid en documentatie-regels die capaciteiten vereisen die ze nooit hebben opgebouwd.

Het opnieuw inrichten van herkomstvolging, documentatie en auditfuncties in een bestaand systeem is duur, langzaam en disruptief, vooral omdat traceerbaarheid een van de meest resource-intensieve delen van compliance is. Het is hetzelfde patroon dat we zagen met de AVG, waar late komers naar privacy-by-design worstelden met dure herbouw en vertraagde markttoegang, terwijl vroege starters een duurzame voorsprong behaalden.

Viktorija Lapenyte is de Head of Product Legal Counsel bij Oxylabs. Met meer dan een decennium aan juridische ervaring in de IT-sector, heeft Viktorija Lapėnytė diepe expertise ontwikkeld in het navigeren van complexe bedrijfs- en regelgevingsuitdagingen als in-house juridisch adviseur. Vandaag is Viktorija de Head of Product Legal Counsel bij Oxylabs, een marktleidende webintelligentiecollectieplatform. Viktorija's team specialiseert zich in de juridische complexiteiten van opkomende datatechnologieën, van compliance en regelgevingsrisicobeheer tot gegevensbescherming en bredere discussies over verantwoorde gegevensverwerving.