Thought leaders
Wie mag frontier AI auditen? De ontbrekende definitie van het White House Accord

Deze week ondertekenden leiders van Google, OpenAI, Anthropic, Meta, xAI en Nvidia het White House Accord on Super Intelligence. De bedrijven hebben zich gecommitteerd aan vier lagen van toezicht voor frontier‑modellen: interne controles, een intern team dat ze verifieert, een onafhankelijke externe auditor of evaluator, en een onafhankelijk bestuurscomité. De toezeggingen zijn voorlopig vrijwillig, en het akkoord zegt dat ze uiteindelijk in wetgeving kunnen worden omgezet.
Van de vier lagen draagt de externe beoordeling het meeste gewicht. Het is de enige laag die iemand buiten het bedrijf in staat stelt te bepalen of de waarborgen werken. Het heeft bovendien de minste definitie. Het akkoord zegt niet wie in aanmerking komt als een onafhankelijke assessor, tegen welke norm ze beoordelen, hoeveel toegang ze krijgen, of hoe onafhankelijkheid standhoudt wanneer een evaluator ook diensten verkoopt aan het bedrijf dat hij beoordeelt. Elk bedrijf kiest zijn eigen assessor.
Onder die voorwaarden kunnen twee bedrijven beide aankondigen dat ze een onafhankelijke beoordeling hebben doorstaan en toch heel verschillende dingen bedoelen. Het overbruggen van die kloof vereist antwoorden op drie vragen.
Wat moet bepalen wie in aanmerking komt
Een geloofwaardige definitie van een onafhankelijke AI-assessor moet minstens vier zaken omvatten.
Onafhankelijkheid. Een assessor mag geen waarborgen beoordelen die hij heeft geholpen ontwerpen, en mag geen herstel- of advieswerk verkopen aan hetzelfde bedrijf dat hij beoordeelt. Volwassen auditvelden letten ook op afhankelijkheid van vergoedingen. Wanneer één klant een groot deel van de omzet van een assessor uitmaakt, heeft de assessor een reden om minder streng te zijn.
Competentie passend bij de taak. “Audit” omvat verschillende activiteiten in AI. Het testen van een model op gevaarlijke mogelijkheden, zoals het helpen bij een cyberaanval of een biologisch wapen, vereist machine‑learning onderzoekers en domeinexperts. Het controleren of de waarborgen van een bedrijf goed zijn ontworpen en in de praktijk werken, vereist ervaren controle‑auditors. Een assessor die voor het ene is gekwalificeerd, is niet automatisch gekwalificeerd voor het andere, en een beoordelingsrapport moet vermelden welke activiteit is uitgevoerd.
Toegang en reikwijdte. Een assessor die alleen documentatie ziet, kan bevestigen dat een waarborg op papier bestaat. Bevestigen dat deze werkt vereist toegang tot systemen, logbestanden, goedkeuringsrecords en mensen gedurende een bepaalde periode. Frontier‑modellen veranderen tussen trainingsruns en implementaties, dus de assessor heeft ook een duidelijke regel nodig voor wanneer een wijziging een nieuwe beoordeling vereist.
Toezicht op de assessor. Iemand moet de controleurs controleren. In gevestigde auditmarkten beoordelen accreditatie‑organisaties het werk van assessors en kunnen ze hun status intrekken wanneer die onvoldoende is. Die backstop is wat de conclusies van een beoordeling gewicht geeft.
De infrastructuur die al bestaat
Niets hiervan hoeft vanaf nul te worden uitgevonden. ISO 42001, de internationale norm voor AI‑beheersystemen, biedt organisaties een raamwerk voor het beheer van AI, met gedocumenteerde controles, duidelijke eigenaren en continue verbetering. De bijbehorende norm, ISO 42006, stelt eisen aan de organen die auditen en certificeren volgens ISO 42001, inclusief de competentie die auditors moeten aantonen en de onpartijdigheidsregels die ze moeten volgen. Omdat certificerende organen onder accreditatie opereren, houdt een derde partij toezicht op de auditors zelf.
Op het gebied van technische tests vullen nieuwere kaders het gat. AIUC-1 certificeert specifieke AI‑agents in specifieke implementaties, met terugkerende derde‑partij tests voor problemen zoals hallucinaties, jailbreaks en onveilig gebruik van tools, en bouwt voort op de controles van ISO 42001.
Staten testen ook modellen voor directe supervisie van assessors. Connecticut heeft dit jaar een wet aangenomen die een pilotprogramma creëert, vanaf juli 2027, waarin het Department of Consumer Protection van de staat tot vijf onafhankelijke verificatie‑organisaties zal goedkeuren. Elk moet een door de staat gesuperviseerde overeenkomst aangaan die de reikwijdte, methoden, rapportage‑verplichtingen en governance definieert. Die structuur beantwoordt verschillende van de open vragen van het akkoord: wie assessors goedkeurt, waaraan ze worden gehouden, en wie hen superviseert.
Deze onderdelen zijn niet gebouwd voor de evaluatie van frontier‑modellen, en ze mogen niet worden gepresenteerd als een volledig antwoord. Het werk dat nog moet gebeuren, is ze met elkaar verbinden, zodat de waarborging van het beheersysteem, technische modeltests en toezicht op assessors samenkomen onder één geloofwaardige definitie van onafhankelijkheid.
Waarom de regels eerst moeten komen
De toezeggingen van het akkoord zijn vandaag vrijwillig. Als ze wet worden, moeten de regels over wie als assessor kan dienen al van kracht zijn voordat het mandaat ingaat, om drie redenen.
Ten eerste wordt vroege praktijk precedent. Zodra ondertekenaars assessors benoemen en resultaten publiceren, zal de markt zich vestigen op werkende definities van “onafhankelijk” en “gekwalificeerd”. Definities die zonder externe druk worden vastgesteld, neigen naar gemak. Wetgevers die later komen, zullen die definities al ingebed vinden in contracten en verwachtingen.
Ten tweede kost het opbouwen van gekwalificeerde capaciteit tijd. Het accrediteren van beoordelingsinstanties, het trainen van evaluatoren die zowel grensverleggende modellen als test van controles begrijpen, en het ontwikkelen van gedeelde methoden kosten allemaal jaren. Een mandaat dat arriveert voordat die capaciteit bestaat, zal worden ingevuld door wie dan ook beschikbaar is.
Ten derde leidt een vereiste zonder een markt van gekwalificeerde beoordelaars tot alleen maar afvinken. Bedrijven zullen voldoen aan de letter van de regel, toezichthouders zullen weinig basis hebben om zwakke beoordelingen aan te vechten, en het publiek krijgt de schijn van toezicht zonder veel inhoud.
Sommigen beweren dat het te vroeg is om deze regels vast te stellen omdat de wetenschap van het evalueren van grensverleggende modellen nog jong is. Dat is een terechte zorg over testmethoden, die moeten blijven evolueren naarmate de modellen dat doen. De hier opgeworpen vragen gaan over de beoordelaar: of hij vrij is van belangenconflicten, gekwalificeerd voor de taak, voldoende toegang krijgt en onder toezicht staat. Die vragen hebben stabiele antwoorden, en andere assurance‑gebieden beantwoorden ze al decennialang.
Wat organisaties nu kunnen doen
Bedrijven die geavanceerde AI bouwen of inzetten hoeven niet te wachten op een mandaat. Bij het kiezen van een beoordelaar kunnen ze vragen welke andere diensten het bedrijf aan hen levert, welke kwalificaties het team heeft voor het specifieke type beoordeling, hoeveel toegang de opdracht omvat, en wie het werk van het bedrijf superviseert. Het nu bouwen van een AI‑beheersysteem geeft elke toekomstige beoordelaar bovendien iets concreets en gedocumenteerds om te evalueren.
Het akkoord creëert een degelijke structuur voor AI‑verantwoordelijkheid. De waarde ervan hangt af van wie de beoordelaarsrol vervult en waaraan zij worden gehouden, en de tijd om dat te definiëren is vóórdat iemand verplicht wordt het te gebruiken.












