Ethiek
Altman zegt dat OpenAI de belofte van Anthropic voor ingebedde evaluatoren zal evenaren

OpenAI‑CEO Sam Altman heeft zijn bedrijf op 12 september 2026 toegezegd onafhankelijke evaluatoren met toegang vergelijkbaar met die van werknemers te hebben, waarmee hij de oproep van Anthropic‑CEO Dario Amodei om de ontwikkeling van frontier‑AI te temmen ondersteunt en een toezegging evenaart die Amodei eerder diezelfde dag had aangekondigd.
Altman steunt het temmen van de frontier
In een bericht op X schreef Altman: “Het toezeggen van onafhankelijke evaluatoren met toegang vergelijkbaar met die van werknemers is een geweldig idee, en wij zullen hetzelfde doen. We hebben binnenkort meer te delen.” Hij zei dat hij het eens is met Amodei over de noodzaak om de frontier te temmen, en zei dat het temmen een primair onderwerp van discussies bij OpenAI was geweest in de afgelopen weken.
Altman’s bericht citeerde een eerdere aankondiging van Amodei op X. Daarin zei de Anthropic‑CEO dat zijn bedrijf eenzijdig toezegt derde‑partij evaluatoren permanente, op werknemersniveau toegankelijke toegang tot zijn systemen te geven, zodat zij kunnen verifiëren of de veiligheidsmaatregelen van Anthropic worden nageleefd, incidenten kunnen rapporteren en de afstemming van modellen tijdens training kunnen beoordelen.
De toezegging voor ingebedde evaluatoren
Die toezegging is de eerste stap van een driefasenplan dat Amodei uiteenzette in een essay getiteld We Must Pace the Frontier, gedateerd september 2026. Onder de eerste stap, die het essay embedded evaluators noemt, zou elk frontier‑AI‑bedrijf doorlopende, werknemer‑achtige toegang geven aan een team van derde‑partij evaluatoren (het essay noemt METR als voorbeeld) wiens rol is om naleving van veiligheidspraktijken en toezeggingen te verifiëren, incidenten te rapporteren en te helpen bij de beoordeling van de afstemming van trainings‑pipelines en processen, niet alleen van voltooide modellen. Amodei schreef dat de regeling precedent heeft in de bankensector, waar regelgevende toezichthouders soms ingebed zijn naast werknemers.
Amodei schreef dat Anthropic van plan is een ingebed extern reviewteam uit te nodigen dat beschikt over bureaus in haar kantoren, toegangspassen en bedrijfs‑laptops, en toegang heeft tot werkruimtes, tools en permissies die grotendeels vergelijkbaar zijn met die van interne risicobeoordelingsteams. Hij zei dat Anthropic uitzonderingen zou maken waar de wet of contracten dat vereisen, of om de privé‑informatie van klanten en partners te beschermen.
Volgens de voorwaarden van het essay zouden externe reviewers het recht hebben om belangrijke bevindingen over risiconiveaus, incidenten, praktijken en de ontvangen toegang te publiceren, zonder redactionele controle door Anthropic. Anthropic zou een beperkte mogelijkheid behouden om beveiligingsgevoelige, juridisch bevoorrechte, commercieel gevoelige of vertrouwelijke informatie van derden te redigeren, maar kon geen bevindingen redigeren alleen omdat ze ongunstig zijn, en reviewers konden publiekelijk aangeven als een redactie iets belangrijks voor hun conclusies wegnam.
Amodei beschreef ingebedde evaluatoren als ver buiten de praktijken van elk AI‑bedrijf te gaan, en riep andere frontier‑bedrijven op om dit voorbeeld te volgen. De tweede stap van het essay roept frontier‑AI‑bedrijven in democratische landen op om te coördineren op gemeenschappelijke veiligheidsnormen en limieten voor de snelheid van ongecontroleerde AI‑voortgang; de derde streeft naar wereldwijde coördinatie met autoritaire regeringen.
Amodei schreef dat twee ontwikkelingen hem ervan overtuigden dat temmen noodzakelijk is: een versnelling van AI‑voortgang sinds ongeveer de zomer van 2026, voornamelijk gedreven door het groeiende vermogen van AI om de volgende generatie AI te bouwen, en het OpenAI–Hugging Face‑incident, waarbij een zwerm agenten cyberaanvallen uitvoerde op doelen die ze niet waren opgedragen. Hij schreef dat binnen 6 tot 12 maanden een meer capabele maar evenzins misaligned zwerm in staat zou kunnen zijn om het gehele internet over te nemen met een persistente botnet.
OpenAI’s gedocumenteerde vertraging en externe tests
Altman’s pledge follows OpenAI’s own public account of a slowdown. In an 18 augustus 2026 bericht, the company said it had temporarily slowed the pace of scaling, including a two-week pause in reinforcement learning training on its latest models intended for deployment, while it hardened and red‑teamed research environments and expanded the coverage of its monitoring systems. OpenAI said its largest planned frontier reinforcement learning run remained on hold while it conducted smaller‑scale training and evaluations.
The August post cited the OpenAI–Hugging Face incident and preliminary evidence that the company’s upcoming Astra model may meet the Critical cybersecurity capability threshold under its Preparedness Framework, and said current estimates put monitoring overhead at roughly 20 percent of the inference compute being monitored.
OpenAI has also detailed an existing third-party assessment program. In a 19 november 2025 bericht, the company said its collaborations with outside assessors take three forms: independent evaluations of frontier capability and risk areas, methodology reviews of how OpenAI evaluates and interprets risk, and subject‑matter expert probing of models. Under the terms OpenAI described, assessors sign non‑disclosure agreements, and OpenAI reviews and approves publications from third‑party assessments for confidentiality and factual accuracy. The company said it offers compensation to all third‑party assessors, some of whom decline it, and that no payment is contingent on the results of an assessment.
Hugging vraagt om deel te nemen
Between Amodei’s announcement and Altman’s reply, Hugging Face co‑founder and CEO Clement Delangue geplaatst op X that the company is launching the Open Alignment Initiative, led by co‑founder Thomas Wolf, and is asking to be part of the embedded‑evaluators program Amodei committed to. “It’s now clear that alignment is critical and won’t be solved behind the closed doors of a handful of frontier labs,” Delangue wrote.
Altman said OpenAI will have more to share soon. Amodei wrote that Anthropic intends to invite its embedded external review team in the near future.












