Vordenker

Wer darf die Frontier‑KI prüfen? Die fehlende Definition im White House Accord

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

In dieser Woche unterzeichneten die Führungskräfte von Google, OpenAI, Anthropic, Meta, xAI und Nvidia den White House Accord on Super Intelligence. Die Unternehmen verpflichteten sich zu vier Ebenen der Aufsicht für Frontier‑Modelle: interne Kontrollen, ein internes Team, das diese überprüft, ein unabhängiger externer Prüfer oder Evaluator und ein unabhängiger Ausschuss des Vorstands. Die Verpflichtungen sind vorerst freiwillig, und der Accord besagt, dass sie schließlich in Gesetzesform gebracht werden könnten.

Von den vier Ebenen hat die externe Bewertung das größte Gewicht. Sie ist die einzige Ebene, die jemandem außerhalb des Unternehmens die Möglichkeit gibt, zu beurteilen, ob Schutzmaßnahmen funktionieren. Sie ist zudem am wenigsten definiert. Der Accord sagt nicht, wer als unabhängiger Prüfer qualifiziert ist, nach welchem Standard er bewertet, welchen Zugriff er erhält oder wie die Unabhängigkeit aussieht, wenn ein Evaluator gleichzeitig Dienstleistungen für das Unternehmen erbringt, das er prüft. Jedes Unternehmen wählt seinen eigenen Prüfer.

Unter diesen Bedingungen können zwei Unternehmen beide verkünden, dass sie eine unabhängige Bewertung bestanden haben, und dabei sehr unterschiedliche Bedeutungen haben. Diese Lücke zu schließen, erfordert Antworten auf drei Fragen.

Was sollte entscheiden, wer qualifiziert ist

Eine glaubwürdige Definition eines unabhängigen KI‑Prüfers muss mindestens vier Punkte abdecken.

Unabhängigkeit. Ein Prüfer sollte keine Schutzmaßnahmen überprüfen, an deren Gestaltung er mitgewirkt hat, und er sollte keine Behebungs‑ oder Beratungsleistungen an dasselbe Unternehmen verkaufen, das er prüft. Reife Prüfungsbereiche achten zudem auf die Abhängigkeit von Honoraren. Wenn ein Kunde einen großen Teil der Einnahmen eines Prüfers ausmacht, hat der Prüfer einen Anreiz, nachsichtig zu sein.

Kompetenz, die zur Aufgabe passt. „Audit“ umfasst mehrere unterschiedliche Aktivitäten im Bereich KI. Das Testen eines Modells auf gefährliche Fähigkeiten, wie die Unterstützung bei einem Cyberangriff oder einer biologischen Waffe, erfordert Fachleute für maschinelles Lernen und Domänenexperten. Das Prüfen, ob die Schutzmaßnahmen eines Unternehmens gut konzipiert und in der Praxis wirksam sind, erfordert erfahrene Kontrollprüfer. Ein Prüfer, der für das eine qualifiziert ist, ist nicht automatisch für das andere qualifiziert, und ein Prüfungsbericht sollte angeben, welche Art von Prüfung durchgeführt wurde.

Zugang und Umfang. Ein Prüfer, der nur Dokumentation einsehen kann, kann bestätigen, dass eine Schutzmaßnahme auf dem Papier existiert. Das Nachweisen, dass sie funktioniert, erfordert Zugriff auf Systeme, Protokolle, Genehmigungsunterlagen und Personen über einen bestimmten Zeitraum. Frontier‑Modelle ändern sich zwischen Trainingsläufen und Einsätzen, sodass der Prüfer zudem klare Regeln benötigt, wann eine Änderung eine erneute Überprüfung erfordert.

Aufsicht über den Prüfer. Jemand muss die Prüfer überprüfen. In etablierten Prüfungs‑Märkten prüfen Akkreditierungsstellen die Arbeit der Prüfer und können deren Status entziehen, wenn sie unzureichend ist. Diese Rückendeckung verleiht den Schlussfolgerungen einer Bewertung Gewicht.

Die bereits vorhandene Infrastruktur

 All dies muss nicht von Grund auf neu erfunden werden. ISO 42001, der internationale Standard für KI‑Managementsysteme, bietet Organisationen ein Rahmenwerk zur Steuerung von KI, mit dokumentierten Kontrollen, klaren Verantwortlichen und kontinuierlicher Verbesserung. Der zugehörige Standard ISO 42006 legt Anforderungen an die Stellen fest, die nach ISO 42001 prüfen und zertifizieren, einschließlich der Kompetenz, die Prüfer nachweisen müssen, und der Unparteilichkeitsregeln, die sie befolgen müssen. Da Zertifizierungsstellen unter Akkreditierung arbeiten, überwacht eine dritte Partei die Prüfer selbst.

Im Bereich der technischen Tests füllen neuere Rahmenwerke die Lücken. AIUC-1 zertifiziert spezifische KI‑Agenten in bestimmten Einsätzen, mit wiederkehrenden Drittanbieter‑Tests für Probleme wie Halluzinationen, Jailbreaks und unsichere Werkzeugnutzung, und baut auf den Kontrollen von ISO 42001 auf.

Bundesstaaten testen ebenfalls Modelle, um Prüfer direkt zu überwachen. Connecticut hat in diesem Jahr ein Gesetz verabschiedet, das ein Pilotprogramm schafft, das im Juli 2027 beginnt, in dem das Department of Consumer Protection des Staates bis zu fünf unabhängige Verifizierungsorganisationen genehmigt. Jede muss einen staatlich überwachten Vertrag abschließen, der Umfang, Methoden, Berichtspflichten und Governance definiert. Diese Struktur beantwortet mehrere der offenen Fragen des Accords: wer Prüfer genehmigt, welchen Standards sie unterliegen und wer sie überwacht.

Diese Bausteine wurden nicht für die Bewertung von Frontier‑Modellen entwickelt und sollten nicht als vollständige Lösung präsentiert werden. Die bevorstehende Aufgabe besteht darin, sie zu verbinden, sodass die Gewährleistung von Managementsystemen, die technische Modellprüfung und die Aufsicht über Prüfer unter einer glaubwürdigen Definition von Unabhängigkeit zusammenpassen.

Warum die Regeln zuerst kommen müssen

Die Verpflichtungen des Accords sind heute freiwillig. Wenn sie zu Gesetz werden, müssen die Regeln, wer als Prüfer fungieren kann, bereits vor Inkrafttreten des Mandats feststehen, aus drei Gründen.

Erstens wird frühe Praxis zum Präzedenzfall. Sobald Unterzeichner beginnen, Prüfer zu benennen und Ergebnisse zu veröffentlichen, wird der Markt funktionierende Definitionen von „unabhängig“ und „qualifiziert“ etablieren. Definitionen, die ohne äußeren Druck festgelegt werden, neigen dazu, Bequemlichkeit zu bevorzugen. Gesetzgeber, die später kommen, werden diese Definitionen bereits in Verträgen und Erwartungen verankert vorfinden.

Zweitens braucht es Zeit, um qualifizierte Kapazitäten aufzubauen. Die Akkreditierung von Bewertungsstellen, die Schulung von Gutachtern, die sowohl Frontier-Modelle als auch Kontrollen‑Tests verstehen, und die Entwicklung gemeinsamer Methoden dauern alle Jahre. Ein Mandat, das eintrifft, bevor diese Kapazität vorhanden ist, wird von demjenigen umgesetzt, der gerade verfügbar ist.

Drittens führt eine Anforderung ohne einen qualifizierten Gutachter‑Markt dahinter zu reiner Formular‑Erfüllung. Unternehmen werden den Wortlaut der Regel einhalten, Regulierungsbehörden haben wenig Grundlage, schwache Bewertungen anzufechten, und die Öffentlichkeit erhält den Anschein von Aufsicht, ohne dass es viel Substanz gibt.

Einige argumentieren, es sei zu früh, diese Regeln festzulegen, weil die Wissenschaft zur Bewertung von Frontier‑Modellen noch jung ist. Das ist eine berechtigte Sorge hinsichtlich der Testmethoden, die sich weiterentwickeln sollten, während sich die Modelle weiterentwickeln. Die hier aufgeworfenen Fragen betreffen den Gutachter: ob er frei von Interessenkonflikten ist, für die Aufgabe qualifiziert ist, ausreichend Zugang erhält und einer Aufsicht unterliegt. Auf diese Fragen gibt es stabile Antworten, und andere Sicherungsbereiche beantworten sie seit Jahrzehnten.

Was Organisationen jetzt tun können

Unternehmen, die fortschrittliche KI entwickeln oder einsetzen, müssen nicht auf ein Mandat warten. Bei der Auswahl eines Gutachters können sie fragen, welche weiteren Dienstleistungen das Unternehmen ihnen anbietet, welche Qualifikationen das Team für die jeweilige Art der Bewertung besitzt, welchen Umfang der Zugang im Auftrag hat und wer die Arbeit des Unternehmens überwacht. Der Aufbau eines KI‑Managementsystems jetzt liefert zudem jedem zukünftigen Gutachter ein konkretes und dokumentiertes Bewertungsobjekt.

Das Abkommen schafft eine solide Struktur für die KI‑Verantwortlichkeit. Sein Wert hängt davon ab, wer die Gutachterrolle übernimmt und welchen Standards sie unterliegen, und die Zeit, dies zu definieren, liegt bevor jemand verpflichtet ist, es anzuwenden.

Patrick Sullivan ist der VP of Strategy & Innovation bei A-LIGN, spezialisiert auf AI-Governance, IT-Sicherheit und Compliance. Mit über 25 Jahren Erfahrung in der Branche konzentriert sich Patrick auf die Bereitstellung strategischer Beratung und Unterstützung für unsere Kunden und Partner, um ihnen zu helfen, die komplexe und sich entwickelnde Landschaft der AI-Governance, Cybersicherheit und Compliance zu navigieren. Seine Expertise ist instrumental bei der Unterstützung von Organisationen, um ihre strategischen Sicherheits- und Compliance-Ziele effektiv zu erreichen.