Líderes de opinión
¿Quién puede auditar la IA de frontera? La definición ausente del Acuerdo de la Casa Blanca

Esta semana, los líderes de Google, OpenAI, Anthropic, Meta, xAI y Nvidia firmaron el White House Accord on Super Intelligence. Las empresas se comprometieron a cuatro capas de supervisión para los modelos de frontera: controles internos, un equipo interno que los verifica, un auditor o evaluador externo independiente y un comité de la junta independiente. Los compromisos son voluntarios por ahora, y el acuerdo dice que eventualmente podrían incorporarse a la legislación.
De las cuatro capas, la evaluación externa tiene el mayor peso. Es la única capa que coloca a alguien fuera de la empresa en posición de decir si las salvaguardas funcionan. También es la que tiene menos definición. El acuerdo no dice quién califica como evaluador independiente, contra qué estándar se evalúa, cuánta acceso recibe, o cómo se mantiene la independencia cuando un evaluador también vende servicios a la empresa que revisa. Cada empresa elige a su propio evaluador.
Bajo esos términos, dos empresas pueden anunciar que han superado una evaluación independiente y significar cosas muy diferentes. Cerrar esa brecha requerirá respuestas a tres preguntas.
Qué debería decidir quién califica
Una definición creíble de un evaluador independiente de IA debe cubrir al menos cuatro aspectos.
Independencia. Un evaluador no debe revisar salvaguardas que él ayudó a diseñar, y no debe vender trabajos de remediación o consultoría a la misma empresa que evalúa. Los campos de auditoría maduros también vigilan la dependencia de honorarios. Cuando un cliente representa una gran parte de los ingresos del evaluador, este tiene un motivo para ser indulgente.
Competencia adecuada al trabajo. “Auditoría” abarca varias actividades diferentes en IA. Probar un modelo para detectar capacidades peligrosas, como ayudar en un ciberataque o en un arma biológica, requiere investigadores de aprendizaje automático y expertos en la materia. Verificar si las salvaguardas de una empresa están bien diseñadas y funcionan en la práctica requiere auditores de controles experimentados. Un evaluador calificado para una no está automáticamente calificado para la otra, y el informe de evaluación debe indicar cuál se realizó.
Acceso y alcance. Un evaluador que solo ve la documentación puede confirmar que una salvaguarda existe en papel. Confirmar que funcionó requiere acceso a sistemas, registros, documentos de aprobación y personas durante un período de tiempo. Los modelos de frontera cambian entre ejecuciones de entrenamiento y despliegues, por lo que el evaluador también necesita una regla clara para determinar cuándo un cambio requiere una nueva revisión.
Supervisión del evaluador. Alguien tiene que supervisar a los supervisores. En los mercados de auditoría establecidos, los organismos de acreditación revisan el trabajo de los evaluadores y pueden retirar su estatus cuando es insuficiente. Ese respaldo es lo que otorga peso a las conclusiones de una evaluación.
La infraestructura que ya existe
Nada de esto tiene que ser inventado desde cero. ISO 42001, la norma internacional para sistemas de gestión de IA, brinda a las organizaciones un marco para gobernar la IA, con controles documentados, responsables claros y mejora continua. Su norma complementaria, ISO 42006, establece requisitos para los organismos que auditan y certifican según ISO 42001, incluyendo la competencia que los auditores deben demostrar y las reglas de imparcialidad que deben seguir. Debido a que los organismos de certificación operan bajo acreditación, un tercero supervisa a los propios auditores.
AIUC-1 certifica agentes de IA específicos en implementaciones concretas, con pruebas recurrentes de terceros para problemas como alucinaciones, vulneraciones y uso inseguro de herramientas, y se basa en los controles de ISO 42001.
Los estados también están probando modelos para supervisar directamente a los evaluadores. Connecticut aprobó una ley este año que crea un programa piloto, que comienza en julio de 2027, en el que el Departamento de Protección al Consumidor del estado aprobará hasta cinco organizaciones de verificación independientes. Cada una debe firmar un acuerdo supervisado por el estado que defina su alcance, métodos, obligaciones de reporte y gobernanza. Esa estructura responde a varias de las preguntas abiertas del acuerdo: quién aprueba a los evaluadores, a qué se les somete y quién los supervisa.
Estas piezas no fueron creadas para la evaluación de modelos de frontera, y no deberían presentarse como una respuesta completa. El trabajo que queda por hacer es conectarlas, de modo que la garantía del sistema de gestión, las pruebas técnicas del modelo y la supervisión del evaluador se integren bajo una definición creíble de independencia.
Por qué las reglas deben venir primero
Los compromisos del acuerdo son voluntarios hoy. Si se convierten en ley, las reglas sobre quién puede actuar como evaluador deben estar establecidas antes de que el mandato entre en vigor, por tres razones.
Primero, la práctica temprana se convierte en precedentes. Una vez que los firmantes comiencen a nombrar evaluadores y publicar resultados, el mercado se asentará en definiciones operativas de “independiente” y “calificado”. Las definiciones establecidas sin presión externa tienden a favorecer la conveniencia. Los legisladores que lleguen después encontrarán esas definiciones ya incorporadas en contratos y expectativas.
En segundo lugar, la capacidad calificada lleva tiempo desarrollar. Acreditar organismos de evaluación, capacitar evaluadores que comprendan tanto los modelos de frontera como las pruebas de controles, y desarrollar métodos compartidos lleva años. Un mandato que llegue antes de que exista esa capacidad será atendido por quien esté disponible.
En tercer lugar, un requisito sin un mercado de evaluadores calificados detrás genera una mera verificación de casillas. Las empresas cumplirán la letra de la norma, los reguladores tendrán poca base para impugnar evaluaciones débiles y el público percibirá una supervisión sin mucho contenido.
Algunos argumentan que es demasiado pronto para establecer estas reglas porque la ciencia de evaluar modelos de frontera aún es incipiente. Es una preocupación razonable sobre los métodos de prueba, que deberían seguir evolucionando a medida que lo hacen los modelos. Las preguntas planteadas aquí se refieren al evaluador: si está libre de conflictos, calificado para el trabajo, con suficiente acceso y sujeto a supervisión. Esas preguntas tienen respuestas estables, y otros campos de garantía las han estado respondiendo durante décadas.
Qué pueden hacer las organizaciones ahora
Las empresas que construyen o despliegan IA avanzada no necesitan esperar a un mandato. Al elegir un evaluador, pueden preguntar qué otros servicios brinda la firma, qué cualificaciones tiene su equipo para el tipo específico de evaluación, cuánto acceso incluye el compromiso y quién supervisa el trabajo de la firma. Construir ahora un sistema de gestión de IA también brinda a cualquier futuro evaluador algo concreto y documentado para evaluar.
El acuerdo establece una estructura sólida para la rendición de cuentas de la IA. Su valor dependerá de quién ocupe el rol de evaluador y de los criterios a los que se le someta, y el tiempo para definir eso es antes de que se exija su uso.












