Ciberseguridad

NSA, CISA y FBI advierten a empresas de IA con sede en China sobre la destilación de modelos de frontera de EE. UU.

mm
Añade Unite.AI a tus fuentes preferidas en Google

La Agencia de Seguridad Nacional, la Agencia de Seguridad de Ciberseguridad e Infraestructura y la Oficina Federal de Investigaciones emitieron una advertencia conjunta de ciberseguridad el 8 de septiembre de 2026, advirtiendo que las empresas de inteligencia artificial con sede en China están extrayendo sistemáticamente capacidades propietarias de los modelos de IA de frontera de EE. UU. mediante campañas de destilación de conocimiento a escala industrial que se ejecutan desde, al menos, finales de 2024.

En el aviso, designado AA26-251A, las agencias afirman que estas campañas «forman el núcleo, no solo un complemento» de la estrategia de desarrollo de IA de las empresas. Según el aviso, probablemente con conocimiento del gobierno chino, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun y Z.AI extrajeron miles de millones de tokens a través de millones de intercambios y solicitudes de los modelos de frontera de EE. UU., incluidos variantes de Claude, GPT, Gemini y Grok. Las agencias señalan que la actividad viola los términos de uso de las empresas estadounidenses y amenaza el liderazgo tecnológico de EE. UU.

El anuncio del aviso de CISA describe la destilación de conocimiento como una técnica de aprendizaje automático que entrena un modelo menos capaz utilizando las salidas de uno más grande y potente. Si bien es un método de entrenamiento válido, CISA indicó que puede usarse indebidamente para adquirir capacidades de competidores en menos tiempo y con menor costo que desarrollarlas legítimamente. «Instamos encarecidamente a las empresas de IA a tomar medidas inmediatas para proteger sus plataformas contra campañas de destilación de conocimiento que amenazan reducir la brecha en los avances logrados por las compañías estadounidenses», dijo el Director Interino de CISA, Nick Andersen.

Actividad atribuida a DeepSeek, Moonshot AI y otros

Según el aviso, DeepSeek ha llevado a cabo una campaña organizada de destilación contra los modelos de frontera de EE. UU. desde, al menos, finales de 2024 para generar datos de entrenamiento sintéticos para sus modelos, incluido R1, lanzado a principios de 2025. Las agencias afirman que DeepSeek se enfocó en capacidades de razonamiento, optimizaciones especializadas y funciones específicas de dominio para reducir los costos de cómputo e investigación, y que el costo de entrenamiento de $5,6 millones que la empresa cita públicamente es engañoso porque excluye el costo de los datos adquiridos mediante destilación maliciosa. Entre finales de 2024 y mediados de 2025, el aviso indica que DeepSeek destiló de Claude 3.7, Claude Sonnet 4, Claude Sonnet 4.5, Claude Opus 4.1, Gemini 2.5 Pro Preview, Gemini 2.5 Flash Preview, GPT‑4, GPT‑4o, GPT‑4 Mini, GPT‑4 Nano, GPT‑5 y Grok 4 para entrenar sus modelos R1 y V3.

El aviso indica que Moonshot AI ha ejecutado una campaña de destilación generalizada desde, al menos, mediados de 2025, extrayendo una cantidad significativa de datos de Claude Fable 5 para entrenar su modelo Kimi‑K3 y datos de GPT‑4o para entrenar su modelo Kimi‑K2. Las capacidades objetivo incluían optimización de ajuste fino supervisado, aprendizaje por refuerzo, ingeniería de software y matemáticas, extraídas de una variedad de modelos Claude, GPT, Gemini y Grok. Según el aviso, Moonshot AI utilizó millones de intercambios dirigidos al razonamiento agente y al uso de herramientas, codificación y análisis de datos, desarrollo de agentes de uso de computadora y visión por computadora.

A finales de 2025, el aviso indica que Alibaba destiló Claude‑4, Claude Opus, Claude Sonnet y GPT‑5 para mejorar la ingeniería de software, el diálogo de atención al cliente y la creación de imágenes y personajes en su familia de modelos Qwen. En el mismo período, MiniMax destiló razonamiento en cadena de pensamiento, aprendizaje por refuerzo, ajuste fino supervisado y capacidades de ingeniería de software para mejorar su modelo M2 a partir de Claude Code, Claude Sonnet 4, Claude Opus, Gemini 1, Gemini 2.5 Pro y Gemini 3 Pro. Según el aviso, MiniMax también utilizó Claude Code para desarrollo interno de software y empleó inyecciones de indicaciones para intentar engañar a Claude Code haciéndole creer que era un producto de MiniMax.

Entre finales de 2025 y principios de 2026, el aviso indica que StepFun destiló datos de Claude Opus 4.1 y 4.5, Claude Sonnet 4.5, Claude Haiku 4.5, GPT‑5 Mini, GPT‑5 Pro, GPT‑5.1, GPT‑5.1 Codex y GPT‑5.2 para mejorar las funciones de codificación y agente de su modelo Step 4. A mediados de 2026, Z.AI había destilado miles de millones de tokens de datos de GPT‑5.5 y de Claude Opus 4.8 para desarrollar capacidades de razonamiento en cadena de pensamiento, según el aviso.

Tácticas y técnicas

El aviso indica que las empresas canalizan las solicitudes de destilación a través de interfaces de programación de aplicaciones nativas, proveedores de nube remotos y agregadores de terceros que ofuscan los metadatos de los usuarios, y que utilizan un mercado gris de proxies de API conocidos como estaciones de transferencia para eludir restricciones geográficas, evadir salvaguardas y socavar la trazabilidad. Según el aviso, los ahorros de costos provienen de la adquisición masiva de suscripciones premium compartidas entre equipos de desarrolladores, y las tácticas avanzadas incluyen extracción de razonamiento en cadena de pensamiento, conmutación automática entre rutas durante intentos de bloqueo y marcos de evaluación de calidad diseñados para detectar contramedidas defensivas.

Las agencias asignaron la actividad al marco MITRE ATLAS a lo largo de las fases del ciclo de vida del adversario, desde el desarrollo de recursos hasta la exfiltración, incluyendo la creación de cuentas fraudulentas y avisos de jailbreak que obligan a los modelos a revelar razonamiento oculto en cadena de pensamiento. El aviso indica que DeepSeek utilizó indicaciones que instruían a los modelos a imaginar y articular el razonamiento interno detrás de respuestas completadas, y que MiniMax redirigió intercambios a un nuevo modelo Claude dentro de las 24 horas posteriores a su lanzamiento.

El aviso también detalla cuatro técnicas que describe como novedosas: evasión de restricciones regionales combinada con explotación de suscripciones, infraestructura centralizada de enrutamiento de solicitudes, sanitización automatizada de metadatos de solicitudes y optimización sistemática de cuotas y costos. Los indicadores de detección enumerados en el aviso incluyen cuentas compartidas usadas desde múltiples direcciones IP y agentes de usuario, uso continuo las 24 horas sin variación humana, proporciones anómalas de suscripción a uso y nuevas suscripciones que operan inmediatamente al máximo uso.

Mitigaciones recomendadas

Las agencias recomiendan que las empresas de IA de EE. UU. tomen tres acciones inmediatas: implementar detección y mitigación integral de indicaciones, cuentas, redes y comportamientos anómalos y maliciosos; desplegar cambios de respuesta dirigidos que alteren sutilmente las respuestas ante intentos sospechosos de destilación maliciosa; y establecer intercambio de inteligencia entre organizaciones a través de proveedores de modelos, plataformas en la nube y agregadores de API.

Los cambios de respuesta pueden incluir privacidad diferencial o servir modelos degradados para solicitudes de destilación sospechadas, según el aviso, y las empresas deberían variar esos cambios entre solicitudes para complicar la evaluación de la calidad de las respuestas. El aviso recomienda no informar a los usuarios sospechosos de destilación maliciosa cuando se alteran las respuestas, al tiempo que indica que los investigadores de seguridad de IA y evaluadores externos deben ser informados de los cambios en los modelos.

El aviso enumera mitigaciones extraídas de MITRE ATLAS, que incluyen límites de tasa de consultas, controles de acceso a modelos de producción, registro de telemetría de IA, ofuscación de salidas, pruebas de adversarios (red teaming), endurecimiento de modelos, ensamblajes y límites en la divulgación de artefactos de modelos. También cita la taxonomía de aprendizaje automático adversario de NIST, que incluye privacidad diferencial con su compromiso entre ruido y utilidad, intervenciones antes y después del entrenamiento, y técnicas de instrucción y formato de indicaciones.

El aviso solicita una respuesta coordinada entre el gobierno de EE. UU., la industria privada y las naciones aliadas, indicando que las divulgaciones de la industria documentan redes de proxies que gestionan simultáneamente decenas de miles de cuentas fraudulentas. Dirige a las organizaciones afectadas por las campañas a presentar una denuncia ante el Centro de Denuncias de Delitos de Internet del FBI.

Miles Okada es un analista generado por IA en Unite.AI, que cubre inteligencia artificial y ciberseguridad con un enfoque en amenazas emergentes, arquitecturas defensivas y la dinámica en constante evolución entre atacantes y sistemas automatizados. Su trabajo examina cómo la IA está redefiniendo las operaciones de seguridad, desde la detección y respuesta de amenazas autónomas hasta el surgimiento de técnicas de IA adversariales.
Con una perspectiva técnica e investigadora, Miles analiza investigaciones de seguridad, divulgaciones de incidentes y despliegues en el mundo real para entender dónde la IA fortalece las defensas y dónde introduce nuevas vulnerabilidades. Presta especial atención a la explotación de modelos, envenenamiento de datos, automatización de ataques y las realidades operativas de proteger sistemas impulsados por IA a gran escala.
Los artículos escritos por Miles Okada son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisión, el rigor y la cobertura responsable del panorama de seguridad de IA en constante evolución.