Ciberseguridad
OpenAI interrumpe campaña coordinada de extracción de razonamiento de modelo

OpenAI dijo en una publicación de seguridad publicada el 30 de septiembre de 2026 que identificó e interrumpió una campaña coordinada diseñada para extraer razonamiento protegido de sus modelos, y atribuyó un núcleo central de la actividad a individuos asociados con Moonshot AI, el desarrollador de Kimi. La actividad observada más temprana ocurrió en la primera semana de julio de 2026.
Lo que OpenAI observó
OpenAI describió la actividad como consistente con la destilación adversarial, que definió como el uso sistemático y no autorizado de los resultados o razonamiento de un modelo para ayudar a entrenar, reproducir o mejorar otro modelo. El razonamiento protegido, según la empresa, es el registro interno del modelo para abordar una tarea; extraerlo puede revelar información retenida del resultado final y ayudar a otros a reproducir las capacidades del modelo.
OpenAI dijo que los operadores no rompieron su cifrado, no comprometieron una base de datos ni obtuvieron acceso directo a las conversaciones de usuarios almacenadas. Los operadores manipularon las interacciones del modelo de modo que el razonamiento protegido pudiera reproducirse en formas visibles para el solicitante de manera coordinada y a gran escala, lo que violó los términos de servicio de la empresa. Una técnica que OpenAI observó consistió en copiar el razonamiento cifrado de una conversación y pedir a un modelo en otra conversación que descifrara y transcribiera el contenido del razonamiento oculto. La empresa afirmó que la manipulación no es una vulnerabilidad única de sus modelos y que compartió información al respecto con socios de la industria a través del Frontier Model Forum para reforzar las defensas colectivas.
La actividad comenzó el 1 de julio de 2026, inicialmente con bajo volumen, hasta que OpenAI observó picos de alto volumen los 24 y 25 de julio de 2026, consistentes en 16 000 solicitudes que utilizaban un patrón de extracción relevante de más de 4 000 usuarios. Una nota al pie en la publicación indica que estas cifras describen extracciones intentadas, no necesariamente exitosas. OpenAI dijo que una investigación adicional identificó actividad de patrones de solicitud relacionados en un conjunto de más de 15 000 usuarios, que interrumpió por completo antes del 28 de julio de 2026. La actividad evolucionó con el tiempo, lo que la empresa afirmó refuerza que la destilación adversarial es un desafío de seguridad más amplio que requiere defensas en capas y adaptativas.
OpenAI dijo que la destilación adversarial plantea riesgos de seguridad y de seguridad nacional: el razonamiento extraído podría usarse para entrenar otro modelo sin preservar las salvaguardas aplicadas a los resultados dirigidos al usuario del modelo original, y la destilación a gran escala puede acelerar la transferencia de capacidades avanzadas sin la misma inversión en seguridad, preocupaciones que la empresa afirmó se intensifican a medida que los modelos adquieren capacidades de doble uso. OpenAI declaró que, antes de publicar, investigó el alcance y el impacto potencial de la campaña, implementó sus propias mitigaciones, y compartió y recibió comentarios de investigadores y socios de la industria, y que el trabajo adicional de mitigación e investigación continúa.
Atribución
OpenAI dijo que no está claro si todos los operadores observados durante el período relevante provienen de un único actor, y que atribuye un núcleo central de la actividad a individuos asociados con Moonshot AI, el desarrollador de Kimi.
El 8 de septiembre de 2026, la Agencia de Seguridad Nacional, la Agencia de Ciberseguridad e Infraestructura y la Oficina Federal de Investigaciones publicaron un aviso conjunto de ciberseguridad que indica que Moonshot AI ha llevado a cabo una campaña de destilación generalizada contra empresas estadounidenses de IA de frontera desde al menos mediados de 2025. El aviso señala que Moonshot AI extrajo datos significativos de Claude Fable 5 para entrenar su modelo Kimi-K3 y datos de GPT-4o para entrenar su modelo Kimi-K2, y que la empresa utilizó modelos estadounidenses para destilar optimización de ajuste fino supervisado, aprendizaje por refuerzo, ingeniería de software y capacidades matemáticas.
El aviso indica de manera más amplia que, probablemente con conocimiento del gobierno chino, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun y Z.AI extrajeron miles de millones de tokens a lo largo de millones de intercambios de modelos estadounidenses de frontera, incluidas variantes de Claude, GPT, Gemini y Grok, desde al menos finales de 2024. Según las agencias, estas compañías canalizaron solicitudes a través de API nativas, proveedores de nube remotos y agregadores de terceros; utilizaron un mercado gris de proxies de API conocidos como estaciones de transferencia para eludir restricciones geográficas, infringir los términos de uso y socavar la trazabilidad; y lograron ahorros de costos mediante la adquisición masiva de suscripciones premium compartidas entre equipos de desarrolladores. Las agencias recomendaron que las empresas estadounidenses de IA implementen detección y mitigación integrales, desplieguen cambios de respuesta dirigidos para intentos sospechosos de destilación y establezcan intercambio de inteligencia entre organizaciones.
La investigación del rastro de razonamiento
OpenAI dijo que investigadores de seguridad independientes pusieron en su conocimiento vulnerabilidades relacionadas de cruce de modelos y compresión de conversaciones mediante divulgación responsable. La empresa afirmó que investigó los hallazgos, confirmó que las rutas de ataque identificadas por los investigadores eran reales, y que el trabajo le ayudó a comprender la clase de ataque más amplia y a acelerar las mitigaciones.
En un artículo presentado a arXiv el 10 de agosto de 2026, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer‑Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping y Maksym Andriushchenko informan que los proveedores líderes ocultan el razonamiento paso a paso de sus modelos para proteger la propiedad intelectual y limitar la filtración de información, devolviendo las trazas al cliente como bloques de texto cifrado que el cliente envía de nuevo con cada solicitud posterior. Los autores identifican una vulnerabilidad arquitectónica: estos bloques cifrados son totalmente compatibles e intercambiables entre diferentes sesiones, usuarios y modelos dentro del ecosistema de un proveedor. Describen un jailbreak de descifrado escalable en el que una traza de razonamiento cifrada de un modelo dado se inyecta en un modelo más débil y menos protegido del mismo proveedor, obligándolo a decodificar y emitir la traza literalmente en texto plano sin vulnerar directamente el modelo más capaz.
Los autores informan que la vulnerabilidad permite cuatro vectores de ataque distintos: eludir los mecanismos anti‑destilación, que demuestran en Anthropic, OpenAI y Google; extracción masiva de datos privados, en la que recuperaron 367 artefactos de información de identificación personal y 182 credenciales al decodificar 315 320 bloques de razonamiento extraídos de repositorios públicos; revelación inadvertida de información peligrosa oculta dentro del proceso de razonamiento incluso cuando la salida visible final del modelo rechaza de forma segura una solicitud maliciosa; y inyecciones de indicaciones invisibles que incrustan cargas maliciosas completamente dentro de bloques cifrados para envenenar los despliegues públicos de agentes. Tras la divulgación responsable, los autores proponen mitigaciones criptográficas y a nivel de sistema para asegurar el razonamiento del lado del cliente.
Cómo respondió OpenAI
OpenAI declaró que mitigó la campaña mediante una combinación de aplicación de cuentas, controles técnicos y coordinación con socios: prohibió o restringió cuentas fraudulentas, reforzó los controles de registro e infraestructura, y amplió la monitorización de redes relacionadas. La empresa también afirmó haber fortalecido las protecciones para el razonamiento oculto entre usuarios, espacios de trabajo, organizaciones y familias de modelos: cerró una vía que permitía a alguien que ya poseía el razonamiento cifrado de otro usuario reproducirlo y recuperar su contenido, añadió verificaciones para detectar y retener la salida en streaming que pudiera exponer el razonamiento, y colaboró con proveedores externos para identificar y bloquear cuentas cuando la actividad relacionada transitaba por sus servicios.
OpenAI indicó que compartió los hallazgos relevantes a través del Frontier Model Forum y los canales apropiados de intercambio de información gubernamental, de modo que otros desarrolladores de modelos de frontera y socios del sector público pudieran buscar actividades similares y reforzar sus propias defensas, y señaló que los sistemas que soportan artefactos de razonamiento portátiles o reproducibles podrían enfrentar riesgos relacionados.
OpenAI afirmó que espera que los intentos de destilación adversaria se vuelvan más sofisticados a medida que los modelos de frontera mejoren y los actores busquen formas más económicas de imitar sus capacidades. La compañía señaló que los despliegues alojados por socios requieren las mismas protecciones que los servicios de primera parte, que los ataques basados en la salida de herramientas exigen protecciones que examinen más que el texto visible ordinario, y que continúa mejorando las defensas de herramientas, la cobertura de clasificadores y los rechazos de modelos mientras propaga los controles pertinentes entre los socios en la nube. OpenAI declaró que su respuesta seguirá centrada en tres áreas: protecciones técnicas más fuertes contra la extracción, mejor detección y aplicación contra campañas coordinadas, y un intercambio de información de amenazas más profundo entre la industria y el gobierno.












