Líderes de opinión

Cuando la IA hackea la IA: La nueva frontera de las ciberamenazas

mm
Añade Unite.AI a tus fuentes preferidas en Google

En los últimos varios años, la tecnología de IA se ha desarrollado significativamente. Desde simples chatbots que podían responder preguntas frecuentes y llamadas telefónicas hasta cirugías de precisión y ciberataques casi autónomos. El incidente en Hugging Face en enero de 2026 se convirtió en un hito preocupante: los agentes de IA demostraron por primera vez la capacidad de hackear plataformas de IA de forma autónoma. Este caso expuso un problema fundamental: las medidas de seguridad tradicionales no funcionan contra una IA atacante. Pero, ¿qué significa esto para la industria de la IA — y de qué deberíamos estar realmente preocupados?

Lo que la IA puede hacer por los atacantes hoy

No será una novedad si les digo que las capacidades de los hackers con IA dependen de las habilidades y objetivos del atacante. Los actores de amenaza que llevan a cabo campañas masivas han comenzado cada vez más a usar IA para reconocimiento, desarrollo de sitios de phishing, señuelos, etc. Además, los atacantes usan IA con frecuencia para la creación de código — lo que se conoce como vibe coding. 

El vibe coding en sí mismo redujo significativamente la barrera de entrada no solo a la profesión de TI, sino que también facilitó que los hackers se incorporaran al negocio del cibercrimen, donde utilizan la tecnología para desarrollar y depurar su malware.

Durante el último año, decenas de grupos APT han confirmado que los ataques basados en IA ya no son teóricos. Además, estoy convencido de que la IA se está convirtiendo en una herramienta peligrosa en manos de los atacantes — y esto no es una exageración. Los ataques híbridos APT son la realidad moderna. Me refiero a una operación dirigida por humanos en la que la IA actúa como herramienta principal.

Lo que importa aquí es AIM3 (Modelo de Madurez de Malware de IA), que define cinco niveles de sofisticación para amenazas habilitadas por IA, donde L1 cubre ataques experimentales y L5 cubre ataques de IA totalmente autónomos.

En 2025, el primer ejemplo conocido de un ataque L4 fue detectado — la operación llevada a cabo por GTG-1002. En este caso, los actores asignaron instancias de Claude Code para operar en grupos como orquestadores y agentes de pruebas de penetración autónomas, permitiendo al actor de amenaza aprovechar la IA para ejecutar entre el 80 % y el 90 % de las operaciones tácticas de forma independiente.

Otra tendencia notable es que los atacantes utilizan más de una solución de IA durante un ataque. Por ejemplo, TAT26-12 ha estado usando dos sistemas de IA que cumplen roles complementarios. Además, se utilizó OpenAI para análisis masivo automatizado en servidores internos de las víctimas: el atacante analizó los informes de OpenAI e introdujo los hallazgos relevantes en sesiones de Claude, que a su vez funcionaron como un asistente interactivo de explotación.

Otro caso similar se dio a conocer en julio de 2026, cuando actores de amenaza no identificados usaron Claude Code y DeepSeek-v4-pro para sus ataques. Claude Code funciona como el motor de ejecución, gestionando el uso de herramientas agente, la ejecución de comandos bash, la persistencia de sesiones y la paralelización de tareas. DeepSeek-v4-pro, a su vez, opera como el modelo de razonamiento subyacente, manejando la lógica de ataque, la generación de scripts y la toma de decisiones.

Cabe señalar que no se pueden nombrar casos confirmados de ataques L5 de IA realizados en la práctica. Supongo que los actores avanzados apuntarán a los niveles L3–L4 de sofisticación para las amenazas de IA, ya que les permite escalar y llevar a cabo suficientes ataques. Dado que los ataques L5 son complejos de implementar, al menos en el futuro cercano seguirán siendo teóricos.

IA en la Dark Web

En foros clandestinos, la IA era típicamente mencionada en discusiones sobre las capacidades generales de cada solución y en el contexto de la creación de prompts. Sin embargo, una parte significativa de las publicaciones estaba directamente relacionada con actividad maliciosa. Las publicaciones en plataformas cibercriminales conocidas cubrían temas como el uso de IA para encontrar instrucciones para configurar la infraestructura del atacante y métodos para evadir la detección por soluciones antivirus populares; usar IA para eludir los procedimientos KYC en intercambios de criptomonedas populares; discutir ataques de IA conocidos; desarrollar y distribuir malware; y usar IA para crear páginas de phishing que imitan servicios en línea.

Las tres soluciones de IA más mencionadas en los foros coinciden con las que se observan con mayor frecuencia en ataques de grupos cibercriminales: Gemini, herramientas de OpenAI y Claude Code. Gemini se utilizó con más frecuencia en ataques importantes, mientras que ChatGPT se discutía más a menudo en los foros. 

Industria de IA como objetivo

Además de usar IA para llevar a cabo ataques, los actores de amenaza apuntan directamente a las soluciones de IA. Los ataques a herramientas de IA rara vez se divulgan públicamente; sin embargo, un ataque de este tipo puede tener un impacto significativo en muchas empresas. Un ataque a proveedores de IA puede generar una campaña de cadena de suministro, permitiendo a los atacantes comprometer a los clientes sin apuntar a ellos directamente.

Además, los desarrolladores de IA también pueden ser víctimas de ataques a la cadena de suministro. Por ejemplo, a principios de mayo de 2026, TeamPCP inyectó el implante malicioso Mini Shai-Hulud en paquetes npm comprometidos; la campaña afectó al menos a dos proveedores de IA, entre otras organizaciones. El grupo de actores de amenaza robó parte de los repositorios internos de un proveedor de IA y los puso a la venta en un foro de la Dark Web.

APT41 intentó otro tipo de ataque usando Gemini para obtener información sobre su infraestructura y sistemas. El intento no tuvo éxito, pero la idea en sí era bastante única.

Además, los investigadores han informado repetidamente vulnerabilidades críticas en varias soluciones de IA, incluyendo CVE-2025-32711 (también conocido como EchoLeak) en Microsoft 365 Copilot, CVE-2025-54135 (también conocido como CurXecute) en Cursor IDE, CVE-2025-53109 en Model Context Protocol, CVE-2025-8217 en la extensión Amazon Q Developer para VS Code, y CVE-2025-34291 en Langflow AI. Los dos últimos se observaron explotados en entornos reales.

Defensas Antiguas, Nuevas Amenazas

Como es bien sabido, existen diferentes tipos de soluciones de IA: basadas en la nube y locales. Lo que considero crucial para que la comunidad de IA comprenda es que las soluciones de IA presentan al menos los mismos problemas de seguridad que otras aplicaciones de escritorio y basadas en la nube, o incluso más. 

La primera amenaza evidente es la distribución de malware que se hace pasar por herramientas locales de IA legítimas; los atacantes a menudo utilizan fuentes de confianza como GitHub para ello. 

Otro ejemplo similar son extensiones maliciosas de asistentes de IA diseñadas para monitorizar pasivamente la actividad del usuario, recopilando URLs visitadas y fragmentos de contenido de chat generado por IA creados durante la navegación rutinaria.

En la mayoría de los casos, si un atacante obtiene acceso al historial de búsquedas de un usuario, puede obtener información sobre su vida privada y diversos procesos de trabajo. Por lo tanto, constituye una amenaza tanto para el usuario como para las empresas.

Otro tipo es una técnica denominada secuestro de tokens de IA: claves API comprometidas, tokens de sesión y dispositivos son el objetivo de actores que venden ese acceso o utilizan estos secretos robados para sus ataques, por ejemplo, para ejecutar tareas ocultas. El alcance del ataque depende de los datos y permisos ya disponibles en la sesión de la víctima. 

Otra técnica popular para IA que me gustaría mencionar es la inyección de prompts, que consiste en insertar entradas maliciosas (prompts) para extraer información no intencionada o sensible del sistema más allá de lo que el desarrollador previó.

El acceso sin restricciones a datos sensibles incrementa el riesgo de una brecha. En otras palabras, la IA se convierte en un punto único de entrada — a menudo con privilegios elevados — lo que atrae una mayor atención por parte de los atacantes.

Cómo Mantenerse Seguro

En el contexto de la ciberseguridad, algunos principios básicos pueden ser incluso más importantes que las tecnologías específicas. Primero, aplique el principio de menor privilegio a la IA. Segundo, nunca confíe en contenido externo. Y, por último pero no menos importante, mantenga a los humanos en el bucle y nunca permita que el modelo decida por sí solo quién obtiene acceso. Recomiendo encarecidamente verificar que todos los puntos estén en su lugar para sus soluciones de IA.

Alyona Shander es una especialista en ciberseguridad con más de nueve años de investigación sobre grupos de ciberdelincuentes y métodos proactivos de caza de amenazas. También es coautora de estudios sobre la actividad de grupos APT y de informes anuales de ciberataques.