Líderes de opiniÃģn

Por quÃĐ las salvaguardas de los chatbots son el límite de seguridad equivocado

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

La inteligencia artificial empresarial ha superado con creces la etapa de prueba de concepto. El 23% de las organizaciones ya estÃĄn escalando sistemas de inteligencia artificial agente en algÚn lugar de su empresa, y el 62% al menos estÃĄn experimentando con agentes de inteligencia artificial. Estos no son proyectos de investigaciÃģn. Son despliegues de producciÃģn, integrados en flujos de trabajo que tocan repositorios de cÃģdigo, datos de clientes, API internas e infraestructura operativa.

La respuesta de la industria a este crecimiento se ha centrado en gran medida en lo que sucede antes de que un agente se ponga en vivo. Los proveedores y los investigadores han invertido energía en salvaguardas previas al despliegue: publicar políticas de escalado, endurecer modelos base, filtrar entradas, asegurar la cadena de suministro de inteligencia artificial y hacer cumplir la alineaciÃģn en el momento del entrenamiento. Los principales proveedores de inteligencia artificial han realizado inversiones sustanciales en herramientas de seguridad orientadas al desarrollador, reforzando una suposiciÃģn central: si el modelo y sus entradas estÃĄn controlados, el riesgo aguas abajo se puede contener.

Es un instinto razonable, pero cada vez mÃĄs incompleto.

La invitaciÃģn no es un perímetro de seguridad

Las salvaguardas que operan en la interfaz del modelo benefician principalmente a los equipos que controlan el cÃģdigo de la aplicaciÃģn, la configuraciÃģn del modelo y la infraestructura subyacente. Ofrecen mucha menos protecciÃģn a los defensores que estÃĄn encargados de proteger los sistemas de inteligencia artificial que no construyeron y no pueden modificar. Ese es un punto ciego significativo, y los adversarios ya lo han encontrado.

El Último informe de inteligencia de amenazas de OpenAI documenta exactamente esta dinÃĄmica. Los actores de amenazas estÃĄn abusando activamente de ChatGPT y herramientas similares en entornos de producciÃģn, no inventando tÃĐcnicas de ataque novedosas, sino integrando la inteligencia artificial en flujos de trabajo existentes para moverse mÃĄs rÃĄpido. La exploraciÃģn se vuelve mÃĄs eficiente. La ingeniería social se amplía. El desarrollo de malware se acelera. La superficie de ataque no ha cambiado fundamentalmente; la velocidad y el volumen de la explotaciÃģn han cambiado.

MÃĄs revelador es cÃģmo respondieron los atacantes cuando esas herramientas se resistieron. OpenAI observÃģ que los actores de amenazas mutaban rÃĄpidamente sus invitaciones, preservando la intenciÃģn subyacente mientras cíclicamente variaban las variaciones de superficie para evitar controles front-end. Este es un patrÃģn que los profesionales de la seguridad han visto antes. Las defensas estÃĄticas, ya sean antivirus basados en firmas o filtrado de entradas, no se mantienen contra adversarios que iteran mÃĄs rÃĄpido que las actualizaciones de reglas pueden seguir.

El desafío se complica a medida que los agentes ganan autonomía. Los agentes de inteligencia artificial modernos no operan en un solo intercambio. Ejecutan secuencias de acciÃģn multi-paso, invocando herramientas legítimas y permisos de maneras que parecen completamente normales en aislamiento. Un agente que utiliza credenciales vÃĄlidas para enumerar API internas no desencadena una alerta. Un agente que accede a tiendas de datos sensibles durante lo que parece un flujo de trabajo rutinario no genera ninguna bandera inmediata. Cada acciÃģn individual pasa la inspecciÃģn; el peligro vive en la combinaciÃģn y la secuencia.

Cuando la amenaza se mueve aguas abajo

Los equipos de seguridad que defienden los despliegues de inteligencia artificial hoy enfrentan un desajuste estructural. Las herramientas disponibles para ellos estÃĄn en gran medida construidas para razonar sobre lo que un modelo estÃĄ permitido decir. El riesgo real que necesitan administrar es lo que un agente estÃĄ haciendo en sistemas, redes e identidades una vez que se le han otorgado permisos y se ha puesto en libertad en un entorno de producciÃģn.

Las salvaguardas basadas en invitaciones comparten las debilidades fundamentales de los enfoques de seguridad anteriores basados en reglas. Son frÃĄgiles porque dependen de predecir patrones de ataque de antemano. Son reactivas porque requieren que alguien haya observado y codificado la amenaza antes de que la defensa pueda funcionar. Y estÃĄn superadas por adversarios que han adoptado la iteraciÃģn asistida por inteligencia artificial como prÃĄctica estÃĄndar. Un defensor que confía en el filtrado de entradas para atrapar a un actor de amenazas que estÃĄ utilizando un modelo de lenguaje para generar variaciones de invitaciones frescas estÃĄ en una posiciÃģn fundamentalmente perdedora.

La exposiciÃģn real se produce despuÃĐs del despliegue. Las acciones impulsadas por el agente se propagan a travÃĐs de los entornos de maneras que no se pueden anticipar completamente con pruebas previas al lanzamiento. Los agentes encuentran casos de borde, interactÚan con fuentes de datos que no estaban diseÃąadas para manejar, reciben entradas de sistemas fuera de la arquitectura original y toman decisiones que se acumulan con el tiempo. La prueba previa al lanzamiento es una instantÃĄnea; la producciÃģn es un flujo continuo. Defender solo la instantÃĄnea significa aceptar que todo lo que sucede en el flujo es efectivamente sin supervisiÃģn.

Desplazando el límite de seguridad hacia el comportamiento del agente

Construir la resiliencia de la inteligencia artificial requiere un marco diferente y el objetivo no debe ser proteger la interfaz del modelo. Debe ser detectar la intenciÃģn del atacante a travÃĐs de las consecuencias observables de las acciones del agente. Esa es una distinciÃģn significativa. La intenciÃģn no siempre se manifiesta en lo que un agente dice o en las entradas que recibe.

Seguir los sistemas de inteligencia artificial debe extenderse mÃĄs allÃĄ de las comprobaciones de alineaciÃģn y evaluaciones de robustez para una evaluaciÃģn continua de cÃģmo los agentes se comportan una vez que interactÚan con herramientas reales, API reales y datos reales. La evaluaciÃģn estÃĄtica en el momento del despliegue es necesaria pero insuficiente. El entorno de amenazas en el que opera un agente cambia constantemente. El comportamiento del agente necesita ser monitoreado con la misma continuidad.

Este es un problema que el endurecimiento de la invitaciÃģn no puede resolver. Detectar la intenciÃģn maliciosa a medida que emerge a travÃĐs de secuencias de acciÃģn requiere modelos capaces de comprender el comportamiento secuencial complejo en entornos operativos. Los modelos de aprendizaje profundo de anÃĄlisis de comportamiento pueden hacer esto de maneras que los sistemas basados en reglas y las herramientas de SIEM tradicionales no pueden. Aprenden quÃĐ es lo normal en todo el contexto de la actividad del agente y superfician desviaciones que indican que algo ha cambiado, incluso cuando ninguna acciÃģn individual desencadenaría una alerta convencional.

La lÃģgica subyacente se mantiene independientemente del contexto de despliegue: la seguridad anclada en la capa de la invitaciÃģn perderÃĄ consistentemente ante los atacantes que operan en la capa de la acciÃģn. La defensa tiene que moverse a donde vive la amenaza real.

QuÃĐ deben hacer ahora los equipos de seguridad

Para los líderes de seguridad que intentan adelantarse a esto, algunos cambios prÃĄcticos pueden cerrar la brecha entre donde se encuentran actualmente las defensas y donde necesitan estar.

EvalÚe la seguridad de la inteligencia artificial en toda la pila de la aplicaciÃģn. El modelo base es una capa. Igualmente importante es cÃģmo los agentes se comportan una vez desplegados en producciÃģn, quÃĐ herramientas llaman, quÃĐ permisos utilizan y cÃģmo esas elecciones evolucionan con el tiempo. Las evaluaciones de seguridad que se detienen en el límite del modelo dejan la superficie operativa en gran medida sin examinar.

Enfuerce el privilegio mínimo a nivel de agente. Los agentes de inteligencia artificial deben tener acceso solo a las herramientas, API y datos necesarios para su funciÃģn designada. Esta restricciÃģn es importante incluso cuando las salidas del agente parecen benignas. Limitar el alcance reduce el radio de acciÃģn de un agente comprometido y crea líneas de base de comportamiento mÃĄs claras que hacen que la detecciÃģn de anomalías sea mÃĄs efectiva.

Trate a los agentes como identidades que generan telemetría. Cada acciÃģn que toma un agente es un dato. Los equipos de seguridad deben construir lÃģgica de detecciÃģn alrededor de cadenas de acciÃģn iniciadas por el agente, no solo las invitaciones del usuario que las preceden. Este cambio de enfoque cambia la supervisiÃģn de lo que alguien le pidiÃģ al agente que hiciera a lo que el agente realmente hizo, que es donde se vuelve visible la intenciÃģn del atacante.

Invierta en monitoreo de comportamiento continuo con modelos de detecciÃģn diseÃąados específicamente para esta tarea. Identificar la intenciÃģn maliciosa a medida que emerge a travÃĐs de secuencias de acciÃģn requiere capacidad especializada. Las herramientas de monitoreo convencionales fueron construidas para patrones de actividad generados por humanos. El comportamiento del agente, con su velocidad, volumen y estructura multi-paso, demanda infraestructura de detecciÃģn diseÃąada desde cero con ese contexto en mente.

Priorice la defensa colectiva. Las tÃĐcnicas de ataque asistidas por inteligencia artificial estÃĄn evolucionando mÃĄs rÃĄpido de lo que cualquier organizaciÃģn individual puede rastrear. La investigaciÃģn compartida, la colaboraciÃģn abierta y la inteligencia de amenazas de la comunidad no son complementos opcionales de una estrategia de seguridad de inteligencia artificial; son entradas bÃĄsicas. Los defensores que se mantienen actualizados son aquellos que contribuyen y se benefician del conocimiento colectivo.

La seguridad del comportamiento realmente entrega

Para los equipos de seguridad que hacen este cambio, el pago operativo es concreto. Anclar la detecciÃģn en el comportamiento del agente en lugar de en las salidas del modelo permite la identificaciÃģn mÃĄs temprana de la intenciÃģn maliciosa, incluso cuando los ataques son sigilosos, adaptables o cifrados. Los atacantes que mutan con ÃĐxito sus invitaciones mÃĄs allÃĄ de los filtros de entrada todavía tienen que actuar. Esas acciones dejan huellas. La detecciÃģn del comportamiento encuentra esas huellas antes de que el daÃąo se propague.

QuizÃĄs lo mÃĄs significativo es que este enfoque da a las organizaciones una ruta creíble para desplegar agentes de inteligencia artificial a gran escala sin aceptar un riesgo de seguridad proporcional. La pregunta que retiene a muchas empresas no es si los agentes de inteligencia artificial pueden entregar valor; es si se pueden desplegar con suficiente confianza de que la postura de seguridad no se degrade a medida que crece el despliegue. La seguridad del comportamiento, basada en cÃģmo los agentes realmente operan en lugar de en las entradas que reciben, proporciona esa confianza de una manera que los controles basados en la invitaciÃģn no pueden estructuralmente.

El límite de seguridad se dibujÃģ en el lugar equivocado, y ese error tenía sentido cuando la inteligencia artificial era una herramienta que esperaba la entrada. Ya no espera, los sistemas agente actÚan, encadenan, escalan y se propagan a travÃĐs de entornos sin que las pruebas previas al despliegue lo anticiparan. Las organizaciones que reconozcan esto antes serÃĄn aquellas que realmente escalen la inteligencia artificial con confianza. Todos los demÃĄs pasarÃĄn los prÃģximos aÃąos descubriendo, violaciÃģn por violaciÃģn, que controlar lo que un modelo dice nunca fue lo mismo que controlar lo que hace.

Mayank Kumar es el Ingeniero de IA Fundador en DeepTempo, donde lidera el diseÃąo y el desarrollo del modelo de lenguaje de registro fundamental de la empresa (LogLM). Con una sÃģlida formaciÃģn acadÃĐmica y de investigaciÃģn en IA generativa y multimodal, aporta una experiencia especializada en la creaciÃģn de modelos específicos de dominio que mejoran la detecciÃģn y respuesta a amenazas en entornos de ciberseguridad.