Entrevistas

Vahid Behzadan, Director de Secured y Assured Intelligent Learning (SAIL) Lab – Serie de Entrevistas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Vahid es profesor asistente de Ciencias de la Computación y Ciencia de Datos en la Universidad de New Haven. También es director del Laboratorio de Aprendizaje Inteligente Seguro y Asegurado (SAIL)

Sus intereses de investigación incluyen la seguridad y la seguridad de los sistemas inteligentes, la modelización psicológica de los problemas de seguridad de la IA, la seguridad de los sistemas complejos adaptativos, la teoría de juegos, los sistemas multiagente y la ciberseguridad.

¿Tiene un amplio trasfondo en ciberseguridad y mantener la IA segura? ¿Puede compartir su trayectoria en cómo se interesó en ambos campos?

Mi trayectoria de investigación ha sido impulsada por dos intereses fundamentales: descubrir cómo se rompen las cosas y aprender sobre los mecanismos de la mente humana. He estado activamente involucrado en la ciberseguridad desde mis primeros años de adolescencia y, en consecuencia, construí mi agenda de investigación temprana en torno a los problemas clásicos de este dominio. Pocos años después de mis estudios de posgrado, me encontré con una rara oportunidad de cambiar mi área de investigación. En ese momento, acababa de descubrir los primeros trabajos de Szegedy y Goodfellow sobre ataques de ejemplos adversos, y encontré la idea de atacar el aprendizaje automático muy intrigante. A medida que miré más a fondo en este problema, llegué a aprender sobre el campo más general de la seguridad y la seguridad de la IA, y encontré que abarcaba muchos de mis intereses fundamentales, como la ciberseguridad, las ciencias cognitivas, la economía y la filosofía. También llegué a creer que la investigación en este área no solo es fascinante, sino también vital para garantizar los beneficios y la seguridad a largo plazo de la revolución de la IA.

 

¿Es el director del Laboratorio de Aprendizaje Inteligente Seguro y Asegurado (SAIL), que trabaja para sentar las bases concretas para la seguridad y la seguridad de las máquinas inteligentes? ¿Puede entrar en detalles sobre el trabajo realizado por SAIL?

En SAIL, mis estudiantes y yo trabajamos en problemas que se encuentran en la intersección de la seguridad, la IA y los sistemas complejos. El enfoque principal de nuestra investigación es investigar la seguridad y la seguridad de los sistemas inteligentes, desde tanto la perspectiva teórica como la aplicada. En el lado teórico, estamos investigando actualmente el problema de la alineación de valores en entornos multiagente y estamos desarrollando herramientas matemáticas para evaluar y optimizar los objetivos de los agentes de IA con respecto a la estabilidad y la alineación robusta. En el lado práctico, algunos de nuestros proyectos exploran las vulnerabilidades de seguridad de las tecnologías de IA de vanguardia, como los vehículos autónomos y el comercio algorítmico, y apuntan a desarrollar técnicas para evaluar y mejorar la resistencia de dichas tecnologías a los ataques adversos.

También trabajamos en las aplicaciones del aprendizaje automático en la ciberseguridad, como la prueba de penetración automatizada, la detección temprana de intentos de intrusión y la recopilación y análisis de inteligencia de amenazas automatizados a partir de fuentes de datos abiertas como las redes sociales.

 

Recientemente lideró un esfuerzo para proponer la modelado de los problemas de seguridad de la IA como trastornos psicopatológicos. ¿Puede explicar qué es esto?

Este proyecto aborda la complejidad creciente de los agentes y sistemas de IA: ya es muy difícil diagnosticar, predecir y controlar comportamientos inseguros de los agentes de aprendizaje por refuerzo en entornos no triviales simplemente mirando sus configuraciones de bajo nivel. En este trabajo, enfatizamos la necesidad de abstracciones de alto nivel para investigar dichos problemas. Inspirados en los enfoques científicos para los problemas de comportamiento en humanos, proponemos la psicopatología como una abstracción de alto nivel útil para modelar y analizar comportamientos emergentes perjudiciales en la IA y la AGI. Como prueba de concepto, estudiamos el problema de seguridad de la IA de la piratería de recompensas en un agente de aprendizaje por refuerzo que aprende a jugar el juego clásico de la serpiente. Mostramos que si agregamos una “semilla de droga” al entorno, el agente aprende un comportamiento subóptimo que se puede describir a través de modelos neurocientíficos de adicción. Este trabajo también propone metodologías de control basadas en los enfoques de tratamiento utilizados en la psiquiatría. Por ejemplo, proponemos el uso de señales de recompensa generadas artificialmente como análogos de la terapia con medicamentos para modificar el comportamiento perjudicial de los agentes.

 

¿Tiene alguna preocupación sobre la seguridad de la IA cuando se trata de vehículos autónomos?

Los vehículos autónomos se están convirtiendo en ejemplos prominentes de la implementación de la IA en sistemas ciberfísicos. Considerando la susceptibilidad fundamental de las tecnologías de aprendizaje automático actuales a los errores y los ataques adversos, estoy profundamente preocupado por la seguridad y la seguridad de incluso los vehículos semiautónomos. Además, el campo de la conducción autónoma sufre de una falta grave de estándares y protocolos de evaluación de seguridad. Sin embargo, sigo siendo optimista. Al igual que la inteligencia natural, la IA también será propensa a cometer errores. Sin embargo, el objetivo de los coches autónomos todavía se puede satisfacer si las tasas e impacto de dichos errores se hacen más bajos que los de los conductores humanos. Estamos presenciando esfuerzos crecientes para abordar estos problemas en la industria y la academia, así como en los gobiernos.

 

Hackear señales de tráfico con calcomanías o utilizando otros medios puede confundir el módulo de visión por computadora de un vehículo autónomo. ¿Cuán grande es este problema?

Estas calcomanías, y los ejemplos adversos en general, plantean desafíos fundamentales en la robustez de los modelos de aprendizaje automático. Para citar a George E. P. Box, “todos los modelos son incorrectos, pero algunos son útiles”. Los ejemplos adversos explotan esta “incorrección” de los modelos, que se debe a su naturaleza abstracta, así como a las limitaciones de los datos muestreados sobre los que se entrenan. Los esfuerzos recientes en el dominio del aprendizaje automático adverso han resultado en avances tremendos hacia el aumento de la resistencia de los modelos de aprendizaje profundo a dichos ataques. Desde una perspectiva de seguridad, siempre habrá una forma de engañar a los modelos de aprendizaje automático. Sin embargo, el objetivo práctico de asegurar los modelos de aprendizaje automático es aumentar el costo de implementar dichos ataques hasta el punto de ineficiencia económica.

 

¿Cuál es su enfoque en las características de seguridad y seguridad de ambos, el aprendizaje profundo y el aprendizaje por refuerzo profundo? ¿Por qué es esto tan importante?

El aprendizaje por refuerzo es el método prominente para aplicar el aprendizaje automático a problemas de control, que por definición involucran la manipulación de su entorno. Por lo tanto, creo que los sistemas basados en el aprendizaje por refuerzo tienen riesgos significativamente más altos de causar daños importantes en el mundo real en comparación con otros métodos de aprendizaje automático, como la clasificación. Este problema se ve exacerbado por la integración del aprendizaje profundo en el aprendizaje por refuerzo, lo que permite la adopción del aprendizaje por refuerzo en entornos complejos. Además, creo que el marco del aprendizaje por refuerzo está estrechamente relacionado con los mecanismos subyacentes de la cognición en la inteligencia humana, y estudiar su seguridad y vulnerabilidades puede conducir a mejores conocimientos sobre los límites de la toma de decisiones en nuestras mentes.

 

¿Cree que estamos cerca de lograr la Inteligencia Artificial General (AGI)?

Esta es una pregunta notoriamente difícil de responder. Creo que actualmente tenemos los bloques de construcción de algunas arquitecturas que pueden facilitar la emergencia de la AGI. Sin embargo, puede tomar unos pocos años o décadas más mejorar estas arquitecturas y aumentar la eficiencia de costo de entrenar y mantener estas arquitecturas. En los próximos años, nuestros agentes van a crecer más inteligentes a una tasa creciente. No creo que la emergencia de la AGI se anuncie en la forma de un titular [científicamente válido], sino como resultado de un progreso gradual. Además, creo que todavía no tenemos una metodología ampliamente aceptada para probar y detectar la existencia de una AGI, y esto puede retrasar nuestra comprensión de las primeras instancias de la AGI.

 

¿Cómo mantenemos la seguridad en un sistema de AGI que es capaz de pensar por sí mismo y probablemente sea exponencialmente más inteligente que los humanos?

Creo que la teoría unificada de comportamiento inteligente es la economía y el estudio de cómo los agentes actúan e interactúan para lograr lo que quieren. Las decisiones y acciones de los humanos están determinadas por sus objetivos, su información y los recursos disponibles. Las sociedades y los esfuerzos colaborativos emergen de sus beneficios para los miembros individuales de dichos grupos. Otro ejemplo es el código penal, que disuade ciertas decisiones al adjuntar un alto costo a las acciones que pueden dañar a la sociedad. De la misma manera, creo que controlar los incentivos y los recursos puede permitir la emergencia de un estado de equilibrio entre los humanos y las instancias de la AGI. Actualmente, la comunidad de seguridad de la IA investiga esta tesis bajo el paraguas de los problemas de alineación de valores.

 

Una de las áreas que sigue de cerca es el contraterrorismo. ¿Tiene preocupaciones sobre que los terroristas tomen el control de los sistemas de IA o AGI?

Hay numerosas preocupaciones sobre el mal uso de las tecnologías de IA. En el caso de las operaciones terroristas, la principal preocupación es la facilidad con la que los terroristas pueden desarrollar y llevar a cabo ataques autónomos. Un número creciente de mis colegas están advirtiendo activamente sobre los riesgos de desarrollar armas autónomas (ver https://autonomousweapons.org/ ). Uno de los principales problemas con las armas habilitadas por la IA es la dificultad de controlar la tecnología subyacente: la IA está a la vanguardia de la investigación de código abierto, y cualquier persona con acceso a Internet y hardware de consumo puede desarrollar sistemas de IA perjudiciales. Sospecho que la emergencia de armas autónomas es inevitable, y creo que pronto habrá una necesidad de nuevas soluciones tecnológicas para contrarrestar dichas armas. Esto puede resultar en un ciclo de gato y ratón que impulsa la evolución de las armas habilitadas por la IA, lo que puede dar lugar a riesgos existenciales graves a largo plazo.

 

¿Qué podemos hacer para mantener los sistemas de IA seguros de estos agentes adversos?

El primer y más importante paso es la educación: todos los ingenieros y practicantes de la IA necesitan aprender sobre las vulnerabilidades de las tecnologías de IA y considerar los riesgos relevantes en el diseño y la implementación de sus sistemas. En cuanto a recomendaciones más técnicas, hay varias propuestas y conceptos de solución que se pueden emplear. Por ejemplo, entrenar a los agentes de aprendizaje automático en entornos adversos puede mejorar su resistencia y robustez contra los ataques de evasión y manipulación de políticas (por ejemplo, ver mi artículo titulado “Whatever Does Not Kill Deep Reinforcement Learning, Makes it Stronger“). Otra solución es tener en cuenta directamente el riesgo de ataques adversos en la arquitectura del agente (por ejemplo, enfoques bayesianos para la modelización del riesgo). Sin embargo, hay una brecha importante en este área, y es la necesidad de métricas y metodologías universales para evaluar la robustez de los agentes de IA contra los ataques adversos. Las soluciones actuales son en gran medida ad hoc y no proporcionan medidas generales de resistencia contra todos los tipos de ataques.

 

¿Hay algo más que le gustaría compartir sobre alguno de estos temas?

En 2014, Scully et al. publicaron un artículo en la conferencia NeurIPS con un tema muy iluminador: “Machine Learning: La tarjeta de crédito de alto interés de la deuda técnica“. Incluso con todos los avances del campo en los últimos años, esta afirmación todavía no ha perdido su validez. El estado actual de la IA y el aprendizaje automático no es nada menos que impresionante, pero todavía no hemos llenado un número significativo de brechas importantes en tanto la fundación como la ingeniería de la IA. Este hecho, en mi opinión, es el más importante de nuestra conversación. Por supuesto, no quiero desanimar la adopción comercial de las tecnologías de IA, pero solo deseo permitir que la comunidad de ingeniería tenga en cuenta los riesgos y los límites de las tecnologías de IA actuales en sus decisiones.

Realmente disfruté aprendiendo sobre los desafíos de seguridad y seguridad de los diferentes tipos de sistemas de IA. Esto es algo que las personas, las corporaciones y los gobiernos necesitan ser conscientes. Los lectores que deseen aprender más pueden visitar el Laboratorio de Aprendizaje Inteligente Seguro y Asegurado (SAIL).

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.