Entrevistas
Vahid Behzadan, Diretor do Laboratório de Aprendizado Inteligente Seguro e Garantido (SAIL) – Série de Entrevistas

Vahid é Professor Assistente de Ciência da Computação e Ciência de Dados na Universidade de New Haven. Ele também é diretor do Laboratório de Aprendizado Inteligente Seguro e Garantido (SAIL)
Suas áreas de interesse incluem segurança e segurança de sistemas inteligentes, modelagem psicológica de problemas de segurança de IA, segurança de sistemas complexos adaptativos, teoria dos jogos, sistemas multiagentes e cibersegurança.
Você tem uma ampla experiência em cibersegurança e manter a IA segura. Pode compartilhar sua jornada e como você se interessou por essas áreas?
Minha trajetória de pesquisa foi impulsionada por dois interesses principais: descobrir como as coisas quebram e aprender sobre os mecanismos da mente humana. Eu estive ativamente envolvido em cibersegurança desde meus anos de adolescente e, consequentemente, construí minha agenda de pesquisa inicial em torno dos problemas clássicos desse domínio. Alguns anos após meu estudo de pós-graduação, eu tive a oportunidade de mudar minha área de pesquisa. Na época, eu havia acabado de descobrir os trabalhos iniciais de Szegedy e Goodfellow sobre ataques de exemplos adversários e encontrei a ideia de atacar o aprendizado de máquina muito intrigante. À medida que eu olhei mais profundamente para esse problema, eu aprendi sobre o campo mais amplo de segurança e segurança de IA e descobri que ele abrange muitos dos meus interesses principais, como cibersegurança, ciências cognitivas, economia e filosofia. Eu também acredito que a pesquisa nessa área não é apenas fascinante, mas também vital para garantir os benefícios e segurança de longo prazo da revolução de IA.
Você é o diretor do Laboratório de Aprendizado Inteligente Seguro e Garantido (SAIL), que trabalha para estabelecer fundamentos concretos para a segurança e segurança de máquinas inteligentes. Pode entrar em detalhes sobre o trabalho realizado pelo SAIL?
No SAIL, meus alunos e eu trabalhamos em problemas que se encontram na interseção de segurança, IA e sistemas complexos. O foco principal de nossa pesquisa é investigar a segurança e segurança de sistemas inteligentes, tanto do ponto de vista teórico quanto prático. Do lado teórico, estamos atualmente investigando o problema de alinhamento de valor em configurações multiagentes e desenvolvendo ferramentas matemáticas para avaliar e otimizar os objetivos de agentes de IA em relação à estabilidade e alinhamento robusto. Do lado prático, alguns de nossos projetos exploram as vulnerabilidades de segurança das tecnologias de IA de ponta, como veículos autônomos e negociação algorítmica, e visam desenvolver técnicas para avaliar e melhorar a resiliência dessas tecnologias a ataques adversários.
Também trabalhamos nas aplicações do aprendizado de máquina em cibersegurança, como testes de penetração automatizados, detecção precoce de tentativas de intrusão e coleta e análise de inteligência de ameaças automatizada a partir de fontes de dados abertas, como mídias sociais.
Você recentemente liderou um esforço para propor a modelagem de problemas de segurança de IA como distúrbios psicopatológicos. Pode explicar o que é isso?
Este projeto aborda a complexidade crescente de agentes e sistemas de IA: já é muito difícil diagnosticar, prever e controlar comportamentos inseguros de agentes de aprendizado por reforço em configurações não triviais apenas olhando para suas configurações de baixo nível. Neste trabalho, enfatizamos a necessidade de abstrações de alto nível para investigar esses problemas. Inspirados pelas abordagens científicas para problemas comportamentais em humanos, propomos a psicopatologia como uma abstração de alto nível útil para modelar e analisar comportamentos emergentes deletérios em IA e AGI. Como um conceito de prova, estudamos o problema de segurança de IA de hacking de recompensa em um agente de aprendizado por reforço que aprende a jogar o jogo clássico de Snake. Mostramos que, se adicionarmos uma “semente de droga” ao ambiente, o agente aprende um comportamento subótimo que pode ser descrito por meio de modelos neurocientíficos de dependência. Este trabalho também propõe metodologias de controle baseadas nas abordagens de tratamento usadas na psiquiatria. Por exemplo, propomos o uso de sinais de recompensa artificialmente gerados como análogos de terapia medicamentosa para modificar o comportamento deletério de agentes.
Você tem alguma preocupação com a segurança de IA quando se trata de veículos autônomos?
Veículos autônomos estão se tornando exemplos proeminentes de implantação de IA em sistemas ciberfísicos. Considerando a suscetibilidade fundamental das tecnologias de aprendizado de máquina atuais a erros e ataques adversários, estou profundamente preocupado com a segurança e segurança de veículos autônomos, mesmo que sejam semi-autônomos. Além disso, o campo de condução autônoma sofre de uma falta séria de padrões de segurança e protocolos de avaliação. No entanto, eu permaneço otimista. Assim como a inteligência natural, a IA também estará sujeita a cometer erros. No entanto, o objetivo de carros autônomos ainda pode ser satisfeito se as taxas e o impacto desses erros forem menores do que os dos motoristas humanos. Estamos testemunhando esforços crescentes para abordar essas questões na indústria e na academia, bem como nos governos.
Hacking de placas de trânsito com adesivos ou usando outros meios pode confundir o módulo de visão computacional de um veículo autônomo. Qual é a magnitude desse problema?
Esses adesivos e exemplos adversários em geral dão origem a desafios fundamentais na robustez de modelos de aprendizado de máquina. Para citar George E. P. Box, “todos os modelos estão errados, mas alguns são úteis”. Exemplos adversários exploram essa “erroneidade” dos modelos, que é devido à sua natureza abstrata, bem como às limitações dos dados amostrados nos quais são treinados. Esforços recentes no domínio de aprendizado de máquina adversário resultaram em grandes avanços para aumentar a resiliência de modelos de aprendizado profundo a esses ataques. Do ponto de vista de segurança, sempre haverá uma maneira de enganar os modelos de aprendizado de máquina. No entanto, o objetivo prático de garantir a segurança dos modelos de aprendizado de máquina é aumentar o custo de implementar esses ataques ao ponto de inviabilidade econômica.
Sua área de foco está na segurança e segurança de aprendizado profundo e aprendizado por reforço. Por que isso é tão importante?
Aprendizado por reforço (RL) é o método proeminente para aplicar aprendizado de máquina a problemas de controle, que, por definição, envolvem a manipulação do ambiente. Portanto, acredito que sistemas baseados em RL têm riscos significativamente maiores de causar danos graves no mundo real em comparação com outros métodos de aprendizado de máquina, como classificação. Esse problema é ainda mais agravado pela integração de aprendizado profundo em RL, que permite a adoção de RL em configurações complexas. Além disso, é minha opinião de que o framework de RL está intimamente relacionado aos mecanismos subjacentes da cognição na inteligência humana, e estudar sua segurança e vulnerabilidades pode levar a melhores insights sobre os limites da tomada de decisões em nossas mentes.
Você acredita que estamos próximos de alcançar a Inteligência Artificial Geral (AGI)?
Essa é uma pergunta notoriamente difícil de responder. Acredito que atualmente temos os blocos de construção de algumas arquiteturas que podem facilitar a emergência de AGI. No entanto, pode levar alguns anos ou décadas para melhorar essas arquiteturas e aumentar a eficiência de custo de treinamento e manutenção dessas arquiteturas. Nos próximos anos, nossos agentes irão crescer mais inteligentes a uma taxa rapidamente crescente. Eu não acho que a emergência de AGI será anunciada na forma de um [cientificamente válido] título, mas como resultado de progresso gradual. Além disso, eu acho que ainda não temos uma metodologia amplamente aceita para testar e detectar a existência de uma AGI, e isso pode atrasar nossa percepção das primeiras instâncias de AGI.
Como podemos manter a segurança em um sistema de AGI que é capaz de pensar por si mesmo e provavelmente será exponencialmente mais inteligente do que os humanos?
Acredito que a teoria unificada de comportamento inteligente é a economia e o estudo de como os agentes agem e interagem para alcançar o que desejam. As decisões e ações dos humanos são determinadas por seus objetivos, informações e recursos disponíveis. Sociedades e esforços colaborativos emergem de seus benefícios para os membros individuais desses grupos. Outro exemplo é o código penal, que desencoraja certas decisões atribuindo um alto custo a ações que possam prejudicar a sociedade. Da mesma forma, acredito que controlar os incentivos e recursos pode permitir a emergência de um estado de equilíbrio entre humanos e instâncias de AGI. Atualmente, a comunidade de segurança de IA investiga essa tese sob a égide de problemas de alinhamento de valor.
Uma das áreas que você segue de perto é o contra-terrorismo. Você tem preocupações com terroristas tomando controle de sistemas de IA ou AGI?
Há muitas preocupações sobre o mau uso de tecnologias de IA. No caso de operações terroristas, a principal preocupação é a facilidade com que os terroristas podem desenvolver e realizar ataques autônomos. Um número crescente de meus colegas está ativamente alertando contra os riscos de desenvolver armas autônomas (veja https://autonomousweapons.org/ ). Um dos principais problemas com armas habilitadas por IA é a dificuldade de controlar a tecnologia subjacente: a IA está na vanguarda da pesquisa de código aberto, e qualquer pessoa com acesso à internet e hardware de consumo pode desenvolver sistemas de IA prejudiciais. Eu suspeito que a emergência de armas autônomas é inevitável e acredito que logo haverá uma necessidade de novas soluções tecnológicas para contrariar essas armas. Isso pode resultar em um ciclo de gato e rato que impulsiona a evolução de armas habilitadas por IA, o que pode dar origem a riscos existenciais graves a longo prazo.
O que podemos fazer para manter os sistemas de IA seguros contra esses agentes adversários?
O primeiro e mais importante passo é a educação: todos os engenheiros e praticantes de IA precisam aprender sobre as vulnerabilidades das tecnologias de IA e considerar os riscos relevantes no design e implementação de seus sistemas. Quanto a recomendações mais técnicas, há várias propostas e conceitos de solução que podem ser empregados. Por exemplo, treinar agentes de aprendizado de máquina em configurações adversárias pode melhorar sua resiliência e robustez contra ataques de evasão e manipulação de política (por exemplo, veja meu artigo intitulado “Whatever Does Not Kill Deep Reinforcement Learning, Makes it Stronger“). Outra solução é considerar diretamente o risco de ataques adversários na arquitetura do agente (por exemplo, abordagens bayesianas para modelagem de risco). No entanto, há uma grande lacuna nessa área, e é a necessidade de métricas e metodologias universais para avaliar a robustez de agentes de IA contra ataques adversários. As soluções atuais são principalmente ad hoc e falham em fornecer medidas gerais de resiliência contra todos os tipos de ataques.
Há algo mais que você gostaria de compartilhar sobre algum desses tópicos?
Em 2014, Scully et al. publicaram um artigo na conferência NeurIPS com um tópico muito esclarecedor: “Aprendizado de Máquina: O Cartão de Crédito de Alto Juro da Dívida Técnica“. Mesmo com todos os avanços do campo nos últimos anos, essa afirmação ainda não perdeu sua validade. O estado atual da IA e do aprendizado de máquina não é nada short of impressionante, mas ainda não preenchemos um número significativo de lacunas importantes tanto na fundação quanto na engenharia da IA. Esse fato, em minha opinião, é a principal lição de nossa conversa. Eu, é claro, não quero desencorajar a adoção comercial de tecnologias de IA, mas apenas permitir que a comunidade de engenharia considere os riscos e limites das tecnologias de IA atuais em suas decisões.
Eu realmente gostei de aprender sobre os desafios de segurança e segurança de diferentes tipos de sistemas de IA. Isso é algo que indivíduos, corporações e governos precisam se tornar conscientes. Os leitores que desejam aprender mais devem visitar o Laboratório de Aprendizado Inteligente Seguro e Garantido (SAIL).












