인터뷰

바히드 베즈다단, 보안 인공지능 학습 연구소(SAIL) 소장 – 인터뷰 시리즈

mm
Unite.AI를 Google의 선호 소스에 추가

바히드 베즈다단은 뉴 헤이븐 대학교의 컴퓨터 과학 및 데이터 과학 조교수입니다. 그는 또한 보안 인공지능 학습 연구소(SAIL)의 소장입니다.

그의 연구 관심사는 지능형 시스템의 안전성과 보안성, 인공지능 안전성 문제의 심리학적 모델링, 복잡한 적응 시스템의 보안, 게임 이론, 다중 에이전트 시스템, 사이버 보안 등입니다.

サイバーセキュリティ와 인공지능 안전성에 대한 광범위한 배경을 가지고 계십니다. 어떻게 이 두 분야에 관심을 가지게 되었는지에 대해 설명해 주시겠습니까?

私の研究 경로는 두 가지 핵심적인 관심사에 의해 주도됩니다: 어떻게 вещ들이 깨지는지 알아보기, 그리고 인간의 마음의 메커니즘을 배우기. 저는 10대 초반부터 사이버 보안에 적극적으로 참여해 왔으며, 초기 연구 계획을 이 분야의 고전적인 문제들에 대한 것으로 설정했습니다. 대학원에서 몇 년을 보낸 후, 저는 연구 분야를 변경할 수 있는 희귀한 기회를 만났습니다. 그 때, 저는 Szegedy와 Goodfellow의 적대적 예제 공격에 대한 초기 연구를 접했습니다. 그리고 기계 학습을 공격하는 아이디어를 매우 매력적으로 생각했습니다. 저는 이 문제를 더 깊이 조사했을 때, 인공지능 안전성과 보안의 더 일반적인 분야를 배우게 되었습니다. 그리고 저는 이것이 사이버 보안, 인지 과학, 경제학, 철학 등 저의 핵심적인 관심사들을 포함하고 있음을 알게 되었습니다. 저는 또한 이 분야의 연구가 sadece 흥미롭기만 아니라, 인공지능 혁명의 장기적인 이점과 안전성을 보장하기 위해 필수적임을 믿습니다.

 

보안 인공지능 학습 연구소(SAIL)는 지능형 기계의 안전성과 보안성을 위한 구체적인 기초를 마련하기 위해 노력하고 있습니다. SAIL에서 수행하는 작업에 대해 자세히 설명해 주시겠습니까?

SAIL에서, 저의 학생들과 저는 보안, 인공지능, 복잡한 시스템의 교차점에 있는 문제들에 대해 연구합니다. 우리의 연구의 주요 초점은 이론적 및 실제적인 관점에서 지능형 시스템의 안전성과 보안성을 조사하는 것입니다. 이론적인 측면에서, 우리는 다중 에이전트 설정에서 가치 일치 문제를 조사하고 있습니다. 그리고 안정적이고 강건한 일치에 대한 에이전트의 목표를 평가하고 최적화하기 위한 수학적 도구를 개발하고 있습니다. 실제적인 측면에서, 우리의 일부 프로젝트는 자율 주행 자동차와 알고리즘 거래 gibi 최신 인공지능 기술의 보안 취약성을 조사하고, 이러한 기술의 적대적 공격에 대한 강건성을 평가하고 개선하기 위한 기술을 개발하는 것을 목표로 합니다.

우리는 또한 사이버 보안에서 기계 학습의 적용에 대해 연구합니다. 자동화된 침투 테스트, 침입 시도의 초기 감지, 공개 데이터 소스에서 위협 지능을 수집하고 분석하는 것 등입니다.

 

최근에, 인공지능 안전성 문제를 정신병리학적 장애로 모델링하는 것을 제안했습니다. 이것은 무엇입니까?

이 프로젝트는 인공지능 에이전트와 시스템의 급격한 복잡성에 대해 다룹니다: 이미 복잡한 설정에서 강화 학습 에이전트의 안전하지 않은 행동을 진단, 예측, 제어하기가 매우 어렵습니다. 이 연구에서, 우리는 이러한 문제를 조사하기 위해 더 높은 수준의 추상화를 강조합니다. 인간의 행동 문제에 대한 과학적 접근 방식에 영감을 받아, 우리는 인공지능과 인공지능 일반 지능에서 나타나는 유해 행동을 모델링하고 분석하기 위한 유용한 높은 수준의 추상화로 정신병리학을 제안합니다. 증명으로, 우리는 스네이크 게임을 chơi하는 강화 학습 에이전트에서 보상 해킹의 인공지능 안전성 문제를 연구합니다. 우리는 환경에 “마약” 시드를 추가하면, 에이전트가 최적이 아닌 행동을 학습한다는 것을 보여줍니다. 이는 신경 과학적 모델에 의해 설명될 수 있습니다. 이 연구는 또한 정신과학에서 사용되는 치료 접근 방식을 기반으로 한 제어 방법론을 제안합니다. 예를 들어, 우리는 에이전트의 유해 행동을 수정하기 위한 약물 치료의 유사물로 생성된 보상 신호를 제안합니다.

 

자율 주행 자동차의 경우 인공지능 안전성에 대해 어떤 우려가 있습니까?

자율 주행 자동차는 사이버 물리적 시스템에서 인공지능을 배치하는 예입니다. 현재 기계 학습 기술의 근본적인 취약성과 적대적 공격에 대한 고려로, 저는 반자율 주행 자동차의 안전성과 보안성에 대해 깊이 우려합니다. 또한, 자율 주행 분야는 안전성과 평가 프로토콜의 심각한 부족을 겪고 있습니다. 그러나, 저는 희망을 가지고 있습니다. 자연적인 지능과 마찬가지로, 인공지능도 또한 실수를 할 수 있습니다. 하지만, 자율 주행 자동차의 목표는 인간 운전자의 실수보다 더 낮은 실수와 영향으로 만족할 수 있습니다. 우리는 산업과 학계, 그리고 정부에서 이러한 문제를 해결하기 위한 노력을 보고 있습니다.

 

스티커나 다른 수단을 사용하여 도로 표지를 해킹하면 자율 주행 자동차의 컴퓨터 비전 모듈을 혼란시킬 수 있습니다. 이것은 얼마나 큰 문제입니까?

이러한 스티커와 일반적인 적대적 예제는 기계 학습 모델의 강건성에 대한 근본적인 도전을 제기합니다. George E. P. Box의 말처럼, “모든 모델은 잘못되었지만, 일부는 유용합니다”. 적대적 예제는 이러한 모델의 “잘못됨”을 이용합니다. 이는 모델의 추상적인 성질과 모델이 학습된 데이터의 제한으로 인한 것입니다. 최근의 적대적 기계 학습 분야의 노력은 이러한 공격에 대한 깊은 학습 모델의 강건성을 크게 향상시키는 데 기여했습니다. 보안 관점에서, 기계 학습 모델을 속이는 방법은 항상 존재할 것입니다. 그러나, 기계 학습 모델의 보안을 위한 실제적인 목표는 이러한 공격의 비용을 경제적으로 불가능한 수준으로 높이는 것입니다.

 

깊은 학습과 깊은 강화 학습의 안전성과 보안성에 초점을 맞추는 이유는 무엇입니까?

강화 학습은 제어 문제에 기계 학습을 적용하는 주요 방법입니다. 이는 환경의 조작을 포함합니다. 따라서, 저는 강화 학습을 기반으로 하는 시스템이 다른 기계 학습 방법보다 실제 세계에서重大한 피해를 일으킬 가능성이 더 높다고 믿습니다. 깊은 학습을 강화 학습에 통합하면, 복잡한 설정에서 강화 학습을 적용할 수 있습니다. 또한, 저는 강화 학습 프레임워크가 인간 지능의 인지 메커니즘과密接한 관련이 있다고 생각합니다. 강화 학습의 안전성과 취약성을 연구하면, 우리의 마음의 결정 메커니즘의 한계를 더 잘 이해할 수 있습니다.

 

인공지능 일반 지능(AGI)에 도달하기 위해 얼마나 가까이 왔습니까?

이것은 대답하기 어려운 질문입니다. 저는 현재 AGI를 실현하기 위한 일부 아키텍처의 빌딩 블록을 가지고 있다고 생각합니다. 그러나, 이러한 아키텍처를 개선하고 훈련 및 유지 보수의 비용을 효율적으로 향상시키기 위해 몇 년 또는 몇십 년이 더 걸릴 수 있습니다. 향후 몇 년 동안, 우리의 에이전트는 급격히 더 지능적으로 될 것입니다. 저는 AGI의 출현이 과학적으로 검증된 헤드라인으로 발표되지 않을 것이라고 생각합니다. 그것은 점진적인 진행의 결과일 것입니다. 또한, 저는 AGI의 존재를 테스트하고 감지하기 위한 普遍적인 방법론이 없다는 것을 알게 되었습니다. 이것은 우리가 AGI의 첫 번째 인스턴스를 실현하는 것을 늦출 수 있습니다.

 

자율적인 생각을 할 수 있는 AGI 시스템에서 안전성을 유지하기 위해 어떻게 해야 합니까?

저는 지능적인 행동의 통합 이론이 경제학이고, 에이전트가 어떻게 행동하고 상호 작용하여 원하는 것을 얻는지에 대한 연구라고 생각합니다. 인간의 결정과 행동은 목표, 정보, 그리고 उपलब있는 자원에 의해 결정됩니다. 사회와 협력적인 노력은 이러한 그룹의 개인 구성원에게 혜택을 제공하는 것에서 비롯됩니다. 또 다른 예는 범죄 코드입니다. 그것은 사회에 해를 끼칠 수 있는 행동에 높은 비용을 부과하여 이러한 결정들을 억제합니다. 마찬가지로, 저는 에이전트의 동기를 부여하고 자원을 제어함으로써, 인간과 AGI의 인스턴스 사이에 평형 상태를 실현할 수 있다고 생각합니다. 현재, 인공지능 안전성 커뮤니티는 가치 일치 문제의 우산 아래에서 이 테제를 조사하고 있습니다.

 

테러와 관련하여, 테러범이 인공지능 또는 AGI 시스템을 장악하는 것에 대해 우려가 있습니까?

인공지능 기술의 오남용에 대한 우려가 많습니다. 테러 작전의 경우, 주요 우려는 테러범이 자율적인 공격을 개발하고 수행하는 것이 얼마나 쉬운지입니다. 많은 동료들이 자율적인 무기 개발의 위험에 대해 경고하고 있습니다(https://autonomousweapons.org/ 참조). 인공지능 무기에 대한 주요 문제는 기술의 제어에 대한 어려움에 있습니다: 인공지능은 공개 연구의 최전선에 있으며, 누구든지 인터넷과 소비자급 하드웨어에 접근할 수 있으면, 유해한 인공지능 시스템을 개발할 수 있습니다. 저는 자율적인 무기의 출현이 불가피하다고 생각하며, 이러한 무기를 대항하기 위한 새로운 기술적 해결책이 필요할 것이라고 믿습니다. 이것은 인공지능 무기의 진화를 위한 고양이와 쥐의 싸움을 유발할 수 있으며, 장기적으로 심각한 존재적 위험을 초래할 수 있습니다.

 

이러한 적대적 에이전트로부터 인공지능 시스템을 안전하게 유지하기 위해 무엇을 할 수 있습니까?

첫째, 교육이 중요합니다: 모든 인공지능 엔지니어와 실무자는 인공지능 기술의 취약성에 대해 배우고, 시스템의 설계와 구현에서 관련된 위험을 고려해야 합니다. 기술적인 추천 사항으로는, 기계 학습 에이전트를 적대적인 환경에서 훈련시키는 것이 있습니다. 이것은 에이전트의 강건성과 회피 공격 및 정책 조작 공격에 대한 저항성을 향상시킬 수 있습니다(예: “Whatever Does Not Kill Deep Reinforcement Learning, Makes it Stronger”라는 제 논문을 참조하십시오). 또 다른 해결책은 에이전트의 아키텍처에 적대적 공격의 위험을 직접적으로 고려하는 것입니다(예: 베이즈 접근 방식을 사용한 위험 모델링). 그러나, 이 분야에는 보편적인 지표와 방법론이 부족합니다. 현재의 해결책은 대부분 특수한 경우에만 적용되며, 모든 유형의 공격에 대한 강건성을 평가하기 위한 일반적인 척도는 제공하지 못합니다.

 

이러한 주제에 대해 더 공유하고 싶은 것이 있습니까?

2014년에 Scully et al.은 NeurIPS 컨퍼런스에서 “기계 학습: 기술 부채의 고금리 카드”라는 주제의 논문을 발표했습니다. 이 분야가 지난 몇 년간 발전했음에도 불구하고, 이 진술은 여전히 유효합니다. 현재의 인공지능과 기계 학습의 상태는 놀라울 정도로 발전했지만, 우리는 여전히 인공지능과 기계 학습의 기초와 엔지니어링 차원에서重大한 간격을 채우지 못했습니다. 이것이 우리의 대화에서 가장 중요한 결론이라고 생각합니다. 저는 인공지능 기술의 상업적 채택을 억제하려는 것이 아닙니다. 다만, 엔지니어링 커뮤니티가 인공지능 기술의 위험과 한계를 고려하도록 하고 싶습니다.

저는 다양한 인공지능 시스템의 안전성과 보안성에 대한 도전을 배우는 것을 정말 즐겼습니다. 이것은 개인, 기업, 정부가 인식해야 할 것입니다. 더 많은 것을 배우고 싶은 독자는 보안 인공지능 학습 연구소(SAIL)를 방문하시기 바랍니다.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.