인터뷰
보 리, Virtue AI의 CEO – 인터뷰 시리즈

보 리, Virtue AI의 CEO는 인공 지능 시스템의 안전성과 보안에 전문적인 연구자이자 기업가입니다. 그는 Virtue AI를 이끌면서 일리노이 주 어바나-샴페인 대학교의 교수로도 활동하며, 기계 학습 보안, 신뢰할 수 있는 AI, 적대적 강건성에 대한 연구에 집중합니다. 그의 경력은 학계와 산업계를 모두 아우르며, 이는 고급 인공 지능 연구를 실제 응용 프로그램으로 번역하여 조직이 더 안전하고 강건한 인공 지능 기술을 구축하는 데 도움이 됩니다.
Virtue AI는 기업 환경에서 사용되는 인공 지능 시스템을 보호하고 관리하는 회사입니다. 그들의 플랫폼은 자동화된 적대적 테스팅, 실시간 가드레일, 지속적인 모니터링 등의 기능을 제공하여 프롬프트 주입, 환각, 데이터 누출과 같은 취약점을 식별합니다. 인공 지능 개발과 배포 워크플로에 직접 통합함으로써, 회사는 대규모 언어 모델과 인공 지능 기반 애플리케이션의 사용을 확대하면서 강력한 보안과 관리 표준을 유지하는 데 도움을 줍니다.
학계에서 Virtue AI의 창립과 리더십으로 전환한 데에는 어떤 동기가 있었으며, 산업계에서 해결하지 못한 문제는 무엇이라고 생각하시나요?
전통적인 보안 도구는 예측 가능한 애플리케이션과 고정 경로를 위해 설계되었습니다.它们는 독립적으로 이성과 적응하는 시스템을 위해 설계되지 않았습니다. 나와 공동 창립자는 기초적인 인공 지능 보안 연구와 기업이 실제로 사용할 수 있는 도구 사이에 간격을 보았습니다. 연구는 존재했지만, 현실적인 적용은 없었습니다. 그것을 변경하기 위해 우리가 시작했습니다.
Virtue AI는 대규모 언어 모델과 자율 에이전트에 대한 안전성, 보안, 및 규정 준수를 중점적으로 다룹니다. 현재 기업이 가장 과소평가하는 분야는 무엇이라고 생각하시나요?
기업은 이러한 모든 영역을 어느 정도 이해하고 있지만, 여전히 큰 간격이 존재합니다.
기업은 모델 보안을 어느 정도 серьез하게 생각하기 시작했습니다. 그러나 에이전트는 다른 문제입니다. 에이전트는 기업 인프라의 가장 민감한 부분에 접근할 수 있습니다. 코드를 실행하고, API를 호출하고, 웹을 탐색하고, 데이터, 재무, 운영에 영향을 미치는 연쇄적인 결정들을 내립니다. 대부분의 보안 팀은 이러한 시스템을 理解하기 위해 설계되지 않았습니다. 그들이 사용하는 도구는 이를 위해 설계되지 않았습니다.
위험은 이론적이지 않습니다. 에이전트 시스템을 위한 보안이 특별히 설계되지 않으면, 작은 실패가 빠르게 누적될 수 있습니다. 예상치 못한 도구 호출, 모호한 지시, 가드레일을 통과한 프롬프트와 같은 것들은 모두 권한 없는 동작이나 데이터 노출로 이어질 수 있습니다.
연속적인 적대적 테스팅은 Virtue AI의 접근 방식의 핵심입니다. 시스템이 라이브로 생산에 들어간 후에 어떤 종류의 실패 또는 위험이 나타나는 경향이 있나요?
대부분의 심각한 것들.
제어된 환경에서, 모델과 에이전트를 테스트합니다. 생산 환경에서는 시스템을 테스트합니다. 그리고 그것은 다른 것입니다. 모델이 도구, 데이터 파이프라인, 사용자 입력, 다른 에이전트와 연결되면, 행동 공간은 예측하지 못한 방식으로 확장합니다. “안전하게 구성된” 에이전트는 실제 데이터베이스, 새로운 MCP 서버, 또는 다른 에이전트와 연결되었을 때 매우 다르게 행동할 수 있습니다. 시스템은 비결정론적이 됩니다. 그것은 평가 중에 존재하지 않았던 контек스트에 따라 결정합니다.
그것이 실제로 중요한 실패를 발견할 때입니다.
실제에서 “인공 지능 안전성”을 측정하는 방법에 대해 어떻게 생각하시나요, 특히 시스템이 미세 조정, 검색, 도구 사용을 통해 진화할 때?
실제에서, 인공 지능 안전성은 단일 정적 벤치마크를 통해 측정될 수 없습니다. 현대적인 인공 지능 시스템은 지속적으로 미세 조정, 검색 보강, 도구 또는 에이전트 상호작용을 통해 진화합니다. 대신, 안전성은 인공 지능 애플리케이션의 전체 수명 주기에서 시스템 수준 속성으로 평가되어야 합니다. 이것은 다이버스한 적대적 테스팅 공격으로 모델과 에이전트를 스트레스 테스트하는 것을 포함하며, 프롬프트, 도구 호출, 동작과 같은 실제 시간 행동을 모니터링하고, 정의된 위험 정책에 대한 결과를 평가합니다.
예를 들어, 우리의 수상한 논문(네이셔널 시큐리티 에이전시와 NeurIPS에서 최고 논문), DecodingTrust,는 기초 모델에 대한 포괄적인 보안 및 안전성 테스팅을 제공했습니다. 우리의 DecodingTrust-에이전트 플랫폼은 다양한 환경에서 네이티브 적대적 테스팅 에이전트를 호스팅하는 현실적인 에이전트 시뮬레이터를 구축하여 동적, 적응적, 지속적인 적대적 테스팅 테스트를 수행했습니다.
중요한 것은, 안전성 측정은 지속적이고 적응 가능해야 합니다. 프롬프트, 검색 소스, 또는 도구의 업데이트는 새로운 취약점을 도입할 수 있기 때문입니다. 실제로, 이것은 자동화된 적대적 테스팅, 런타임 가드레일, 관측 가능성을 결합하여 모델 응답뿐만 아니라 실제 세계에서 작동하는 종단 간 인공 지능 시스템의 안전성을 측정하는 것을 의미합니다.
강건성, 개인 정보, 적대적 공격에 대한 연구 배경이 있습니다. 이 중에서 실제 세계의 방어로 번역하기 가장 어려웠던 영역은 무엇이라고 생각하시나요?
강건성, 개인 정보, 적대적 공격에 대한 연구를 실제 세계의 방어로 번역하는 것은 실제로 매우 가능합니다. 사실, 우리 연구 그룹의 많은 연구 방향은 실제로 배포된 인공 지능 시스템에서 관찰된 실제 보안 문제에 의해 직접적으로 영감을 받았습니다. 실제로 어려운 것은 방어를 구축하는 것이 아니라, 동적 실제 환경에서 신뢰할 수 있는 보안 보장을 제공하는 것입니다.
학술 연구에서, 우리 그룹은 강건성과 개인 정보 보장과 같은 분야에서 강력한 진전을 이루었습니다. 그러나 이러한 결과는 일반적으로 가정에 의존하며, 복잡한 생산 시스템에서 완전히 성립하지 않을 수 있습니다. 현대적인 인공 지능 애플리케이션은 새로운 데이터, 미세 조정, 검색 파이프라인, 도구 통합을 통해 지속적으로 진화합니다. 이것은 시간이 지남에 따라 새로운 취약점을 도입할 수 있습니다.
因此, 효과적인 인공 지능 보안은 한 번의 보호에 의존할 수 없습니다. 그것은 지속적인 적대적 테스팅, 위험 발견, 적응 가드레일이 시스템과 함께 진화하는 것을 필요로 합니다. 이것이 Virtue AI의 철학입니다. 우리의 오랜 인공 지능 보안 연구와 자동화된 대규모 적대적 테스팅, 실시간 보호를 결합하여 지속적으로 새로운 위험을 식별하고 방어를 업데이트하여 실제 세계의 인공 지능 시스템을 위한 실제적이고 확장 가능한 보안을 가능하게 합니다.
자율적인 인공 지능 에이전트를 보안하는 것은 전통적인 소프트웨어 또는 채트봇을 보안하는 것과 근본적으로 어떻게 다르나요?
에이전트는 정적인 프로그램이 아닙니다. 그들은 예측 가능한 경로를 따르지 않으며, 배포 시에 그들이 그린 경계를 벗어나지 않습니다.
전통적인 보안은 고정된 실행 경로, 안정적인 API, 결정론적 행동을 가정합니다. 자율적인 에이전트는 이러한 모든 가정에 위배합니다. 그들은 다음에 무엇을 할지에 대해 이성적으로 생각하고, 컨텍스트에 기반하여 도구를 선택하며, 단일 실행에서 여러 시스템에 영향을 미치는 효과를 생성합니다.
프롬프트를 스캔하거나, 모델을 강화하거나, 단일 API 호출을 모니터링하고, 작업이 완료된 것으로 생각할 수 없습니다. 에이전트를 완전한 시스템으로 보안해야 합니다. 그들의 이성, 도구 사용, 환경, 그리고 다운스트림에서 발생하는 모든 것을 포함하여 보안해야 합니다.
그것이 핵심 문제입니다. 포인트 컨트롤은 이를 위해 설계되지 않았습니다.
에이전트가 여러 시스템, 도구, 데이터 소스에 걸쳐 동시에 작동할 때, 기존의 보안 도구는 어디에서 부족한가요?
그들은 에이전트가 실제로 어떻게 작동했는지에 대해 눈이 먼 채로 남겨집니다.
대부분의 도구는 명확한 경계와 안정적인 행동을 가진 애플리케이션을 위해 설계되었습니다. 그들은 단일 API 호출이 어떻게 보였는지에 대해 말할 수 있습니다. 그러나 에이전트가 다섯 개의 도구 호출을 통해 의도하지 않은 결과를 만들어내는 방식에 대해 말할 수 없습니다.
가시성 격차가 문제입니다. 에이전트의 전체 동작과 결정 체인을 볼 수 없으면, 그것을 관리할 수 없으며,事後에 감사할 수 없습니다.
실시간 가드레일은 모니터링이나 로깅만으로는 어떻게 위험을 줄입니까?
로깅은 손상이 발생한 후에 무엇이 잘못되었는지에 대해 말해줍니다. 그것은 포렌식과 규정 준수에 유용하지만, 아무 것도 막지 못합니다.
자율적인 에이전트의 경우, 동작과 탐지 사이의 지연은 실제로 비용이 될 수 있습니다. 이미 잘못된 API 호출을 실행하거나 데이터를 유출한 에이전트는 로깅 파이프라인이 따라잡을 때까지 기다리지 않습니다.
실시간 가드레일은 동작을 실행하기 전에 그것을 가로챕니다. 에이전트가 정책을 위반하는 것을 시도하면, 실행되기 전에 차단되거나 플래그가 설정됩니다. 실행된 후가 아닙니다.
조합이 중요합니다. 실시간 예방과 모든 에이전트-도구 상호작용에 걸쳐 일관된 집행 지점은 개별 구성 요소의 수동 모니터링과는 다른 위험 프로파일입니다.
Virtue AI는 깊이 기술적인 연구자들에 의해 설립되었습니다. 이것은 제품 결정에 어떻게 영향을 미치나요? 더 상업적으로 주도되는 인공 지능 스타트업과 비교하여?
인공 지능 보안과 거버넌스는 본질적으로 깊은 기술적인 문제입니다. 우리가 보호하는 시스템들, 즉 대규모 언어 모델, 멀티모달 모델, 에이전트 시스템들은 자신들이 고급 연구에 기반하고 있습니다. 강력한 인공 지능 전문 지식 없이, 효과적인 보안 솔루션을 설계하는 것은 거의 불가능합니다.
많은 경우에, 인공 지능 보안의 가장 큰 도전은 고급 적대적 테스팅 알고리즘이 연구 논문에서 인공 지능 에이전트의 취약점을 식별했을 때, 그것을 생산급 방어로 어떻게 번역할 수 있는지입니다. Virtue AI에서, 연구와 배포 사이의 격차를 메우는 것이 핵심입니다.
연구자들이 수십 년 동안 인공 지능 강건성, 적대적 학습, 신뢰할 수 있는 인공 지능에 대해 일해왔기 때문에, 우리의 연구와 엔지니어링 팀은 동일한 문제에 대해 동시에 일합니다. 우리의 연구자들은 새로운 모델 아키텍처, 새로운 에이전트 워크플로우, 진화하는 공격 기술을 지속적으로 연구합니다. 엔지니어링 팀은 이러한 통찰력을 직접 생산 시스템에 통합합니다.
새로운 취약점을 발견할 때마다, 즉시 새로운 탐지 모델, 가드레일, 적대적 테스팅 전략으로 번역될 수 있습니다. 이것은 매사마다 발생합니다. 단지 제품 로드맵에서 발생하는 것이 아닙니다.
결과적으로, 우리의 제품은 최신 기술이고 기업이 준비되어 있습니다. 이것은 조직이 인공 지능 시스템을 안전하게 구축하고 배포하는 데 도움이 됩니다. 많은 고객이 이 연구 주도 접근 방식이 실제로 더 빠르게 이동할 수 있게 해주면서 안전성과 규정 준수를 유지할 수 있다고 말합니다.
반면에, 순수하게 상업적으로 주도되는 팀은 오늘날 고객이 요청하는 것에 최적화하는 경향이 있습니다. 이것은 인공 지능 시스템의 빠르게 진화하는 위협 풍경을 따라가지 못할 수 있습니다. 인공 지능 보안에서, 위협은 기술 자체만큼 빠르게 진화합니다. 연구를 먼저 하는 기초는 새로운 위험을 더 일찍 예측하고, 방어를 구축하기 전에 광범위한 문제가 되기 전에 허용합니다.
기업이 Virtue AI에 처음 접근했을 때 가장 흔하게 가지고 있는 인공 지능 보안에 대한 오해는 무엇이라고 생각하시나요?
기업이 Virtue AI에 처음 접근했을 때 가장 흔하게 가지고 있는 오해는 인공 지능 보안이 단순히 전통적인 보안 도구나 기본적인 콘텐츠 필터링 필터를 적용함으로써 해결될 수 있다는 것입니다.
실제로, 인공 지능 시스템은 완전히 새로운 위협 표면을 도입합니다. 프롬프트 주입, 탈옥, 환각으로 인한 오남용, 검색 시스템을 통해 데이터 누출, 도구 또는 외부 API를 통해 에이전트 조작과 같은 것들이 있습니다. 이러한 위험은 모델 자체의 행동과 이성에서 비롯됩니다. 인프라를 둘러싼 것입니다.
따라서 인공 지능 시스템을 보호하려면, 모델과 에이전트의 입력, 출력, 결정 프로세스를 이해하는 보안 메커니즘이 필요합니다. 이것은 인공 지능 애플리케이션의 전체 수명 주기에서 필요합니다. 이것이 우리가 강조하는 인공 지능 네이티브 보안입니다. 자동화된 적대적 테스팅을 통해 취약점을 발견하고, 실시간 가드레일을 통해 정책을 시행하며, 시스템 수준에서 관측 가능성을 통해 프롬프트, 도구 호출, 에이전트 동작을 모니터링하는 것입니다.
한번 기업이 인공 지능 위험을 전통적인 소프트웨어 위험과 다르게 본다면, 인공 지능을 위한 근본적으로 새로운 보안 스택이 필요하다는 것을 빠르게 깨닫습니다.
마지막으로, 실제로 제품을 출하하는 기업에서 “책임 있는 인공 지능 배포”는 실제로 무엇을 의미합니까? 理論적으로가 아니라, 실제로?
더 빠르고 더 안전한 것은 반대되는 것이 아닙니다. 대부분의 기업은 심각한 보안이 느리게 만든다고 생각합니다. 더 많은 검토 주기, 더 많은 게이트, 제품을 출하하기 전에 더 많은 마찰이 필요하다고 생각합니다.
실제로, 에이전트를 자신감 있게 배포하는 기업은 보안을 프로세스에 빌드인하는 것입니다. 배포 전에 자동화된 적대적 테스팅, 에이전트가 라이브일 때 실시간 컨트롤, 전체 에이전트 수명 주기에서 중앙 집중식 가시성입니다.
그것은 규정 준수 연습이 아닙니다. 실제로 빠르게 이동할 수 있게 해줍니다. 왜냐하면 생산에서 무엇을 놓쳤는지 발견하지 않기 때문입니다.
책임 있는 배포는 구체적으로, 에이전트가 무엇을 할 수 있는지 알고, 무엇을 하고 있는지 볼 수 있으며, 무엇이 잘못되어도 그것을 멈출 수 있다는 것을 의미합니다.
책임 있는 인공 지능 개발은 대규모 인공 지능 시스템 배포를 지속적으로 확신과 함께 가능하게 합니다. 인공 지능 혁신을 느리게 하는 것이 아닙니다.
인터뷰 감사합니다. 더 많은 것을 배우고 싶은 독자는 Virtue AI를 방문하시기 바랍니다.












