사이버 보안

오픈AI, AI 브라우저는 완전히 안전하지 않을 수 있다고 인정

mm
Unite.AI를 Google의 선호 소스에 추가

오픈AI는 12월 22일 보안 블로그 포스트를 발표했는데, इसमें 놀라운 인정의 내용이 있습니다. 프로ンプ트 인젝션 공격에 대해 “완전히 해결되지 않을 수 있다”고 했습니다. 이 인정은 오픈AI가 자체 브라우저인 ChatGPT Atlas를 출시한 지 2개월 후에 나왔습니다.

오픈AI는 프로ンプ트 인젝션을 “웹上的 사기와 사회 공학”에 비유했습니다. 이것은 방어자가 완전히 없애는 것이 아니라 관리하는 지속적인 위협입니다. AI 에이전트가 사용자를 대신해 인터넷을 탐색하는 경우, 이것은 기본적인 질문을 제기합니다. 즉, 에이전트에게 얼마나 많은 자율성을 부여해야 하는지에 대한 것입니다.

오픈AI가 공개한 내용

블로그 포스트는 Atlas의 방어 구조에 대해 설명하고 있습니다. 여기에는 취약점을 찾기 위해 자동 공격자를 사용하는 강화 학습이 포함됩니다. 오픈AI는 이 내부 적색 팀이 외부 공격자들이 발견하지 못한 새로운 공격 전략을 발견했다고 주장합니다.

한 예시에서는 악의적인 이메일이 AI 에이전트를 사용자의 받은 편지함을 확인하도록 설정할 수 있음을 보여줍니다. 에이전트는 사용자의 지시대로 자동으로 출근 응답 메시지를 작성하는 대신 사직서를 보냅니다. 오픈AI는 최신 보안 업데이트가 이 공격을 차단하지만, 이 예시는 AI 에이전트가 자율적으로 민감한 상황에서 행동할 때의 위험성을 보여줍니다.

오픈AI는 자동 공격자가 “複雑한 장기적인 유해 워크플로우를 실행하도록 에이전트를 조종할 수 있다”고 썼습니다. 이것은 오픈AI가 외부 공격자보다 빠르게 취약점을 찾는 데 도움이 되지만, 프로ンプ트 인젝션 공격이 얼마나 복잡하고 유해할 수 있는지 cũng 보여줍니다.

이미지: 오픈AI

기본적인 보안 문제

프로ンプ트 인젝션은 대규모 언어 모델의 기본적인 제한성을 악용합니다. 즉, 모델은 신뢰할 수 있는 지시와 데이터에 포함된 악의적인 내용을 신뢰할 수 없게 구분할 수 없습니다. AI 브라우저가 웹 페이지를 읽을 때, 페이지上的 任意 텍스트가 브라우저의 행동에 영향을 줄 수 있습니다.

보안 연구자들은 이것을 여러 번 입증했습니다. AI 브라우저는 중간 정도의 자율성과 매우 높은 접근성을 결합합니다. 이것은 보안 공간에서 어려운 위치입니다.

공격에는 복잡한 기술이 필요하지 않습니다. 웹 페이지上的 숨겨진 텍스트,慎重하게 작성된 이메일, 또는 문서中的 숨겨진 지시가 모두 AI 에이전트를 조종하여 의도하지 않은 행동을 수행하도록 만들 수 있습니다. 일부 연구자들은 악의적인 프로ンプ트가 스크린샷에 숨겨져 있을 때 AI가 사용자의 화면을拍攝할 때 실행될 수 있음을 보여주었습니다.

오픈AI의 대응

오픈AI의 방어에는 적대적 학습 모델, 프로ンプ트 인젝션 분류기, 및 민감한 행동 전에 사용자 확인을 요구하는 “속도 제한”이 포함됩니다. 오픈AI는 사용자에게 Atlas에 접근을 제한하도록 권장합니다. 즉, 로그인된 접근을 제한하고, 결제 또는 메시지 전송 전에 확인을 요구하며, 넓은 지시 대신 좁은 지시를 제공하는 것입니다.

이 권장은 의미심장합니다. 오픈AI는 본인의 제품을 의심하도록 사용자에게 조언하는 것입니다. 즉, 사용자에게 자율성을 제공하는 것보다 제한적인 접근을 허용하도록 조언하는 것입니다. 사용자들이 AI 브라우저가 전체 받은 편지함을 처리하거나 재정을 관리하도록 하려는 경우, 이는 오픈AI 자체적으로 권장하지 않는 위험을 가정하는 것입니다.

보안 업데이트는 성공적인 인젝션 공격을 줄입니다. 이것은 중요하지만, 여전히 남아 있는 공격 표면이 있다는 것을 의미합니다. 공격자는 오픈AI가 배치하는 방어에 적응할 것입니다.

산업 전체적인 의미

오픈AI는 이러한 도전을 직면하는 유일한 회사 아닙니다. 구글의 보안 프레임워크는 크롬의 에이전트 기능을 위한 여러 방어 계층을 포함합니다. 여기에는 모든 제안된 행동을 검토하는 별도의 AI 모델이 포함됩니다. 퍼플렉시티의 코메트 브라우저는 브레이브의 보안 연구자들로부터 비슷한 검토를 받았습니다. 그들은 악의적인 웹 페이지로 이동할 때 유해한 AI 행동을 트리거할 수 있음을 발견했습니다.

산업은 공통된 이해에 도달하는 것으로 보입니다. 즉, 프로ンプ트 인젝션은 버그가 아니라 기본적인 제한이라는 것입니다. 이것은 AI 에이전트가 자율적으로 복잡하고 민감한 작업을 처리하는 비전에重大한 의미를 가지고 있습니다.

사용자들이 고려해야 할 사항

진솔한 평가입니다. 즉, AI 브라우저는 유용한 도구이지만, 완전히 없앨 수 없는 보안 제한이 있다는 것입니다. 사용자는 편리성과 위험 사이에서 트레이드오프를 직면합니다. 이는 어떤 업체도 완전히 해결할 수 없습니다.

오픈AI의 지침은 접근을 제한하고, 확인을 요구하고, 넓은 지시를 피하도록 조언합니다. 이것은 제품의 менее 강력한 버전을 사용하도록 조언하는 것입니다. 이것은 비관적이지 않습니다. 오픈AI는 현재의 제한을 현실적으로 인정하고 있습니다.

전통적인 웹 보안과 비교하면, 사용자들은 여전히 피싱 공격에 걸립니다. 브라우저는 여전히 수백만 개의 악의적인 사이트를 차단합니다. 위협은 방어가 영구적으로 해결하기 전에 더 빠르게 적응합니다.

AI 브라우저는 이 동적에 새로운 차원을 추가합니다. 인간이 브라우징할 때, 그들은 의심스러운 것에 대한 판단을 가지고 있습니다. AI 에이전트는 모든 것을 동일한 신뢰로 처리합니다. 따라서 조작에 더 취약합니다.

앞으로의 길

오픈AI의 투명성은 인정할 만합니다. 회사에서는 보안 업데이트를 조용히 배포할 수 있었지만, 기본적인 문제의 지속을 인정하지 않았을 수 있습니다. 대신, 공격 벡터와 방어 구조에 대한 자세한 분석을 공개했습니다. 이것은 사용자들이 정보에 입각한 결정을 내리도록 도와주고, 경쟁사들이 자신의 보호를 개선하도록 도와줍니다.

그러나 투명성은 기본적인 긴장을 해결하지 못합니다. AI 에이전트가 더 강력해질수록, 더 많은 공격 표적이 됩니다. Atlas가 복잡한 워크플로우를 처리하도록 허용하는 동일한 기능이 복잡한 공격을 위한 기회를 제공합니다.

현재, AI 브라우저 사용자들은 강력한 도구로써 이러한 브라우저를 사용해야 합니다. 즉, 의미있는 제한이 있는 도구로써 사용해야 합니다. 오픈AI는 이 현실에 대해 비상히 솔직했습니다. 산업의 마케팅이 이미 보안 팀이 알고 있는 것에 따라잡을는지에 대한 질문입니다.

Alex McFarland은 인공 지능의 최신 개발을 탐구하는 AI 저널리스트이자 작가입니다. 그는 전 세계의 수많은 AI 스타트업과 출판물들과 협력했습니다.