사상 리더
AI 감시에는 세 가지盲點이 있으며 대부분의 회사들은 이 중 어느 것도 감시하지 않는다

대부분의 회사의 AI 안전 대화는 잘못된 목표를 향하고 있다. 팀들은 어떤 모델을 사용할지에 대해 몇 주 동안 논의한 후, 모델을 이메일, 결제, 고객 데이터베이스 및 코드에 연결하지만, 더 단순한 질문을 묻지 않는다: 이 것이 어떤 행동을 할 때, 누가 감시하고, 누가 그것을 멈출 수 있는가?
숫자는 이것이 곧 비싼 일이 될 것이라는 것을 말한다. Gartner에 따르면 2028년까지 최소 15%의 일상적인 업무 결정은 AI에 의해 자동으로 이루어질 것이라고 한다. 이는 2024년보다 크게 증가한 것이다. 같은 연구에서 2027년 말까지 40% 이상의 AI 프로젝트가 취소될 것이라고 경고한다. 취소 사유 중 하나는 약한 위험 통제이다. 이것을 다시 읽어보라. 모델이 나쁘기 때문에 프로젝트가 취소되는 것이 아니다. 모델을 관리하는 방법을 만들지 않아서 취소되는 것이다.
나는 생계를 위해 AI 관리 시스템을 구축한다. 그래서 나는 같은 간격을 계속해서 본다. 세 가지 간격이 있다. 대부분의 회사는 이 중 아무 것도 제대로 감시하지 않는다. 그리고 많은 회사는 아무 것도 감시하지 않는다.
에이전트는 큰소리치는 것
모두가 자율 에이전트에 대해 걱정한다. 그리고 그들은 옳다. 하지만 대부분의 사람들은 잘못된 부분에 대해 걱정한다. 에이전트의 불안정한 점은 그것이 추론한다는 것이 아니다. 그것이 행동한다는 것이다. 그것은 환불을 제안하지 않는다. 그것은 환불을 지불한다. 그것은 이메일을草案하지 않는다. 그것은 이메일을 보낸다. 모델에 일련의 도구를 주면 실제 시스템에 영향을 미치고 변경할 수 있는 능력을 준 것이다.
이를 잘못하면 실패는 서투른 문장이 아니다. 그것은 돈을 내보내는 것이다. 또는 데이터베이스에서 조용히 삭제된 테이블이다. 그리고 더 날카로운 경계가 있다. 프롬프트 주입은 LLM 애플리케이션의 OWASP 위험 목록의 최상단에 있다. 그리고 이유가 있다: 모델에 잘못된 텍스트를 제공하면 모델이 요청되지 않은 행동을 할 수 있다. 모델이 말할 수만 있다면 그것은 번거로운 일이다. 하지만 모델이 도구를 호출할 수 있다면 그것은 공격자에게 API 키를 제공하는 것이다.
표준적인答案은 에이전트가 하는 모든 것을 로그에 기록하고 추적하는 것이다. 좋다. 하지만 추적은 이미 발생한 일에 대한 설명이다. 그것은 돈을 빼간 후에 CCTV 영상을 보는 것이다. 그것은 도둑질을 막을 수 있는 것이 아니다.
누구도 언급하지 않는 조용한 것
두 번째 盲點은 슬라이드에 나오지 않는다. 그것은 평범한 API 호출이다. 에이전트가 아니고, 프레임워크가 아니고, 단지 서비스의 일부에서 프롬프트를 조립하여 모델에 전송하는 코드 조각이다.
대부분의 프로덕션에서 사용되는 AI는 이렇게 보인다. 그리고 이것은 가장 관리되지 않는 부분이다. 왜냐하면 이것이 너무 평범하기 때문이다. 이것은 서비스의 세 번째 계층에 묻혀 있는 HTTP 요청이다. AI 정책에 대해 들어보지 못한 엔지니어가 작성한 것이다. 그리고 이것은 어디에 있는지 모를 것이다. 이 하나의 호출은 고객의 데이터를 第三方 모델로 보낼 수 있다. 또는 다운스트림에서 행동을触發할 수 있다. 그리고 이것이 되어도 확인하는 것이 없다. 그리고 이것이 된 것을 기록하는 독립적인 것이 없다.
사람이 복잡한 것
세 번째 盲點은 사람이다. 이것이 가장 나쁜 것이다. 직원들은 이미 몇 개월 전에 ChatGPT나 Claude에 작업을 붙여넣으면 더 빠르게 완료된다는 것을 알아냈다. 그래서 그들은 하루 종일这样한다. 보통은 회사에서 볼 수 없는 개인 계정에서这样한다. 이것은 가상적인 것이 아니다. Cyberhaven의 실제 작업장 사용량 조사에 따르면 실제로 많은 직원이 기밀 회사 데이터를 ChatGPT에 붙여넣었다. 대부분은 회사에서 볼 수 없는 계정에서这样했다.
경고할 이야기가 있다면, 그것은 삼성이다. 2023년에 삼성은 직원들이 ChatGPT에 기밀 소스 코드를 붙여넣은 후 내부에서 생성된 AI를 금지시켰다. 세 번이었다. 한 달도 안 되는 기간에. 이것들은 나쁜 배우가 아니었다. 빠르게 디버깅하려고 하는 좋은 엔지니어였다. 그것이 전체 함정이다:泄露는 생산성과 동일하게 보인다. 그리고 당신의 旧 데이터 손실 도구는 이를 잡을 수 없다. 왜냐하면 이것은 파일이 건물 밖으로 나가는 것이 아니라 브라우저 탭으로 복사한 것이기 때문이다.
실제로 작동하는 것
세 가지를 일렬로 세우면 해결책은 에이전트에만 관련된 것이 아니라 모든 AI가 하는 것을 그것이 하는 전에 관리하는 것이 된다. 몇 가지 중요한 것들이 있다. 대부분은 어렵게 배운 것이다.
행동의 앞에 앉아라, 뒤에 앉지 마라. 이것이 전체 게임이다. 그리고 이것이 내가 관찰 가능성과 관리가 같은 단어가 아니라고 계속 주장하는 이유이다. 어제 에이전트가 4만 파운드를 이동시켰다는 것을告诉하는 대시보드는 손실 보고서이다. 하지만 사람이 확인하기 전에 그 전송을 잡을 수 있는 것은 제어이다. 만약 ваш 설정이 일어난 것을告诉할 수만 있다면, 당신은 관리를 하고 있지 않다. 당신은indsight을 가지고 있다.
한 개의 체크포인트를 사용하라, 도구마다 하나씩 사용하지 마라. 에이전트, API 호출, 직원이 챗봇에 붙여넣는 것은 세 가지 별개의 문제로 느껴진다. 그래서 회사들은 세 가지 별개의 도구를 구입하고 세 가지 간격이 있는 세트를 끝내게 된다. 나쁜 것들이 그 간격에 산다. AI가 하는 모든 것은どこ에서 오는지에 관계없이 같은 게이트를 통과해야 한다.
AI가 다시 쓸 수 없는 로그를 유지하라. 행동을 하는 시스템이 또한唯一의 기록 시스템이라면, 당신은 기록을 가지고 있지 않다. 당신은 그것이 편집할 수 있는 일기를 가지고 있다. 이것이 규칙이 향하는 방향이다. EU AI법의 기록 유지 요구 사항, 제12조는 높은 위험 시스템이 무엇을 했는지 시스템 외의 누군가가 재구성할 수 있도록 존재한다. 실제로는 로그를 시스템 밖에서 유지해야 한다. 그리고事後에 조용히 변경할 수 없다.
큰, 돌이킬 수 없는 호출에 사람을 넣어라. 모든 것에 대해서는 아니지만, 그렇게 하면 사람들을 승인으로 물들게 할 것이다. 하지만 돌이킬 수 없는 호출, 돈을 이동시키는 것, 데이터를 내보내는 것, 기록을 삭제하는 것은 기다렸다가 사람에게 승인을 받아야 한다. EU AI법은 이미 높은 위험 시스템에 대해 인간의 감독을 필수로 규정하고 있다, 제14조. 하지만 기억해야 할 점은 감독이 실제로 효과가 있는 것은 사람에게 시간과 컨텍스트가足够해서 실제로 “아니오”라고 말할 수 있을 때이다. 읽지 않는 승인은ただ의 연극이다.
정직한 감정 점검
이 세 가지 중 어느 것도 코너 케이스가 아니다. 이것이 대부분의 회사가 현재 AI를 사용하는 普通的な 방법이다. 조용하게, 그리고 거의 нет이다. 다음 몇 년 동안 추한 사건 없이 통과하는 팀들은 가장 아름다운 차트를 가진 팀들이 아니다. 그것은 일찍 결정한 팀이다. 모든 AI가 하는 것을, 에이전트, API 호출, 붙여넣은 문단, 모두 하나의 게이트를 통해 전에 지나가도록 하는 것이다. 아니라면之后에 지나가도록 하는 것이다.
당신의 설정을 테스트하고 싶다면, 두 가지 질문에 정직하게 답하라. 세 가지 표면 중에서 실제로 볼 수 있는 것은 몇 개인가? 그리고 볼 수 있는 것 중에서 멈출 수 있는 것은 몇 개인가? 많은 회사에서 두 번째 질문에 대한 정직한答案은 0이다. 그것이 먼저 고쳐야 할 숫자이다.












