사상 리더
AI 에이전트는 작업을 수행할 수 있습니다. 하지만 기업이 이를 운영할 수 있을까요?

AI 에이전트는 작업을 완료하는 데 놀라울 정도로 능숙해지고 있습니다. 에이전트에 목표와 적절한 도구에 대한 접근, 충분한 컨텍스트, 그리고 명확히 정의된 워크플로우를 제공하면, 정보 조사, 문서 분석, 의사 결정, 시스템 업데이트, 그리고 다른 에이전트와의 조정을 수행할 수 있습니다.
그것이 에이전트형 AI의 흥미로운 부분입니다. 또한 우리가 데모에서 자주 보는 부분이기도 합니다.
기업 운영은 다르게 보입니다. 대출 신청이 인수 과정 중간에 변경됩니다. 고객이 검증이 완료된 후 새로운 정보를 제공합니다. 두 시스템이 동일한 계정에 대해 의견이 일치하지 않습니다. 어제 유효했던 승인이 오늘은 더 이상 유효하지 않을 수 있습니다. 에이전트가 사례를 요약한 뒤 다른 에이전트에게 전달하는 과정에서 사소해 보이는 세부 사항이 사라집니다.
원활한 흐름은 에이전트가 수행해야 할 작업의 80%를 차지할 수 있습니다. 기업은 나머지 20% 속에서 운영됩니다.
80/20 구도는 업계 통계가 아니라 운영 복잡성이 숨겨지는 위치를 설명하는 방식입니다. 기업 운영에서 어려운 부분은 종종 정상적인 경우가 아니라 예외, 인계, 의존성, 변화하는 컨텍스트, 그리고 조직이 결과에 대해 책임을 지는 의사 결정입니다.
AI가 질문에 답하는 단계에서 행동을 취하는 단계로 전환함에 따라 이 운영 복잡성은 훨씬 더 중요해집니다. 기업은 에이전트가 어떻게 구축되는지를 넘어, 어떻게 운영되는지를 고민해야 합니다.
바로 여기서 Agentic Operations가 시작됩니다.
답변 생성에서 행동 수행으로
기업용 생성 AI의 첫 물결은 주로 정보에 관한 것이었습니다. 모델은 문서를 요약하고, 보고서를 생성하며, 질문에 답하고, 기업 지식을 검색하고, 직원들이 기존 작업을 더 빠르게 완료하도록 도왔습니다.
에이전트는 근본적으로 다른 무언가를 도입합니다. 에이전트는 비즈니스 프로세스의 상태를 변화시키는 행동을 취할 수 있습니다. 에이전트는 무언가를 승인하거나 거부하고, 기록 시스템을 업데이트하고, 고객에게 커뮤니케이션을 보내며, 다른 워크플로를 트리거하고, 다른 에이전트를 호출하거나, 다음에 일어날 일을 결정하는 의사 결정을 내릴 수 있습니다.
OpenAI는 실용 가이드에서 에이전트를 설명합니다 이는 사용자를 대신해 독립적으로 작업을 수행하는 시스템으로, 모델을 사용해 워크플로 실행을 관리하고 도구를 사용해 외부 시스템과 상호 작용합니다. 잘못된 답변의 운영상의 결과는 잘못된 행동의 결과와 매우 다릅니다.
따라서 기업의 질문은 변합니다. 모델이 좋은 답변을 생성했는지, 에이전트가 할당된 작업을 성공적으로 완료했는지만을 묻는 것으로는 충분하지 않습니다. 기업은 비즈니스 컨텍스트, 정책, 권한 및 프로세스 초기에 발생한 모든 상황을 고려하여 행동이 전혀 일어나야 했는지 여부를 점점 더 알아야 합니다.
그림 1: 생성 AI는 출력을 생성합니다. 에이전트형 AI는 비즈니스 상태를 변화시킵니다.

AI가 비즈니스 상태를 변경하고 이후 결정에 영향을 미칠 수 있게 되면, 신뢰성을 모델 수준에서만 측정할 수 없게 됩니다.
에이전트는 비즈니스 프로세스가 실패해도 성공할 수 있다
AI 기반 대출 인수 워크플로를 고려해 보십시오. 한 에이전트가 신청 서류를 추출하고, 다른 에이전트가 소득을 검증하며, 또 다른 에이전트가 신용 정보를 평가하고, 이후 에이전트가 인수 에이전트가 결정하거나 권고를 내리기 전에 사례를 요약합니다.
각 에이전트는 명확히 정의된 책임을 가지고 있으며, 그 책임을 올바르게 수행할 수 있습니다. 문서 에이전트는 올바른 정보를 추출할 수 있습니다. 소득 검증 에이전트는 작업을 성공적으로 완료할 수 있습니다. 요약 에이전트는 사용 가능한 정보를 정확히 요약할 수 있습니다. 인수 에이전트는 지침을 정확히 따를 수 있습니다.
최종 비즈니스 결정은 여전히 잘못.
초기 검증 이후에 업데이트된 소득 정보가 도착한다고 상상해 보십시오. 새로운 문서는 처리되지만, 다음 단계에 대한 사례 요약 시 그 중요성이 감소합니다. 최종 인수 에이전트는 합리적인 요약을 받지만, 전체 프로세스에 걸쳐 존재했던 완전한 비즈니스 컨텍스트는 받지 못합니다.
아무것도 반드시 충돌한 것은 아닙니다. API가 실패한 것도 아닙니다. 개별 에이전트가 반드시 환각한 것도 아닙니다. 모든 구성 요소가 성공적인 실행을 보고할 수 있지만, 비즈니스 프로세스는 잘못된 결과에 도달할 수 있습니다.
Anthropic은 효과적인 에이전트를 구축하기 위한 가이드에서 관련된 도전을 논의합니다, 자율 시스템이 단계가 늘어날수록 복합 오류에 직면할 수 있음을 지적합니다. 문제는 모델 정확도를 넘어 상태, 컨텍스트, 의사 결정 및 가정이 워크플로 전반에 걸쳐 이동하기 때문에 더 넓어집니다.
이는 중요한 구분을 만듭니다 에이전트 신뢰성과 비즈니스 프로세스 신뢰성. 기업은 궁극적으로 개별 에이전트를 경험하지 않습니다. 전체 프로세스가 만들어낸 결과를 경험합니다.
그림 2: 지역적인 성공이 비즈니스 성공을 보장하지 않는다

이는 Agentic AI가 도입한 중요한 변화 중 하나이다. 워크플로는 모든 구성 요소가 개별적으로 검토했을 때 정상으로 보이더라도 실패할 수 있다.
능력은 권한이 아니다
현재 에이전트 스택의 대부분은 당연히 능력에 초점을 맞추고 있다. 팀은 에이전트가 추론하고, 올바른 도구를 선택하며, 작업을 완수하고, 오류에서 복구하며, 허용 가능한 정확도와 지연 시간으로 운영할 수 있는지를 알고 싶어한다.
기업에는 또 다른 요구 사항이 있다: 권한.
예를 들어, 인수 심사 에이전트가 대출을 승인할 수 있다고 가정해 보자. 이것이 그 에이전트가 평가할 수 있는 모든 대출을 승인해야 한다는 의미는 아니다. 그 권한은 대출 금액, 위험 등급, 고객 유형, 가용 증거, 신뢰 수준, 이전 결정, 혹은 이전 검토 후 신청서가 변경되었는지 여부 등에 따라 달라질 수 있다.
이는 에이전트가 할 수 있는 것과 에이전트가 허가된 것 사이에 경계를 만든다.
OpenAI는 에이전트 도구와 관련된 위험을 평가하고 민감하고 되돌릴 수 없는 행동에 대해 보호 장치나 인간 개입을 추가할 것을 권고한다. Microsoft는 에이전트가 운영하는 핵심 비즈니스 프로세스에 대한 가이드라인에서 유사한 접근 방식을 취한다, 이 경우 에이전트는 정의된 경계 내에서 일상적인 결정을 내릴 수 있으며, 의사결정 권한에 따라 어떤 행동은 독립적으로 수행될 수 있고 어떤 행동은 인간 승인이 필요하다.
에이전트 능력이 향상됨에 따라 이 구분은 더욱 중요해진다, 덜 중요해지는 것이 아니다. 보다 능력 있는 에이전트는 더 중대한 행동을 취할 수 있다. 따라서 기업은 이러한 행동이 허용되는 경계를 정의하고 강제할 보다 명확한 방법이 필요하다.
질문은 에이전트가 이것을 할 수 있습니까?에서 어떤 조건에서 에이전트가 이것을 허가받아 수행해야 하는가?
비즈니스 정책은 실행에 더 가깝게 이동해야 한다
기업은 이미 인간이 수행하는 프로세스를 제어하기 위한 광범위한 메커니즘을 보유하고 있다. 이들은 SOP, 승인 매트릭스, 컴플라이언스 정책, 위험 임계값, 교육, 직무 분리, 감사 및 에스컬레이션 절차를 사용한다. 이러한 메커니즘 대부분은 단순한 가정에 기반하여 설계되었다: 사람이 규칙을 읽고 상황을 이해한 뒤 작업을 수행하면서 규칙을 적용한다.
에이전트는 그 가정을 바꾼다.
특정 임계값을 초과하는 거래에 대해 2차 승인을 요구하는 정책을 고려해 보자. 인간이 작업을 수행할 때는 정책이 교육 및 워크플로 제어와 함께 문서 형태로 존재할 수 있다. 에이전트가 수백 또는 수천 건의 행동을 신속하게 실행할 수 있을 때, 그 정책 문서가 존재한다는 사실만으로 위반 행동을 방지하지는 않는다.
작성된 정책과 비즈니스 행동 사이 어딘가에서 정책이 실행 가능하도록 전환되어야 한다.
이는 모든 정책이 결정론적 코드가 되어야 한다는 의미는 아니다. 일부 제어는 결정론적일 것이고, 일부는 의미 해석이 필요하며, 일부는 위험이나 신뢰도에 따라 달라지고, 다른 일부는 계속해서 인간의 판단을 요구할 것이다. 더 큰 아키텍처 변화는 비즈니스 정책이 실행 경로에 더 가깝게 이동하기 시작한다는 점이다.
AWS는 금융 서비스 분야에서 Agentic AI와 관련하여 이 점을 구체적으로 강조한다, 여기에는 에이전트 행동에 대한 정책 기반 검증 및 중대한 활동에 대한 감사 추적이 필요함이 포함된다.
전통적으로 조직은 실행 전에 많은 거버넌스 요구 사항을 정의하고, 이후 감사와 검토를 통해 준수를 확인할 수 있었다. 자율 시스템이 지속적으로 기계 속도로 작동할 때는 일부 제어가 프로세스가 진행되는 동안 작동해야 한다.
루프 내 인간 참여는 필요하지만, 그것이 운영 모델은 아니다
AI 워크플로에서 불확실성에 대한 가장 일반적인 대응은 인간을 루프에 포함시키는 것이다. 이는 특히 중대한 결정에 대해 타당하지만, 인간 검토를 모든 예외에 대한 해답으로 간주하면 문제가 발생한다.
에이전트 기반 운영이 수천 또는 수백만 건의 결정을 처리한다고 상상해 보라. 모든 특이 상황, 낮은 신뢰도 결과, 정책 모호성 또는 예외가 사람에게 전달된다면, 조직은 운영 병목 현상을 제거한 것이 아니다. 단지 병목을 검토 대기열로 옮긴 것뿐이다. 시간이 지나면 또 다른 문제가 발생할 수 있다: 인간에게 너무 많은 일상적인 결정을 승인하도록 요구하면, 인간 감독 자체가 의미를 잃을 수 있다.
인간은 여전히 필수적이지만, 그 역할은 변화해야 한다. 모든 결정을 검토하는 대신, 실제 판단이 필요한 상황, 에이전트의 권한에 도달한 경우, 혹은 시스템이 독립적으로 해결해서는 안 되는 상황에 집중해야 한다.
따라서 확장 가능한 운영 모델은 위험 점수와 인간 검토만으로는 의존할 수 없습니다. 에이전트 행동이 비즈니스 행동이 되기 전에, 시스템은 현재 비즈니스 상황, 관련 정책, 에이전트의 권한, 그리고 워크플로우에서 이미 발생한 일을 고려해야 합니다. 결과는 계속 진행하거나, 추가 증거를 요청하거나, 행동을 보류하거나, 결정을 인간에게 에스컬레이션하는 것이 될 수 있습니다.
그림 3: 인간 검토는 런타임 제어의 한 결과가 된다

이는 인간 감독의 역할을 변화시킵니다. 인간은 이제 기본적으로 모든 불확실한 단계에 삽입되지 않습니다. 비즈니스 상황, 정책, 권한 또는 행동의 결과가 판단을 필요로 할 때 인간 개입은 가능한 결과 중 하나가 됩니다.
이 구분은 기업 규모에서 중요합니다. 일부 행동은 정책과 권한 내에 명확히 포함되므로 자동으로 진행되어야 합니다. 일부는 필요한 증거가 없거나 비즈니스 상태가 변경되어 일시 중지되어야 합니다. 다른 경우는 조직이 의도적으로 사람에게 맡겨두었던 경계선을 넘었기 때문에 에스컬레이션되어야 합니다.
목표는 인간을 루프에서 제거하는 것이 아니라, 인간을 올바른 루프, 일상적인 결정이 명확히 정의된 경계 내에서 진행되도록 허용하면서. 에이전트 시스템이 확장됨에 따라 인간 감독의 품질은 사람들이 검토하는 결정 수보다는 운영 시스템이 인간 판단이 실제로 중요한 결정을 식별할 수 있는지에 더 의존하게 될 수 있습니다.
관측 가능성은 필요하지만, 보는 것이 제어를 의미하지는 않는다
업계는 AI 관측 가능성에서 상당한 진전을 이루었습니다. 팀은 프롬프트, 모델 응답, 트레이스, 도구 호출, 지연 시간, 토큰 사용량, 그리고 점점 더 에이전트가 결과를 생성하기 전에 따라간 전체 경로를 검사할 수 있습니다.
이 가시성은 필수적입니다. OpenAI의 에이전트 안전 및 평가에 대한 가이드라인 또한 에이전트 행동을 이해하기 위해 평가 및 트레이스 등급과 같은 기술을 강조합니다.
하지만 가시성만으로는 운영 문제를 해결하지 못합니다.
지난 주에 인수 심사 에이전트가 승인 정책을 2,700번 위반한 것을 발견했다고 상상해 보세요. 이는 뛰어난 관측 가능성와 형편없는 운영을 동시에 나타냅니다.
중요한 비즈니스 프로세스의 경우, 기업은 에이전트 행동을 이해하는 것뿐만 아니라 프로세스가 진행되는 동안 대응할 수 있는 능력이 필요합니다.
그림 4: 운영 제어 루프

관측 가능성은 답합니다 에이전트가 수행한 작업. Agentic Operations도 답해야 합니다 에이전트가 계속 진행해야 하는지.
그 구분은 행동이 비용이 많이 들거나, 중대한 결과를 초래하거나, 되돌리기 어렵거나, 다수의 하위 결정에 영향을 미칠 수 있을 때 특히 중요해집니다.
가장 심각한 실패는 에이전트 간에 발생할 수 있다
기업이 다중 에이전트 및 장기 워크플로우로 이동함에 따라 드러나는 또 다른 과제가 있습니다. 많은 비즈니스 정책은 단일 행동에 국한되지 않습니다.
일련의 결정에 걸쳐 총 금융 노출을 제한하는 정책을 고려해 보세요. 개별 거래는 허용 한도 이하일 수 있지만 누적 노출은 이를 초과할 수 있습니다. 각 행동을 독립적으로 보면 위반이 나타나지 않을 것입니다.
권한에서도 동일한 문제가 발생할 수 있습니다. 에이전트는 정보를 수집하도록 권한이 부여될 수 있지만 최종 결정을 내릴 권한은 없을 수 있습니다. 여러 번의 전달 후, 하위 에이전트가 원래 작업에 부여된 권한 제한을 유지하지 않은 채 정보를 받을 수 있습니다. 개별 단계는 합리적으로 보일 수 있지만 전체 순서는 의도된 비즈니스 프로세스를 위반하게 됩니다.
컨텍스트도 유사한 문제를 야기합니다. 워크플로우 첫 단계에서 중요했던 정보가 몇 단계 뒤에 요약되거나 변형되거나 누락될 수 있습니다. 하위 에이전트는 더 이상 가지고 있지 않은 정보에 대해 추론할 수 없으며, 그 추론이 그 외에는 올바르다 하더라도 마찬가지입니다.
이러한 실패는 신뢰성 단위가 확대되어야 함을 시사합니다.
우리는 모델의 응답이 정확한지 여부를 물어보며 평가를 계속할 것입니다. 에이전트가 작업을 올바르게 완료했는지 여부를 물어보며 평가할 것입니다. 그러나 워크플로우 수준에서는 정보, 권한 및 정책이 일련의 행동을 통해 유지되었는지가 질문이 됩니다. 비즈니스 수준에서는 최종 결과가 정확하면서도 허용되었는지가 질문이 됩니다.
이는 또한 더 넓은 수명 주기 관점과 일치합니다 NIST AI 위험 관리 프레임워크, 이는 배포 전 일회성 평가로 간주하는 대신 AI 위험에 대한 지속적인 측정 및 관리를 강조합니다.
여기서 에이전트 운영이 시작됩니다
AI 거버넌스, 모델 평가, LLMOps, 가시성, 보안 및 책임 있는 AI는 이미 AI 시스템 운영의 중요한 부분을 다루고 있습니다. Agentic Operations는 이러한 분야를 대체하지 않습니다. 이는 자율 및 반자율 시스템이 비즈니스 프로세스에 직접 참여하기 시작할 때 중요해지는 운영 레이어를 다룹니다.
Agentic Operations는 실제 비즈니스 프로세스 내에서 자율 및 반자율 AI 시스템을 운영하는 학문으로, 권한, 컨텍스트, 의사결정, 예외, 인간 개입 및 실행 중 책임 관리 방식을 포함합니다.
이 구분이 중요한 이유는 관리 대상이 더 이상 단순히 모델이 아니기 때문입니다. 이는 소프트웨어가 독립적으로 의사결정을 내리고 행동을 취할 수 있는 지속적인 비즈니스 프로세스입니다.
실제로 이는 다른 종류의 운영 질문을 만들게 됩니다. 에이전트가 허가된 행동은 무엇인가? 장기 워크플로우 전반에 걸쳐 유지되어야 할 비즈니스 컨텍스트는 무엇인가? 새로운 증거가 이전 결정을 무효화하면 어떻게 되는가? 조직이 개별적으로 허용된 행동이 집합적으로 정책을 위반하는지를 어떻게 감지할 수 있는가? 에이전트가 계속 진행, 일시 중지, 중단 또는 에스컬레이션 해야 하는 시점은 언제인가? 몇 달 후에 조직이 특정 결정이 내려진 이유를 재구성할 수 있는가?
소유권에 관한 질문도 있습니다. 에이전트가 기술적인 작업을 올바르게 수행했지만 비즈니스 결과가 잘못되었다면, 실패에 대한 책임은 누구에게 있나요? 실행을 에이전트에 위임한다고 해서 이를 운영하는 조직의 책임이 위임되는 것은 아닙니다.
에이전트가 작업을 수행할 수는 있지만, 결과에 대한 책임은 기업에 남아 있습니다.
목표는 통제된 자율성
Agentic AI의 미래는 때때로 완전한 자율성으로의 진행으로 묘사되며, 인간이 비즈니스 워크플로우에서 점차 사라지는 모습을 그립니다. 대부분의 기업에게 이는 아마도 잘못된 목표일 것입니다.
The more useful goal is controlled autonomy.
오늘날 많은 AI 지원 프로세스는 에이전트가 행동을 제안하고 사람이 최종 결정을 내리는 패턴을 따릅니다. 신뢰도가 높아짐에 따라 일부 워크플로우는 정의된 권한 내에서 에이전트가 결정을 내리도록 허용하고, 주변 시스템이 실행을 감독하며 인간이 예외를 처리합니다. 성숙하고 위험도가 낮은 워크플로우는 결국 에이전트가 독립적으로 결정하고 행동하도록 허용하면서도, 중요한 결정은 계속 모니터링 및 기록됩니다.
Fig 5 : Increasing level of autonomy

적절한 경계는 프로세스마다 다릅니다. 은행은 문서 분류에서는 상당한 자율성을 허용하면서도 신용 결정에 대해서는 엄격한 통제를 요구할 수 있습니다. 보험사는 일상적인 청구는 자동화하되, 특이한 증거 조합은 에스컬레이션할 수 있습니다. 의료 기관은 에이전트가 정보를 수집하고 요약하도록 허용하되, 중요한 결정은 사람에게 남겨둘 수 있습니다.
따라서 중요한 질문은 에이전트가 얼마나 자율적으로 될 수 있는가가 아니라, 조직이 얼마나 책임 있게 자율성을 운영할 수 있는가입니다.
이는 또한 통제의 역할을 변화시킵니다. 통제는 반드시 자율성을 감소시키는 메커니즘이 아닙니다. 잘 설계된 통제는 조직이 더 큰 자신감으로 자율성을 확대할 수 있게 합니다.
에이전트를 운영하는 것이 구축하는 것보다 더 어려워질 수 있음
모델은 계속 개선될 것입니다. 도구 사용도 개선될 것이고, 에이전트 프레임워크도 향상될 것입니다. 추론 능력도 향상되며, 오늘날 어려워 보이는 많은 문제들이 결국 일상적인 과제로 전환될 것입니다.
하지만 더 나은 모델이 비즈니스 정책, 변화하는 컨텍스트, 예외, 조직 경계 또는 책임을 없애지는 못합니다. 오히려 더 나은 에이전트일수록 이러한 문제는 더욱 중요해집니다. 자율적으로 행동할 수 없는 시스템은 운영 권한이 제한됩니다. 수천 건의 비즈니스 결정을 실행할 수 있는 시스템은 완전히 다른 책임을 수반합니다.
이 때문에 기업 AI의 다음 단계는 가장 많은 에이전트를 배치한 조직에 의해 결정되지 않을 수 있습니다. 오히려 에이전트를 어떻게 운영하는지를 배우는 조직에 의해 결정될 것입니다.
첫 80%는 에이전트가 작동할 수 있음을 보여줍니다. 남은 20%는 기업이 비즈니스에 신뢰를 줄 수 있는지를 결정합니다.
에이전트가 더욱 능력 있게 되면서, 기업이 직면하는 핵심 질문은 우리 에이전트가 무엇을 할 수 있는가에서 더 어려운 질문으로 바뀔 수 있습니다:
우리는 어떤 조건 하에 무엇을 허용할 준비가 되어 있는가, 그리고 그 조건이 변할 때 이를 어떻게 알 수 있는가?
그것이 Agentic Operations가 시작되는 지점입니다.












