사상 리더
아키텍처 테스트: 실제 에이전트 AI와 리배지드 자동화 구별하는 방법

요즘 마케팅 기술 업체의 홈페이지를 열면 첫 화면 어딘가에서 거의 어김없이 “powered by AI”, 즉 “AI 기반”이라는 표현을 볼 수 있습니다. 너무 보편적인 주장이 돼 이제는 별 의미가 없어졌습니다. Gartner는 이런 관행을 “에이전트 워싱”이라고 부르기 시작했습니다. 기반 시스템을 의미 있게 바꾸지 않은 채 기존 규칙 기반 자동화를 자율 에이전트로 포장해 기업의 관심에 편승하는 것입니다.
이 구분은 이론적인 논쟁에 그치지 않습니다. 기업 구매자는 이름표를 근거로 실제 예산을 결정하라는 요구를 받지만 이름표만으로는 아키텍처의 역량을 신뢰하기 어렵습니다. 에이전트와 규칙 엔진을 실제로 구분하는 요소와 그 차이가 비용·위험·장기적 유연성에 중요한 이유를 이해하는 것은 2026년 AI 활용 소프트웨어를 평가하는 사람의 기본 소양이 되고 있습니다.
자동화와 에이전트 시스템의 경계
전통적인 자동화 시스템은 사용자 화면이 아무리 정교해도 한 가지 핵심 메커니즘에 기반합니다. “이 입력에 대해 미리 작성한 어떤 규칙을 실행할까?”라고 묻는 규칙 엔진입니다. 잠재 고객의 점수가 기준을 넘으면 이메일을 보냅니다. 잠재 고객이 특정 행동 세 가지를 완료하면 정해진 순서를 실행합니다. 모든 규칙은 해당 상황을 미리 예상한 엔지니어가 작성했습니다. 사람이 만든 규칙의 한계에 도달하면 어떻게 해야 할까요? 이 아키텍처는 알려진 상황을 완벽하게 처리하도록 확장할 수 있지만 알려지지 않은 상황을 처리할 수는 없습니다. 새 규칙이나 사람의 개입 없이는 전에 보지 못한 상황에 안정적으로 적응할 수 없습니다. 엔지니어가 시스템으로 돌아가 새 규칙을 써야 합니다. 이 끝없는 작업을 언제까지나 따라갈 수는 없습니다.
에이전트 시스템의 중심 질문은 전혀 다릅니다. “내 목표, 현재 맥락, 사용할 수 있는 행동을 고려하면 다음에 무엇을 해야 할까?” 이는 현대 AI의 에이전트 이론에서 널리 쓰이는 지능형 에이전트 정의 중 하나를 반영합니다. 구매자에게 더 중요한 것은 마케팅 표현이 아니라 기반 작동 방식의 변화라는 점입니다. 에이전트는 목표를 유지하고, 도구와 정보를 바탕으로 추론하며, 자신의 행동이 낳을 결과를 예상·평가하고, 계획이 실패하면 방향을 바꿉니다. 예상하지 못한 일이 생길 때마다 사람이 논리를 다시 쓰지 않아도 이를 반복합니다. 실제 운영 플랫폼 대부분은 자율 계획만 쓰기보다 결정론적 작업 조율, 정책 집행, 목표 지향 추론을 결합합니다. 규칙은 사람이 미리 내린 결정을 자동 실행합니다.
지금 이 질문이 중요한 이유
구매자에게 이 질문이 시급해진 이유는 기업의 도입 속도만 봐도 알 수 있습니다. Gartner는 기업 애플리케이션의 40%가 2026년 말까지 작업별 AI 에이전트를 통합할 것으로 예상합니다. 불과 1년 전에는 5% 미만이었습니다. IDC는 내장 에이전트 사용이 2027년까지 열 배로 증가하고 같은 기간 추론 수요는 천 배로 증가할 것으로 예측합니다. 추론 수요는 조직 업무에 에이전트가 얼마나 깊이 통합됐는지를 나타내는 지표입니다.
이 성장 곡선과 수요 일정은 구매자가 주의하지 않으면 에이전트 워싱이 늘어날 이유를 설명합니다. 실제 역량을 갖춘 솔루션의 공급보다 수요가 많아지면 기존 제품에 새 이름표를 붙인 상품이 즉시 시장에 넘쳐납니다. 구매자는 이미 구축 방법을 아는 시스템에 부풀려진 가격을 지불하게 됩니다.
기업의 과장된 기대와 실제 가치 사이의 격차
더 중요한 것은 과장된 기대와 실제 배포된 역량 사이의 격차가 얼마나 커질 수 있는가입니다. 널리 인용되는 MIT NANDA 이니셔티브의 2025년 7월 연구는 생성형 AI 시범 사업의 95%가 측정 가능한 손익 효과를 내지 못했다고 보고했습니다. 조직들이 AI 시스템에 총 300억~400억 달러를 투자했음에도 그랬습니다. 흥미로운 것은 연구자들이 실패 원인으로 모델 품질보다 통합을 압도적으로 많이 지목했다는 점입니다. 기업마다 자체 호스팅이 현실적으로 어려운 대형 모델을 시험하지만, 모델이 이해하도록 설계된 업무 흐름에 맞춰 통합하는 곳은 매우 적습니다. 그 결과 조직의 맥락을 학습하고 시간이 지나며 개선할 수 없습니다.
Gartner도 에이전트 프로젝트에 비슷한 전망을 제시했습니다. 2027년까지 실패율이 40%를 넘을 수 있다는 것입니다. 확대 전에 거버넌스와 투자수익률을 맞추지 않는 조직이 해당합니다. 생성형 AI, 특히 에이전트가 시장에 나오는 것은 좋은 일입니다. 하지만 오늘 이용 가능한 기술을 도입하는 것과 조직 안에 신중하고 올바르게 배치하는 것은 다릅니다.
에이전트 전문화가 기술·아키텍처 선택인 이유
지속 가능한 에이전트 구현과 에이전트 워싱을 가르는 선택이 있습니다. 모든 일을 처리하는 단일 시스템을 만들 것인지, 업무 흐름의 좁은 영역을 각각 담당하는 전문 에이전트 집단, 이른바 “에이전트 팀”을 만들 것인지입니다.
따라서 많은 기업 아키텍처는 계획 담당 에이전트가 범위가 좁게 정해진 실행 에이전트들에게 일을 위임하는 구조를 사용합니다.
전문 모델은 더 좁고 관련성이 높은 데이터로 학습한다는 점에서 범용 모델과 다릅니다. 호흡기 전문의와 가정의학과 의사의 차이와 비슷합니다. 범용 모델도 글을 쓰고 계획을 세울 수 있습니다. 그러나 모든 브랜드의 구체적인 색상 팔레트, 매체별 이미지 비율 요건, 어제 해당 독자의 피드에서 유행한 주제까지 학습한 것은 아닙니다.
그렇다고 도메인 적응과 미세조정이 완벽한 해결책은 아닙니다. 도메인에 맞춰 미세조정한 언어 모델 연구는 새 전문 정보를 학습한 모델이 그 내용에 관해 항상 안정적으로 추론하지는 못하며 학습 중 기억한 패턴 밖에서는 여전히 환각을 일으킬 수 있다고 지적합니다. 아키텍처 관점의 교훈은 한 번 미세조정한 뒤 믿으면 된다는 것이 아닙니다. 아무리 좁게 전문화해도 모든 전문 에이전트 주변에 검색으로 근거를 확보하는 기능, 제한된 예측 범위, 사람의 승인 절차 같은 도구를 구축해야 한다는 것입니다.
한 단계 더: 에이전트 데이터는 어디로 흐르는가?
전문화는 공개 인터넷으로 질의하는 대형 모델보다 통제된 환경에서 호스팅하는 전문 모델을 선택할 또 다른 근거와도 연결됩니다. 데이터 노출 문제입니다. 사설 기업 환경에 배포한 경우를 제외하면 외부 호스팅 모델에 보낸 프롬프트는 조직이 직접 관리하는 인프라 경계를 벗어납니다. 고객 데이터를 학습에 쓰지 않겠다는 업체 약속은 흔하지만 이는 아키텍처가 아닌 정책에 관한 설명이며 정책은 바뀔 수 있습니다.
막연히 겁을 주려는 이야기가 아닙니다. 반도체 소스 코드를 공개 챗봇에 입력한 것이 2023년 삼성 엔지니어들이 내부 도구의 독점 알고리즘과 코드를 실수로 노출한 경로였습니다. 더 최근 조사도 이런 행동이 여전히 흔함을 시사합니다. 연구자들은 직원의 약 4.7%가 기밀정보를 공개 LLM에 붙여넣었으며 직원이 제출한 전체 콘텐츠의 약 11%가 기밀로 분류된다고 추정합니다. 모든 직원이 최후의 방어선인 구조에서는 어떤 내부 정책으로도 그 간극을 완전히 막을 수 없습니다.
규제도 이 현실을 따라오고 있습니다. 고위험 AI 시스템을 운영하는 미국 기업이 주목할 준수 일정이 있습니다. 최근인 2026년 8월 2일 EU AI법 의 남은 의무 대부분이 시행됐습니다. 이 법은 2025년 2월부터 단계적으로 적용됐으며 이번 날짜는 다음 주요 적용 단계입니다. 다만 중요한 예외가 있습니다. 제6조 제1항의 고위험 분류 규칙은 2027년 8월부터 적용되므로 다른 고위험 관련 조항과 별도의 후속 일정을 따릅니다.
AI 시스템이 어떤 데이터를 어디서 처리하는지 문서화하지 못하는 기업은 이제 이론적인 수준을 넘어 직접적인 규정 준수 위험에 직면합니다. 사설 환경에서 호스팅하는 전문 모델도 거버넌스 업무를 없애지는 않습니다. 그러나 내부 데이터가 기본적으로 제3자에게 계속 흐르는 가장 큰 노출 경로는 제거합니다.
더 직설적으로 말하면, 업체에 데이터가 어디로 가는지 물으십시오. 머뭇거리거나 “클라우드에 머문다”고만 말한다면 다른 업체에 물어보기 시작하십시오. 진지하게 하는 말입니다.
거버넌스는 마지막 검토가 아니라 아키텍처에 포함돼야 한다
마지막으로 다룰 오해는 거버넌스가 마무리 단계에서 이뤄진다는 생각입니다. 너무 많은 조직이 AI 출력을 환각이 있는 LLM 응답처럼 다룹니다. 규모가 커져 비용을 감당하기 어려워질 때까지 사람의 검토가 반드시 필요하다고 보는 것입니다. 마지막 순간이라도 잘못된 출력을 막는 편이 낫지만, 에이전트 업체들이 거버넌스 체계를 강조하는 이유가 있습니다. 이를 추론 계층의 핵심에 넣기 때문입니다. 거버넌스 자체도 관찰 가능해야 하며 정책 평가, 승인 사건, 제약 위반을 운영 신호로 드러내야 합니다.
잘 설계한 에이전트 시스템에는 대개 예측에 대한 명확한 한계 같은 제약이 있습니다. 관측 도구는 이를 바탕으로 모든 출력을 생성에 사용된 데이터까지 추적할 수 있습니다. 정확도도 내부 순위표에만 의존하지 않고 실제 환경의 독립적인 제3자 기준으로 평가합니다. 사용자에게 도달한 실수를 고치는 것은 좋은 거버넌스입니다. 여러 유형의 실수를 자동으로 예방하는 것은 더 낫습니다. 이를 염두에 두고 구매자는 다음을 물어야 합니다.
-
- 목표와 규칙. 명시적으로 처리하도록 설계하지 않은 입력을 만나면 시스템은 무엇을 합니까? 규칙 엔진은 대체 규칙을 가리킬 것입니다. 에이전트는 목표를 다시 평가하고 가능한 행동을 저울질하는 과정을 설명할 것입니다.
- 모델 호스팅과 전문화. 기반 모델은 해당 분야에 특화돼 있으며 어디에서 실행됩니까? 역량과 데이터 개인정보 보호에 관한 질문에 동시에 답합니다.
- 기억과 맥락. 시스템은 상호작용 사이에 조직 맥락을 유지합니까, 아니면 매 세션을 새것으로 취급합니까? 거버넌스 경계 안에서 유지되는 지속적 기억은 예외 상황마다 엔지니어가 규칙을 다시 쓰지 않아도 에이전트가 개선되게 합니다.
- 환각 처리. 전문 모델이 덜 틀리기를 바라기만 하는 대신, 잘못된 결과가 실제 업무 과정에 들어가기 전에 어떻게 탐지하고 제한합니까?
- 감사 가능성. 모든 결과를 그 바탕이 된 추론과 데이터까지 추적할 수 있습니까? 성능을 독립적인 제3자가 평가했습니까?
- 관측 가능성. 에이전트 시스템을 실제 운영에 배치하면 관측 가능성은 추론만큼 중요해집니다. 결정, 기억, 도구 사용, 정책 집행을 볼 수 없다면 기업은 기존 소프트웨어에 기대하는 수준의 신뢰로 AI를 운영할 수 없습니다.
기업의 비용 구조에서도 중요한 이유
업체 종속을 이야기할 때 가격 논의는 기능과 이름표를 비교하는 과정에서 자주 빠집니다. 그러나 경제적 논리도 같은 방향을 가리킵니다. 대형 제공업체는 토큰 기반 API를 제공하므로 크게 증가하는 구독 가격을 청구할 수 있습니다. 새 모델 세대마다, 만족할 결과를 얻기 위한 반복마다, 자동화가 수행해야 할 복잡한 다단계 마케팅 캠페인 작업마다 토큰을 소비합니다.
같은 구독 등급에는 사용량 상한도 있습니다. 업무 대부분에 가까운 범위에서 AI에 의존하기 시작하면 이 한도가 큰 운영 병목이 됩니다. 전문 모델을 직접 구축·호스팅하면 가변적인 사용 비용과 예측하기 어려운 생성 비용을 기본 인프라 비용에 가까운 것으로 바꿀 수 있습니다. 규모가 커지면 앞선 기술적 선택만큼이나 영향이 누적되는 경제적 선택입니다.
마무리: 이름표는 핵심이 아니었다
지금 이야기하는 모델 세대의 과열된 관심이 식을 때까지 “AI 기반”이라는 표현은 모든 업체 홈페이지를 뒤덮을 것입니다. 그러나 중요한 것은 수식어가 아니라 아키텍처입니다. 추론은 어디서 일어납니까? 데이터는 어디로 갑니까? 시스템은 실제로 얼마나 전문화돼 있습니까? 거버넌스를 설계 때부터 고려했습니까, 아니면 나중에 덧붙였습니까? 이런 핵심 요소가 진정한 새 경쟁 우위를 얻는지, 아주 비싼 겉치레를 사는지를 결정합니다.












