사상 리더
기업 AI 파일럿이 생산에 도달하지 못하는 이유: 모델이 아니라 하네스입니다

모델은 결코 어려운 부분이 아니었다. 빌드 내부에서 생산은 모델 주변의 계층에서 승리 또는 패배한다: 검색, 그라운드, 라우팅, 평가.
모든 주요 기업 AI 설문조사는 동일한 벽을 설명한다: 조직은 모델에 접근할 수 있으며 파일럿을 실행하고 데모에서 인상적인 것을 보여줄 수 있지만 거의 모든 것이 생산에 도달하지 못한다. 보고서는 외부에서 실행위원회가 설문조사를回答하는 방식으로 간격을 설명한다. 이것은 빌드 내부의 관점이다: 여기서 파일럿이 생산에 도달하거나 조용히 죽는다.
모두가 측정하는 간격
숫자는 이제 익숙해졌다. Deloitte의 기업 AI 현황 보고서는 AI에 대한 접근이 거의 보편적이지만 약 4분의 1의 조직만이 실험의 40% 이상을 생산에 도달시키고, 약 5분의 1의 조직만이 자율 에이전트에 대한 성숙한 거버넌스를 보고한다. MIT의 Project NANDA는 더 직설적으로 말한다: 수백 개의 배포에서 압도적인 다수의 파일럿이 측정할 수 있는 재정적 이익을 생성하지 못했다. Gartner는_proof-of-concept 단계 이후에 많은 생성적 AI 프로젝트가 중단될 것이라고 예측했다. 이는 데이터 품질이 낮고, 비용이 증가하고, 비즈니스 가치가 불분명하기 때문이다.
이러한 발견을 함께 쌓으면 하나의 형태가 나타난다. 병목현상은 모델에 대한 접근이 아니다. 그 문제는 해결되었다. 병목현상은 데모에서 작동하는 모델과 생산에서 작동하는 시스템 사이의 거리이다. 모든 사용자에게, 실제 로드에서, 잘못된 경우에 실제 결과가 있는 경우에.
명확하게 말해야 할 예외가 있다: 많은 파일럿이 모델과 관련이 없는 이유로 출하되지 않는다: 실제 비즈니스 케이스가 없거나, 사용할 수 있는 데이터가 없거나, 실행위원회가 없거나, 모델링되지 않은 총 비용이다. 이러한 경우를 제외하고, 다음은 기술적으로 실제이고, 데모에서 설득력 있게 나타나며, 실제 사용 사례를 가지고 있는 파일럿이 생산에 도달하지 못하는 경우에 대한 것이다. 이러한 경우에 결정적인 요인은 거의 모델이 아니다.
설문조사 데이터가 무엇을 알려줄 수 없는 것은 무엇이 실제로 그 간격을 닫는가이다. 그答案은 설문조사에 없다. 그것은 모델 주변의 계층에서 발견된다: 정보를 검색하고, 그라운드 체크를하고, 작업을 올바른 모델로 라우팅하고, 전체를 지속적으로 평가한다.
패턴: 결정적인 수정은 거의 모델이 아니다
기업 AI 참여에서 일관된 패턴이 있다: 생산에 도달한 파일럿의 경우, 변경이 그것을 가져온 것은 거의 모델이 아니다. 모델 주변의 계층이다: 정보를 검색하고, 그라운드 체크를하고, 작업을 올바른 모델로 라우팅하고, 전체를 지속적으로 평가한다.
우리는 이를 하네스 계층이라고 부른다. 에이전트는 모델과 도구에 대한 접근을 의미하며, 하네스는 모델이 컨텍스트를 검색하고, 도구를 사용하고, 생산물을 책임지게 하는 모든 것을 의미한다: 검색, 그라운드 체크, 모델 라우팅, 가드레일, 평가. 이러한 구성 요소는 분리되어 작동하지 않는다. 특정 사용 사례를 위해 의도적으로 결합해야 한다. 이러한 결합된 규율이 생산 준비가 실제로 승리 또는 패배하는 곳이다.
이것은 proof-of-concept 함정을 재구성한다. 팀은 이미 작동하는 부분을 최적화하기 때문에 중단된다. 새로운 모델을 교체하고, 프롬프트를 재설계하고, 다음 프론티어 릴리스를 기다리지만, 실제 실패 지점은 데모에서 스트레스를 받지 않는 시스템의 일부에 있다.
그라운드, 더 똑똑한 모델이 아니라, 에이전트를 충분히 안전하게 만드는 것
보험 분야에서 빌드한 추천 및 자문 에이전트를 고려해보자. 이 도메인에서는 자신감이 있는 잘못된 답변은 글리치가 아니라 책임이다. 이러한 경우의 첫 번째 본능은 가장 가능성이 높은 모델을 사용하는 것이다. 그러나 그것은 안전을 사는 것이 아니다. 더 유창한 모델은 더 설득력 있는 환상을 생성한다. 규제된 컨텍스트에서 그것은 더 나쁘다.
시스템을 출하할 수 있게 만든 것은 하네스였다: 테넌트 안전 소스에서만 정보를 검색하는 검색 설계, 사용자에게 도달하기 전에 생성된 주장을 소스에 대해 검증하는 그라운드 체크, 지원되지 않는 것을 주장하는 것보다 차라리 기권하는 검증 단계. 결과는 LLM-ONLY 기준선에 대한 80~90%의 환상 감소와 95% 이상의 그라운드 정확도, 2초 미만의 P95 지연 시간을 유지하며, 안전 계층이 시스템을 느리게 느끼지 않도록 했다.
모델 선택과 안전을 동등하게하는 모든 사람에게 반直관적인 교훈이다: 그라운드 및 검증 계층이 거버넌스이다. 정책 문서와 승인위원회는 중요하지만, 모델이 추론 시간에 사실을 발명하는 것을 막을 수 없다. 검색 및 검증 하네스가 막을 수 있다. 우리의 배포에서 기술 그라운드 계층이 실제 거버넌스 메커니즘이다: “AI는 fatto를 만들 수 없다”는 원칙이 시스템의 속성이 되는 곳이다.
모델 라우팅, 모델 선택이 아니라, AI 비용이 결정되는 곳
파일럿이 죽는 두 번째 곳은 예산 검토이다. 시스템이 아름답게 작동할 수 있지만, 토큰당 경제학을 千개 사용자와 수십 개의 사용 사례에 걸쳐 총 소유 비용 문제가 되면 취소될 수 있다.
여기에서도 본능, 즉 하나의 강력한 모델을 선택하고 모든 것을 그 모델을 통해 라우팅하는 것은 실수이다. 대부분의 기업 워크로드는 혼합이다: 요청의 큰 부분은 루틴이고, 작은 부분은真正로 어렵다. 모든 요청을 프론티어 모델로 보내면 루틴 작업에 대한 프론티어 가격을 지불한다.
우리가 수행한 제3자 LLM API에서 Amazon Bedrock로의 마이그레이션 에서Amazon Bedrock에서 이익은 모델을 교체하는 것이 아니라 모델 계층을 재구성하는 것이었다. 각 작업을 적절한 모델 티어로 라우팅하고, Bedrock 네이티브 비용 및 거버넌스 컨트롤을 결합하여, AI 인프라 비용을 42% 줄이고, 60% 빠른 준수 콘텐츠 생성을 제공했다. 애플리케이션을 재구성하지 않고.
이 원리를 확장하면 그것은 합성된다. 티어드 “어드바이저” 아키텍처, 저렴한 모델이 요청의 대부분을 트라이어지 및 처리하고, 프론티어 모델은真正로 필요한 경우에만 예약된 경우, 라우팅은 한 번의 절약에서 구조적인 절약으로 변신한다.
이 패턴은 기업 AI 비용을 60~80% 줄였고, 일부 배포에서는 85%까지 줄였다. 주요점은 헤드라인 百分比가 아니다. 그것은 AI 시스템의 비용이 모델을 선택하는 것이 아니라 아키텍처에 의해 결정된다는 것이다.
왜 이것은 설문조사 데이터에서 보이지 않는가
이것은 설문조사에 깨끗하게 나타나지 않는다. 왜냐하면 설문조사는 결과에 대해 질문하고, 메커니즘에 대해 질문하지 않기 때문이다. “파일럿이 생산에 도달했나요?”는 실행위원회가 대답할 수 있는 예/아니요 질문이다. “무엇이 실제로 그것을 가져왔나요?”는 빌드 팀만이 대답할 수 있는 질문이다. 그리고 그答案은 거의 “우리가 더好的 모델을 찾았다”가 아니다. 그것은 거의 “우리가 모델 주변의 계층을 고쳤기 때문”이다.
이 불일치는 proof-of-concept 함정의 지속적인 이유를 설명한다. 산업은 모델 문제를 진단하고 모델 솔루션을 구입하는 반면, 실제 제약은 검색, 그라운드, 라우팅, 평가에 있다: 데모에서 보여주지 않는,Foundation 모델 출시 광고에서 광고하지 않는 비글ャ머한 플럼빙이다.
또한 거버넌스와 배달 속도가 반대가 아니라는 것을 설명한다. 일반적인 내러티브는 거버넌스를 배송을 제동하는 것으로 취급한다. 우리의 경험에 따르면, 시스템을 신뢰할 수 있을 만큼 신뢰할 수 있게 만드는 그라운드 및 검증 작업은 시스템을 governable하게 만드는 작업이다. 하네스 계층에서 수행된 거버넌스는 빌드를 늦추는 것이 아니다. 그것은 빌드를 출하할 수 있게 만드는 것이다.
파일럿이 중단된 경우 이것은 무엇을 의미하는가
생성적 AI 프로젝트가 proof-of-concept 지옥에 갇혀 있다면, 가장 유용한 일은 모델을 먼저 보지 않는 것이다. 모델은 이미 충분히 좋은 부분일 가능성이 가장 높다. 모델 주변의 계층을 보라:
- 검색 및 그라운드: 시스템이 관리되는 소스에서 답변을하는지, 아니면 훈련에서 즉흥적으로 답변을하는지?
- 검증: 사용자에게 보여지기 전에 출력을 확인하는 것이 있나요, 아니면 모델의 자신감이 직접 가나요?
- 라우팅: 모든 요청이 프론티어 가격을 지불하는지, 아니면 작업이 잘할 수 있는 가장 저렴한 모델로 매칭되는지?
- 평가: 품질이 지속적으로 측정되는지, 아니면 데모에서 한 번 확인되고 다시는 확인되지 않는지?
2026년에 파일럿에서 생산으로 넘어가는 조직은 최고의 모델에 접근할 수 있는 조직이 아니다. 모두가 그것을 가지고 있다. 그것은 모델이 어려운 부분이 아니었으며, 생산이 실제로 승리되는 하네스에 공학적 노력을 투자한 조직이다.












