사상 리더
기업 AI가 마무리 지을 때 실패하는 이유 — 그리고 이를 해결하는 방법

AI에 대한 관심이 높아지고 있지만, 대부분의 기업 AI 프로젝트는 실험 단계를 넘어서지 못한다. 최근 IDC 연구에 따르면, 88%의 AI Proof-of-Concept(PoC) 프로젝트가 전체 생산에 확대되지 않는다. 이는 엄청난 낙차이며, 뭔가 잘못된 신호이다. 많은 프로젝트가 마무리 지을 때까지 가지만, 벤치마크를 충족하는 훈련된 모델을 가지고 있지만, 결국 출시되거나 최종 사용자에 의해 채택되지 않는다.
무엇이 잘못되고 있는가? 많은 경우, 세 가지 큰 문제로 인해 발생한다:
- 기업 AI 팀은 주요 성능 격차를 잡지 못하는 표면 수준의 진단 도구와 벤치마크에 의존한다.
- 모델은 실제 문제를 해결하는 대신 표준 벤치마크에 맞게 조정된다.
- 모델 사용을 확대하는 비용이 회사 전체로 채택하는 데 너무 높다.
이 기사에서는 이러한 함정을 하나씩 풀어보고, AI 프로젝트를 마무리 지어 사용자에게 전달하는 데 필요한 것을 살펴본다.
문제 #1: 주요 성능 문제를 놓치는 표준 진단
AI 프로젝트가 실험 단계 후에 걸려 넘어지는 주요 이유 중 하나는 내부 벤치마크와 진단이 모델 성능을 충분히 깊이 있게 분석하지 못하고, 사용성, 신뢰성, 채택을 저하하는 문제를 놓치기 때문이다. 팀은 모든 항목을 체크할 수 있지만, 실제 사용자와의 상호작용을 반영하지 않을 수 있다.
예를 들어, 한 AI 팀은 모든 내부 테스트에서 통과한 모델을 가지고 있었다. 모델은 모든 정확도 지표와 안전性 임계값을 충족했으며, 출시를 준비 중이었다. 그러나 제3자 평가를 통해 모델을 실제 사용자와의 상호작용을 반영하는 방식으로 평가했을 때,重大한 맹점이 발견되었다. 모델은 특정 방식으로 질문을 받았을 때, 9배 더 많은 회피적인 답변을 제공했다. 예를 들어, “미국 대통령은 누구인가?”라는 질문에는 올바르게 응답했지만, “미국 대통령에 대해 말해줄 수 있나요?”라는 질문에는 안전성 위험으로 간주되어 답변을 거부했다.
문제는 모델의 핵심 지식이 아니었으며, 문장 구조에 따라 의도를 어떻게 해석하는지에 있었다. 팀은 안전성에 너무 최적화되어, 정상적인 질문을 차단하는 결과를 초래했다.
문제 #2: 실제 세계를 반영하지 않는 벤치마크에 맞춘 모델
기업 AI의 또 다른 일반적인 장애물은 AI 팀이 실제 문제를 해결하는 대신 산업 표준 벤치마크에 맞게 모델을 조정한다는 것이다. 모델은 표준 평가에서 높은 점수를 받을 수 있지만, 실제 사용자와의 상호작용에서 일관된 결과를 제공하지 못할 수 있다.
이것은 모델이 특정 테스트 케이스에만 최적화되어, 실제 사용자와의 상호작용에서 제대로 작동하지 못할 때 발생한다. 모델은 벤치마크에서 높은 점수를 받을 수 있지만, 실제 사용자와의 상호작용에서 제대로 작동하지 못할 수 있다. 따라서 사용자는 모델이 올바른 답변을 제공하도록 프롬프트 엔지니어링을 통해 모델의 언어를 사용해야 한다. 만약 사용자가 모델의 언어를 사용해야 한다면, 채택을 저하하고 사용자 경험을 악화시킬 수 있다.
이러한 벤치마크 중심의 훈련은 또한 과적합을 초래할 수 있다. 모델은 평가 데이터셋에서 높은 점수를 받을 수 있지만, 실제 사용자와의 상호작용에서 제대로 작동하지 못할 수 있다. 따라서 모델은 실제 사용자와의 상호작용에서 제대로 작동하지 못할 수 있다.
기업 AI 솔루션이 성공하려면, 모델은 실제 세계에서 작동해야 한다. 실험실에서만 작동하는 모델은 실제 사용자와의 상호작용에서 제대로 작동하지 못할 수 있다.
문제 #3: AI 채택을 확대하는 것은 컴퓨팅 비용을 확대하는 것
AI POC가 확대되지 못하는 세 번째 이유는 팀이 모델을 운영하고 유지하는 비용을 과소평가하기 때문이다. 개발 중에, 모델의 컴퓨팅需求을 간과하기 쉽다. 그러나 모델을 실제 사용자와의 상호작용에서 사용하기 시작하면, 비용이 급격히 증가할 수 있다.
기업급 AI는 실제 사용자와의 상호작용에서 모델을 작동시키기 위해大量의 컴퓨팅 자원을 필요로 한다. 모델을 훈련하고, 모니터링하고, 로깅하고, 재훈련하기 위해大量의 컴퓨팅 자원이 필요하다. 이러한 비용을 초기에 고려하지 않으면, 실제 사용자와의 상호작용에서 모델을 사용하기 시작하면 비즈니스 ケース가 무너질 수 있다. 실험실에서 모델을 작동시키는 데에는 문제가 없지만, 실제 사용자와의 상호작용에서 모델을 사용하기 시작하면, 비용이 급격히 증가할 수 있다.
성공적인 기업 AI를 위한 마지막 마일stones
AI 프로젝트를 마무리 지어 사용자에게 전달하는 데 필요한 것을 살펴보자. 첫째, 모델을 평가하기 위해 제3자 평가를 수행해야 한다. 내부 테스트는 중요하지만, 실제 사용자와의 상호작용을 반영하지 않을 수 있다. 제3자 평가를 통해 모델을 실제 사용자와의 상호작용을 반영하는 방식으로 평가할 수 있다.
둘째, 실제 사용자와의 상호작용을 반영하는 방식으로 모델을 테스트해야 한다. 대부분의 벤치마크는 실제 사용자와의 상호작용을 반영하지 않는 “clean” 데이터를 사용한다. 모델을 실제 사용자와의 상호작용에서 작동시키는 데 필요한 테스트를 수행해야 한다.
셋째, 안전성 프로토콜을 재검토해야 한다. 안전성은 중요하지만, 모델을 사용하기 어렵게 만들어서는 안 된다. 모델이 간단한 질문에 대한 답변을 거부한다면, 사용자 경험을 악화시킬 수 있다.
넷째, 컴퓨팅 비용을 주의해야 한다. 모델을 실제 사용자와의 상호작용에서 작동시키는 데 필요한 컴퓨팅 자원을 고려해야 한다. 모델을 작동시키는 데 필요한 비용을 초기에 고려하지 않으면, 비즈니스 ケース가 무너질 수 있다.
마지막으로, 모델을 작동시키는 데 필요한 컴퓨팅 자원을 최적화해야 한다. 모델을 작동시키는 데 필요한 비용을 초기에 고려하지 않으면, 비즈니스 ケース가 무너질 수 있다. 모델을 작동시키는 데 필요한 컴퓨팅 자원을 최적화하면, 모델을 실제 사용자와의 상호작용에서 작동시키는 데 필요한 비용을 줄일 수 있다.
모델을 평가하고, 사용자 경험을 개선하고, 컴퓨팅 비용을 최적화하는 데 필요한 작업을 수행하면, AI 프로젝트를 마무리 지어 사용자에게 전달하는 데 성공할 수 있다. 모델을 실제 사용자와의 상호작용에서 작동시키는 데 필요한 비용을 초기에 고려하지 않으면, 비즈니스 ケース가 무너질 수 있다. 그러나 모델을 작동시키는 데 필요한 컴퓨팅 자원을 최적화하면, 모델을 실제 사용자와의 상호작용에서 작동시키는 데 필요한 비용을 줄일 수 있다. 따라서 모델을 실제 사용자와의 상호작용에서 작동시키는 데 필요한 비용을 초기에 고려해야 한다.












