사상 리더
AI는 실제 업무에 준비되지 않았다: 모델이 복잡한 작업에서 실패하는 이유

AI 버블에 투자하는 사람들은 화이트칼라 전문가들에게 가장 어려운 문제를 넘겨줄 것을 요청하고, 데이터를 조금 더 포기하면 오후 시간을 되찾을 수 있다고 직원들에게 약속합니다. 복잡한 분석, 판단, 그리고 수년간 개발된 워크플로우가 모델에 흡수되어 인간을 더 나은 일에 자유롭게 해줄 것이라고 합니다. 이것이 현재 기업 미국에서 지배적인 서사이며, 이는 함정입니다.
능력 신화: 모델이 복잡한 작업에서 실패하는 이유
A new 연구 out of UC Berkeley tested leading AI agents against real world professional tasks across 55 industries, from healthcare to finance to law. Overall performance came in below 25 percent. Then researchers isolated the hardest task in each field – the kind of work that separates a senior professional from a junior one – and every single model failed. The scores weren’t just low. They were at zero.
그러한 결과라면 스스로 서사를 바꿨을 것이라고 생각할 수 있지만, 실제로는 그렇지 않았습니다. 산업 전반에 걸쳐 AI 투자자들은 현재 대부분의 AI 모델이 실제보다 더 진보했다고 전문가들을 설득하려는 데 너무 많은 이해관계를 가지고 있습니다. 그러나 가장 흥미로운 질문은 AI가 오늘날 직업의 가장 어려운 부분을 수행할 수 있는가가 아니라, 우리와 AI를 판매하는 모든 사람들은 이미 그 답을 알고 있다는 점입니다.
따라서 또 다른 질문이 떠오릅니다. 아직 자신의 사고가 완전히 형성되지 않은 젊은 전문가가 이 데이터 교환에 동의하면 그들의 판단은 어떻게 될까요?
미네소타 연구 결과: AI가 기술을 중간으로 평탄화하는 방식
A new empirical 연구 out of the University of Minnesota Law School offers a real answer, using law as the test case. Researchers ran about a hundred upper-level law students through a sequence of realistic tasks: synthesizing law from raw source material, answering closed book questions to test what they absorbed, applying that law to a fact pattern, and then revising their own work. One group had AI access only at the very first and very last steps. The other had no AI until the end.
AI를 활용해 초안을 작성한 학생들은 더 강력한 작업을 더 빠르게 만들어냈으며, 이는 그다지 놀라운 일은 아닙니다. 그러나 놀라운 점은 그 이후에 일어난 일입니다. 연구진은 초기 AI 사용이 이해 격차를 남겨 도구가 제거될 때 드러날 것으로 예상했지만, 이는 발생하지 않았습니다. 법을 종합하는 데 AI를 사용한 학생들은 AI 없이 작업한 학생들보다 차가운 테스트에서도 더 잘 이해하고 있었습니다. 독립적인 추론은 약화되지 않았으며, 오히려 경우에 따라 향상되었습니다.
전환점은 모든 학생이 작업을 수정하기 위해 AI를 사용할 수 있게 된 마지막 단계에서 나타났습니다. 약한 메모로 시작한 학생들은 그 접근성을 활용해 실제로 개선했으며, 강한 메모로 시작한 학생들은 오히려 성과가 악화되었습니다. 유능한 도구를 혼자 사용하게 되었지만 사용 방법에 대한 추가적인 구조가 없었기에, 기술은 누적되지 않고 중간으로 평탄화되었습니다.
이 두 연구는 뚜렷한 진실을 제시합니다: AI는 전문적인 판단을 대체할 수 없으며, 버클리 수치는 이 논의를 영원히 종결시켜야 합니다. 그러나 AI가 접촉만으로도 추론을 침식시키는 부식성 힘도 아닙니다. 그 효과는 전적으로 과정 내에서 AI가 어디에 나타나는가에 달려 있습니다.
대체보다 순서화: 판단을 핵심에 유지하기
이는 법률 실무 외에도 적용됩니다. 모든 지식 직종이 현재 이 실험의 자체 버전을 진행하고 있습니다: 예를 들어, 의사는 모델이 감별 진단 초안을 작성하도록 할지 결정하고, 분석가는 모델이 첫 번째 모델을 구축하도록 할지 결정하며, 조교는 스스로 작업을 진행하기 전에 모델이 논증을 구조화하도록 할지 결정합니다. 미네소타 연구 결과는 모든 형태의 AI에 대해 일괄적인 예·아니오 답이 아니라 순서화가 핵심임을 시사합니다. AI는 힘든 작업과 마찰을 일으키는 업무의 초기 단계에 적합하지만 판단에는 적합하지 않습니다. 고객이 실제로 비용을 지불하는 작업의 중심에 위치해서는 안 되며, 현재로서는 시도한다 하더라도 그 자리에 도달할 수 없습니다.
그럼에도 불구하고 여전히 다른 주장을 하는 기업들은 데이터가 존재하지 않는다고 말하는 AI 버전을 판매하고 있습니다. 연구가 실제로 제시하는 한계에 맞춰 제품과 고객 관계를 구축하는 기업만이 5년 후에도 전문가들의 신뢰를 받을 것입니다. 그 외의 모든 기업은 매우 비용이 많이 드는 오해를 설명하는 데 시간을 소비하게 될 것입니다.












