사상 리더
오픈 모델은 계속 개선되고 있습니다. 경제 상황은 점점 복잡해지고 있습니다.

AI 모델은 18개월 전보다 확실히 향상되었습니다. 하지만 더 깊이 살펴보니, 그 진보에 대한 일반적인 설명들이 맞지 않았습니다.
모델이 단순히 규모가 커졌기 때문에 개선된 것은 아닙니다. “오픈 소스가 승리하고 있다”는 말은 절반만 맞습니다. 그리고 벤치마크 점수를 보는 조언은 기대만큼 유용하지 않았습니다. 이 사실을 받아들이는 데 시간이 걸렸습니다.
그래서 8개 연구소의 46개 모델에 걸친 18개월 데이터를 수집했습니다. 인텔리전스가 상품화되고 있는지, 오픈 모델이 최첨단을 따라잡고 있는지, 그리고 기업이 시스템 선택 시 어떤 지표를 측정해야 하는지 이해하고 싶었습니다.
핵심 발견은 간단했습니다: 벤치마크 점수는 모델 자체의 속성이 아니라 모델, 소프트웨어 및 주변 환경, 그리고 사용된 시간과 컴퓨팅 파워를 반영합니다. 하나의 숫자를 공개하면 나머지 두 요소는 숨겨진 것이 됩니다.
하지만 그 의미는 훨씬 더 넓습니다. 기업은 개별 모델을 비교하기보다 작업을 수행해야 하는 전체 시스템을 평가해야 합니다.
Benchmarks Hide the System
복합 점수를 보지 않고 테스트별로 모델을 비교했을 때, 선도적인 오픈 가중 모델과 독점 모델 사이의 격차는 단일 숫자로 표현되지 않았습니다.
SWE-bench Verified라는 오래된 테스트에서는 격차가 0.2점이었습니다. 현실적인 다국어 소프트웨어 작업을 표준화된 설정으로 설계한 최신 테스트인 SWE-bench Pro에서는 격차가 18.2점이었습니다.
겉보기 모델 격차는 벤치마크에 따라 달라집니다
| Benchmark | Gap | Status |
|---|---|---|
| SWE-bench Verified | 0.2점 | 포화, 오염 플래그 지정 |
| GPQA Diamond | 2.0점 | 포화, 상한선 약 92–95% |
| Terminal-Bench 2.1 | 4.9점 | 실시간, 에이전시 |
| Humanity’s Last Exam | 9.8점 | 실시간, 최첨단 추론 |
| SWE-bench Pro | 18.2점 | 실시간, 표준화된 스캐폴드 |
출처: Jaspreet Singh의 2026년 7월 주요 오픈 가중 및 독점 모델 분석.
동일한 모델도 누가 테스트를 수행하느냐에 따라 다른 점수를 받을 수 있습니다. Kimi K3는 독립 평가에서 Terminal-Bench 2.1에서 80.9%를 기록했으며, 제조사가 보고한 결과에서는 88.3%를 받았습니다. 이 7.4점 차이는 제가 분석한 다섯 개 벤치마크 중 세 개에서 오픈 대 최첨단 격차보다 큽니다.
모델은 주변 소프트웨어를 통해 지시를 받고, 제공된 컨텍스트를 활용하며, 접근 가능한 도구를 사용하고, 개발자가 설정한 추론 예산 내에서 작동합니다. 이러한 조건을 바꾸면 결과도 함께 변합니다.
공개 벤치마크는 진보 방향을 이해하는 데 유용합니다. 하지만 기업 내부에서 무엇이 작동할지를 결정하는 근거로는 부적합합니다.
Agentic Reliability Changes the Math
AI가 질문에 답하는 단계에서 작업 흐름을 완성하는 단계로 이동함에 따라 이는 더욱 중요해집니다.
예를 들어 20단계로 구성된 워크플로우에서 AI가 각 단계를 95%의 정확도로 수행한다고 가정해 보겠습니다. 이는 신뢰할 만해 보이지만, 전체 시퀀스를 고려하면 워크플로우 성공률은 단 36%에 불과합니다.
더 나은 모델은 특히 어려운 에이전시 작업에서 각 단계의 성공 확률을 높일 수 있습니다. 한 번의 실수가 작업 전체를 망치는지를 결정하는 것은 주변 엔지니어링입니다. 진행 상황 저장, 출력 검증, 안전한 재시도 및 실패 복구는 설득력 있는 시연과 신뢰할 수 있는 제품을 구분하는 요소가 됩니다.
모델 선택은 여전히 중요합니다. 하지만 최고 점수를 받은 모델이 자동으로 가장 신뢰할 수 있는 시스템을 제공하는 것은 아닙니다.
Choose Models by the Work
데이터는 오픈-가중 모델과 독점 모델 논쟁 양쪽이 보통 주장하는 것보다 더 좁은 결론을 뒷받침합니다.
오픈-가중 모델은 결과를 직접 측정할 수 있는 명확하고 단기적인 작업에서 경쟁력을 갖습니다. 분류, 추출, 요약 및 구조화된 생성 작업이 점점 이 범주에 포함되고 있습니다.
최첨단 모델은 여전히 장기 에이전시 작업, 압박 상황에서의 지시 준수, 그리고 사후에 실패를 감지하기 비용이 큰 작업에서 프리미엄을 유지합니다. 최신 벤치마크가 0점이 아닌 약 18점 차이를 보이는 곳이며, 모델 공급자가 제공하는 안전 계층이 가치를 갖는 곳입니다.
기업은 작업별로 모델을 선택해야 하지만 전환이 자유롭다고 가정해서는 안 됩니다. 컨텍스트, 추론 및 프롬프트 캐시는 제공자 간에 깨끗하게 이동하지 않습니다. 시스템을 변경해 작업을 다시 시작해야 하거나 엔지니어링 및 거버넌스 단계가 추가되면 더 저렴한 모델도 더 비싸질 수 있습니다.
모델 선택이 점점 덜 영구적이 되고 있습니다. 전환은 여전히 아키텍처적 결정입니다.
지능이 저렴해져도 판단은 여전히 비싸다
유능한 범용 능력은 매우 저렴해지고 있습니다. 그러나 곡선 상단에서는 성능이 한 단계씩 향상될 때마다 이전보다 더 많은 비용이 듭니다. 마지막 9포인트의 능력은 그 이하의 모든 것보다 대략 10배 정도 비용이 듭니다.
대부분의 기업은 모든 요청에 가장 강력한 모델이 필요하지 않습니다. 다만 어떤 작업에 그것이 필요할지 판단할 필요는 있습니다.
요약, 추출, 분류, 초안 작성 및 번역은 유틸리티 기능으로 이동하고 있습니다. 남아 있는 희소한 요소는 판단입니다: 다섯 가지 가능한 답변 중 어느 것이 옳은지 아는 것, 질문 자체가 잘못됐음을 인지하는 것, 그리고 언제 멈추고 인간에게 물어볼지를 결정하는 것.
판단은 독점적인 컨텍스트, 비즈니스 규칙, 워크플로, 과거 지식, 그리고 작업을 검증하고 실패를 억제하는 엔지니어링에서 비롯됩니다.
다른 누구도 실행할 수 없는 평가 구축
기업에게 가장 가치 있는 벤치마크는 자체 작업을 기반으로 구축됩니다.
비즈니스에서 실제 작업 50~200개로 구성된 비공개 평가 세트를 만드세요. 주변 시스템은 고정한 채 테스트를 반복 실행하고, 답변이 얼마나 다듬어졌는지가 아니라 작업이 올바르게 완료되었는지를 점수화합니다.
비용에도 동일한 원칙을 적용하세요. 토큰당 비용은 모델이 더 오래 추론하거나 재시도가 많아지거나 인간 검토자의 작업량이 늘어날 때 오해를 일으킬 수 있습니다. 대신 승인된 결과당 비용을 측정하십시오.
소수의 모델부터 시작하십시오. 작업 초기에 작업을 라우팅하고 중간에 제공자를 변경하지 마세요. 각 추가 제공자의 보안, 거버넌스 및 운영 부담을 공개된 가격과 함께 계산합니다.
시장은 계속해서 새로운 벤치마크 우승자를 내놓을 것이며, 기업들은 각각에 맞춰 AI 전략을 재구축하려는 유혹을 받을 것입니다. 더 나은 방법은 작업에 맞는 모델을 선택한 뒤, 해당 모델이 수행해야 하는 조건 하에서 전체 시스템을 평가하는 것입니다.
귀사의 아키텍처를 이끌어야 할 벤치마크는 오직 귀사만 실행할 수 있는 것입니다.












