사상 리더

아니, AI는 정체하지 않았다. 당신은 잘못된 점수를 보고 있다

mm
Unite.AI를 Google의 선호 소스에 추가

경영자들은 이제 자신의 AI 로드맵에 대해 의문을 가지고 있다. 2023년에 발생한 초기의 생성 도구의 급증之后, 동力的 유지 여부를 물어보는 것이 자연스럽다. 그러나 이러한 질문은 점수를 잘못 읽고 있다. AI의 발전은 정체하지 않았다. 그것은 바뀌었다.

한때 표면에서 일어난 지수적 변화, 유창한 글쓰기, 정리된 요약은 이제 더 깊은, 더 중요한 분야에서 일어난다: 추론, 코드, 워크플로우 오케스트레이션, 및 멀티모달 이해. 이러한 발전은 덜 화려하지만, 훨씬 더 영향력이 있다. 만약 당신이 여전히 AI를 더 좋은 문장을 작성하는 능력으로 측정하고 있다면, 당신은 실제 변화를 놓치고 있다.

실제적인 발전은 일이 이루어지는 곳에서 일어나고 있다

진전은 가장 중요한 곳에서 가속화되고 있다. 새로운 엄격한 벤치마크인 GPQA는 대학 수준의 과학적 추론을 평가하며, 모델의 성능은 거의 49% 포인트가 증가했다. MMMU는 크로스 도메인 및 멀티모달 작업을 테스트하며, 점수는 거의 19 포인트가 증가했다. SWE-bench는 실제 GitHub 코드베이스를 수정하고 자동 테스트를 통과하는 벤치마크이며, 1년 만에 4.4%에서 71%로 급증했다.

이러한 발전은 사소한 것이 아니다. 그것은 대규모 언어 모델이 정밀성, 추론, 및 복잡한 시스템 간의 통합을 요구하는 작업을 마스터하고 있음을 보여준다. SWE-bench는 특히 玩具 문제를 넘어서서 모델이 실제 소프트웨어 개발에 참여할 수 있는지 여부를 보여주며, 이는曾经似乎遥远한 임계값이다.

同时, 기업들은 자신의 기대치를 발전시키고 있다. 모델이 “일반적으로 지능적”인 것만으로는 충분하지 않다. 그것들은 특별히 유용해야 한다. 도메인 적응 모델, 툴 연결 시스템, 및 멀티 에이전트 프레임워크로의 전환은 실제 워크플로우에 통합된 성능을 요구하는 것에 대한 증가하는需求을 반영한다.

내러티브는 현실과 일치하지 않는다

왜 그것이 정체된 것처럼 느껴질까? 두 가지 이유가 있다. 첫째, 초기에 주목을 끈 벤치마크인 텍스트 요약, 이메일 생성, 및 간단한 채팅 작업은 자연적인 천장을 맞이했다. 한 번 모델이 이러한 작업에서 90%의 정확도를 일관되게 수행하면, 발전은 미미해 보인다. 이것은 천장 효과이며, 발전의 정체가 아니다.

오늘날의 발전은 긴 컨텍스트 메모리, 툴 통합, 추론 시간 추론, 및 도메인 특정 정확도를 포함한다. 이러한 능력은 바이럴 데모를 생성하지 않지만, 모델이 실제 워크플로우에서 수행할 수 있는 것을 극적으로 향상시킨다. 전통적인 언어 벤치마크는 천장을 맞이하고 있지만, 실제 세계의 추론, 툴 사용, 및 기업 신뢰성에 연결된 운영 벤치마크는 이전보다 빠르게 개선되고 있다. 이러한 격차는 불일치를 설명한다: 사소한 관찰자는 정체를 보지만, 실무자는 표면 아래에서 변화를 보고 있다.

데모에서 배포로

AI는 더 이상 화려한 데모나 狭い 프로토タイプ에 국한되지 않는다. 그것은 신뢰성, 정확성, 및 결과 전달이 중요한 기업 환경에서 본격적인 배포를 넘어서고 있다. 구조화된, 작업 특정 시스템으로의 전환은 이미 진행 중이다.

2026년까지, 40%의 기업 애플리케이션은 내장된 AI 에이전트를 특징으로 할 것이다. 이는 2025年的 5%에서 큰跃进이다. 이러한 에이전트는 단순히 프롬프트에 응답하는 것이 아니라, 작업을 수행하고, 워크플로우를 오케스트레이션하며, 재무, 사이버 보안, 및 고객 운영과 같은 분야에서 구체적인 결과를 생성한다.

이 발전은 더 깊은 기술적 변화를 반영한다. 주요 AI 개발자들은 원시적인 확장 대신 추론 시간 추론을 채택하고 있다. 이는 모델이 문제를 생각하고, 출력을 검증하며, 외부 툴과 동적으로 상호 작용할 수 있게 한다. 한때 狭い 자동화로 보였던 것이 실제 작업을 위해 설계된 에이전트로 변하고 있다.

경영자들이 곧 犯할 실수

현재 기업 리더들이 직면한 실제 위험은 AI의 발전이 정체했다는 것이 아니다. 그것은 mereka가 그렇게 믿고, 실제로 가속화되는 능력의 순간에 투자를 중단할 때이다.

앞서가는 조직들은 다음 GPT 스타일의 공개를 기다리고 있지 않다. 그들은 오늘의 AI를 고가치의 크로스 기능 워크플로우에 내장시키고, 측정 가능한 비즈니스 영향을 생성하고 있다. AI를 사용하는 조직의 2/3 이상이 이러한 배포와 직접 관련된 비용 감소 또는 수익 증가를 보고 있다. 가장 성공적인 채택자는 AI를 여러 비즈니스 기능에 통합하고, 전체 프로세스 체인을 자동화한 사람們이다.

AI 평가를 재고하기

점수를 업데이트할 때가 되었다. 조직은 전체 작업 완료, 툴 오케스트레이션, 및 크로스 모달 워크플로우를 추적해야 한다. 모델은 질문에 대답하는 것만이 아니라, 여러 단계의 작업을 완료하고, 실패에서 회복하며, 기존 시스템에 통합되는 출력을 생성하는지 여부를 평가해야 한다.

GPQA, MMMU, 및 SWE-bench와 같은 벤치마크는 시작점이다. 그러나 기업의 특정 도메인 및 워크플로우를 중심으로 구축된 내부 벤치마크가 훨씬 더 중요하다.

프론티어는 이동했다

AI는停滯하지 않았다. 그것은 실제 작업이 일어나는 곳으로 이동하고 있다. 시스템이 추론하고, 검증하고, 도메인 간에 상호 작용해야 하는 곳으로 이동하고 있다. 그것은 新規성 단계를 떠나고, 인프라 단계로 진입하고 있다.

이 변화를 이해하는 회사들은 이미 우위를 점하고 있다. 그들은 다음 바이럴 데모를 기다리고 있지 않다. 그들은 실제 생산성을 캡처하고, 해결 시간을 개선하고, 프로세스를 정밀성과 속도로 확장하고 있다.

만약 당신이 여전히 오래된 점수를 보고 있다면, 당신은 다른 곳에서 득점되는 점수를 놓치고 있다. 다음 리더들은 화려한 효과를 기다린 사람들이 아니다. 그들은 실제 신호를 보고, 행동한 사람들이다.

스티브 윌슨은 Exabeam의 Chief AI Officer로서 글로벌 기업을 위한 고급 AI 기반 사이버 보안 솔루션 개발을 이끌고 있습니다. 시즌 기술 책임자로서, 윌슨은 글로벌 2000 기업을 위한 대규모 클라우드 플랫폼과 보안 시스템을 설계해 왔습니다. 그는 AI 및 보안 커뮤니티에서 깊은 기술 전문 지식과 실제 기업 응용 프로그램을 연결하는 것으로 널리 존경받고 있습니다. 윌슨은 또한 대규모 언어 모델 보안을 위한 개발자 플레이북(O'Reilly Media)을 저술하였으며, 이는 현대 소프트웨어 스택에서 GenAI 시스템을 보안하기 위한 실용적인 가이드입니다.