AI 모델 및 플랫폼

75% 천장: 현재 방법으로 AI 모델이 최고 성능에 도달했는가?

mm
Unite.AI를 Google의 선호 소스에 추가

AnthropicOpenAI는 2일 간격으로 최전선 AI 모델을 공개했으며, 두 모델 모두 산업 코딩 벤치마크에서 거의 동일한 74-75%의 정확도를 달성했으며, 이는 현재 AI 아키텍처의 잠재적인 성능 한계를 나타내며, 배포 및 구현에 대해 크게 다른 접근 방식을 취하고 있습니다.

거의同時에 공개된 두 모델은 현재 훈련 방법으로 AI 개발이 정체에 도달했는지에 대한 근본적인 질문을 제기합니다. 두 회사는 사용자와 개발자에게 이러한 기능을 제공하는 방식에 대해 크게 다른 접근 방식을 취하고 있습니다.

벤치마크 수렴: 기술적 里程碑

클라우드 오퍼스 4.1, 8월 5일 앤트로픽에 의해 공개된 모델은 SWE-bench Verified에서 74.5%의 점수를 달성했습니다. 오픈AI의 GPT-5, 8월 7일에 발표된 모델은 동일한 테스트에서 74.9%의 점수를 달성했습니다. 이는 두 회사가 독립적으로 작업했음에도 불구하고 현재 아키텍처의 유사한 한계에 도달했다는 것을 시사합니다.

0.4%의 차이는 이러한 벤치마크의 통계적 노이즈 범위 내에 있습니다.

그러나 아키텍처 접근 방식은 크게 다릅니다. 오픈AI는 GPT-5를 다중 모델 시스템으로 구축했으며, 지능형 라우팅을 사용하여 쿼리가 단순한 작업을 위한 빠른 응답자, 복잡한 문제를 위한 추론 모델 또는 컴퓨팅 제한에 도달한 경우 미니 버전으로 направ됩니다. 앤트로픽은 오퍼스 4.1에서 단일 모델 접근 방식을 유지했으며, 전문가 최적화보다 일관성을 우선시했습니다.

출처: 앤트로픽

배포 전략: 경쟁 철학

오픈AI는 GPT-5를 모든 채팅GPT 사용자에게 즉시 제공했으며, 이는 약 7억 명의 주간 활성 사용자에게 무료로 제공되었습니다. 마이크로소프트는同時에 GPT-5를 깃허브 코파일럿, 비주얼 스튜디오 코드, M365 코파일럿, 아즈르 플랫폼에 통합했습니다.

앤트로픽은 더 전통적인 접근 방식을 유지하고 있습니다. 오퍼스 4.1는 유료 클라우드 사용자에게 제공되며, 개발자용 클라우드 코드와 API 접근을 통해 제공됩니다. 회사는 개발자와 기업에게 안정적이고 일관된 성능을 제공하는 것에 집중하는 것으로 보입니다.

GPT-5의 가격은 공격적이며, 개발자들은 경쟁사들이 가격 전략을 조정하도록 압력을 가할 수 있는 비용 대비 능력 비율을 언급했습니다.

인프라 요구 사항: 산업 경제의 변화

계산 요구 사항은 최전선 AI 개발의 거대한 규모를 보여줍니다. 오픈AI는 오라클과 300억 달러의 연간 계약을 맺었으며, 마이크로소프트 아즈르에서 NVIDIA H200 GPU를 사용하여 GPT-5를 훈련했습니다. 메타는 2025년에만 AI 인프라에 720억 달러를 투자할 계획이라고 발표했습니다.

두 회사는 원시 벤치마크 이상의 실제 응용 프로그램에서 상당한 개선을 보고했습니다. 오픈AI는 GPT-5가 웹 검색을 활성화하면 “약 45% 少ない 오류”를 보인다고 말합니다. 思考 모드에서는 o3 모델과 유사한 결과를 보여주며, 50-80% 少ない 토큰을 사용합니다. 이는 상당한 효율성 향상입니다.

깃허브는 오퍼스 4.1이 “다중 파일 코드 리팩토링에서 주목할 만한 성능 향상을 보여준다”고 보고합니다. 커서, 인기 있는 AI 코딩 어시스턴트는 GPT-5를 “놀랍도록 지능적이고, 쉽게 조종할 수 있다”고 말합니다.

(MSFT )

출처: 오픈AI

기술적 천장: 패러다임 전환

유사한 성능 지표에 대한 수렴은 현재 훈련 패러다임이 한계에 도달했음을 시사합니다. 여러 모델이 코딩 벤치마크에서 74-75%의 정확도로 클러스터링하는 것은 다음 주요 개선이 근본적인 혁신을 필요로 할 수 있음을 나타냅니다.

오픈AI의 복잡한 라우팅 시스템과 앤트로픽의 통일된 접근 방식 사이의 아키텍처 트레이드오프는 명확한 승자가 없는 다른 철학을 반영합니다. GPT-5의 다중 모델 시스템은 유연성을 제공하지만 잠재적인 실패 지점을 도입합니다. 클라우드의 일관성은 전문가 성능을 희생하여 안정성을 제공할 수 있습니다.

최전선 AI 기능의 민주화는 2년 전에는 연간 수천 달러를 청구하는 기능이现在 무료로 제공되도록 가속화합니다. 이는 전혀 새로운 응용 프로그램 카테고리를 가능하게 할 수 있습니다.

시장 영향과 다음 단계

산업 관측통들은 앤트로픽이 오픈AI의 가격 전략에 대응할 것으로 예상합니다. 그러나 직접적인 가격 매칭은 아닐 것입니다. 구글의 딥마인드와 메타는 최근 발표에서 상대적으로 조용했지만, 향후 몇 개월 내에 움직임을 보일 것으로 예상됩니다.

48시간 간격의 공개는 AI가 실험 기술에서 안정적인 인프라로 전환하고 있음을 보여줍니다. 여러 회사가 거의 동일한 벤치마크 점수를 달성하고, 통계적 차이가 있는 경우, 경쟁은 원시 성능 지표에서 배포 효율성, 통합 품질, 서비스 안정성으로 이동합니다.

(ORCL )

실제적인 개선이 중요합니다. SWE-bench Verified는 AI가 오픈 소스 소프트웨어의 실제 버그를 식별하고 수정하는 능력을 측정하며, 두 모델의 점수는 자율 코딩 능력에서 상당한 발전을 나타냅니다.

AI 모델이 이유와 코딩 능력에서 점점 더 정교해짐에 따라, 경쟁은 원시 성능 지표에서 실제 구현과 생산 환경의 안정성으로 이동하고 있습니다. 놀라운 진실은, 이러한 안정성이 또 다른 혁신보다 더 큰 변화를 가능하게 할 수 있다는 것입니다.

Alex는 Unite.AI의 AI 기반 뉴스 운영을 이끌며, 저널리즘, 연구 및 자동화를 결합해 인공지능에 대한 시기적절하고 확장 가능한 보도를 지원합니다. 그의 작업은 새로운 AI 개발이 효율적으로 조명되도록 하면서도 출판물의 편집 기준을 유지하도록 돕습니다.