AI 모델 및 플랫폼

제미니 3.1 프로, 기록적인 推論 성능 달성

mm
Unite.AI를 Google의 선호 소스에 추가

구글은 2월 19일 제미니 3.1 프로(Gemini 3.1 Pro)를 출시했으며, 이는 기존의 플래그십 AI 모델보다 推論 성능을 두 배 이상提高하면서 가격은 동일하게 유지했다.

가장 주목할 만한 숫자는 ARC-AGI-2 벤치마크에서 제미니 3.1 프로가 77.1%의 점수를 얻은 것이다. 이는 완전히 새로운 논리 패턴을 해결하는 모델의 능력을 테스트하는 벤치마크이며, 제미니 3 프로는 31.1%의 점수를 얻었다. 46 퍼센트 포인트의 점프는 모든 프런티어 모델 패밀리에서 단일 세대의 推論 성능 향상 중 가장 크다.

이 모델은 구글의 소비자와 개발자 플랫폼에서 즉시 사용할 수 있다. 제미니 앱 사용자들은 AI 프로와 AI 울트라 플랜을 통해 높은 사용량 제한과 함께 접근할 수 있으며, 개발자들은 제미니 API를 통해 AI 스튜디오, 버텍스 AI, 제미니 CLI, 안티그라비티, 안드로이드 스튜디오에서 3.1 프로에 접근할 수 있다. 노트북LM도 프로와 울트라 구독자들을 위해 업그레이드된다.

가격은 20만 토큰 미만의 프롬프트에 대한 입력 토큰당 2달러, 더 긴 컨텍스트의 경우 4달러로 유지된다. 출력은 1만 토큰당 12달러이다. 제미니 3 프로를 이미 API를 통해 사용하는 경우 업그레이드는 무료이다.

전반적인 벤치마크 성능

모델 카드는 제미니 3.1 프로가 18개의 추적 벤치마크 중 12개에서 1위를 차지한다고 나타낸다. ARC-AGI-2를 넘어서서, GPQA 다이아몬드에서 94.3%, 라이브코드벤치 프로에서 2,887 엘로의 점수를 얻었다. 이는 경쟁적 프로그래밍에서 모든 프런티어 모델 중最高의 점수이다.

인간성의 마지막 시험에서 3.1 프로는 44.4%의 점수를 얻었으며, 이는 제미니 3 프로의 37.5%보다 높으며, GPT-5.2의 34.5%보다 앞선다. 다국어 MMLU 벤치마크에서는 92.6%의 점수를 얻었으며, 128,000 토큰의 긴 컨텍스트 정확도는 84.9%로 유지된다.

이 모델은 1백만 토큰의 입력 컨텍스트 창과 64,000개의 출력 토큰을 유지하며, 이는 코드를 전체 코드베이스로 ingestion하고 단일 세션에서 상당한 코드 블록을 생성해야 하는 AI 코드 도구의 사양과 일치한다.

3.1 프로가 선도하지 않는 분야도 중요하다. SWE-Bench Verified 테스트에서 실세계 소프트웨어 엔지니어링 작업을 테스트하면 80.6%의 점수를 얻으며, 이는 앤트로픽의 클라우드 오퍼스 4.6의 80.8%보다 약간 낮다. 간격은 작지만 앤트로픽이 실용적인 코딩 작업에서 약간의 우위를 유지하고 있음을 보여준다.

다이나믹 싱킹의 변화

제미니 3.1 프로는 기본적으로 다이나믹 싱킹을 사용한다. 이는 모델이 각 프롬프트의 복잡성에 따라 내부적인 推論을 조정하는 접근 방식이다. 간단한 질문에는 빠른 답변을 제공하며, 복잡한 멀티스텝 문제에는 더 깊은 처리 체인을.trigger하여 모델이 응답을 생성한다.

개발자는 API의 thinking_level 매개변수를 통해 이 동작을 제어할 수 있다. 이는 내부적인 推論의 최대 깊이를 설정한다. 이는 推論 모델에서 긴장関係을 해결한다. 확장된 推論은 어려운 문제에서 정확도를提高하지만, 간단한 질의에 대해 대기 시간과 비용을 추가한다. 다이나믹 싱킹은 이 트레이드오프를 자동화하려고 시도한다.

이 기능은 더广泛한 산업의 변화를 반영한다. 오픈AI의 o-시리즈 모델은 체인-오브-사고 推論을 선택 가능한 모드로 도입했다. 앤트로픽의 클라우드는 확장된 推論을 선택 가능한 기능으로 사용한다. 구글의 접근 방식은 대부분의 사용자가 모델이 얼마나 생각해야 하는지 결정하기보다는 모델이 자동으로 결정하도록 하는 것이다.

경쟁 분야의 경쟁

제미니 3.1 프로는 벤치마크 리더십이 매월 변경되는 시장에서 출시된다. 구글의 제미니 3은 오픈AI에서 “코드 레드”를.trigger하여 GPT-5.2를 한 달도 안 되는 시간에 출시했다. 앤트로픽은 클라우드 업데이트를 가속화된 속도로 출하하고 있다. 각 릴리스는 모델 간의 간격을 좁혀서 플랫폼 간의 선택은 원시 능력보다는 에코시스템과 가격에越来越 의존하게 된다.

구글의优势는 분배이다. 제미니 3.1 프로는 수백만 명의 사람들이 사용하는 제품에 직접 슬롯된다. 지메일, 독스, 검색, 개인 지능 기능이 모델을 사용자의 개인 데이터에 연결한다. 이 모델은 또한 제미니 엔터프라이즈와 제미니 CLI를 구동하며, 개발자와 비즈니스에게 이미 사용하는 도구를 통해 접근할 수 있다.

개발자가 프런티어 모델을 선택할 때, 가격 결정은 더 쉬워졌다. 1만 토큰당 2달러의 가격으로 제미니 3.1 프로는 오픈AI와 앤트로픽의 플래그십 가격을 같은 능력으로 낮췄다. 기존 사용자에게는 무료 업그레이드가 제공되므로 마이그레이션 마찰이 제거된다.

推論 성능 향상은 에이전트 응용 프로그램에서 가장 중요하다. 에이전트는 계획을 수립하고, 멀티스텝 작업을 수행하며, 도구를 자율적으로 사용하는 AI 시스템이다. ARC-AGI-2는 특히 훈련 데이터에서 커버되지 않은 문제에 대한 새로운 패턴 인식을 테스트한다. 77.1%의 점수를 얻은 모델은 31.1%의 점수를 얻은 모델보다 낯선 상황을 훨씬 더 신뢰성 있게 처리한다.

이 벤치마크 성능 향상이 실제로 비례하는 실제 성능 향상을 제공하는지 여부는 구글이 향후 몇 주 동안 답변해야 할 질문이다. 벤치마크는 특정 능력을 제어된 조건에서 캡처하지만, 실제 사용자 경험은 모델이 사람們이 던진 작업의 예측할 수 없는 범위에서 수행하는 방식에 달려 있다. ARC-AGI-2의 점프는 3.1 프로가 이전의任何 모델보다 더 나은 새로운 상황을 처리할 수 있음을 시사한다. 사용자가 이 능력으로 무엇을 할지 여부는 숫자가 중요하다는 것을 결정할 것이다.

Alex McFarland은 인공 지능의 최신 개발을 탐구하는 AI 저널리스트이자 작가입니다. 그는 전 세계의 수많은 AI 스타트업과 출판물들과 협력했습니다.