Mô hình và nền tảng AI
Gemini 3.1 Pro Đạt Được Những Tiến Bố Reasoning Gains Kỷ Lục
Google (GOOGL ) đã phát hành Gemini 3.1 Pro vào ngày 19 tháng 2, một bản cập nhật cho mô hình AI hàng đầu của công ty, giúp tăng gấp đôi hiệu suất lý luận trong khi giữ nguyên giá cả giống như người tiền nhiệm.
Số liệu nổi bật nhất: trên ARC-AGI-2, một điểm chuẩn kiểm tra khả năng của mô hình trong việc giải quyết các mẫu logic hoàn toàn mới thay vì nhớ lại dữ liệu đào tạo, Gemini 3.1 Pro đạt điểm 77,1%. Gemini 3 Pro đạt điểm 31,1%. Sự tăng trưởng 46 điểm phần trăm này là mức tăng lớn nhất trong một thế hệ mô hình lý luận.
Mô hình này có sẵn ngay lập tức trên các nền tảng người tiêu dùng và nhà phát triển của Google. Người dùng ứng dụng Gemini trên các kế hoạch AI Pro và AI Ultra có thể truy cập với giới hạn sử dụng cao hơn, trong khi các nhà phát triển có thể truy cập 3.1 Pro thông qua API Gemini trong AI Studio, Vertex AI, Gemini CLI, Antigravity và Android Studio. NotebookLM cũng nhận được bản nâng cấp cho người đăng ký Pro và Ultra.
Giá cả vẫn giữ ở mức 2 đô la cho mỗi triệu token đầu vào cho các yêu cầu dưới 200.000 token, tăng lên 4 đô la cho các ngữ cảnh dài hơn. Chi phí đầu ra là 12 đô la cho mỗi triệu token. Đối với những người đã sử dụng Gemini 3 Pro thông qua API, bản nâng cấp này là miễn phí.
Hiệu Suất Benchmark Toàn Diện
Thẻ mô hình model card cho thấy Gemini 3.1 Pro tuyên bố đứng đầu 12 trong 18 điểm chuẩn được theo dõi. Ngoài ARC-AGI-2, các điểm nổi bật bao gồm 94,3% trên GPQA Diamond, một bài kiểm tra lý luận khoa học cấp sau đại học, và 2.887 Elo trên LiveCodeBench Pro, điểm số cao nhất trong tất cả các mô hình tiên phong cho lập trình cạnh tranh.
Trên Humanity’s Last Exam – một điểm chuẩn được rút ra từ các câu hỏi chuyên gia được thu thập từ các lĩnh vực học thuật khác nhau – 3.1 Pro đạt 44,4%, tăng từ 37,5% cho Gemini 3 Pro và vượt qua GPT-5.2 với 34,5%. Điểm chuẩn đa ngôn ngữ MMLU cho thấy 92,6%, và độ chính xác ngữ cảnh dài ở 128.000 token vẫn giữ ở mức 84,9%.
Mô hình này vẫn giữ cửa sổ ngữ cảnh đầu vào 1 triệu token và tạo ra tối đa 64.000 token đầu ra, phù hợp với các công cụ mã hóa AI cần phải tiêu thụ toàn bộ cơ sở mã và tạo ra các khối mã đáng kể trong một phiên.
Điểm mà 3.1 Pro không dẫn đầu cũng rất đáng chú ý. Trên SWE-Bench Verified, một bài kiểm tra về các nhiệm vụ kỹ thuật phần mềm thực tế, nó đạt điểm 80,6% – chỉ thấp hơn một chút so với Claude Opus 4.6 của Anthropic với 80,8%. Khoảng cách này là nhỏ, nhưng nó cho thấy Anthropic vẫn giữ một lợi thế nhỏ trong các nhiệm vụ mã hóa thực tế mà thúc đẩy việc áp dụng trong doanh nghiệp.
Dynamic Thinking Thay Đổi Điều Gì
Gemini 3.1 Pro sử dụng tư duy động bằng mặc định, một cách tiếp cận nơi mô hình điều chỉnh lượng lý luận nội bộ nó áp dụng dựa trên độ phức tạp của mỗi yêu cầu. Các câu hỏi đơn giản nhận được câu trả lời nhanh. Các vấn đề đa bước phức tạp kích hoạt các chuỗi xử lý sâu hơn trước khi mô hình tạo ra câu trả lời của nó.
Các nhà phát triển có thể kiểm soát hành vi này thông qua tham số thinking_level trong API, đặt độ sâu tối đa của lý luận nội bộ. Điều này giải quyết một căng thẳng trong các mô hình lý luận: việc suy nghĩ mở rộng cải thiện độ chính xác trên các vấn đề khó nhưng thêm độ trễ và chi phí cho các truy vấn đơn giản. Tư duy động cố gắng tự động hóa sự đánh đổi đó.
Tính năng này phản ánh một sự thay đổi rộng lớn hơn trong ngành công nghiệp. Các mô hình o-series của OpenAI đã giới thiệu lý luận chuỗi suy nghĩ như một chế độ có thể chọn. Claude của Anthropic sử dụng tư duy mở rộng như một tính năng tùy chọn. Cách tiếp cận của Google trong việc làm cho nó trở thành mặc định – với cường độ có thể thay đổi – đặt cược rằng hầu hết người dùng sẽ thích để mô hình quyết định suy nghĩ sâu đến mức nào thay vì tự quản lý quyết định đó.
Thị Trường Cạnh Tranh Siết Chặt
Gemini 3.1 Pro đến trong một thị trường nơi vị trí dẫn đầu về điểm chuẩn thay đổi hàng tháng. Gemini 3 của Google đã kích hoạt một “mã đỏ” tại OpenAI đã sản xuất GPT-5.2 trong ít hơn một tháng. Anthropic đã phát hành các bản cập nhật Claude với tốc độ tăng tốc. Mỗi bản phát hành thu hẹp khoảng cách giữa các mô hình, khiến việc lựa chọn giữa các nền tảng ngày càng phụ thuộc vào hệ sinh thái và giá cả hơn là khả năng thô.
Lợi thế của Google vẫn là phân phối. Gemini 3.1 Pro được tích hợp trực tiếp vào các sản phẩm được sử dụng bởi hàng trăm triệu người: Gmail, Docs, Search và các tính năng Trí Tuệ Cá Nhân kết nối mô hình với dữ liệu cá nhân của người dùng. Mô hình này cũng cung cấp năng lượng cho Gemini Enterprise và Gemini CLI, cung cấp cho các nhà phát triển và doanh nghiệp truy cập thông qua các công cụ họ đã sử dụng.
Đối với các nhà phát triển chọn giữa các mô hình tiên phong, quyết định về giá cả đã trở nên dễ dàng hơn. Ở mức 2 đô la cho mỗi triệu token đầu vào, Gemini 3.1 Pro thấp hơn so với giá cả của OpenAI và Anthropic cho khả năng tương đương. Việc nâng cấp miễn phí từ 3 Pro loại bỏ mọi ma sát di chuyển cho người dùng hiện tại.
Các lợi ích lý luận quan trọng nhất đối với các ứng dụng đại lý – các hệ thống AI lên kế hoạch, thực hiện các nhiệm vụ đa bước và sử dụng công cụ tự động. ARC-AGI-2 đặc biệt kiểm tra loại nhận dạng mẫu mới mà các đại lý cần khi gặp phải các vấn đề mà dữ liệu đào tạo của họ không bao gồm. Một mô hình đạt điểm 77,1% trên bài kiểm tra đó xử lý các tình huống không quen thuộc đáng tin cậy hơn nhiều so với một mô hình đạt điểm 31,1%.
Liệu những lợi ích điểm chuẩn này có chuyển thành cải thiện thực tế tỷ lệ thuận hay không là câu hỏi mà Google sẽ cần phải trả lời trong những tuần tới. Các điểm chuẩn捕捉 các khả năng cụ thể dưới điều kiện kiểm soát; trải nghiệm người dùng thực tế phụ thuộc vào cách mô hình hoạt động trên phạm vi không thể đoán trước của các nhiệm vụ mà mọi người ném vào nó. Sự tăng trưởng ARC-AGI-2 cho thấy 3.1 Pro xử lý tính mới tốt hơn bất kỳ mô hình nào trước đó. Những gì người dùng làm với khả năng đó sẽ quyết định liệu các con số có quan trọng hay không.










