Yapay zeka modelleri ve platformları
Gemini 3.1 Pro, Rekor Düzeyde Mantık Kazançları Sağlıyor
Google (GOOGL ), 19 Şubat’ta amiral gemisi AI modelinin bir güncellemesi olan Gemini 3.1 Pro‘yu yayınladı. Bu güncelleme, akıl yürütme performansını neredeyse ikiye katlarken, fiyatı önceki sürümle aynı kaldı.
En dikkat çekici sayı: ARC-AGI-2, modellerin tamamen yeni mantık kalıplarını çözebilme yeteneğini test eden bir benchmark’ta Gemini 3.1 Pro, %77,1 puan aldı. Gemini 3 Pro, %31,1 puan almıştı. Bu %46’lık puan artışı, herhangi bir sınır model ailesindeki en büyük tek nesil akıl yürütme kazancıdır.
Model, Google’un tüketici ve geliştirici platformlarında hemen kullanıma sunuldu. Gemini uygulamasını kullanan AI Pro ve AI Ultra planlarındaki kullanıcılar, daha yüksek kullanım limitleriyle erişime sahip olurken, geliştiriciler Gemini API aracılığıyla AI Studio, Vertex AI, Gemini CLI, Antigravity ve Android Studio’da 3.1 Pro’ya erişebilir. NotebookLM de Pro ve Ultra aboneleri için bu güncellemeyi aldı.
Fiyat, 200.000 tokenin altındaki promlar için 1 milyon girdi tokeni başına 2$ olarak kaldı ve daha uzun bağlamlar için 4$’a yükseldi. Çıkış maliyeti, 1 milyon token başına 12$ olarak belirlendi. Zaten Gemini 3 Pro’yu API aracılığıyla kullananlar için güncelleme ücretsiz oldu.
Tüm Alanlarda Benchmark Performansı
Model kartı, Gemini 3.1 Pro’nun 18 takip edilen benchmark’ın 12’sinde ilk sırada yer aldığını gösteriyor. ARC-AGI-2’nin ötesinde, öne çıkanlar arasında %94,3’lük GPQA Elmas, bir bilim akıl yürütme testi ve LiveCodeBench Pro’da 2.887 Elo puanı yer alıyor; bu, tüm sınır modelleri için rekabetçi programlama açısından en yüksek puanı temsil ediyor.
Insanlığın Son Sınavı – akademik disiplinler boyunca uzmanlardan topladığı sorulardan oluşan bir benchmark – 3.1 Pro, %44,4’e ulaştı; bu, Gemini 3 Pro’nun %37,5’ine ve GPT-5.2’nin %34,5’ine göre daha yüksek bir puan. Çok dilli MMLU benchmark’u %92,6 puan alırken, 128.000 tokenlik uzun bağlam doğruluğu %84,9 olarak kaldı.
Model, 1 milyon tokenlik girdi bağlam penceresini korur ve 64.000 tokenlik çıktı üretir; bu, tek bir oturumda tüm kod tabanlarını işleyip önemli kod blokları üretebilen AI kodlama araçlarının özelliklerini eşler.
3.1 Pro’nun lider olmadığı alanlar da dikkat çekicidir. Gerçek dünya yazılım mühendisliği görevlerini test eden SWE-Bench Verified’de %80,6 puan alır; bu, Anthropic’in Claude Opus 4.6’sının %80,8’ine çok yakın bir puan. Aradaki fark küçüktür, ancak Anthropic’in pratik kodlama görevlerinde dar bir avantajı koruduğunu gösterir.
Dinamik Düşünceyi Değiştirenler
Gemini 3.1 Pro, her bir promun karmaşıklığına bağlı olarak uyguladığı iç akıl yürütme miktarını ayarlayarak dinamik düşünceyi varsayılan olarak kullanır. Basit sorular hızlı cevaplar alırken, karmaşık çok adımlı problemler daha derin işlem zincirlerini tetikleyerek modelin yanıt üretmesini sağlar.
Geliştiriciler, API’deki thinking_level parametresini kullanarak bu davranışı kontrol edebilir ve iç akıl yürütmenin maksimum derinliğini ayarlayabilir. Bu, akıl yürütme modellerindeki bir gerilimi giderir: uzatılmış akıl yürütme, zor sorunlarda doğruluğu geliştirir ancak basit sorgular için gecikme ve maliyet ekler. Dinamik düşünce, bu ticaretin otomatikleştirilmesini amaçlar.
Bu özellik, endüstrinin daha geniş bir değişimini yansıtır. OpenAI’nin o-serisi modelleri, zincirleme düşünceyi seçilebilir bir mod olarak tanıttı. Anthropic’in Claude’u, uzatılmış düşünceyi seçime bağlı bir özellik olarak kullanır. Google’un yaklaşımı, varsayılan olarak dinamik düşünceyi kullanmak ve yoğunluğunu değiştirmektir; bu, většelerin modelin ne kadar düşünmesi gerektiğine karar vermesini istemek yerine karar vermeyi modelin kendisine bırakmayı tercih edeceği üzerine bir bahistir.
Rekabet Alanı Daralıyor
Gemini 3.1 Pro, benchmark liderliğinin aylık olarak değiştiği bir pazarda ortaya çıktı. Google’un Gemini 3’ü, OpenAI’de “kod kırmızı” alarmını tetikleyerek bir aydan kısa sürede GPT-5.2’yi üretti. Anthropic, Claude güncellemelerini hızlanan bir tempoda yayınlamaya devam ediyor. Her bir sürüm, modeller arasındaki farkı daraltıyor ve platformlar arasındaki seçimi, ham yetenek yerine ekosistem ve fiyatlandırma temelinde yapmaya bağlı hale getiriyor.
Google’un avantajı, dağıtımda kalıyor. Gemini 3.1 Pro, yüz milyonlarca insanın kullandığı ürünlerin içine doğrudan entegre ediliyor: Gmail, Docs, Search ve Kişisel Zeka özellikleri, modeli kullanıcıların kişisel verilerine bağlıyor. Model ayrıca Gemini Enterprise ve Gemini CLI‘yi güçlendirerek, geliştiricilere ve işletmelere already kullanmakta oldukları araçlar aracılığıyla erişim sağlıyor.
Geliştiriciler için, frontier modeller arasında seçim yaparken fiyat kararı daha kolay hale geldi. 1 milyon girdi tokeni başına 2$’lık fiyatıyla Gemini 3.1 Pro, OpenAI ve Anthropic’in benzer yeteneklere sahip amiral gemisi fiyatlarını geride bırakıyor. Ücretsiz 3 Pro’dan güncelleme, mevcut kullanıcılar için herhangi bir geçiş sıkıntısını ortadan kaldırıyor.
Akıl yürütme kazanımları, özellikle ajantik uygulamalar için önemlidir – planlama, çok adımlı görevleri yürütme ve araçları özerk olarak kullanan AI sistemleri. ARC-AGI-2 özellikle, ajanların eğitim verilerinin kapsamadığı sorunlarla karşılaştıklarında ihtiyaç duydukları türden yeni kalıp tanıma yeteneğini test eder. %77,1 puan alan bir model, %31,1 puan alan bir modele göre tanıdık olmayan durumlara çok daha güvenilir bir şekilde yanıt verir.
Bu benchmark kazanımlarının gerçek dünya iyileştirmelerine dönüşüp dönüşmeyeceği, Google’un önümüzdeki haftalar boyunca cevaplayacağı bir soru. Benchmark’lar, belirli yetenekleri kontrol edilen koşullar altında yakalar; ancak kullanıcı deneyimi, modelin insanların kendisine verdiği geniş ve öngörülemez görev yelpazesi boyunca nasıl performans gösterdiğine bağlıdır. ARC-AGI-2’deki atılım, 3.1 Pro’nun önceki herhangi bir modelden daha iyi yeni durumlarla başa çıktığını gösterir. Kullanıcıların bu yeteneği nasıl kullanacağı, sayıların önemli olup olmadığını belirleyecektir.










