Yapay zeka modelleri ve platformları

OpenAI ve Anthropic, AI Silah Yarışı Yoğunlaşırken Çift Model Sürprizi Yaptı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

OpenAI ve Anthropic, bugün birbirlerinin ardından yeni amiral gemisi modellerini yayınladı. Aynı zamanda OpenAI, bir entreprise ajan platformu ve Perplexity, bir çok model araştırma özelliği tanıttı. Bugün, genellikle bir haftada üretilenden daha önemli AI ürün duyurularını tek bir öğleden sonra içinde getirdi.

Ne geldi ve ne anlama geliyor.

Anthropic’in Opus 4.6’sı: Ajan Takımları ve Bir Milyon Token Penceresi

Anthropic, Claude Opus 4.6 adlı en yetenekli modelini iki önemli özellik ile yayınladı: bir milyon token bağlam penceresi ve Ajan Takımları adlı yeni bir özellik.

Bağlam penceresi daha büyük bir teknik başarıdır. Bir milyon token ile Opus 4.6, tek bir istemde yaklaşık 3.000 sayfa metin işleyebilir – önceki sürümünün 256.000 token limitinin dört katı. 128.000 token çıktı desteği ile birlikte, model artık tüm kod tabanlarını, düzenleyici dosyalarını veya araştırma koleksiyonlarını parçalamadan veya özetlemeden işleyebilir.

Ajan Takımları, Claude Code’da mevcuttur ve birden fazla Claude örneğinin bir paylaşılan kod tabanında paralel olarak çalışmasına olanak tanır. Tek bir ajanın görevleri sırayla gerçekleştirmesi yerine, geliştiriciler bir ajanın ön uç değişikliklerini, diğerinin testleri yazmasını ve bir diğerinin arka uç mantığını yeniden düzenleyerek aynı projede eş zamanlı olarak çalışan takımlar oluşturabilir.

Opus 4.6 ayrıca, modelin bir istemde ne kadar akıl yürütme çabası yatırması gerektiğini ayarlayabilen adaptif düşünme özelliği tanır. Basit sorular hızlı yanıtlar alır; karmaşık problemler daha derin ve genişletilmiş düşünceyi tetikler. Geliştiriciler bunu dört seviyede – düşük, orta, yüksek ve maksimum – çaba kontrolleri aracılığıyla ayarlayabilir.

Testlerde Opus 4.6, agentic kodlama için Terminal-Bench 2.0’de en yüksek puanı alır ve Humanity’s Last Exam adlı karmaşık akıl yürütme değerlendirmesinde liderlik eder. Anthropic, GDPval-AA değerlendirmesinde GPT-5.2’ye karşı 144 puanlık Elo avantajı ve Opus 4.5’e karşı 190 puanlık iyileşme iddia eder.

API fiyatları değişmedi ve girişte bir milyon token için 5 dolar ve çıkışta bir milyon token için 25 dolar olarak kaldı. Ancak 200.000 tokeni aşan istemler için premium oran 10/37,50 dolar olarak uygulanır.

Anthropic, ayrıca Claude’un Microsoft PowerPoint’ta bir araştırma önizlemesini duyurdu. Model, mevcut slayt düzenlerini ve şablonlarını okuyabilir ve sunumları oluşturabilir veya düzenleyebilir ve marka biçimlendirmesini koruyabilir.

OpenAI’nin GPT-5.3-Codex’i: Kendisini Oluşturan Model

Anthropic’in duyurusundan dakikalar sonra OpenAI, GPT-5.3-Codex adlı en yetenekli kodlama modelini tanıttı. Bu sürüm, GPT-5.2-Codex’in ön plana çıkan kodlama performansını GPT-5.2’nin akıl yürütme ve profesyonel bilgi yetenekleriyle birleştirdi ve ayrıca %25 daha hızlı çalışıyor.

En önemli iddia: GPT-5.3-Codex, kendisini oluşturdu. OpenAI’nin Codex ekibi, modelin erken sürümlerini kendi eğitim süreci boyunca kullandı – eğitim çalıştırmalarını hatalardan arındırdı, dağıtım altyapısını yönetti ve değerlendirme sonuçlarını teşhis etti. Bu, bir modelin kendi gelişiminde etkili olduğu ilk kamu açıklaması ve hem verimlilik hem de güvenlik konusunda önemli soruları gündeme getiriyor.

GPT-5.3-Codex, SWE-Bench Pro ve Terminal-Bench gibi gerçek dünya yazılım mühendisliği görevlerini değerlendiren testlerde endüstri lideri puanlar elde etti. Model, uzun süren görevleri işleyebilir – araştırma, araç kullanımı ve karmaşık yürütme – ve kullanıcılar, görevler devam ederken modelle etkileşime girebilir ve bağlamını kaybetmez – bir meslektaşla işbirliği yapma gibidir.

Model, şu anda tüm ChatGPT paid plan kullanıcılarına Codex uygulaması, CLI, IDE uzantısı ve web arayüzü aracılığıyla kullanılabilir. API erişimi yakında sağlanacak.

Geliştiriciler, AI kod oluşturucularını seçerken, rekabetçi resim şimdi net bir şekilde tanımlanmıştır: Opus 4.6, ajan koordinasyonu ve uzun bağlam çalışması liderliğini sürdürürken, GPT-5.3-Codex, hızı ve entegre akıl yürütme vurgulamaktadır. Her iki model de, çakışan testlerde en yüksek puanları iddia etmektedir ve Cursor ve Apple’ın Xcode gibi araçlar her iki modeli de desteklemektedir, böylece geliştiriciler serbestçe geçiş yapabilir.

OpenAI Frontier: Kuruluş Ajanlarına Özel Platform

Model lansmanıyla birlikte OpenAI, Frontier adlı bir entreprise platformunu tanıttı. Frontier, AI ajanlarının oluşturulmasına, dağıtılmasına ve yönetilmesine olanak tanır. Platform, veritabanlarına, CRM sistemlerine, HR platformlarına, biletleme araçlarına ve diğer iş uygulamalarına bağlanır ve ardından AI ajanlarının bu uygulamalar arasında işlemleri gerçekleştirmesine izin verir.

OpenAI, Frontier’ı “kuruluş için bir anlamsal katman” olarak tanımladı – burada insan çalışanları ve AI ajanları aynı platformda, paylaşılan veri erişimini ve güvenlik kontrollerini paylaşarak çalışırlar. Ajanlar, çalışanlara benzer kimliklere, paylaşılan kurumsal bağlama ve kuruluş düzeyinde izinlere sahiptir.

Platform, model-bağımsızdır – şirketler, OpenAI’nin modelleri üzerine inşa edilmiş ajanları, Google (GOOGL ), Microsoft ve Anthropic’ten gelen ajanlarla birlikte yönetebilir. İlk müşteriler arasında Intuit (INTU ), State Farm, Thermo Fisher ve Uber bulunmaktadır.

Frontier, OpenAI’yi doğrudan Salesforce’ın Agentforce ve ServiceNow’ın AI ajanları gibi entreprise platformlarıyla rekabete sokar. Fark, OpenAI’nin model katmanından yukarıya inşa etmekte olmasıdır, oysa mevcut şirketler AI’yi mevcut iş akış araçlarına eklemektedir. Şirketlerin AI altyapısını AI sağlayıcılarından mı yoksa yazılım satıcılarından mı aldıkları, 2026’da entreprise AI rekabetini tanımlayacaktır.

Perplexity’nin Model Konseyi: Üç Model, Bir Yanıt

Perplexity, Model Konseyi adlı bir özelliği tanıttı. Bu özellik, aynı istemi üç model üzerinde aynı anda çalıştırır – Claude Opus, GPT ve Gemini – ve ardından bir sentezleyici model, bu modellerin çıktılarını tek bir yanıtta birleştirmektedir. Bu yanıt, anlaşma ve anlaşmazlık alanlarını işaretler.

Resim: Perplexity

Öncül, hiçbir tek modelin tüm istekler boyunca güvenilir şekilde en iyisi olmadığıdır. Üç ön plan modeli aynı yanıta ulaştığında, güven yüksek olur. Çelişkiler olduğunda, kullanıcılar daha derin bir inceleme yapmalıdır. Model Konseyi, Max abonelerine açıktır ve yatırım araştırması, stratejik analiz ve karmaşık karar alma için konumlandırılmıştır.

Bu özellik, Perplexity’nin temel model oluşturmak yerine çok model orkestrasyonu yoluyla farklılaşmaya yönelik stratejisini yansıtmaktadır. Ön plan AI sohbet botları arasındaki fark, bireysel testlerde daraldıkça, onların çıktılarını birleştirmek daha değerli olabilir.

Bunun Tüm Anlamı

Bu sürümler, AI rekabetinin model yeteneklerinden ürün altyapısına kaydığını doğrulamaktadır. Hem OpenAI hem de Anthropic, aynı testlerde liderlik gösteren modellere sahiptir; şimdi farklılaşma, bu modellerin üzerine ne inşa edilebileceğinde yatmaktadır.

Perplexity ise, model savaşlarının nasıl birleştirildiğinden daha önemli olabileceği konusunda sessiz bir argüman sunmaktadır. Model Konseyi faydalı olduğunu kanıtlarsa, geleceğin Claude ve GPT arasında seçim yapmak değil, ikisini de kullanmak olduğunu öne sürer.

Geliştiriciler ve AI yığınlarını değerlendiren entreprises için bu, kararı daha da zorlaştırdı.

Alex McFarland yapay zeka muhabiri ve yazarıdır ve yapay zekadaki son gelişmeleri araştırıyor. Birçok yapay zeka başlangıç şirketi ve dünya çapındaki yayınlarda işbirliği yaptı.