Yapay zeka modelleri ve platformları
MiniMax M2.7’yi Açık Kaynaklı Hale Getirdi, Kendini Geliştiren Bir Ajans Modeli

Çinli AI şirketi MiniMax, 229 milyar parametreli bir Mixture-of-Experts modeli olan MiniMax M2.7’nin ağırlıklarını açık kaynaklı olarak yayınladı. Bu model, kendi geliştirme döngüsüne katıldı – şirketin dediğine göre, otonom AI self-evolusyonuna doğru ilk adım.
Orijinal olarak 18 Mart’ta duyurulan MiniMax M2.7, şimdi Hugging Face’de SGLang, vLLM, Transformers ve NVIDIA NIM için dağıtım desteği ile ücretsiz olarak mevcuttur. Model, SWE-Pro’da %56,22 ve Terminal Bench 2’de %57,0 puan almaktadır ve bu, onu gerçek dünya yazılım mühendisliği görevleri için en güçlü açık kaynaklı LLM’ler arasında yer almasını sağlamaktadır.
Modelin Kendisini Nasıl Geliştirdiği
M2.7 ile ilgili en önemli iddia, kendi iterasyonunda oynadığı roldür. MiniMax, modelin bir iç sürümünü bir program iskelesini optimize etmekle görevlendirdi ve bunu 100’den fazla tur için otonom olarak çalıştırdı. Bu süreçte, M2.7 hata yollarını analiz etti, iskele kodunu değiştirdi, değerlendirmeleri çalıştırdı ve her değişikliği保持 etmek veya geri almak için karar verdi.
Model, kendi başına optimizasyonlar keşfetti: sistematik olarak sıcaklık ve frekans cezası gibi optimum örnek parametreleri aradı, iş akışı rehberleri gibi otomatik olarak aynı hata kalıplarını dosyalar arasında bir düzeltme sonrasında kontrol eden iş akışı rehberleri tasarladı ve iskele aracının döngüsüne döngü algılamayı ekledi. MiniMax, bu otonom süreçten internal değerlendirme setlerinde %30’luk bir performans iyileşmesi rapor etmektedir.
MiniMax’ın pekiştirme öğrenimi ekibinde, M2.7 artık günlük iş akışlarının %30 ila %50’sini uçtan uca yönetmektedir. Araştırmacılar, yalnızca kritik kararlar için etkileşime girerken, model literatür incelemesi, deney takibi, veri boru hatları, hata ayıklama ve birleştirme isteklerini yönetmektedir.
MiniMax ayrıca M2.7’yi MLE Bench Lite üzerinde test etti, OpenAI’nin 22 makine öğrenimi yarışmasını tek bir A30 GPU üzerinde çalıştıran bir dizi yarışmadır. Üç 24 saatlik deneme boyunca, modelin en iyi çalışması 9 altın madalya, 5 gümüş madalya ve 1 bronz madalya üretti. Ortalama madalya oranı %66,6, Gemini 3.1 ile eşdeğerdi ve yalnızca Opus 4.6 (%75,7) ve GPT-5.4’ten (%71,2) sonra geldi.
Mühendislik ve Ofis Çalışmaları Üzerindeki Benchmark Performansı
Yazılım mühendisliği benchmark’lerinde, M2.7 kapanmış kaynaklı ön models ile eşdeğer veya onlara yaklaşmaktadır. SWE-Pro’da %56,22 puanı, birden fazla programlama dilini kapsayan günlükleri analiz, hata giderme, kod güvenliği incelemesi ve ML iş akışı hatalarını içeren bir benchmark’te GPT-5.3-Codex ile eşdeğerdir. VIBE-Pro’da %55,6 puan almıştır ve SWE Çok Dilli’de %76,5 ve Çoklu SWE Bench’de %52,7 puan almıştır.
AI kodu oluşturucular ötesinde, MiniMax M2.7’yi profesyonel ofis görevleri için konumlandırdı. 45 modelin alan uzmanlığını değerlendiren GDPval-AA’da M2.7, açık kaynaklı modeller arasında en yüksek ELO puanı olan 1495’i elde etti – yalnızca Opus 4.6, Sonnet 4.6 ve GPT-5.4’ten sonra geldi. Toolathon’da %46,3’lük bir doğruluk oranı elde etti ve MiniMax’ın MM Claw değerlendirmesinde 40 kompleks beceri (her biri 2.000 tokeni aşan) boyunca %97’lik bir beceri uyumluluk oranını korudu.
Model, MiniMax’ın “Aracılık Takımları” olarak adlandırdığı şey aracılığıyla yerli çoklu ajans işbirliğini desteklemektedir – burada birden fazla model örneği, görevleri birlikte çalışırken ayrı rol kimliklerini korur. Bu yetenek, ajansların kararlı rol sınırları ve ajanslar arasında karşıt akıl yürütme gerektiren iş otomasyonu senaryolarına yöneliktir.
MiniMax, M2.7’yi bir Mixture-of-Experts mimarisi üzerine inşa etti, yani her bir çıkarım geçişinde yalnızca toplam 229 milyar parametresinin bir alt kümesi etkinleşir. Bu, modeli, benzer çıkış kalitesine sahip bir yoğun modelden daha ucuz ve daha hızlı hizmet vermeyi sağlar – geliştiricilerin modelleri yerel olarak çalıştırmak veya sınırlı altyapıda çalıştırmak istedikleri durumlarda önemli bir consideration.
MiniMax ayrıca, ajan etkileşimlerini gerçek zamanlı görsel geri bildirim ile bir web GUI’sine yerleştiren ve büyük dil modellerini üretkenlikten etkileşimli eğlenceye genişletme konusundaki ilgisini gösteren OpenRoom adlı bir etkileşimli demo’yu açık kaynaklı olarak yayınladı.
Çıkış, ajan becerileri manzarasına başka bir rekabetçi seçenek ekliyor – Meta, Alibaba ve DeepSeek’in sınırlarını genişlettiği bir manzara. Bir modelin, kendi halefini geliştirmeye anlamlı bir şekilde katkıda bulunması – self-evolusyon açısı – masih erken aşamada, ancak M2.7, bu sürecin nasıl çalıştığına dair ilk somut veri noktalarını sunuyor: 100’den fazla otonom optimizasyon turundan %30’luk bir internal benchmark kazancı, döngüde hiçbir insan müdahalesi olmadan.












