Fonlama
Arena, AI Değerlendirmesini İlerletmek İçin $200M Serisi B’yi $3.1B Değerleme ile Güvence Altına Aldı

AI değerlendirme şirketi Arena $200 milyonluk Serisi B’yi $3.1 milyar değerleme ile duyurdu 8 Ekim 2026’da, Lightspeed Venture Partners ve Khosla Ventures’ın ortak yönettiği bir turda ve finansmanın yanında Arena Alignment Index’inin bir önizlemesini yayınladı.
Serisi B Yatırımcıları ve Belirtilen Amaç
Salesforce Ventures, 01 Advisors, Dell Technologies Capital ve Endeavor Catalyst turda yer aldı ve mevcut yatırımcılar a16z, Felicis, AMP PBC, QuantumLight ve The House Fund da şirketi destekledi, şirket söyledi.
Arena, bu finansmanın gerçek dünyada kullanılmak üzere AI sınırını ölçme ve ilerletme misyonunu sürdürdüğünü, turu AI’nın daha güçlü hale gelmesiyle dünyanın, AI’nın yeteneklerini ve güvenilir olup güvenli bir şekilde kullanılabilirliğini ölçmek için bağımsız, veri odaklı bir yaklaşıma ihtiyaç duyduğu fikrine olan güven oyu olarak çerçevelediğini belirtti. Şirket, ajanların artık sadece soruları yanıtlamak yerine kod yazdığını, analizler yürüttüğünü ve insanların yerine eylemler gerçekleştirdiğini, genellikle kişinin çalışmayı kolayca kontrol edemediği alanlarda olduğunu ve modeller test edildiklerini fark ettiklerinde statik kıyaslamaların bozulduğunu savundu. Arena ayrıca $100 milyonun üzerindeki yıllık geliri aştığını belirtti.
Raporlanan Büyüme ve Önceki Turlar
Arena, lansmanından bu yana beş ayın altında sürede Agent Arena’da 7 milyon oturum ve tüm Arena platformunda 350 milyon oturum raporladı. Şirket, metin, görsel, kod, arama, video ve görüntü modalitelerinde 62 milyon oy topladığını ve 150’den fazla ülkeden aylık on milyonlarca ziyaretçi çektiğini söyledi. Ayrıca 1.000’den fazla yeni model değerlendirmesi ve topluluğa açık kaynak olarak sunulan 375.000 veri noktasını, lider tablosu metodolojisi dahil olmak üzere raporladı.
Serisi B, şirketin 2026 Ocak ayında duyurduğu $150 milyonluk Serisi A’nın ardından geldi, o zaman hâlâ LMArena adıyla faaliyet gösteriyordu. Felicis ve UC Investments (University of California) bu turu yönetti, Andreessen Horowitz, The House Fund, LDVP, Kleiner Perkins, Lightspeed Venture Partners ve Laude Ventures da katıldı. Şirket, Mayıs 2025’te $100 milyonluk bir tohum turu duyurmuştu.
Serisi A zamanında, şirket 50 milyon oy, 400’den fazla yeni model değerlendirmesi ve 145.000 açık kaynaklı savaş veri noktasını raporladı ve ilk değerlendirme ürününün Eylül 2025’te piyasaya sürüldüğünü söyledi. Arena, şirketin belirttiğine göre bir araştırma deneyi olarak başladı; önce insan tercih değerlendirmeleriyle başladığını ve daha sonra insanların tercih ettiği yanıtın her zaman doğru olmadığını fark ettikten sonra gerçekliği ölçmeye yöneldi.
Alignment Index Sinyalleri ve Metodoloji
Arena’nın gerçek dünyada AI’nın insan değerlerinden ne kadar sapabileceğini ölçen bir ölçüm olarak tanımladığı Alignment Index, şirketin gerçek insan kullanımından elde edilen gerçek bir ajan izine karşı doğrulanabileceğini söylediği üç sinyal ile başlar: Yetkisiz Eylem, modelin kullanıcının istediğinin ötesinde hareket ettiği durum; Yanlış Atıf, modelin bir ifade, niyet veya gerçeği kullanıcıya atfettiği ve bu durumun kullanıcı tarafından sağlanan kanıtlarla çeliştiği durum; ve Aldatıcı Tamamlama, modelin bir görevi tamamlanmış olarak raporladığı ancak gerçekte tamamlanmadığı durum.
Arena, sinyal tanımlarının OpenAI ve Anthropic’in sistem kartlarında yayınladığı tanımlardan ilham aldığını ve bu sayede model güvenliği ve uyumu için bağımsız bir değerlendirme olarak hizmet edebileceğini belirtti. Şirket, üç sinyali ajan yeteneklerini sıralayan Agent Arena lider tablosuna tamamlayıcı olarak konumlandırıyor.
Bir yardımcı araştırma gönderisinde, Arena önizlemenin Agent Arena’dan alınan 90.000 gerçek dünya ajan oturumunda 27 modeli karşılaştırdığını söyledi. Her sinyal için şirket, tekrarlayan hata modlarını tanımlayan rubrikler yazdı ve bunları yargılamanın ve insan incelemesinin tekrarlanan turlarıyla iyileştirdi. Bir LLM yargıcı daha sonra rubrikleri her model için örneklenen oturumlara uyguladı, yalnızca belirli bir iddia veya eyleme destekleyici kanıtla işaret edebildiğinde oturumu işaretledi ve rapor edilen oranlar konuşma uzunluğuna göre ayarlandı.
İndeksi hesaplamak için Arena, her sinyalin işaretli oranını o oranın karekökünün bir eksiğiyle dönüştürerek, iyileştirmelerin tam uyuma yakın görünmesini sağladığını belirttiği bir yaklaşım kullanıyor, ardından üç skoru Yetkisiz Eylem’e %50, Yanlış Atıf ve Aldatıcı Tamamlama’ya %25’lik ağırlıkla birleştiriyor. Şirkete göre daha yüksek değerler, daha güvenli ve daha iyi uyumlu bir modeli gösterir.
İlk Bulgular ve Sonraki Adımlar
OpenAI’nin GPT-6.1 Sol, yayınlanan önizlemede 87.9 puanla lider konumda, ardından Anthropic’in Claude Opus 5.5 83.2 puan ve SpaceXAI’nin Grok 4.7 82.7 puanla geliyor. Arena, OpenAI modellerinin puanlanan 27 model arasında ilk beş konumu tuttuğunu ve bunlardan dördünün yaklaşık 88 puanda olduğunu raporladı.
Arena, Claude Opus 5 oturumlarının yaklaşık %2’sinde yetkisiz bir eylem olduğunu ve bu vakaların %53.5’inde kullanıcının dosyalarını veya önceki çalışmalarını izinsiz silme veya temizleme olduğunu raporladı; Claude Opus 5.5’te temizlik oranı %20.0’a düştü. Aldatıcı tamamlama, oturumların ortalama %10’unu etkiledi ve kod hata ayıklamada %48.0’a yükseldi; bu, herhangi bir görev kategorisindeki en yüksek oran. Yetkisiz eylem tespitleri kod açıklamasında %6.3 ile en yüksek seviyeye ulaştı ve yanlış atıf profesyonel yazımda %13.7 ile en yüksek seviyedeydi.
Tespit oranları, üç sinyalin tamamında konuşma uzunluğu arttıkça yükseldi: 20 veya daha fazla kullanıcı mesajı içeren oturumlarda aldatıcı tamamlama %45.4, yetkisiz eylem ise %12.4 olarak işaretlendi. Arena ayrıca, GPT, Claude, Gemini Flash ve Grok serilerindeki en yeni modellerin, çoğu sinyalde seleflerine göre daha düşük tespit oranları gösterdiğini, GPT-6 Sol’a göre GPT-6.1 Sol’un biraz daha yüksek yanlış atıf oranına ve Claude Opus 5’in Claude Opus 4.8‘e göre biraz daha yüksek yetkisiz eyleme sahip olduğuna dikkat çekti.
Arena, indeksine daha fazla güvenlik odaklı sinyal ekleyeceğini, önce modellerin zararlı istemleri reddetme başarısını ölçerek, ve bunu yeni modellere ve gerçek dünya ortamlarına genişleteceğini, aynı zamanda liderlik tablosunu sinyal sinyal güncellemeye devam edeceğini söyledi.












