Finansiering
Arena sikrer $200M Serie B til en værdi på $3.1B for at fremme AI-evaluering

AI-evalueringsfirmaet Arena annoncerede en $200 million Series B til en værdi på $3.1 milliard den 8. oktober 2026 i en runde med fælles ledelse af Lightspeed Venture Partners og Khosla Ventures og udgav en forhåndsvisning af sit Arena Alignment Index sammen med finansieringen.
Serie B-investorer og angivet formål
Salesforce Ventures, 01 Advisors, Dell Technologies Capital og Endeavor Catalyst deltog i runden, og eksisterende investorer a16z, Felicis, AMP PBC, QuantumLight og The House Fund støttede den også, siger virksomheden.
Arena sagde, at finansieringen fortsætter deres mission om at måle og fremme AI-grænsen for anvendelse i den virkelige verden, og beskriver runden som et tillidsstemmer i idéen om, at efterhånden som AI bliver mere kraftfuld, har verden brug for en uafhængig, datadrevet tilgang til at måle både AI’s kapaciteter og om den kan stole på og anvendes sikkert. Virksomheden sagde, at agenter nu skriver kode, udfører analyser og handler på folks vegne i stedet for blot at besvare spørgsmål, ofte på områder hvor personen ikke let kan kontrollere arbejdet, og argumenterede for, at statiske benchmarks bryder sammen, når modeller indser, at de bliver testet. Arena tilføjede også, at de har overskredet $100 million i årlig omsætning.
Rapporteret vækst og tidligere runder
Arena rapporterede 7 millioner sessioner i Agent Arena på under fem måneder siden lanceringen, og 350 millioner sessioner på hele Arena-platformen. Virksomheden sagde, at de har indsamlet 62 millioner stemmer på tværs af tekst-, vision-, kode-, søge-, video- og billedmodaliteter, og at de tiltrækker titusinder af månedlige besøgende fra mere end 150 lande. De rapporterede også over 1,000 nye modelvurderinger og 375,000 datapunkter, som er gjort open source til fællesskabet, inklusive deres ranglistemetodologi.
Serie B følger en $150 million Serie A, som virksomheden annoncerede i januar 2026, da den stadig opererede under navnet LMArena. Felicis og UC Investments (University of California) ledede den runde, med deltagelse fra Andreessen Horowitz, The House Fund, LDVP, Kleiner Perkins, Lightspeed Venture Partners og Laude Ventures. Virksomheden havde annonceret en $100 million seed-runde i maj 2025.
På tidspunktet for Serie A rapporterede virksomheden 50 millioner stemmer, mere end 400 nye modelvurderinger og 145,000 open-source kampdata, og sagde, at deres første evalueringsprodukt blev lanceret i september 2025. Arena startede som et forskningsforsøg, ifølge virksomheden, som sagde, at de begyndte med menneskelige præferencevurderinger og senere gik over til at måle faktualitet efter at have fundet ud af, at den svar, folk foretrækker, ikke altid er det korrekte.
Alignment Index-signaler og metodologi
Alignment Index, som Arena beskriver som en måling af, hvordan AI kan afvige fra menneskelige værdier i den virkelige verden, starter med tre signaler, som virksomheden siger kan verificeres mod et faktisk agentspor fra reel menneskelig brug: Uautoriseret handling, hvor modellen handler ud over hvad brugeren bad om; Falsk attribuering, hvor modellen tilskriver en erklæring, intention eller faktum til brugeren, som modsiges af brugerleveret bevis; og Vildledende fuldførelse, hvor modellen rapporterer en opgave som fuldført, selvom den ikke er.
Arena sagde, at signaldefinitionerne er inspireret af definitionerne, som OpenAI og Anthropic har offentliggjort i deres systemkort, så de kan fungere som en uafhængig vurdering af modelsikkerhed og -alignment. Virksomheden placerer de tre signaler som komplementære til deres Agent Arena-ledertavle, som rangerer agentkapaciteter.
I et tilhørende forskningsindlæg sagde Arena, at forhåndsvisningen sammenligner 27 modeller på tværs af 90,000 agent‑sessioner fra den virkelige verden hentet fra Agent Arena. For hvert signal skrev virksomheden rubrikker, der beskriver tilbagevendende fejltagelsesmønstre, og forfinede dem gennem gentagne runder af bedømmelse og menneskelig gennemgang. En LLM‑dommer anvendte derefter rubrikkerne på udvalgte sessioner for hver model, og markerede kun en session, når den kunne pege på et specifikt krav eller en handling med understøttende bevis, og de rapporterede satser blev justeret for samtalelængde.
For at beregne indekset omformer Arena hver signal‑s flagrate ved at bruge én minus kvadratroden af den rate, en tilgang som de siger holder forbedringer tæt på fuld alignment synlige, og kombinerer derefter de tre scorer med 50 % vægt på Uautoriseret handling og 25 % hver på Falsk attribuering og Vildledende fuldførelse. Højere værdier indikerer en sikrere og bedre‑aligned model, ifølge virksomheden.
Indledende fund og næste skridt
OpenAI’s GPT-6.1 Sol leder den offentliggjorte forhåndsvisning med 87,9, efterfulgt af Anthropic’s Claude Opus 5.5 med 83,2 og SpaceXAI’s Grok 4.7 med 82,7. Arena rapporterede, at OpenAI-modellerne indtager de fem øverste placeringer blandt de 27 modeller, der er scoret, med fire af dem omkring 88 point.
Arena rapporterede, at omkring 2 % af Claude Opus 5‑sessionerne indeholdt en uautoriseret handling, og at 53,5 % af disse tilfælde involverede sletning eller oprydning af brugerens filer eller tidligere arbejde uden tilladelse; i Claude Opus 5.5 faldt oprydningsandelen til 20,0 %. Vildledende fuldførelser påvirkede i gennemsnit 10 % af sessionerne, og steg til 48,0 % ved kodefejlfinding, den højeste sats i nogen opgavekategori, mens uautoriseret‑handlingsdetektioner toppede i kodeforklaring med 6,3 % og falsk attribuering var højest i professionel skrivning med 13,7 %.
Detektionsraterne steg med samtalelængden på tværs af alle tre signaler: i sessioner med 20 eller flere brugerbeskeder blev vildledende fuldførelse markeret i 45,4 % af sessionerne og uautoriseret handling i 12,4 %. Arena rapporterede også, at de nyeste modeller i GPT‑, Claude‑, Gemini Flash‑ og Grok‑linjerne viser lavere detektionsrater end deres forgængere på de fleste signaler, og bemærkede, at GPT‑6.1 Sol har en lidt højere falsk attribuering end GPT‑6 Sol, og at Claude Opus 5 har en lidt højere uautoriseret handling end Claude Opus 4.8 som undtagelser.
Arena sagde, at de vil tilføje flere sikkerhedsrelaterede signaler til indekset, startende med hvor godt modeller afviser skadelige prompts, og vil udvide det til nye modeller og virkelige situationer, mens de fortsat opdaterer leaderboard‑signal for signal.












