펀딩
Arena, AI 평가를 진전시키기 위해 $200백만 시리즈 B를 $3.1십억 가치로 확보

AI 평가 기업 Arena 발표했습니다 $200 백만 시리즈 B를 $3.1 십억 가치로 2026년 10월 8일에, Lightspeed Venture Partners와 Khosla Ventures가 공동 주도한 라운드에서, 그리고 자금 조달과 함께 Arena Alignment Index 미리보기를 공개했습니다.
시리즈 B 투자자 및 명시된 목적
Salesforce Ventures, 01 Advisors, Dell Technologies Capital, 그리고 Endeavor Catalyst가 라운드에 참여했으며, 기존 투자자 a16z, Felicis, AMP PBC, QuantumLight 및 The House Fund도 이를 지원했다고 회사는 밝혔습니다.
Arena는 이번 자금 조달이 실제 활용을 위한 AI 최전선을 측정하고 발전시키는 사명을 지속한다고 밝혔으며, 이번 라운드를 AI가 점점 강력해짐에 따라 세계가 AI의 역량과 신뢰성 및 안전한 사용 여부를 측정할 독립적이고 데이터 기반의 접근 방식을 필요로 한다는 아이디어에 대한 신뢰 표명으로 설명했습니다. 회사는 에이전트가 이제 코드를 작성하고, 분석을 수행하며, 단순히 질문에 답하는 것이 아니라 사람을 대신해 행동을 취하고 있으며, 이는 사용자가 작업을 쉽게 검증하기 어려운 영역에서 종종 발생한다고 말하고, 모델이 테스트되고 있음을 인식하면 정적 벤치마크가 무너진다고 주장했습니다. Arena는 또한 연간 매출이 $100 백만을 초과했다고 밝혔습니다.
보고된 성장 및 이전 라운드
Arena는 출시 후 5개월 미만의 기간 동안 Agent Arena에서 7백만 세션을, 전체 Arena 플랫폼에서는 3억 5천만 세션을 기록했다고 보고했습니다. 회사는 텍스트, 비전, 코드, 검색, 비디오 및 이미지 모달리티 전반에 걸쳐 6천2백만 표를 수집했으며, 150개국 이상에서 매월 수천만 명의 방문자를 유입한다고 밝혔습니다. 또한 1,000개가 넘는 새로운 모델 평가와 37만 5천 개의 데이터 포인트를 커뮤니티에 오픈소스로 제공했으며, 여기에는 리더보드 방법론이 포함됩니다.
시리즈 B는 회사가 2026년 1월에 발표했다 $150 백만 시리즈 A에 이어 진행되었습니다. 당시 회사는 아직 LMArena라는 이름으로 운영되고 있었습니다. Felicis와 UC Investments(University of California)가 해당 라운드를 주도했으며, Andreessen Horowitz, The House Fund, LDVP, Kleiner Perkins, Lightspeed Venture Partners 및 Laude Ventures가 참여했습니다. 회사는 2025년 5월에 $100 백만 시드 라운드를 발표한 바 있습니다.
시리즈 A 당시, 회사는 5천만 표, 400개가 넘는 새로운 모델 평가 및 14만 5천 개의 오픈소스 전투 데이터 포인트를 보고했으며, 첫 평가 제품이 2025년 9월에 출시되었다고 밝혔습니다. Arena는 연구 실험으로 시작했으며, 초기에는 인간 선호도 평가로 시작해 이후 사람들이 선호하는 응답이 항상 정확하지 않다는 사실을 발견하고 사실성 측정으로 전환했다고 회사는 말합니다.
정렬 지표 신호 및 방법론
Arena가 AI가 실제 세계에서 인간 가치에서 얼마나 벗어날 수 있는지를 측정하는 지표로 설명하는 Alignment Index는 실제 인간 사용으로부터 얻은 에이전트 트레이스를 기준으로 검증할 수 있다고 회사가 말하는 세 가지 신호로 시작합니다: Unauthorized Action(사용자가 요청한 범위를 넘어 모델이 행동하는 경우), False Attribution(모델이 사용자에게 진술, 의도 또는 사실을 귀속시키지만 사용자 제공 증거와 모순되는 경우), 그리고 Deceptive Completion(모델이 작업이 완료되지 않았음에도 완료된 것으로 보고하는 경우).
Arena는 신호 정의가 OpenAI와 Anthropic이 시스템 카드에 공개한 정의에서 영감을 받았으며, 이를 통해 모델 안전성과 정렬에 대한 독립적인 평가를 제공할 수 있다고 밝혔습니다. 회사는 이 세 가지 신호를 에이전트 능력을 순위 매기는 Agent Arena 리더보드와 보완적인 요소로 위치시킵니다.
Arena는 동반 연구 게시물에서 미리보기가 Agent Arena에서 추출한 90,000개의 실제 에이전트 세션을 기반으로 27개 모델을 비교한다고 밝혔습니다. 각 신호마다 회사는 반복되는 실패 유형을 설명하는 루브릭을 작성하고, 판정 및 인간 검토 라운드를 거쳐 이를 다듬었습니다. 이후 LLM 판사가 각 모델의 샘플 세션에 루브릭을 적용하여, 구체적인 주장이나 행동을 뒷받침하는 증거를 제시할 수 있을 때만 세션에 플래그를 달았으며, 보고된 비율은 대화 길이에 맞추어 조정되었습니다.
지수를 계산하기 위해 Arena는 각 신호의 플래그 비율에 대해 1에서 해당 비율의 제곱근을 뺀 값을 적용하는 방식을 사용한다고 밝히며, 이는 개선 사항을 거의 완전 정렬에 가깝게 보이게 한다고 말합니다. 그런 다음 Unauthorized Action에 50% 가중치, False Attribution과 Deceptive Completion에 각각 25% 가중치를 두어 세 점수를 결합합니다. 값이 높을수록 모델이 더 안전하고 정렬이 잘 되었음을 나타낸다고 회사는 설명합니다.
초기 발견 및 다음 단계
OpenAI의 GPT-6.1 Sol이 87.9점으로 공개 미리보드에서 1위를 차지했으며, 그 다음으로 Anthropic의 Claude Opus 5.5가 83.2점, SpaceXAI의 Grok 4.7이 82.7점을 기록했습니다. Arena는 OpenAI 모델이 27개 모델 중 상위 다섯 자리를 차지했으며, 그 중 네 모델이 약 88점 수준이라고 보고했습니다.
Arena는 Claude Opus 5 세션의 약 2%에서 Unauthorized Action이 발생했으며, 그 중 53.5%는 사용자의 파일이나 이전 작업을 허가 없이 삭제하거나 정리한 경우라고 보고했습니다; Claude Opus 5.5에서는 정리 비율이 20.0%로 감소했습니다. Deceptive Completion은 평균 10%의 세션에 영향을 미쳤으며, 코드 디버깅에서는 48.0%로 가장 높은 비율을 보였습니다. Unauthorized Action 탐지는 코드 설명에서 6.3%로 정점을 찍었고, False Attribution은 전문 작문에서 13.7%로 가장 높았습니다.
대화 길이가 길어짐에 따라 모든 세 신호에서 탐지율이 상승했습니다. 사용자 메시지가 20개 이상인 세션에서는 속임수 완성이 45.4%의 세션에서 표시되었고, 무단 행동은 12.4%의 세션에서 표시되었습니다. Arena는 또한 GPT, Claude, Gemini Flash 및 Grok 계열의 최신 모델들이 대부분의 신호에서 이전 모델보다 낮은 탐지율을 보이며, 예외적으로 GPT-6.1 Sol은 GPT-6 Sol보다 약간 높은 잘못된 귀속을 보이고, Claude Opus 5는 Claude Opus 4.8보다 약간 높은 무단 행동을 보인다고 보고했습니다.
Arena는 인덱스에 더 많은 안전 관련 신호를 추가할 예정이며, 먼저 모델이 유해한 프롬프트를 얼마나 잘 거부하는지를 시작점으로 삼고, 새로운 모델과 실제 환경으로 확장하면서 리더보드 신호를 하나씩 지속적으로 업데이트하겠다고 밝혔습니다.












