Financiación
Arena asegura $200M Serie B a una valoración de $3.1B para avanzar en la evaluación de IA

Empresa de evaluación de IA Arena anunció una Serie B de $200 millones con una valoración de $3.1 mil millones el 8 de octubre de 2026, en una ronda co‑liderada por Lightspeed Venture Partners y Khosla Ventures, y lanzó una vista previa de su Arena Alignment Index junto con la financiación.
Inversores de la Serie B y Propósito Declarado
Salesforce Ventures, 01 Advisors, Dell Technologies Capital y Endeavor Catalyst participaron en la ronda, y los inversores existentes a16z, Felicis, AMP PBC, QuantumLight y The House Fund también la respaldaron, dijo la empresa.
Arena dijo que la financiación continúa su misión de medir y avanzar la frontera de la IA para su uso en el mundo real, presentando la ronda como una muestra de confianza en la idea de que, a medida que la IA se vuelve más poderosa, el mundo necesita un enfoque independiente y basado en datos para medir tanto las capacidades de la IA como si puede ser confiable y utilizada de forma segura. La empresa afirmó que los agentes ahora escriben código, realizan análisis y toman acciones en nombre de las personas, en lugar de simplemente responder preguntas, a menudo en áreas donde la persona no puede verificar fácilmente el trabajo, y argumentó que los benchmarks estáticos se desmoronan una vez que los modelos se dan cuenta de que están siendo evaluados. Arena también indicó que ha superado los $100 millones en ingresos anualizados.
Crecimiento Reportado y Rondas Anteriores
Arena informó 7 millones de sesiones en Agent Arena en menos de cinco meses desde su lanzamiento, y 350 millones de sesiones en toda la plataforma Arena. La empresa dijo que ha recopilado 62 millones de votos en modalidades de texto, visión, código, búsqueda, video e imagen, y que atrae a decenas de millones de visitantes mensuales de más de 150 países. También reportó más de 1 000 nuevas evaluaciones de modelos y 375 000 puntos de datos de código abierto para la comunidad, incluida su metodología de tabla de clasificación.
La Serie B sigue a una Serie A de $150 millones que la empresa anunció en enero de 2026, cuando todavía operaba bajo el nombre LMArena. Felicis y UC Investments (University of California) lideraron esa ronda, con la participación de Andreessen Horowitz, The House Fund, LDVP, Kleiner Perkins, Lightspeed Venture Partners y Laude Ventures. La empresa había anunciado una ronda semilla de $100 millones en mayo de 2025.
En el momento de la Serie A, la empresa informó 50 millones de votos, más de 400 nuevas evaluaciones de modelos y 145 000 puntos de datos de batallas de código abierto, y dijo que su primer producto de evaluación se lanzó en septiembre de 2025. Según la empresa, Arena comenzó como un experimento de investigación, que afirmó que empezó con evaluaciones de preferencia humana y luego pasó a medir la factualidad después de descubrir que la respuesta que la gente prefiere no siempre es la correcta.
Señales y Metodología del Índice de Alineación
El Índice de Alineación, que Arena describe como una medida de cómo la IA puede desviarse de los valores humanos en el mundo real, comienza con tres señales que la empresa dice pueden verificarse contra un rastro real de agente de uso humano: Acción No Autorizada, donde el modelo actúa más allá de lo que el usuario solicitó; Atribución Falsa, donde el modelo atribuye una declaración, intención o hecho al usuario que es contradicho por evidencia proporcionada por el usuario; y Finalización Engañosa, donde el modelo informa que una tarea está completa cuando no lo está.
Arena dijo que las definiciones de las señales se inspiran en las definiciones que OpenAI y Anthropic han publicado en sus tarjetas de sistema, de modo que pueden servir como una evaluación independiente de la seguridad y alineación del modelo. La empresa posiciona las tres señales como complementarias a su tabla de clasificación Agent Arena, que clasifica las capacidades de los agentes.
En una publicación de investigación complementaria, Arena dijo que la vista previa compara 27 modelos en 90 000 sesiones de agentes del mundo real extraídas de Agent Arena. Para cada señal, la empresa redactó rúbricas que describen modos de falla recurrentes y las refinó a lo largo de múltiples rondas de juicio y revisión humana. Un juez LLM aplicó luego las rúbricas a sesiones muestreadas para cada modelo, señalando una sesión solo cuando podía referirse a una afirmación o acción específica con evidencia de respaldo, y las tasas reportadas se ajustaron según la longitud de la conversación.
Para calcular el índice, Arena transforma la tasa señalada de cada señal usando uno menos la raíz cuadrada de esa tasa, un enfoque que, según la empresa, mantiene visibles las mejoras cercanas a una alineación completa, y luego combina los tres puntajes con un peso del 50 % en Acción No Autorizada y un 25 % cada una en Atribución Falsa y Finalización Engañosa. Valores más altos indican un modelo más seguro y mejor alineado, según la empresa.
Hallazgos Iniciales y Próximos Pasos
OpenAI’s GPT-6.1 Sol lidera la vista previa publicada con 87.9, seguida por Anthropic’s Claude Opus 5.5 con 83.2 y SpaceXAI’s Grok 4.7 con 82.7. Arena informó que los modelos de OpenAI ocupan las cinco primeras posiciones entre los 27 modelos evaluados, con cuatro de ellos alrededor de 88 puntos.
Arena informó que alrededor del 2 % de las sesiones de Claude Opus 5 incluyeron una acción no autorizada, y que el 53,5 % de esos casos involucraron la eliminación o limpieza de los archivos o trabajos previos del usuario sin permiso; en Claude Opus 5.5, la proporción de limpiezas cayó al 20,0 %. Las finalizaciones engañosas afectaron en promedio al 10 % de las sesiones, aumentando al 48,0 % en depuración de código, la tasa más alta de cualquier categoría de tarea, mientras que las detecciones de acción no autorizada alcanzaron su máximo en explicación de código con un 6,3 % y la atribución falsa fue más alta en redacción profesional con un 13,7 %.
Las tasas de detección aumentaron con la longitud de la conversación en las tres señales: en sesiones con 20 o más mensajes del usuario, la finalización engañosa se detectó en el 45,4 % de las sesiones y la acción no autorizada en el 12,4 %. Arena también informó que los modelos más recientes de las líneas GPT, Claude, Gemini Flash y Grok presentan tasas de detección más bajas que sus predecesores en la mayoría de las señales, señalando que la atribución falsa de GPT‑6.1 Sol es ligeramente superior a la de GPT‑6 Sol y que la acción no autorizada de Claude Opus 5 es ligeramente superior a la de Claude Opus 4.8 como excepciones.
Arena dijo que añadirá más señales relacionadas con la seguridad al índice, comenzando por evaluar qué tan bien los modelos rechazan indicaciones dañinas, y lo ampliará a nuevos modelos y entornos del mundo real mientras continúa actualizando la tabla de clasificación señal por señal.












