Líderes de opinión
Los modelos abiertos siguen mejorando. La economía se vuelve más compleja.

Los modelos de IA son evidentemente mejores que hace 18 meses. Pero cuando comencé a profundizar, las explicaciones habituales de ese progreso no cuadraban.
No mejoraron simplemente porque se hicieron más grandes. “El código abierto está ganando” solo es parcialmente cierto. Y el consejo de observar las puntuaciones de los benchmarks resultó ser mucho menos útil de lo que esperaba. Esa idea me tomó un tiempo aceptar.
Así que recopilé 18 meses de datos de 46 modelos de ocho laboratorios. Quería entender si la inteligencia se está convirtiendo en una mercancía, si los modelos abiertos están alcanzando la vanguardia, y qué deben medir las empresas al elegir los sistemas sobre los que construirán.
El hallazgo clave fue sencillo: una puntuación de benchmark no es realmente una propiedad del modelo. Refleja el modelo, el software y el contexto que lo rodea, y cuántos tiempo y potencia de cómputo se le permitió usar. Publicar un solo número oculta los otros dos.
Sin embargo, las implicaciones son mucho más amplias. Las empresas comparan modelos individuales cuando deberían estar evaluando el sistema completo que debe realizar el trabajo.
Los benchmarks ocultan el sistema
Cuando dejé de observar las puntuaciones compuestas y comparé los modelos prueba por prueba, la brecha entre los principales modelos de peso abierto y los propietarios no era un solo número.
En SWE-bench Verified, una prueba más antigua que ha aparecido en innumerables anuncios de modelos, la brecha fue de 0,2 puntos. En SWE-bench Pro, una prueba más reciente diseñada alrededor de trabajo de software realista y multilingüe con una configuración estandarizada, fue de 18,2 puntos.
La aparente brecha del modelo depende del benchmark
| Benchmark | Brecha | Estado |
|---|---|---|
| SWE-bench Verified | 0,2 pts | Saturado, contaminación detectada |
| GPQA Diamond | 2,0 pts | Saturado, techo alrededor del 92–95 % |
| Terminal-Bench 2.1 | 4,9 pts | En vivo, agente |
| Humanity’s Last Exam | 9,8 pts | En vivo, razonamiento de vanguardia |
| SWE-bench Pro | 18,2 pts | En vivo, andamiaje estandarizado |
Fuente: análisis de Jaspreet Singh de los principales modelos de peso abierto y propietarios, julio de 2026.
El mismo modelo también puede recibir puntuaciones diferentes según quién realice la prueba. Kimi K3 obtuvo 80,9 % en Terminal-Bench 2.1 en una evaluación independiente y 88,3 % cuando su fabricante informó el resultado. Ese salto de 7,4 puntos es mayor que la brecha entre abierto y frontera en tres de los cinco benchmarks que analicé.
Un modelo recibe instrucciones a través del software circundante, aprovecha el contexto que se le brinda, utiliza las herramientas a las que puede acceder y opera dentro de un presupuesto de razonamiento establecido por el desarrollador. Cambiar esas condiciones hace que el resultado cambie también.
Los benchmarks públicos son útiles para comprender la dirección del progreso. Son una base pobre para decidir qué funcionará dentro de su empresa.
La fiabilidad agente altera las matemáticas
Esto se vuelve más importante a medida que la IA pasa de responder preguntas a completar una secuencia de acciones.
Considere un flujo de trabajo con 20 pasos, donde la IA acierta cada paso el 95 % de las veces. Eso parece fiable. Sin embargo, a lo largo de toda la secuencia, el flujo de trabajo solo tiene éxito el 36 % de las veces.
Un modelo mejor puede mejorar las probabilidades en cada paso, especialmente en trabajos agente difíciles. Es la ingeniería circundante la que determina si un paso erróneo arruina el trabajo. Guardar el progreso, verificar los resultados, reintentar de forma segura y recuperarse de fallos a menudo separa una demostración convincente de un producto fiable.
La elección del modelo sigue siendo importante. Pero el modelo con la mejor puntuación no produce automáticamente el sistema más fiable.
Elija modelos según el trabajo
Los datos respaldan una conclusión más estrecha que la que suele presentar cualquiera de los lados del debate abierto versus propietario.
Los modelos de peso abierto son competitivos para trabajos bien definidos y de corto plazo donde el resultado puede medirse directamente. La clasificación, extracción, resumido y generación estructurada cada vez entran más en esta categoría.
Los modelos de vanguardia siguen justificando su precio premium en tareas agente más largas, cumplimiento de instrucciones bajo presión y trabajos donde el fallo es costoso de detectar después. Ahí es donde los benchmarks más recientes muestran una brecha cercana a 18 puntos en lugar de cero, y donde la capa de seguridad proporcionada por el proveedor del modelo tiene valor.
Las empresas deben seleccionar los modelos según la tarea, pero no deben asumir que cambiar es gratuito. El contexto, el razonamiento y las cachés de prompts no se trasladan limpiamente entre proveedores. Un modelo más barato puede resultar más costoso si cambiar de sistema obliga a reiniciar el trabajo o añade capas de ingeniería y gobernanza.
La elección del modelo se está volviendo menos permanente. Cambiar sigue siendo una decisión arquitectónica.
A medida que la inteligencia se abarata, el juicio sigue siendo costoso
La capacidad competente de propósito general se está volviendo extraordinariamente barata. En la parte superior de la curva, sin embargo, cada punto adicional de rendimiento cuesta más que el anterior. Los últimos nueve puntos de capacidad cuestan aproximadamente diez veces lo que cuesta todo lo que está por debajo de ellos.
La mayoría de las empresas no necesitan el modelo más potente para cada solicitud. Sí necesitan saber qué trabajo lo merece.
Resumir, extraer, clasificar, redactar y traducir se están acercando a la capacidad de utilidad. Lo que sigue siendo escaso es el juicio: saber cuál de cinco respuestas plausibles es correcta, notar que la pregunta estaba equivocada y decidir cuándo detenerse y pedir la intervención de un humano.
El juicio proviene del contexto propietario, las reglas de negocio, los flujos de trabajo, el conocimiento histórico y la ingeniería que verifica el trabajo y contiene los fallos.
Construye la evaluación que nadie más puede ejecutar
Para una empresa, el benchmark más valioso se construye a partir de su propio trabajo.
Crea un conjunto de evaluación privado con 50 a 200 tareas reales de tu negocio. Mantén el sistema circundante fijo, ejecuta las pruebas repetidamente y puntúa si el trabajo se completó correctamente en lugar de cuán pulida suene la respuesta.
Aplica la misma disciplina al costo. El costo por token puede ser engañoso cuando un modelo razona más tiempo, requiere más reintentos o genera más trabajo para un revisor humano. Mide el costo por resultado aceptado en su lugar.
Comienza con un número reducido de modelos. Dirige el trabajo al inicio de una tarea en lugar de cambiar de proveedor a mitad del proceso. Cuenta la carga de seguridad, gobernanza y operativa de cada proveedor adicional junto a su precio anunciado.
El mercado seguirá produciendo nuevos ganadores de benchmarks, y las empresas seguirán tentadas a reconstruir su estrategia de IA alrededor de cada uno. Un enfoque mejor es elegir los modelos para el trabajo, y luego evaluar todo el sistema bajo las condiciones en que debe desempeñarse.
El benchmark que debe guiar tu arquitectura es el que solo tu empresa puede ejecutar.












