Modelos y plataformas de IA

Cerebras ejecuta GPT-5.6 Sol de OpenAI a 750 tokens por segundo en la nueva categoría Ultrafast

mm
Añade Unite.AI a tus fuentes preferidas en Google

Cerebras (CBRS ) ahora está ejecutando el modelo insignia de OpenAI a una velocidad que ninguna nube de GPU ha igualado públicamente. El 13 de agosto de 2026, el fabricante de chips a escala de oblea anunció que impulsa GPT-5.6 Sol en una nueva categoría de servicio de OpenAI llamada Ultrafast, ofreciendo hasta 750 tokens de salida por segundo y, según cuenta de OpenAI, ejecutando el modelo hasta 14 × más rápido que el procesamiento Standard. Ultrafast se lanza primero en la API de OpenAI como una vista previa limitada para un grupo selecto de clientes, con el acceso ampliándose a medida que la capacidad crece.

La afirmación central es específica: inteligencia de frontera sin la penalización de velocidad. GPT-5.6 Sol es el modelo más capaz de OpenAI, y sobre el silicio de Cerebras genera tokens lo suficientemente rápido como para integrarse en productos en tiempo real en lugar de quedar detrás de un trabajo por lotes nocturno. Ambas compañías presentan la categoría como la eliminación del compromiso entre un modelo lo suficientemente inteligente para trabajos de alto riesgo y uno lo suficientemente rápido para usarse mientras el trabajo aún está en curso.

Los números de velocidad detrás de Ultrafast

La cifra de 750 tokens de salida por segundo acapara los titulares, pero las comparaciones directas publicadas por Cerebras son más reveladoras. Frente a las velocidades de salida comunicadas por Artificial Analysis, la empresa afirma que GPT-5.6 Sol en Ultrafast funciona 11 veces más rápido que Claude Fable 5 y cinco veces más rápido que Opus 4.8 en modo Fast.

Cerebras también sometió el nivel a una ejecución completa de Humanity’s Last Exam, una prueba de 2.500 preguntas presentada como de dificultad doctoral. GPT-5.6 Sol en Ultrafast respondió todas en 11 horas y 11 minutos; Claude Fable 5 necesitó 78 horas y 27 minutos para llegar a conclusiones comparables: casi siete veces más, según Cerebras. En GDP-Val, una prueba de trabajo intelectual con valor económico, la empresa informa de una aceleración integral de 5,6 veces frente al procesamiento Standard, sin pérdida de calidad.

Son evaluaciones realizadas por el proveedor, y Cerebras lo indica expresamente: la comparación de Humanity’s Last Exam se llevó a cabo el 10 de julio y entre el 13 y el 15 de julio de 2026, mientras que la cifra de GDP-Val procede de sus propias pruebas del 31 de julio de 2026. Deben entenderse como mediciones de la empresa, no como resultados independientes.

Por qué el chip a escala de oblea gana en latencia

El mecanismo importa porque explica por qué un fabricante de chips relativamente pequeño está ejecutando el mayor modelo de OpenAI a velocidades que los proveedores dominantes de GPU no han igualado. La inferencia rápida de un modelo grande es, fundamentalmente, un problema de movimiento de datos: en las GPU, los pesos del modelo deben trasladarse repetidamente entre la memoria del chip y el almacenamiento externo para generar cada token sucesivo, por lo que el ancho de banda de memoria se convierte en el cuello de botella.

La respuesta de Cerebras es eliminar ese movimiento. Su Wafer-Scale Engine integra 44 GB de SRAM en un único chip del tamaño de una oblea, de modo que los pesos permanecen en el chip y los tokens atraviesan sin interrupciones las capas distribuidas entre obleas mediante procesamiento en cadena. Como los pesos nunca abandonan el silicio, el enfoque puede escalar con el tamaño del modelo: ese es el argumento de la empresa para sostener que la ventaja de velocidad se mantiene al crecer los modelos de frontera. En la economía de la inferencia, ese es el factor decisivo: el coste y la latencia dependen principalmente de la rapidez con que se suministran los pesos al cálculo, y mantener 44 GB en una sola pastilla aborda directamente ese problema.

Una asociación de $10 mil millones llega al modelo insignia

Ultrafast es hasta ahora el producto más visible de una relación que lleva meses desarrollándose. OpenAI contrató a Cerebras capacidad de cómputo de baja latencia por 10.000 millones de dólares a principios de 2026, y este lanzamiento pone esa capacidad al servicio del principal modelo de la empresa, en lugar de uno más pequeño o especializado. OpenAI describe Ultrafast como «el siguiente paso» de la colaboración para incorporar inferencia de latencia ultrabaja a su plataforma.

Para Cerebras, esta posición es significativa. La empresa emergente lleva tiempo defendiendo que su arquitectura a escala de oblea es la adecuada para la inferencia, aunque el mercado sigue girando en torno a los proveedores de GPU. La competencia se extiende por todo el sector de aceleradores, mientras los actores consolidados avanzan hacia integrar los modelos directamente en sus chips. Encargarse de ejecutar el modelo insignia de OpenAI aporta a Cerebras un cliente de referencia en producción en lo más alto del mercado. El propio modelo encabeza la GPT-5.6 family OpenAI launched —con Sol como insignia, junto a Terra, la opción equilibrada, y Luna, la opción económica—, por lo que Ultrafast vincula a Cerebras con la primera línea de esa gama.

Quién lo recibe y para qué sirve

OpenAI orienta este nivel a tareas de alto impacto en las que el tiempo es crucial: responder a incidentes mientras una interrupción sigue en curso, investigar finanzas mientras cambian las condiciones del mercado, ofrecer atención al cliente y voz en tiempo real, realizar operaciones comerciales y mantener ciclos de investigación en directo que antes se ejecutaban durante la noche. El acceso inicial ha llegado a empresas de programación, comercio y finanzas, como Jane Street, Podium, Basis y Rogo.

«El aumento de velocidad que aporta Cerebras es impresionante», afirmó John Crepezzi, del área de asistentes de IA de Jane Street, en el anuncio de OpenAI. «Permite utilizar los modelos de formas diferentes y hace viable que los desarrolladores trabajen junto a ellos de manera más concentrada y productiva».

OpenAI mantiene deliberadamente un despliegue limitado. La empresa dice que está aprovechando la fase preliminar para averiguar dónde un cambio de velocidad de un orden de magnitud aporta más valor y ampliará el acceso a medida que crezca la capacidad. Tanto OpenAI como Cerebras permiten registrarse para recibir novedades sobre la ampliación de la versión preliminar.

Qué ocurre a continuación

A corto plazo, lo que cabe observar es la capacidad disponible, no nuevas capacidades del modelo. Ultrafast es una versión preliminar limitada y ambas empresas vinculan una disponibilidad más amplia al aumento de capacidad, no a una fecha fija; por tanto, habrá que seguir el ritmo de expansión. A más largo plazo, la cuestión es si la ventaja de la memoria integrada de Cerebras se mantiene al crecer los modelos de OpenAI, precisamente la apuesta de su arquitectura a escala de oblea.

Theo Nash es un especialista en inteligencia artificial generada en Unite.AI, que cubre la infraestructura de inteligencia artificial, el cómputo y los sistemas de hardware que alimentan la inteligencia artificial moderna. Su trabajo se centra en los fundamentos técnicos detrás de las cargas de trabajo de inteligencia artificial a gran escala, incluyendo centros de datos, aceleradores, redes y las pilas de software que los unen.
Con una perspectiva analítica y basada en la ingeniería, Theo examina cómo los avances en GPUs, silicio personalizado, arquitecturas de memoria y sistemas distribuidos permiten nuevas generaciones de modelos de inteligencia artificial. Presta especial atención a los compromisos de rendimiento, la eficiencia energética, la escalabilidad y las limitaciones prácticas que dan forma a la implementación en el mundo real de la infraestructura de inteligencia artificial.
Los artículos escritos por Theo Nash son generados por inteligencia artificial y revisados por el equipo editorial de Unite.AI para garantizar la precisión técnica, la claridad y la cobertura responsable del paisaje de cómputo de inteligencia artificial en constante evolución.