Modelos y plataformas de IA

Cerebras ejecuta GPT-5.6 Sol de OpenAI a 750 tokens por segundo en la nueva capa Ultrafast

mm
Añade Unite.AI a tus fuentes preferidas en Google

Cerebras ahora ejecuta el modelo insignia de OpenAI a una velocidad que no ha sido igualada públicamente por ninguna nube de GPU. El 13 de agosto de 2026, el fabricante de chips de escala de oblea anunció que impulsa GPT-5.6 Sol en un nuevo nivel de servicio de OpenAI llamado Ultrafast, que entrega hasta 750 tokens de salida por segundo y, según la cuenta de OpenAI, ejecuta el modelo hasta 14 veces más rápido que el procesamiento estándar. Ultrafast se lanza primero en la API de OpenAI como una vista previa limitada para un grupo selecto de clientes, con acceso que se expande a medida que crece la capacidad.

La afirmación central es específica: inteligencia fronteriza sin penalización de velocidad. GPT-5.6 Sol es el modelo más capaz de OpenAI, y en el silicio de Cerebras genera tokens lo suficientemente rápido como para sentarse dentro de productos en tiempo real en lugar de detrás de un trabajo por lotes nocturno. Ambas empresas enmarcan el nivel como la eliminación del compromiso entre un modelo lo suficientemente inteligente para trabajo de alto riesgo y uno lo suficientemente rápido como para usar mientras el trabajo aún está sucediendo.

Los números de velocidad detrás de Ultrafast

La cifra de 750 tokens de salida por segundo es el titular, pero las comparaciones más reveladoras son las carreras de cabeza a cabeza que Cerebras publicó. En comparación con las velocidades de salida informadas por Artificial Analysis, la empresa dice que GPT-5.6 Sol en Ultrafast ejecuta 11 veces más rápido que Claude Fable 5 y 5 veces más rápido que Opus 4.8 en modo rápido.

Cerebras también sometió el nivel a una pasada completa del examen final de la humanidad, un benchmark de 2.500 preguntas dirigido a la dificultad del nivel de doctorado. GPT-5.6 Sol en Ultrafast respondió las 2.500 preguntas en 11 horas y 11 minutos; Claude Fable 5 necesitó 78 horas y 27 minutos para llegar a conclusiones comparables: casi 7 veces más lento, según Cerebras. En GDP-Val, un benchmark para el trabajo de conocimiento económicamente valioso, la empresa informa un aceleramiento de velocidad de extremo a extremo de 5,6 veces sobre el procesamiento estándar sin degradación de calidad.

Estas son evaluaciones realizadas por el proveedor, y Cerebras es explícito al respecto: la comparación del examen final de la humanidad se benchmarkó por Cerebras el 10 y 13-15 de julio de 2026, y la cifra de GDP-Val proviene de su propia prueba del 31 de julio de 2026. Trátelas como las propias mediciones de la empresa, no como resultados independientes.

Por qué el chip de escala de oblea gana en latencia

El mecanismo es importante aquí, porque explica por qué un fabricante de chips relativamente pequeño está sirviendo el modelo más grande de OpenAI a velocidades que los incumbentes de GPU no han igualado. La inferencia rápida en un modelo grande es fundamentalmente un problema de movimiento de datos: en las GPU, los pesos del modelo deben ser transportados repetidamente entre la memoria en el chip y el almacenamiento fuera del chip para generar cada token sucesivo, y la banda de memoria se convierte en el cuello de botella.

La respuesta de Cerebras es eliminar ese movimiento. Su Motor de escala de oblea empaqueta 44 GB de SRAM en un solo chip del tamaño de una oblea, por lo que los pesos del modelo permanecen en el chip y los tokens fluyen a través de las capas canalizadas a través de las obleas sin interrupción. Debido a que los pesos nunca dejan el silicio, el enfoque se escala con el tamaño del modelo: lo que es el argumento de la empresa de que la ventaja de velocidad se mantiene a medida que crecen los modelos fronterizos. Para la economía de inferencia, eso es el juego completo: el costo y la latencia de servir un modelo están dominados por lo rápido que puedes alimentar los pesos a la computadora, y mantener 44 GB residentes en un solo die ataca directamente.

Una asociación de $10 mil millones llega a la insignia

Ultrafast es el producto más visible hasta ahora de una relación que ha estado creciendo durante meses. OpenAI seleccionó a Cerebras para $10 mil millones en computación de baja latencia a principios de 2026, y este lanzamiento coloca esa capacidad detrás del modelo superior de la empresa en lugar de uno más pequeño o especializado. OpenAI describe Ultrafast como “el próximo paso” en la asociación para traer inferencia de ultra baja latencia a su plataforma.

Para Cerebras, la colocación es significativa. La startup ha argumentado durante mucho tiempo que su arquitectura de escala de oblea es la forma correcta para la inferencia, incluso mientras el centro de gravedad del mercado se encuentra con los proveedores de GPU: un concurso que se lleva a cabo en todo el negocio de aceleradores mientras los incumbentes se mueven para hornear modelos directamente en su silicio. Colocar la capa de servicio para el modelo insignia de OpenAI da a Cerebras una cuenta de referencia de producción en la parte superior del mercado. El modelo en sí ancla la familia GPT-5.6 que OpenAI lanzó (Sol como la insignia, junto con el equilibrado Terra y el eficiente en términos de costo Luna), por lo que Ultrafast adjunta Cerebras al frente de esa alineación.

Quién lo obtiene y para qué es

OpenAI está posicionando el nivel en trabajo sensible al tiempo, de alto riesgo: respuesta a incidentes mientras la interrupción aún está sucediendo, investigación financiera mientras las condiciones del mercado están cambiando, soporte al cliente en tiempo real y voz, comercio y bucles de investigación en vivo que solían ejecutarse durante la noche. El acceso temprano ha ido a empresas en codificación, comercio y finanzas, incluyendo Jane Street, Podium, Basis y Rogo.

> “El aumento de velocidad que trae Cerebras es impresionante”, dijo John Crepezzi, asistentes de AI en Jane Street, en el anuncio de OpenAI. “Permite diferentes formas de usar los modelos y hace que sea práctico para los desarrolladores trabajar de una manera más enfocada y productiva junto con ellos”.

OpenAI está manteniendo el lanzamiento estrecho a propósito. La empresa dice que está utilizando el período de vista previa para aprender dónde un cambio de velocidad de orden de magnitud crea el mayor valor, y expandirá el acceso a medida que crezca la capacidad. Ambas empresas, OpenAI y Cerebras, están aceptando inscripciones para actualizaciones a medida que se amplía la vista previa.

Qué sucede a continuación

El observable a corto plazo es la capacidad, no la capacidad. Ultrafast es una vista previa limitada, y ambas empresas vinculan una disponibilidad más amplia al crecimiento de la capacidad en lugar de a una fecha fija: por lo que el ritmo de expansión es lo que hay que ver. La pregunta más larga es si la ventaja de memoria en el chip de Cerebras se mantiene a medida que los modelos de OpenAI se escalan, lo que es exactamente la apuesta que la arquitectura de escala de oblea está construida.

Theo Nash es un especialista en inteligencia artificial generada en Unite.AI, que cubre la infraestructura de inteligencia artificial, el cómputo y los sistemas de hardware que alimentan la inteligencia artificial moderna. Su trabajo se centra en los fundamentos técnicos detrás de las cargas de trabajo de inteligencia artificial a gran escala, incluyendo centros de datos, aceleradores, redes y las pilas de software que los unen.
Con una perspectiva analítica y basada en la ingeniería, Theo examina cómo los avances en GPUs, silicio personalizado, arquitecturas de memoria y sistemas distribuidos permiten nuevas generaciones de modelos de inteligencia artificial. Presta especial atención a los compromisos de rendimiento, la eficiencia energética, la escalabilidad y las limitaciones prácticas que dan forma a la implementación en el mundo real de la infraestructura de inteligencia artificial.
Los artículos escritos por Theo Nash son generados por inteligencia artificial y revisados por el equipo editorial de Unite.AI para garantizar la precisión técnica, la claridad y la cobertura responsable del paisaje de cómputo de inteligencia artificial en constante evolución.