Modelos y plataformas de IA

Cerebras Presenta la Solución de Inferencia de IA Más Rápida del Mundo: 20 Veces Más Rápida a un Fracción del Costo

mm
Añade Unite.AI a tus fuentes preferidas en Google

Cerebras Systems (CBRS ), pionero en cómputo de alto rendimiento de IA, ha presentado una solución innovadora que está a punto de revolucionar la inferencia de IA. El 27 de agosto de 2024, la empresa anunció el lanzamiento de Cerebras Inference, el servicio de inferencia de IA más rápido del mundo. Con métricas de rendimiento que superan con creces las de los sistemas basados en GPU tradicionales, Cerebras Inference ofrece 20 veces la velocidad a una fracción del costo, estableciendo un nuevo estándar en la computación de IA.

Velocidad y Eficiencia de Costo Sin Precedentes

Cerebras Inference está diseñado para ofrecer un rendimiento excepcional en varios modelos de IA, particularmente en el segmento en rápida evolución de modelos de lenguaje grande (LLM). Por ejemplo, procesa 1.800 tokens por segundo para el modelo Llama 3.1 8B y 450 tokens por segundo para el modelo Llama 3.1 70B. Este rendimiento no solo es 20 veces más rápido que el de las soluciones basadas en GPU de NVIDIA (NVDA ), sino que también se ofrece a un costo significativamente menor. Cerebras ofrece este servicio a partir de solo 10 centavos por millón de tokens para el modelo Llama 3.1 8B y 60 centavos por millón de tokens para el modelo Llama 3.1 70B, lo que representa una mejora de 100 veces en el rendimiento por precio en comparación con las ofertas basadas en GPU existentes.

Mantener la Precisión Mientras se Amplían los Límites de la Velocidad

Uno de los aspectos más impresionantes de Cerebras Inference es su capacidad para mantener la precisión de vanguardia mientras ofrece una velocidad sin precedentes. A diferencia de otros enfoques que sacrifican la precisión por la velocidad, la solución de Cerebras se mantiene dentro del dominio de 16 bits durante toda la ejecución de la inferencia. Esto garantiza que las ganancias de rendimiento no se produzcan a expensas de la calidad de las salidas del modelo de IA, un factor crucial para los desarrolladores que se centran en la precisión.

Micah Hill-Smith, cofundador y director ejecutivo de Análisis Artificial, destacó la importancia de este logro: “Cerebras está ofreciendo velocidades un orden de magnitud más rápidas que las soluciones basadas en GPU para los modelos de IA Llama 3.1 8B y 70B de Meta. Estamos midiendo velocidades superiores a 1.800 tokens de salida por segundo en Llama 3.1 8B y superiores a 446 tokens de salida por segundo en Llama 3.1 70B, un nuevo récord en estas pruebas.”

La Creciente Importancia de la Inferencia de IA

La inferencia de IA es el segmento de más rápido crecimiento de la computación de IA, que representa aproximadamente el 40% del mercado total de hardware de IA. La introducción de la inferencia de IA de alta velocidad, como la ofrecida por Cerebras, es similar a la introducción de Internet de banda ancha, desbloqueando nuevas oportunidades y anunciando una nueva era para las aplicaciones de IA. Con Cerebras Inference, los desarrolladores pueden crear aplicaciones de IA de próxima generación que requieren un rendimiento complejo y en tiempo real, como agentes de IA y sistemas inteligentes.

Andrew Ng, fundador de DeepLearning.AI, subrayó la importancia de la velocidad en el desarrollo de IA: “DeepLearning.AI tiene múltiples flujos de trabajo de agentes que requieren hacer preguntas a un LLM repetidamente para obtener un resultado. Cerebras ha construido una capacidad de inferencia impresionantemente rápida que será muy útil para este tipo de cargas de trabajo.

Amplio Apoyo de la Industria y Asociaciones Estratégicas

Cerebras ha obtenido un fuerte apoyo de los líderes de la industria y ha formado asociaciones estratégicas para acelerar el desarrollo de aplicaciones de IA. Kim Branson, vicepresidente senior de IA/ML en GlaxoSmithKline, un cliente temprano de Cerebras, enfatizó el potencial transformador de esta tecnología: “La velocidad y la escala cambian todo.”

Otras empresas, como LiveKit, Perplexity y Meter, también han expresado su entusiasmo por el impacto que tendrá Cerebras Inference en sus operaciones. Estas empresas están aprovechando el poder de las capacidades de cómputo de Cerebras para crear experiencias de IA más responsivas y humanas, mejorar la interacción del usuario en los motores de búsqueda y mejorar los sistemas de gestión de redes.

Cerebras Inference: Niveles y Accesibilidad

Cerebras Inference está disponible en tres niveles competitivamente precios: Gratis, Desarrollador y Empresarial. El nivel gratuito ofrece acceso a la API de forma gratuita con límites de uso generosos, lo que lo hace accesible a una amplia gama de usuarios. El nivel Desarrollador ofrece una opción de implementación sin servidor flexible, con modelos Llama 3.1 con un precio de 10 centavos y 60 centavos por millón de tokens. El nivel Empresarial está diseñado para organizaciones con cargas de trabajo sostenidas, ofreciendo modelos personalizados, acuerdos de nivel de servicio personalizados y soporte dedicado, con precios disponibles a petición.

Potenciando Cerebras Inference: El Wafer Scale Engine 3 (WSE-3)

En el corazón de Cerebras Inference se encuentra el sistema CS-3 de Cerebras, impulsado por el procesador de IA de vanguardia Wafer Scale Engine 3 (WSE-3). Este procesador de IA es insuperable en términos de tamaño y velocidad, ofreciendo 7.000 veces más ancho de banda de memoria que la H100 de NVIDIA. La escala masiva del WSE-3 permite que maneje muchos usuarios concurrentes, garantizando velocidades abrasadoras sin comprometer el rendimiento. Esta arquitectura permite a Cerebras evitar los compromisos que normalmente afectan a los sistemas basados en GPU, ofreciendo el mejor rendimiento de su clase para cargas de trabajo de IA.

Integración Sin Problemas y API Amigable para Desarrolladores

Cerebras Inference está diseñado con los desarrolladores en mente. Cuenta con una API que es completamente compatible con la API de Completions de Chat de OpenAI, lo que permite una migración fácil con cambios mínimos en el código. Este enfoque amigable para los desarrolladores garantiza que la integración de Cerebras Inference en flujos de trabajo existentes sea lo más sencilla posible, permitiendo una implementación rápida de aplicaciones de IA de alto rendimiento.

Cerebras Systems: Impulsando la Innovación en Diversas Industrias

Cerebras Systems no solo es líder en cómputo de IA, sino también un actor clave en diversas industrias, incluyendo la atención médica, la energía, el gobierno, el cómputo científico y los servicios financieros. Las soluciones de la empresa han sido instrumentales en impulsar avances en instituciones como los Laboratorios Nacionales, Aleph Alpha, la Clínica Mayo y GlaxoSmithKline.

Al ofrecer una velocidad, escalabilidad y precisión sin precedentes, Cerebras está permitiendo que las organizaciones en estos sectores aborden algunos de los problemas más desafiantes en IA y más allá. Ya sea acelerando el descubrimiento de fármacos en la atención médica o mejorando las capacidades computacionales en la investigación científica, Cerebras está a la vanguardia de la innovación.

Conclusión: Una Nueva Era para la Inferencia de IA

Cerebras Systems está estableciendo un nuevo estándar para la inferencia de IA con el lanzamiento de Cerebras Inference. Al ofrecer 20 veces la velocidad de los sistemas basados en GPU tradicionales a una fracción del costo, Cerebras no solo está haciendo que la IA sea más accesible, sino que también está allanando el camino para la próxima generación de aplicaciones de IA. Con su tecnología de vanguardia, asociaciones estratégicas y compromiso con la innovación, Cerebras está en posición de liderar la industria de IA hacia una nueva era de rendimiento y escalabilidad sin precedentes.

Para obtener más información sobre Cerebras Systems y probar Cerebras Inference, visite www.cerebras.ai.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.