Alianzas

Crusoe firma un acuerdo plurianual para impulsar el entrenamiento y la inferencia de Perplexity

mm
Añade Unite.AI a tus fuentes preferidas en Google

Crusoe, el 15 de septiembre de 2026, anunció una asociación plurianual con Perplexity bajo la cual Perplexity ejecutará todo su ciclo de vida de modelos en Crusoe Cloud, entrenando modelos de vanguardia en clústeres dedicados NVIDIA GB300 NVL72 y sirviéndolos en producción a través del servicio Managed Inference de Crusoe.

El anuncio, con fecha en San Francisco, también compromete a Crusoe a adoptar Perplexity Enterprise Pro y Max para sus 1,800 empleados. Según el comunicado, la implementación tiene como objetivo dotar al personal de búsqueda web y de conocimiento interno, investigación de varios pasos, análisis de datos y acceso a modelos de IA de vanguardia.

El comunicado describe los productos de Perplexity como operando en tiempo real para millones de usuarios, un entorno en el que la latencia y el rendimiento de la inferencia son el producto y no simples referencias teóricas. Crusoe afirmó que su servicio Managed Inference está diseñado para inferencia de nivel de producción, impulsado por optimizaciones propietarias y creado para el rendimiento y el costo en los modelos más populares, y que Crusoe Cloud ofrece la profundidad operativa y la escala necesarias para acompañar el crecimiento de Perplexity.

Declaraciones ejecutivas

Chase Lochmiller, cofundador y CEO de Crusoe, dijo que las empresas de IA de más rápido crecimiento necesitan una infraestructura que siga el ritmo durante todo el ciclo de vida del modelo y escale con ellas a medida que crecen. “Perplexity está construyendo el futuro de cómo las personas encuentran respuestas, y Crusoe es un socio clave para hacerlo posible, desde el primer electrón hasta el último token”, afirmó Lochmiller.

Aravind Srinivas, cofundador y CEO de Perplexity, dijo que operar IA a la escala de Perplexity significa que cada milisegundo de latencia se percibe por los usuarios. Describió a Crusoe como construido alrededor de esa restricción, calificándolo como inferencia de alto rendimiento y baja latencia respaldada por hardware de próxima generación.

Dion Harris, director senior de Soluciones de Infraestructura HPC y AI en NVIDIA, dijo que la IA moderna requiere una arquitectura informática unificada desde la investigación hasta el despliegue. Impulsado por NVIDIA GB300 NVL72 y NVIDIA InfiniBand, Harris afirmó que Crusoe Cloud permite a Perplexity entrenar, afinar y servir modelos de vanguardia en producción con la velocidad y eficiencia que demanda la IA agente.

La plataforma GB300 NVL72

Los clústeres de entrenamiento dedicados mencionados en el acuerdo funcionan con el GB300 NVL72 de NVIDIA, que NVIDIA describe como un sistema a escala de bastidor totalmente refrigerado por líquido, que integra 72 GPUs Blackwell Ultra y 36 CPUs Grace basadas en Arm. Las especificaciones publicadas por NVIDIA indican 130 TB/s de ancho de banda NVLink, 20 TB de memoria GPU con hasta 576 TB/s de ancho de banda, 37 TB de memoria rápida y 2 592 núcleos CPU Arm Neoverse V2. Cada GPU del sistema recibe 800 Gb/s de conectividad de red mediante un módulo de E/S ConnectX-8 SuperNIC, trabajando con plataformas de red Quantum‑X800 InfiniBand o Spectrum‑X Ethernet.

NVIDIA afirma que las fábricas de IA construidas sobre el GB300 NVL72 ofrecen hasta un aumento de 50 x en el rendimiento total de producción de IA en comparación con plataformas basadas en Hopper. La compañía atribuye esa cifra a una mejora declarada de 10 x en la capacidad de respuesta del usuario, medida en tokens por segundo por usuario, y a una mejora de 5 x en el rendimiento por megavatio respecto a Hopper, y señala que los números son proyecciones de rendimiento sujetas a cambios.

Servicio de Inferencia Gestionada e Historia

El elemento de producción del acuerdo funciona con Crusoe Managed Inference, que la compañía disponible de forma general el 20 de noviembre de 2025, para cargas de trabajo de inferencia en producción en Crusoe Cloud. El servicio está impulsado por el motor de inferencia propietario de Crusoe, construido alrededor de MemoryAlloy, una caché de pares clave‑valor a nivel de clúster que elimina prefills duplicados al permitir que las GPUs obtengan cachés de prefijo de nodos locales y remotos. Crusoe afirma que el motor ofrece hasta 9,9 x más rapidez en el tiempo al primer token y 5 x mayor rendimiento, comparado con vLLM para el modelo Llama‑3.3‑70B en un despliegue de cuatro nodos.

Crusoe ofrece el servicio en tres opciones de despliegue, según su página del producto Managed Inference. Serverless Inference brinda consumo basado en uso de modelos abiertos a través de una API totalmente gestionada, dirigida a cargas de trabajo en etapas tempranas, tráfico de bajo volumen y experimentación rápida. Los despliegues Self‑Serve, que la página indica están ahora disponibles de forma general, ejecutan modelos optimizados para rendimiento o capacidad de respuesta, incluidos modelos personalizados con el Serverless Fine‑Tuning de Crusoe. Los despliegues Tailored emparejan a los clientes con el equipo de Crusoe para un endpoint dedicado y benchmarkeado, una opción que la página orienta a modelos propietarios.

Los desarrolladores acceden al servicio a través de Crusoe Intelligence Foundry, un centro donde pueden generar claves API, usar endpoints gestionados afinados para cada modelo, monitorizar métricas de rendimiento y habilitar rendimiento provisionado para despliegues a escala de producción. El hub de modelos de Crusoe enumera modelos abiertos preconfigurados de laboratorios como DeepSeek, Google, Z.ai, OpenAI, Meta, Alibaba y NVIDIA, con los recuentos de parámetros y longitudes de contexto declarados para cada modelo.

Theo Nash es un especialista en inteligencia artificial generada en Unite.AI, que cubre la infraestructura de inteligencia artificial, el cómputo y los sistemas de hardware que alimentan la inteligencia artificial moderna. Su trabajo se centra en los fundamentos técnicos detrás de las cargas de trabajo de inteligencia artificial a gran escala, incluyendo centros de datos, aceleradores, redes y las pilas de software que los unen.
Con una perspectiva analítica y basada en la ingeniería, Theo examina cómo los avances en GPUs, silicio personalizado, arquitecturas de memoria y sistemas distribuidos permiten nuevas generaciones de modelos de inteligencia artificial. Presta especial atención a los compromisos de rendimiento, la eficiencia energética, la escalabilidad y las limitaciones prácticas que dan forma a la implementación en el mundo real de la infraestructura de inteligencia artificial.
Los artículos escritos por Theo Nash son generados por inteligencia artificial y revisados por el equipo editorial de Unite.AI para garantizar la precisión técnica, la claridad y la cobertura responsable del paisaje de cómputo de inteligencia artificial en constante evolución.