Entrevistas
Corey Sanders, Vicepresidente Senior de Producto en CoreWeave – Serie de Entrevistas

Corey Sanders, Vicepresidente Senior de Producto en CoreWeave (CRWV ), lidera la estrategia y ejecución de producto para una de las plataformas en la nube más rápidas en crecimiento, enfocada en inteligencia artificial. Es responsable de escalar la innovación, dar forma a soluciones personalizadas con los clientes y fortalecer la posición de CoreWeave en el mercado de infraestructura de inteligencia artificial. Antes de unirse a CoreWeave, Sanders pasó dos décadas en Microsoft (MSFT ) en roles de liderazgo senior que abarcan ingeniería en la nube, plataformas específicas de la industria, estrategia de soluciones comerciales y asociaciones empresariales a gran escala, con una profunda experiencia en la conexión entre la ejecución técnica y la estrategia de lanzamiento al mercado.
CoreWeave es un proveedor de nube nativa de inteligencia artificial diseñado específicamente para computación de alto rendimiento y cargas de trabajo de inteligencia artificial a gran escala. La empresa opera una huella en expansión rápidamente de centros de datos en los EE. UU. y Europa, ofreciendo infraestructura y software acelerados por GPU diseñados para el entrenamiento, la inferencia y los casos de uso de cómputo avanzado. Al centrarse en la arquitectura personalizada en lugar de la nube de propósito general, CoreWeave se ha convertido en un socio de infraestructura crítico para laboratorios de inteligencia artificial y empresas que buscan rendimiento, escalabilidad y eficiencia a gran escala.
Pasaste más de 20 años en Microsoft trabajando en ingeniería de Windows, estrategia de ventas en la nube y Microsoft Cloud para la industria. ¿Qué te enseñó esa progresión sobre lo que realmente impulsa la adopción empresarial, y cómo estás aplicando esas lecciones hoy en CoreWeave?
La adopción empresarial comienza con la resolución de un problema específico del cliente. La innovación por la innovación en sí no es tan crucial para la empresa. Se trata de ponerte en su lugar para entender qué los aqueja realmente, ya sea el costo del soporte, las complejidades operativas, la conexión con los clientes o la gestión de equipos y líneas de productos globales, y luego ofrecer servicios que ayuden. A menudo están dispuestos a ser innovadores en su enfoque, pero la consideración más crucial es ayudarlos a resolver su problema. El error más frecuente que he visto en el diseño de productos es dejarse llevar por la “guayness” de un producto. Si bien eso tiene peso en el espacio del consumidor, los clientes empresariales, al final, se preocupan mucho más por la utilidad que por la “guayness”.
CoreWeave se describe a menudo como una oferta de infraestructura de inteligencia artificial personalizada. En términos prácticos, ¿qué significa personalizado desde una perspectiva de producto, y dónde tropiezan las plataformas en la nube de propósito general con las cargas de trabajo de inteligencia artificial?
El mayor beneficio de ser personalizado es la capacidad de centrarse y ofrecer servicios sin necesidad de resolver todos los casos de uso generales. Te daré dos ejemplos: uno en software y otro en hardware.
En el lado del software, nuestra oferta de Almacenamiento de Objetos con caché LOTA se centra específicamente en el almacenamiento en caché para cargas de trabajo de inteligencia artificial. Se despliega directamente en los nodos GPU, ofrece un punto final S3 para la aplicación y responde a las solicitudes GPU abarcando su caché a través de varios nodos. Esto aumenta el rendimiento hasta 7 GB/s, muy por encima de lo que ofrecen las nubes de propósito general. Podemos lograr esto porque hacemos suposiciones de diseño alrededor de cargas de trabajo específicas de inteligencia artificial, división de lectura/escritura y diseños de clúster. Si un cliente usara esto para alojar una base de datos o un sitio web de comercio electrónico, no tendría el mismo impacto. Esa es la definición de personalizado en software.
El ejemplo de hardware es similar. Dada nuestra expansiva implementación de las últimas generaciones de SKU de NVIDIA (NVDA ), muchas de las cuales requieren enfriamiento líquido, CoreWeave ha desarrollado una experiencia y diseños de centros de datos específicos para satisfacer esas necesidades. A diferencia de las nubes más grandes que construyen para la fungibilidad y luego deben agregar enfriamiento líquido de forma retrospectiva, CoreWeave construye centros de datos centrados en inteligencia artificial desde cero. Esto resulta en menores costos y mayor disponibilidad para los últimos tipos de SKU.
A continuación, se muestra una imagen del caché LOTA mencionado.

Cuando los clientes piensan por primera vez en escalar la inteligencia artificial, muchos creen que solo necesitan acceso a GPU. ¿Qué es lo que típicamente se dan cuenta de que les falta una vez que comienzan a entrenar o a servir modelos a gran escala?
Dada la complejidad de ejecutar cargas de trabajo a través de clústeres de GPU masivos, los servicios circundantes se convierten en los verdaderos impulsores del éxito. Esto incluye los obvios, como el almacenamiento y la red, pero también servicios operativos críticos como la observabilidad, la orquestación y la seguridad. Aquí es donde CoreWeave realmente brilla con nuestra oferta Mission Control. Proporciona a los clientes una profunda conciencia de la salud del nodo y el tiempo de ejecución en su flota, integrando ese conocimiento directamente en el motor de orquestación. Esto permite al cliente tratar su infraestructura no como 1.000 GPU individuales, sino como una sola entidad de trabajo cohesiva.
¿Cuáles son las principales prioridades de producto en las que te estás centrando actualmente para mejorar los resultados de los clientes, ya sea en términos de rendimiento, confiabilidad, previsibilidad de costos o experiencia del desarrollador?
En la plataforma central, nos centramos constantemente en el rendimiento, la confiabilidad y la observabilidad. Debemos asegurarnos de que los clientes puedan ejecutar trabajos de manera repetible y predecible mientras aprovechan al máximo cada TFLOP en cada GPU. Más allá de eso, estamos trabajando para simplificar la incorporación de clientes que pueden no estar familiarizados con cada campana y silbato en una herramienta como SLURM (que todos usan, pero casi todos odian). Finalmente, estamos desarrollando servicios y modelos de facturación adicionales para hacer que sea más fácil innovar y comenzar pequeño. Actualmente, experimentar es sorprendentemente difícil debido a las altas barreras de entrada, como las limitaciones de capacidad, los compromisos de tres años y la necesidad de expertos especializados solo para empezar. Queremos devolver la facilidad de innovación a la plataforma de inteligencia artificial.
A medida que más cargas de trabajo de inteligencia artificial se desplazan de entrenamiento intensivo a inferencia intensiva, ¿cómo influye esa transición en el diseño de la infraestructura y las decisiones de la hoja de ruta del producto?
Crea oportunidades significativas para aplicar la diferenciación existente de CoreWeave a los requisitos de inferencia. Por ejemplo, el caché LOTA que mencioné se centra en alimentar a las GPU durante el entrenamiento; sin embargo, podemos tomar esa misma tecnología, integrarla en cosas como el KVCache y convertirla en un diferenciador de inferencia poderoso. De manera similar, herramientas como Mission Control se vuelven aún más vitales para la inferencia, ya que observar la salud de la GPU es crucial para ejecutar aplicaciones agénticas de alta disponibilidad.
En los próximos uno a dos años, ¿qué definirá el liderazgo en el mercado de la nube de inteligencia artificial, y qué capacidades importarán más a los clientes?
Creo que el liderazgo estará definido por dos cosas. La primera es la entrega de los requisitos de escala en constante crecimiento para el entrenamiento. Esto requerirá avances en la observabilidad, el monitoreo de la salud y la recuperación automática. Cuando se pasa de cientos a decenas de miles de GPU distribuidas a nivel global, la respuesta manual a los fallos es un no inicio.
La segunda es la entrega de los servicios adecuados para la inferencia y las cargas de trabajo agénticas. Esto requiere capacidades de implementación global y modelos de negocio que fomenten la experimentación. Este patrón de uso fue lo que ayudó a que la nube creciera originalmente, y se ha perdido algo en la era de la inteligencia artificial. Necesitamos traerlo de vuelta a través de un mejor soporte de plataforma, capacidades multi-nube y facilidad de uso multi-región.
Anteriormente, lideraste iniciativas de nube específicas de la industria en sectores como la salud, el comercio minorista, los servicios financieros, la fabricación y la nube soberana. ¿Qué lecciones de esos verticales se traducen directamente a la infraestructura de inteligencia artificial, y cuáles no?
Los cambios generacionales en las GPU continúan introduciendo nuevas complejidades. Cada nuevo lanzamiento trae una mayor interconexión, más memoria y mayores necesidades de energía, todas las cuales requieren que revisitemos nuestras suposiciones sobre cómo se conectan los nodos y se entrega el software. Debemos ser implacables aquí para mantener nuestro liderazgo. Por otro lado, el área que mejora más rápidamente es la escala a la que los clientes pueden adaptarse; la velocidad a la que están adoptando huellas de cómputo más grandes es impresionante.
A medida que los centros de datos y clústeres de inteligencia artificial continúan escalando, ¿cuáles son los desafíos operativos que están resultando más difíciles de resolver hoy, y cuáles están mejorando más rápidamente?
Los cambios generacionales de las GPU continúan creando nuevas complejidades en el diseño y el software. Cada nuevo lanzamiento de GPU viene con capacidades de interconexión aumentadas, más memoria, mayores necesidades de energía, etc., que requieren revisitar nuestras suposiciones sobre cómo se conectan los nodos, cómo se gestionan los bastidores y cómo se entrega el software. Necesitaremos seguir centrados en este trabajo para asegurar que mantengamos nuestra posición de liderazgo. Los que están mejorando más rápidamente son lo que los clientes pueden lograr con la creciente escala del cómputo.
En la infraestructura de inteligencia artificial, la confiabilidad va más allá del tiempo de actividad. ¿Cómo define CoreWeave la confiabilidad, y qué indicadores reflejan mejor el éxito desde la perspectiva del cliente?
A gran escala, la consideración más grande para un cliente es simplemente terminar el trabajo. En operaciones masivas, los fallos o retrasos individuales son esperados. La clave es cómo detectamos y respondemos automáticamente a esos problemas para asegurar que el trabajo se complete a pesar de los desafíos. Es por eso que integramos Mission Control en servicios de nivel superior como SUNK (Slurm en Kubernetes). Esto permite a los clientes responder a los fallos automáticamente sin perder horas o semanas de trabajo. Para nosotros, el éxito no se trata solo del tiempo de actividad del nodo; se trata del éxito del trabajo.
Mirando hacia adelante, ¿qué gran cambio en la infraestructura de inteligencia artificial crees que todavía está subestimado, ya sea relacionado con la evolución del hardware, la especialización de las pilas, los requisitos de soberanía o nuevos modelos de implementación?
Creo que el advenimiento del Aprendizaje por Refuerzo (RL) como una parte renovada de la pila de inteligencia artificial está subestimado. Si bien no es un campo de estudio nuevo, fue ampliamente eclipsado durante la primera ola de desarrollo de LLM. El RL está haciendo un regreso y desempeñará un papel vital en hacer que los servicios de inteligencia artificial sean más receptivos a los paisajes cambiantes de sus usuarios. Debido a esto, estamos muy emocionados con la oferta de RL sin servidor que tenemos hoy.
Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar CoreWeave.












