Entrevistas

Christian Stano, Field CTO en Anyscale – Serie de entrevistas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Christian Stano, Field CTO en Anyscale, ha construido una carrera en la intersección de la infraestructura de inteligencia artificial a gran escala, plataformas de aprendizaje automático y computación distribuida. Antes de unirse a Anyscale, lideró la organización de plataforma de AI/ML en Attentive, donde escaló la infraestructura que respaldaba la personalización para más de medio millón de suscriptores y ayudó a impulsar la adopción de sistemas de computación unificados basados en Ray que mejoraron la velocidad de desarrollo mientras reducían los costos operativos. Al comienzo de su carrera, trabajó en ciberseguridad, arquitectura en la nube y iniciativas de inteligencia artificial en el sector público en organizaciones como Coalfire y Deloitte, donde contribuyó a una de las primeras plataformas de aprendizaje automático del Departamento de Defensa de los EE. UU. Su experiencia abarca ingeniería de plataforma de inteligencia artificial, MLOps, infraestructura nativa en la nube, habilitación de desarrolladores y escalado organizacional, lo que le da una profunda experiencia en ayudar a las empresas a operativizar la inteligencia artificial a escala de producción.

Anyscale es la empresa detrás de Ray, el marco de computación distribuida de código abierto ampliamente utilizado para escalar cargas de trabajo de inteligencia artificial y Python en clústeres de CPU y GPU. Fundada por los creadores originales de Ray en el RISELab de la Universidad de California en Berkeley, la empresa se centra en simplificar la implementación, la orquestación y la administración de infraestructuras de inteligencia artificial a gran escala para el entrenamiento, la inferencia, el procesamiento de datos y las cargas de trabajo de inteligencia artificial autónoma. Su plataforma permite a las organizaciones ejecutar sistemas de inteligencia artificial distribuidos en entornos en la nube y locales, mientras proporciona observabilidad, gobernanza y optimizaciones de rendimiento diseñadas para aplicaciones de inteligencia artificial modernas. Ray se ha convertido en una capa fundamental en la pila de infraestructura de inteligencia artificial en surgimiento, ayudando a los desarrolladores a escalar cargas de trabajo desde una sola máquina hasta miles de nodos con mínimos cambios en el código Python existente.

Ha trabajado en ciberseguridad, plataformas de aprendizaje automático en el sector público y sistemas de personalización a gran escala. ¿Qué patrones ha visto consistentemente cuando las organizaciones intentan pasar de pilotos de inteligencia artificial a producción?

A través de las industrias, tres patrones aparecen rutinariamente. Primero, los equipos no tienen un camino pavimentado confiable desde el desarrollo hasta la producción. Pueden construir un modelo en una libreta, pero no hay una forma estandarizada de ejecutarlo en producción. Cada implementación se convierte en una excepción, y cada fallo es una sorpresa. Segundo, la infraestructura no puede escalar con las necesidades. El sistema que funcionaba en un piloto se derrumba cuando se le alimenta con volúmenes de datos reales o tráfico real. Tercero, los equipos vuelan a ciegas. Carecen de la observabilidad para saber cómo están funcionando realmente sus sistemas, dónde están a punto de fallar y cuándo intervenir.

Lo que conecta los tres es el mismo desafío raíz — los equipos no tienen un modelo mental sólido para escalar. Intentan resolver todo al mismo tiempo en lugar de ser deliberados sobre la secuencia. Pienso en ello como tres fases: hacer que funcione, hacerlo bien, hacerlo rápido. Estas fases no son hitos de una sola vez — estas fases son iterativas. Estás constantemente priorizando entre lo que está roto en este momento y lo que se romperá a continuación. Los equipos que tienen éxito saben en qué fase están y se mantienen disciplinados sobre no saltar hacia adelante antes de que la base sea sólida.

En Anyscale, vemos a equipos que llegan en cada etapa. Algunos todavía están tratando de hacer que funcione — necesitan un camino confiable desde el desarrollo hasta la producción. Otros lo tienen, pero se ahogan en la complejidad operativa y necesitan hacerlo bien. Y muchos vienen a nosotros porque han construido algo que funciona, pero no pueden empujarlo a la escala que la empresa exige. Una capa de computación unificada ayuda en cada fase, pero el punto de entrada depende de dónde es más agudo el dolor.

En Attentive, ayudó a escalar sistemas de inteligencia artificial que respaldaban a cientos de millones de usuarios. ¿Cuáles fueron los mayores cuellos de botella arquitectónicos u organizacionales que tuvo que superar para alcanzar ese nivel de escala?

El mayor cuello de botella fue la curva en forma de S de la complejidad de la infraestructura. A medida que empujábamos nuestros modelos para incorporar más datos y servir a más clientes, llegamos a un punto de inflexión de cómputo donde incluso los nodos más grandes con escalado vertical lanzaban errores de memoria agotada, y el escalado horizontal ingenuo no funcionaba. Nuestro cómputo no podía seguir el ritmo de la escala de nuestros datos.

La respuesta natural fue agregar más herramientas para trabajar alrededor de los límites. Esta era mi guión interno desde experiencias anteriores. Cada herramienta resolvía un problema estrecho, pero agregaba complejidad operativa. Nuestra canalización de aprendizaje automático se enfrentaba a convertirse en un patchwork de integraciones, y cada nuevo caso de uso significaba más costura, más modos de fallo, mayores costos y más sobrecarga para el equipo de la plataforma.

Lo que finalmente desbloqueó la escala para nosotros fue unificar el procesamiento de datos, el entrenamiento, la inferencia y el servicio en Ray y Anyscale. El impacto fue inmediato: con costos de infraestructura dramáticamente más bajos, ciclos de entrenamiento significativamente más rápidos incluso a medida que crecían los volúmenes de datos, y la capacidad de escalar modelos a órdenes de magnitud más clientes.

¿Qué motivó su decisión de unirse a Anyscale en esta etapa, y cómo ve el papel de Field CTO en la adopción de inteligencia artificial empresarial?

Mi experiencia al llevar Anyscale a Attentive cambió fundamentalmente mi guión para construir plataformas de aprendizaje automático. Antes de eso, una parte significativa de la ingeniería de la plataforma era el costo de coser sistemas fragmentados. Con Anyscale, pudimos eliminar mucha de esa sobrecarga y centrarnos en la experiencia del desarrollador, la confiabilidad y el rendimiento. Ese cambio tuvo un impacto enorme en la productividad del equipo y los resultados del sistema. Unirme a Anyscale fue una oportunidad de trabajar en ese problema a tiempo completo y ayudar a otras organizaciones a navegar la misma transición. Como Field CTO, mi rol es básicamente tomar esas lecciones del mundo real y convertirlas en patrones repetibles que nuestros clientes puedan aplicar a medida que escalan la inteligencia artificial.

Muchas empresas aún están atascadas en la “fase de piloto” de la inteligencia artificial. Desde su perspectiva, ¿qué específicamente se rompe cuando las empresas intentan escalar estos experimentos iniciales en sistemas de producción?

Cuando las empresas pasan de experimentos de inteligencia artificial a producción, lo que se rompe raramente es solo el modelo — es el sistema y las operaciones circundantes. En algunos casos, los equipos golpean los límites de la infraestructura temprano y no pueden entrenar o servir a la escala que desean. Tienen que limitar el número de clientes o casos de uso que su modelo sirve como resultado. Con más frecuencia, los problemas surgen en producción a través de casos de borde inesperados o cambios en los datos. Uno de los puntos de fallo más comunes es la memoria: a medida que el tamaño, la distribución o la modalidad de los datos cambian, los trabajos se quedan sin memoria y fallan. Estos problemas son difíciles de anticipar y aún más difíciles de recuperar automáticamente. La realidad es que el fallo es inevitable en la inteligencia artificial en producción. El objetivo no es evitarlo por completo, sino detectarlo rápidamente, entenderlo y construir sistemas auto-sanadores para resolverlo antes de que impacte en el negocio.

Ray, el marco de computación distribuida creado por el equipo detrás de Anyscale, está ganando tracción como base para cargas de trabajo de inteligencia artificial. ¿Por qué la ejecución distribuida se está convirtiendo en una capa tan crítica en la infraestructura de inteligencia artificial moderna?

La ejecución distribuida y la gestión de cargas de trabajo se han convertido en una apuesta para las canalizaciones de inteligencia artificial. Las cargas de trabajo de inteligencia artificial modernas son inherentemente paralelas y consumen muchos recursos. El entrenamiento, la inferencia y el procesamiento de datos todos requieren coordinar grandes cantidades de tareas a través de CPU y GPU, a menudo de forma dinámica. En el paisaje de cómputo actual, la complejidad de gestionar estas cargas de trabajo a través de recursos escasos es una carga operativa masiva. Los sistemas tradicionales no fueron diseñados para este nivel de complejidad o escala. Marcos como Ray son críticos porque permiten a los equipos escalar cargas de trabajo de forma transparente desde una sola máquina hasta miles de nodos al automatizar la coordinación subyacente. Este cambio refleja un movimiento más amplio hacia el cómputo nativo de inteligencia artificial, donde la infraestructura está diseñada específicamente para los patrones de las cargas de trabajo de inteligencia artificial en lugar de adaptarse de paradigmas anteriores.

A medida que más empresas adoptan Ray a través de la plataforma de Anyscale, ¿qué diferencias ve entre las organizaciones que estandarizan en un enfoque unificado y aquellas que cosen herramientas fragmentadas?

La diferencia entre plataformas unificadas y herramientas fragmentadas en última instancia se reduce a enfoque y eficiencia. Cuando los equipos confían en sistemas desconectados múltiples, pasan una cantidad significativa de tiempo cosiendo esos sistemas, gestionando inconsistencias y respondiendo a fallos en diferentes entornos. Esto crea una sobrecarga operativa y ralentiza la experimentación. En contraste, un enfoque unificado permite a los equipos concentrar sus esfuerzos en mejorar un solo sistema, lo que conduce a una mayor confiabilidad, un rendimiento más fuerte y una experiencia del desarrollador más fluida. También simplifica los procesos de llamada y depuración porque los patrones son consistentes y más fáciles de entender. El resultado no es solo la eficiencia técnica, sino la claridad organizacional.

Basándose en su experiencia en la construcción de plataformas de aprendizaje automático de extremo a extremo, ¿qué tan importante es la experiencia del desarrollador (DevEx) en la aceleración de la adopción de inteligencia artificial en los equipos?

La experiencia del desarrollador es una de las áreas de mayor influencia para acelerar la adopción de inteligencia artificial. Cuando los equipos de plataforma invierten en hacer que los sistemas sean más fáciles de usar a través de flujos de trabajo estandarizados, plantillas y una reducción de la fricción de la infraestructura, amplifican la productividad de cada ingeniero en la organización. Esto es especialmente importante en inteligencia artificial, donde el ritmo de cambio es extremadamente rápido y los equipos necesitan iterar rápidamente para mantenerse competitivos. Las mejoras en la experiencia del desarrollador se traducen directamente en una experimentación más rápida, un tiempo más rápido hasta la producción y, en última instancia, un mayor impacto comercial. Las herramientas de codificación de inteligencia artificial amplifican estos fundamentos de DevEx. En muchos sentidos, es la forma más escalable de aumentar la velocidad en toda la organización.

La eficiencia de costos se está convirtiendo en una preocupación importante a medida que las cargas de trabajo de inteligencia artificial se escalan. ¿Cuáles son algunas de las formas más pasadas por alto para que las empresas reduzcan los costos de infraestructura sin sacrificar el rendimiento?

A medida que las cargas de trabajo de inteligencia artificial se escalan, la gestión de costos se vuelve más importante y más compleja. Uno de los desafíos más pasados por alto es cómo los costos pueden espiral rápidamente debido a las ineficiencias, especialmente con la infraestructura basada en GPU. Los clústeres grandes pueden iniciar miles de nodos, y si los recursos no se gestionan ni se apagan correctamente, los costos se acumulan rápidamente. Esto crea una forma de dispersión de inteligencia artificial específica, donde el uso del cómputo crece más rápido de lo que los equipos pueden rastrear o controlar. Abordar esto requiere una combinación de una sólida gobernanza, visibilidad y automatización, como el escalado automático, la terminación automática y la gestión de recursos centralizada. A escala, la eficiencia de costos no es solo una preocupación operativa, es una parte fundamental del diseño del sistema.

Ha trabajado en todo, desde almacenes de características hasta sistemas de inferencia en tiempo real. ¿Cómo cree que está evolucionando el equilibrio entre las cargas de trabajo de inteligencia artificial por lotes y en tiempo real?

El equilibrio entre las cargas de trabajo de inteligencia artificial por lotes y en tiempo real no ha cambiado fundamentalmente — sigue siendo una cuestión de requisitos comerciales. El procesamiento por lotes es generalmente más rentable y más fácil de operar, lo que lo hace adecuado para muchos casos de uso. Los sistemas en tiempo real son esenciales cuando la latencia impacta directamente la experiencia del usuario o el resultado comercial, como en aplicaciones de chat o detección de fraude. Ambos enfoques seguirán coexistiendo, y la clave para las organizaciones es construir plataformas que puedan respaldar cada uno de manera efectiva. La decisión final se reduce a compromisos entre costo, latencia y confiabilidad.

Mirando hacia adelante, ¿cómo se ve una plataforma de inteligencia artificial empresarial “madura” en 2-3 años — y cómo encajan herramientas como Ray y plataformas como Anyscale en ese futuro?

En los próximos años, las plataformas de inteligencia artificial empresarial maduras se definirán por varias características clave. Dependerán de una infraestructura unificada que respalde todo el ciclo de vida de la inteligencia artificial, desde el procesamiento de datos hasta el entrenamiento y la inferencia, en lugar de una colección de herramientas desconectadas. Tendrán operaciones de día 2 sólidas, con capacidades de observabilidad, confiabilidad y depuración automatizadas. La gestión de costos será predecible y gobernada, lo que permitirá a las organizaciones escalar de manera sostenible. Y quizás lo más importante, permitirán una alta velocidad de desarrollo, haciendo que sea fácil para los equipos pasar de la idea a la producción rápidamente. Plataformas como Ray y Anyscale juegan un papel central en este futuro al proporcionar la base nativa de inteligencia artificial que hace posible este nivel de escala y eficiencia.

Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar Anyscale.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.