Entrevistas

Kirill Solodskih, Co-Fundador y CEO de TheStage AI – Serie de Entrevistas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Kirill Solodskih, PhD, es el Co-Fundador y CEO de TheStage AI, así como un experimentado investigador y empresario de IA con más de una década de experiencia en la optimización de redes neuronales para aplicaciones empresariales del mundo real. En 2024, co-fundó TheStage AI, que obtuvo $4,5 millones en financiamiento para automatizar completamente la aceleración de redes neuronales en cualquier plataforma de hardware.

Anteriormente, como Líder de Equipo en Huawei, Kirill lideró la aceleración de aplicaciones de cámara de IA para Qualcomm (QCOM ) NPUs, contribuyendo al rendimiento de los smartphones P50 y P60 y obteniendo múltiples patentes por sus innovaciones. Su investigación ha sido presentada en conferencias líderes como CVPR y ECCV , donde recibió premios y reconocimiento en la industria. También presenta un podcast sobre optimización y inferencia de IA.

¿Qué te inspiró a co-fundar TheStage AI, y cómo pasaste de la academia y la investigación a abordar la optimización de inferencia como fundador de una startup?

Los cimientos de lo que eventualmente se convirtió en TheStage AI comenzaron con mi trabajo en Huawei, donde estaba profundamente involucrado en la automatización de despliegues y la optimización de redes neuronales. Estas iniciativas se convirtieron en la base de algunas de nuestras innovaciones revolucionarias, y ahí es donde vi el verdadero desafío. Entrenar un modelo es una cosa, pero hacer que funcione de manera eficiente en el mundo real y hacer que sea accesible a los usuarios es otra. El despliegue es el cuello de botella que impide que muchas grandes ideas cobren vida. Para hacer algo tan fácil de usar como ChatGPT, hay muchos desafíos técnicos involucrados. Desde una perspectiva técnica, la optimización de redes neuronales se trata de minimizar parámetros mientras se mantiene el rendimiento alto. Es un problema matemático difícil con mucho espacio para la innovación.

La optimización de inferencia manual ha sido durante mucho tiempo un cuello de botella en IA. ¿Puedes explicar cómo TheStage AI automatiza este proceso y por qué es un cambio de juego?

TheStage AI aborda un gran cuello de botella en IA: la compresión y aceleración manuales de redes neuronales. Las redes neuronales tienen miles de millones de parámetros, y determinar cuáles eliminar para mejorar el rendimiento es casi imposible a mano. ANNA (Analizador de Redes Neuronales Automatizado) automatiza este proceso, identificando qué capas excluir de la optimización, similar a cómo se automatizó la compresión ZIP.

Esto cambia el juego al hacer que la adopción de IA sea más rápida y asequible. En lugar de confiar en procesos manuales costosos, las startups pueden optimizar modelos automáticamente. La tecnología da a las empresas una visión clara del rendimiento y el costo, garantizando la eficiencia y la escalabilidad sin conjeturas.

TheStage AI afirma reducir los costos de inferencia hasta en un 5x — ¿qué hace que su tecnología de optimización sea tan efectiva en comparación con los métodos tradicionales?

TheStage AI reduce los costos de salida hasta en un 5x con un enfoque de optimización que va más allá de los métodos tradicionales. En lugar de aplicar el mismo algoritmo a toda la red neuronal, ANNA la descompone en capas más pequeñas y decide qué algoritmo aplicar a cada parte para lograr la compresión deseada mientras se maximiza la calidad del modelo. Al combinar heurísticas matemáticas inteligentes con aproximaciones eficientes, nuestro enfoque es altamente escalable y hace que la adopción de IA sea más fácil para empresas de todos los tamaños. También integramos configuraciones de compilador flexibles para optimizar redes para hardware específico como iPhones o GPUs de NVIDIA. Esto nos da más control para ajustar el rendimiento, aumentando la velocidad sin perder calidad.

¿Cómo se compara la aceleración de inferencia de TheStage AI con el compilador nativo de PyTorch, y qué ventajas ofrece a los desarrolladores de IA?

TheStage AI acelera la salida mucho más allá del compilador nativo de PyTorch. PyTorch utiliza un método de compilación “justo a tiempo”, que compila el modelo cada vez que se ejecuta. Esto lleva a tiempos de inicio largos, a veces de minutos o incluso más. En entornos escalables, esto puede crear ineficiencias, especialmente cuando se necesitan nuevos GPUs para manejar la carga de usuario aumentada, lo que causa retrasos que afectan la experiencia del usuario.

En contraste, TheStage AI permite que los modelos se precompilen, por lo que una vez que un modelo está listo, se puede implementar instantáneamente. Esto conduce a despliegues más rápidos, una mayor eficiencia del servicio y ahorros de costo. Los desarrolladores pueden implementar y escalar modelos de IA más rápido, sin los cuellos de botella de la compilación tradicional, lo que lo hace más eficiente y receptivo para casos de uso de alta demanda.

¿Puedes compartir más sobre la herramienta QLIP de TheStage AI y cómo mejora el rendimiento del modelo mientras mantiene la calidad?

QLIP, la herramienta de TheStage AI, es una biblioteca de Python que proporciona un conjunto esencial de primitivas para construir rápidamente nuevos algoritmos de optimización adaptados a diferentes hardware, como GPUs y NPUs. La herramienta incluye componentes como cuantización, poda, especificación, compilación y servicio, todos críticos para desarrollar sistemas de IA eficientes y escalables.

Lo que distingue a QLIP es su flexibilidad. Le permite a los ingenieros de IA prototipar e implementar nuevos algoritmos con solo unas pocas líneas de código. Por ejemplo, un reciente artículo de conferencia de IA sobre redes neuronales cuantizadas se puede convertir en un algoritmo funcional utilizando las primitivas de QLIP en minutos. Esto facilita a los desarrolladores integrar las últimas investigaciones en sus modelos sin ser limitados por marcos rígidos.

A diferencia de los marcos de código abierto tradicionales que te limitan a un conjunto fijo de algoritmos, QLIP permite a cualquiera agregar nuevas técnicas de optimización. Esta adaptabilidad ayuda a los equipos a mantenerse por delante del panorama de IA en constante evolución, mejorando el rendimiento mientras garantiza la flexibilidad para futuras innovaciones.

Contribuiste a marcos de cuantización de IA utilizados en las cámaras de los P50 y P60 de Huawei. ¿Cómo te influyó esa experiencia en tu enfoque de optimización de IA?

Mi experiencia trabajando en marcos de cuantización de IA para las cámaras de los P50 y P60 de Huawei me dio valiosas perspectivas sobre cómo la optimización puede ser optimizada y escalada. Cuando comencé con PyTorch, trabajar con el gráfico de ejecución completo de las redes neuronales era rígido, y los algoritmos de cuantización tenían que implementarse manualmente, capa por capa. En Huawei, construí un marco que automatizó el proceso. Simplemente se ingresa el modelo, y genera automáticamente el código para la cuantización, eliminando el trabajo manual.

Esto me llevó a darme cuenta de que la automatización en la optimización de IA se trata de permitir la velocidad sin sacrificar la calidad. Uno de los algoritmos que desarrollé y patenté se convirtió en esencial para Huawei, particularmente cuando tuvieron que transitar de procesadores Kirin a Qualcomm debido a sanciones. Permitió al equipo adaptar rápidamente las redes neuronales a la arquitectura de Qualcomm sin perder rendimiento o precisión.

Al optimizar y automatizar el proceso, redujimos el tiempo de desarrollo de más de un año a solo unos meses. Esto tuvo un impacto significativo en un producto utilizado por millones y moldeó mi enfoque de optimización, centrándome en la velocidad, la eficiencia y la pérdida mínima de calidad. Esa es la mentalidad que traigo a ANNA hoy en día.

Tu investigación ha sido presentada en CVPR y ECCV — ¿cuáles son algunos de los avances clave en la eficiencia de IA que más te enorgullecen?

Cuando se me pregunta sobre mis logros en la eficiencia de IA, siempre recuerdo nuestro artículo que fue seleccionado para una presentación oral en CVPR 2023. Ser elegido para una presentación oral en una conferencia como esta es raro, ya que solo 12 artículos son seleccionados. Esto se suma al hecho de que la IA generativa suele dominar el escenario, y nuestro artículo tomó un enfoque diferente, centrado en el aspecto matemático, específicamente en el análisis y la compresión de redes neuronales.

Desarrollamos un método que nos ayudó a entender cuántos parámetros realmente necesita una red neuronal para funcionar de manera eficiente. Al aplicar técnicas del análisis funcional y pasar de una formulación discreta a una continua, logramos buenos resultados de compresión mientras manteníamos la capacidad de integrar estos cambios de regreso al modelo. El artículo también presentó varios algoritmos novedosos que no habían sido utilizados por la comunidad y encontraron aplicación adicional.

Este fue uno de mis primeros artículos en el campo de IA, y fue importante el esfuerzo colectivo de nuestro equipo, incluidos mis co-fundadores. Fue un hito significativo para todos nosotros.

¿Puedes explicar cómo funcionan las Redes Neuronales Integrales (INNs) y por qué son una innovación importante en el aprendizaje profundo?

Las redes neuronales tradicionales utilizan matrices fijas, similares a tablas de Excel, donde el tamaño y los parámetros están preestablecidos. Las INNs, sin embargo, describen redes como funciones continuas, ofreciendo mucha más flexibilidad. Piensa en ello como una manta con pinzas a diferentes alturas, y esto representa la onda continua.

Lo que hace que las INNs sean emocionantes es su capacidad para “comprimir” o “expandir” dinámicamente según los recursos disponibles, similar a cómo una señal analógica se digitaliza en sonido. Puedes encoger la red sin sacrificar la calidad, y cuando sea necesario, expandirla de regreso sin volver a entrenar.

Las probamos, y mientras que los métodos de compresión tradicionales llevan a una pérdida significativa de calidad, las INNs mantienen una calidad cercana al original incluso bajo una compresión extrema. Las matemáticas detrás de esto son más no convencionales para la comunidad de IA, pero el valor real radica en su capacidad para ofrecer resultados sólidos y prácticos con un esfuerzo mínimo.

TheStage AI ha trabajado en algoritmos de annealing cuántico — ¿cómo ves el papel de la computación cuántica en la optimización de IA en el futuro cercano?

Cuando se trata de computación cuántica y su papel en la optimización de IA, la idea clave es que los sistemas cuánticos ofrecen un enfoque completamente diferente para resolver problemas como la optimización. Aunque no inventamos algoritmos de annealing cuántico desde cero, empresas como D-Wave proporcionan bibliotecas de Python para construir algoritmos cuánticos específicamente para tareas de optimización discreta, ideales para computadoras cuánticas.

La idea aquí es que no estamos cargando directamente una red neuronal en una computadora cuántica. Eso no es posible con la arquitectura actual. En su lugar, aproximamos cómo se comportan las redes neuronales bajo diferentes tipos de degradación, haciéndolas encajar en un sistema que una placa cuántica puede procesar.

En el futuro, los sistemas cuánticos podrían optimizar y escalar redes con una precisión que los sistemas tradicionales luchan por igualar. La ventaja de los sistemas cuánticos radica en su paralelismo incorporado, algo que los sistemas clásicos solo pueden simular utilizando recursos adicionales. Esto significa que la computación cuántica podría acelerar significativamente el proceso de optimización, especialmente a medida que averiguamos cómo modelar redes más grandes y complejas de manera efectiva.

El verdadero potencial radica en utilizar la computación cuántica para resolver tareas de optimización masivas e intrincadas y descomponer parámetros en grupos más pequeños y manejables. Con tecnologías como la computación cuántica y la computación óptica, hay vastas posibilidades para optimizar IA que van mucho más allá de lo que la computación tradicional puede ofrecer.

¿Cuál es tu visión a largo plazo para TheStage AI? ¿Hacia dónde crees que se dirige la optimización de inferencia en los próximos 5-10 años?

A largo plazo, TheStage AI aspira a convertirse en un Centro de Modelos global donde cualquier persona pueda acceder fácilmente a una red neuronal optimizada con las características deseadas, ya sea para un smartphone o cualquier otro dispositivo. El objetivo es ofrecer una experiencia de arrastrar y soltar, donde los usuarios ingresan sus parámetros y el sistema genera automáticamente la red. Si la red no existe, se crea automáticamente utilizando ANNA.

Nuestro objetivo es hacer que las redes neuronales se ejecuten directamente en los dispositivos de los usuarios, reduciendo los costos en un 20 a 30%. En el futuro, esto podría eliminar casi por completo los costos, ya que el dispositivo del usuario manejaría los cálculos en lugar de depender de servidores en la nube. Esto, combinado con avances en la compresión de modelos y la aceleración de hardware, podría hacer que el despliegue de IA sea significativamente más eficiente.

También planeamos integrar nuestra tecnología con soluciones de hardware, como sensores, chips y robots, para aplicaciones en campos como la conducción autónoma y la robótica. Por ejemplo, aspiramos a construir cámaras de IA capaces de funcionar en cualquier entorno, ya sea en el espacio o bajo condiciones extremas como la oscuridad o el polvo. Esto haría que la IA sea utilizable en una amplia gama de aplicaciones y nos permitiría crear soluciones personalizadas para hardware y casos de uso específicos.

Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar TheStage AI.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.