Entrevistas
Neetu Pathak, Co-Fundadora y CEO de Skymel – Serie de Entrevistas

Neetu Pathak, Co-Fundadora y CEO de Skymel, lidera la empresa en la revolución de la inferencia de IA con su tecnología innovadora NeuroSplit ™. Junto con el CTO Sushant Tripathy, impulsa la misión de Skymel para mejorar el rendimiento de las aplicaciones de IA mientras reduce los costos computacionales.
NeuroSplit ™ es una tecnología de inferencia adaptativa que distribuye dinámicamente las cargas de trabajo de IA entre los dispositivos de los usuarios y los servidores en la nube. Este enfoque aprovecha los recursos de cómputo inactivos en los dispositivos de los usuarios, reduciendo los costos de la infraestructura en la nube hasta un 60%, acelerando las velocidades de inferencia, garantizando la privacidad de los datos y permitiendo una escalabilidad sin problemas.
Al optimizar la potencia de cómputo local, NeuroSplit ™ permite que las aplicaciones de IA se ejecuten de manera eficiente incluso en GPUs más antiguas, reduciendo significativamente los costos mientras se mejora la experiencia del usuario.
¿Qué te inspiró a co-fundar Skymel y qué desafíos clave en la infraestructura de IA estabas tratando de resolver con NeuroSplit?
La inspiración para Skymel surgió de la convergencia de nuestras experiencias complementarias. Durante su tiempo en Google (GOOGL ), mi co-fundador, Sushant Tripathy, estaba desplegando modelos de IA basados en voz en miles de millones de dispositivos Android. Descubrió que había una gran cantidad de potencia de cómputo inactiva disponible en los dispositivos de los usuarios, pero la mayoría de las empresas no podían utilizarla efectivamente debido a los complejos desafíos de ingeniería para acceder a estos recursos sin comprometer la experiencia del usuario.
Mientras tanto, mi experiencia trabajando con empresas y startups en Redis me dio una visión profunda de cómo la latencia se estaba convirtiendo en un factor crítico para los negocios. A medida que las aplicaciones de IA se volvían más comunes, estaba claro que necesitábamos mover el procesamiento más cerca de donde se estaba creando la datos, en lugar de enviar constantemente los datos de un lado a otro a los centros de datos.
Fue entonces cuando Sushant y yo nos dimos cuenta de que el futuro no se trataba de elegir entre el procesamiento local o en la nube, sino de crear una tecnología inteligente que pudiera adaptarse sin problemas entre el procesamiento local, en la nube o híbrido según cada solicitud de inferencia específica. Esta idea nos llevó a fundar Skymel y desarrollar NeuroSplit, superando las limitaciones tradicionales de la infraestructura que estaban frenando la innovación en IA.
¿Puedes explicar cómo NeuroSplit optimiza dinámicamente los recursos de cómputo mientras mantiene la privacidad del usuario y el rendimiento?
Uno de los principales obstáculos en la inferencia de IA local ha sido sus requisitos de cómputo estáticos; tradicionalmente, ejecutar un modelo de IA requiere los mismos recursos computacionales independientemente de las condiciones del dispositivo o del comportamiento del usuario. Este enfoque de “talla única” ignora la realidad de que los dispositivos tienen diferentes capacidades de hardware, desde varios chips (GPU, NPU, CPU, XPU) hasta anchos de banda de red variables, y los usuarios tienen diferentes comportamientos en términos de uso de aplicaciones y patrones de carga.
NeuroSplit monitorea continuamente varios telemetrías del dispositivo, desde capacidades de hardware hasta utilización de recursos actuales, estado de la batería y condiciones de la red. También tenemos en cuenta los patrones de comportamiento del usuario, como la cantidad de otras aplicaciones que se están ejecutando y los patrones de uso típicos del dispositivo. Esta supervisión integral permite a NeuroSplit determinar dinámicamente cuánta inferencia de cómputo se puede ejecutar de manera segura en el dispositivo del usuario mientras se optimiza para los indicadores de rendimiento clave de los desarrolladores.
Cuando la privacidad de los datos es fundamental, NeuroSplit garantiza que los datos sin procesar nunca abandonen el dispositivo, procesando la información sensible localmente mientras mantiene un rendimiento óptimo. Nuestra capacidad para dividir, recortar o desconectar modelos de IA nos permite ajustar 50-100 modelos de IA en el espacio de memoria de un solo modelo cuantizado en un dispositivo del usuario. En términos prácticos, esto significa que los usuarios pueden ejecutar significativamente más aplicaciones impulsadas por IA simultáneamente, procesando datos sensibles localmente, en comparación con los enfoques de cómputo estático tradicionales.
¿Cuáles son los principales beneficios de la inferencia adaptativa de NeuroSplit para las empresas de IA, particularmente aquellas que trabajan con tecnología de GPU más antigua?
NeuroSplit ofrece tres beneficios transformadores para las empresas de IA. Primero, reduce drásticamente los costos de infraestructura a través de dos mecanismos: las empresas pueden utilizar GPUs más antiguas y más baratas de manera efectiva, y nuestra capacidad única para ajustar tanto modelos completos como modelos de stub en GPUs en la nube permite tasas de utilización de GPU significativamente más altas. Por ejemplo, una aplicación que normalmente requiere múltiples NVIDIA A100 a $2.74 por hora ahora puede ejecutarse en una sola A100 o en múltiples V100 a solo 83 centavos por hora.
En segundo lugar, mejoramos sustancialmente el rendimiento procesando los datos sin procesar directamente en los dispositivos de los usuarios. Esto significa que los datos que eventualmente viajan a la nube son mucho más pequeños en tamaño, reduciendo significativamente la latencia de la red mientras se mantiene la precisión. Este enfoque híbrido ofrece a las empresas lo mejor de ambos mundos: la velocidad del procesamiento local con el poder del cómputo en la nube.
En tercer lugar, al procesar los datos iniciales sensibles en el dispositivo del usuario, ayudamos a las empresas a mantener fuertes protecciones de privacidad del usuario sin sacrificar el rendimiento. Esto es cada vez más crucial a medida que las regulaciones de privacidad se vuelven más estrictas y los usuarios se vuelven más conscientes de la privacidad.
¿Cómo reduce la solución de Skymel los costos de inferencia de IA sin comprometer la complejidad o la precisión del modelo?
Primero, al dividir los modelos de IA individuales, distribuimos el cómputo entre los dispositivos de los usuarios y la nube. La primera parte se ejecuta en el dispositivo del usuario, manejando del 5% al 100% del cómputo total dependiendo de los recursos del dispositivo disponibles. Solo el cómputo restante necesita ser procesado en GPUs en la nube.
Esta división significa que las GPUs en la nube manejan una carga de cómputo reducida; si un modelo originalmente requería una GPU A100 completa, después de la división, esa misma carga de trabajo podría necesitar solo el 30-40% de la capacidad de la GPU. Esto permite a las empresas utilizar instancias de GPU más rentables como la V100.
En segundo lugar, NeuroSplit optimiza la utilización de GPU en la nube. Al organizar de manera eficiente tanto los modelos completos como los modelos de stub en la misma GPU en la nube, logramos tasas de utilización significativamente más altas en comparación con los enfoques tradicionales. Esto significa que más modelos pueden ejecutarse simultáneamente en la misma GPU en la nube, reduciendo aún más los costos por inferencia.
¿Qué distingue el enfoque híbrido (local + nube) de Skymel de otras soluciones de infraestructura de IA en el mercado?
El panorama de la IA se encuentra en un punto de inflexión fascinante. Mientras que Apple (AAPL ), Samsung y Qualcomm (QCOM ) están demostrando el poder de la IA híbrida a través de sus características de ecosistema, estas siguen siendo jardines cerrados. Pero la IA no debería limitarse por el dispositivo que un usuario sucede que use.
NeuroSplit es fundamentalmente agnóstico del dispositivo, agnóstico de la nube y agnóstico de la arquitectura de la red neuronal. Esto significa que los desarrolladores pueden finalmente ofrecer experiencias de IA consistentes independientemente de si sus usuarios están en un iPhone, un dispositivo Android o una laptop; o si están utilizando AWS, Azure o Google Cloud.
Piensa en lo que esto significa para los desarrolladores. Pueden construir su aplicación de IA una vez y saber que se adaptará inteligentemente en cualquier dispositivo, cualquier nube y cualquier arquitectura de red neuronal. No necesitan construir diferentes versiones para diferentes plataformas o comprometer características en función de las capacidades del dispositivo.
Estamos sacando las capacidades de IA híbrida de los jardines cerrados y haciéndolas universalmente accesibles. A medida que la IA se vuelve central en cada aplicación, este tipo de flexibilidad y consistencia no es solo una ventaja; es esencial para la innovación.
¿Cómo complementa el Agente de Orquestador a NeuroSplit y qué papel desempeña en la transformación de las estrategias de implementación de IA?
El Agente de Orquestador (OA) y NeuroSplit trabajan juntos para crear un sistema de implementación de IA auto-optimizable:
1. Los desarrolladores establecen los límites:
- Restricciones: modelos permitidos, versiones, proveedores de nube, zonas, reglas de cumplimiento
- Objetivos: latencia objetivo, límites de costo, requisitos de rendimiento, necesidades de privacidad
2. El OA trabaja dentro de estas restricciones para lograr los objetivos:
- Decide qué modelos/API utilizar para cada solicitud
- Ajusta las estrategias de implementación en función del rendimiento en el mundo real
- Toma decisiones para optimizar los objetivos especificados
- Puede reconfigurarse instantáneamente a medida que cambian las necesidades
3. NeuroSplit ejecuta las decisiones del OA:
- Utiliza la telemetría del dispositivo en tiempo real para optimizar la ejecución
- Divide el procesamiento entre el dispositivo y la nube cuando es beneficioso
- Garantiza que cada inferencia se ejecute de manera óptima dadas las condiciones actuales
Es como tener un sistema de IA que se auto-optimiza dentro de las reglas y objetivos definidos, en lugar de requerir una optimización manual para cada escenario.
En tu opinión, ¿cómo redefinirá el Agente de Orquestador la forma en que se despliega la IA en las industrias?
Resuelve tres desafíos críticos que han estado frenando la adopción y la innovación de la IA.
Primero, permite que las empresas sigan el ritmo de los últimos avances en IA sin esfuerzo. Con el Agente de Orquestador, pueden aprovechar los modelos y técnicas más nuevos sin tener que volver a trabajar en su infraestructura. Esta es una ventaja competitiva importante en un mundo donde la innovación en IA se está moviendo a una velocidad vertiginosa.
En segundo lugar, permite la optimización dinámica de la selección de modelos de IA por solicitud. El Agente de Orquestador puede combinar inteligentemente modelos de todo el ecosistema de opciones para ofrecer los mejores resultados posibles para cada interacción del usuario. Por ejemplo, un sistema de servicio al cliente de IA podría utilizar un modelo especializado para preguntas técnicas y otro modelo para preguntas de facturación, ofreciendo mejores resultados para cada tipo de interacción.
En tercer lugar, maximiza el rendimiento mientras minimiza los costos. El Agente automáticamente equilibra entre ejecutar la IA en el dispositivo del usuario o en la nube en función de lo que tiene más sentido en ese momento. Cuando la privacidad es importante, procesa los datos localmente. Cuando se necesita más potencia de cómputo, aprovecha la nube. Todo esto sucede detrás de escena, creando una experiencia fluida para los usuarios mientras se optimizan los recursos para las empresas.
Pero lo que realmente distingue al Agente de Orquestador es cómo permite a las empresas crear experiencias hiper-personalizadas de próxima generación para sus usuarios. Toma un plataforma de aprendizaje en línea; con nuestra tecnología, pueden construir un sistema que se adapte automáticamente a la comprensión de cada estudiante. Cuando un usuario busca “aprendizaje automático”, la plataforma no muestra solo resultados genéricos; puede evaluar instantáneamente su comprensión actual y personalizar las explicaciones utilizando conceptos que ya conoce.
En última instancia, el Agente de Orquestador representa el futuro de la implementación de IA; un cambio de la infraestructura de IA estática y monolítica a la orquestación de IA dinámica y auto-optimizable. No se trata solo de hacer que la implementación de IA sea más fácil; se trata de hacer posible clases enteras de aplicaciones de IA que no existen.
¿Qué tipo de retroalimentación has recibido hasta ahora de las empresas que participan en la beta privada del Agente de Orquestador?
La retroalimentación de nuestros participantes en la beta privada ha sido excelente. Las empresas están emocionadas de descubrir que pueden finalmente liberarse del bloqueo de la infraestructura, ya sea a modelos propietarios o a servicios de alojamiento. La capacidad de tomar decisiones de implementación a prueba de futuro ha sido un juego cambiator; elimina los meses de rework temidos cuando se cambia de enfoque.
Nuestros resultados de rendimiento de NeuroSplit han sido nada menos que asombrosos; no podemos esperar para compartir los datos públicamente pronto. Lo que es particularmente emocionante es cómo el concepto mismo de implementación de IA adaptativa ha capturado la imaginación. El hecho de que la IA se esté implementando a sí misma suena futurista y no es algo que esperaran ahora, así que solo desde el avance tecnológico, la gente se emociona con las posibilidades y los nuevos mercados que podría crear en el futuro.
Con los avances rápidos en la IA generativa, ¿qué ves como los próximos obstáculos importantes para la infraestructura de IA, y cómo planea Skymel abordarlos?
Nos dirigimos hacia un futuro que la mayoría no ha comprendido completamente aún: no habrá un solo modelo de IA dominante, sino miles de millones. Incluso si creamos el modelo de IA general más poderoso imaginable, todavía necesitaremos versiones personalizadas para cada persona en la Tierra, cada una adaptada a contextos, preferencias y necesidades únicos. Eso son al menos 8.000 millones de modelos, basados en la población del mundo.
Esto marca un cambio revolucionario desde el enfoque de “talla única” de hoy. El futuro exige una infraestructura inteligente que pueda manejar miles de millones de modelos. En Skymel, no solo estamos resolviendo los desafíos de implementación de hoy; nuestra hoja de ruta tecnológica ya está construyendo la base de lo que está por venir.
¿Cómo visualizas la evolución de la infraestructura de IA en los próximos cinco años, y qué papel crees que Skymel desempeñará en esta evolución?
El panorama de la infraestructura de IA está a punto de experimentar un cambio fundamental. Mientras que hoy en día se centra en escalar modelos de lenguaje grande genéricos en la nube, los próximos cinco años verán a la IA volviéndose profundamente personalizada y consciente del contexto. Esto no se trata solo de afinar; se trata de una IA que se adapta a usuarios, dispositivos y situaciones específicos en tiempo real.
Este cambio crea dos desafíos de infraestructura importantes. Primero, el enfoque tradicional de ejecutar todo en centros de datos centralizados se vuelve insostenible tanto técnicamente como económicamente. En segundo lugar, la creciente complejidad de las aplicaciones de IA significa que necesitamos una infraestructura que pueda optimizar dinámicamente a través de múltiples modelos, dispositivos y ubicaciones de cómputo.
En Skymel, estamos construyendo una infraestructura que aborda específicamente estos desafíos. Nuestra tecnología permite que la IA se ejecute donde más sentido tenga; ya sea en el dispositivo donde se genera la datos, en la nube donde hay más cómputo disponible, o inteligentemente dividido entre los dos. Más importante aún, toma estas decisiones en tiempo real en función de condiciones y requisitos cambiantes.
Mirando hacia adelante, las aplicaciones de IA exitosas no se definirán por el tamaño de sus modelos o la cantidad de cómputo que pueden acceder. Se definirán por su capacidad para ofrecer experiencias personalizadas y responsivas mientras gestionan los recursos de manera eficiente. Nuestro objetivo es hacer que este nivel de optimización inteligente esté disponible para cada aplicación de IA, independientemente de la escala o la complejidad.
Gracias por la gran entrevista, los lectores que deseen obtener más información pueden visitar Skymel.












