Entrevistas
Jeronimo De Leon, Gerente Senior de Producto de Inteligencia Artificial en Backblaze – Serie de Entrevistas

Jeronimo De Leon es un experimentado líder en gestión de productos con más de 10 años de experiencia impulsando la innovación basada en inteligencia artificial en entornos empresariales y de startups. Actualmente, como Gerente Senior de Producto de Inteligencia Artificial en Backblaze, lidera el desarrollo de funciones de inteligencia artificial y aprendizaje automático, se centra en cómo Backblaze mejora el ciclo de vida de los datos de inteligencia artificial para las arquitecturas de MLOps de los clientes y implementa herramientas y agentes de inteligencia artificial para optimizar las operaciones internas.
Backblaze es una empresa de almacenamiento y respaldo en la nube que ofrece respaldos automáticos y ilimitados de computadoras para individuos y empresas, junto con soluciones de almacenamiento de objetos escalables para cargas de trabajo empresariales, medios y aplicaciones. Sus servicios se centran en la asequibilidad, la seguridad de los datos, la recuperación sencilla y la compatibilidad sin problemas con los sistemas existentes.
Llevas más de una década de experiencia en gestión de productos impulsados por inteligencia artificial, desde trabajar con LLM en Intelas y RAG en Welcome.AI hasta lanzar el chatbot de Bloomberg y ahora liderar los esfuerzos de inteligencia artificial en Backblaze. ¿Cómo han moldeado estas experiencias tu visión sobre el papel del almacenamiento en la nube en la escalabilidad de los flujos de trabajo de inteligencia artificial y aprendizaje automático?
Desde que comencé a trabajar en proyectos de inteligencia artificial en IBM Watson, he visto que el ritmo de la innovación se ha acelerado dramáticamente. Lo que antes llevaba años pasar de la investigación a la producción ahora sucede en meses. Sin embargo, los desafíos fundamentales de la infraestructura siguen siendo los mismos: ¿dónde está el dato, dónde lo almacenamos y cómo lo accedemos de manera eficiente?
Antes, las limitaciones eran la capacidad de procesamiento y los modelos, pero ahora tenemos una abundancia de modelos preentrenados y hay muchos proveedores de capacidad de procesamiento. Sin embargo, cuando comenzamos un proyecto, típicamente teníamos que empezar con un proyecto de recopilación y procesamiento de datos, y eso sigue siendo lo mismo hoy en día. Constantemente veo que las organizaciones tropiezan con el mismo cuello de botella de consolidar datos de fuentes dispares. Las organizaciones que tienen éxito son aquellas que resuelven el problema de la accesibilidad a los datos temprano, creando una base que se escalona con su madurez en inteligencia artificial. Las decisiones sobre la arquitectura de almacenamiento determinan cuán rápido puedes llegar a la formación de modelos y innovar.
¿Dónde ves que el almacenamiento en la nube juega los roles más críticos a lo largo del ciclo de vida de la inteligencia artificial, desde la ingesta y el procesamiento de datos hasta el entrenamiento, la afinación, la inferencia y el monitoreo?
El almacenamiento en la nube es fundamental en todo el ciclo de vida de la inteligencia artificial, con etapas clave en la agregación de datos, el procesamiento, el entrenamiento y la inferencia. Al principio, la consolidación sistemática, el catálogo y la seguridad de los archivos aceleran los nuevos proyectos y facilitan la prueba de modelos emergentes. Los datos limpios y bien procesados a menudo superan a la simple cantidad de datos, lo que hace que el almacenamiento sea central tanto para la calidad como para la escalabilidad. Una de mis frases favoritas de Backblaze es: “No es acaparamiento si se trata de datos”. Nunca sabes cuán valioso puede ser, así que las organizaciones deben recopilar tanto como sea posible. Durante el entrenamiento, el almacenamiento escalable garantiza el rendimiento de grandes conjuntos de datos, y en la inferencia, la captura de las salidas de las predicciones y la retroalimentación del usuario permite la iteración continua. Al final, el almacenamiento es la base que determina cuán rápido puedes innovar con la inteligencia artificial.
¿Cuáles son los obstáculos más grandes que enfrentan las organizaciones al escalar el almacenamiento para la inteligencia artificial, y cómo difieren estos desafíos entre las startups más pequeñas y las grandes empresas?
Los obstáculos más grandes al escalar el almacenamiento para la inteligencia artificial son el costo, la gestión de los datos y la accesibilidad. Almacenar grandes volúmenes de datos es solo parte del desafío; también deben estar organizados, ser recuperables y gobernados con los controles adecuados. Los datos limpios y bien estructurados a menudo son más valiosos que simplemente tener más datos.
Para las startups, el desafío inicial es adquirir suficientes datos para entrenar y afinar sus modelos. Una vez que los tienen, el costo y la arquitectura se convierten en las siguientes barreras.
Para las grandes empresas, el desafío es la complejidad. Sus datos son abundantes pero fragmentados a través de silos, sistemas heredados y regímenes de cumplimiento, lo que hace que la consolidación y la accesibilidad sean difíciles.
Las organizaciones que tienen éxito tratan el almacenamiento como un habilitador estratégico que se escalona en costo, rendimiento y accesibilidad junto con su madurez en inteligencia artificial.
Entre el costo, la latencia, la seguridad y el cumplimiento, ¿cuál ves como la barrera más apremiante para escalar la inteligencia artificial hoy en día, y cómo deberían priorizar las organizaciones para abordarla?
Entre el costo, la latencia, la seguridad y el cumplimiento, la latencia es una de las barreras más apremiantes. Impacta directamente tanto el entrenamiento como la inferencia, y la inferencia en particular da forma a la experiencia del usuario. Las organizaciones hacen todo lo posible para reducir la latencia en esta etapa, ya que los retrasos en la prestación de predicciones pueden socavar la adopción.
El costo sigue siendo un desafío constante a medida que crecen los volúmenes de datos, y el cumplimiento se vuelve más crítico a medida que las organizaciones escalan, especialmente en industrias reguladas. Las startups a menudo se centran primero en el costo y la latencia, mientras que las empresas deben equilibrar la latencia con la gobernanza y las demandas regulatorias. La prioridad debería ser construir un almacenamiento que minimice la latencia para el entrenamiento y la inferencia, al mismo tiempo que es eficiente en términos de costo y cumplimiento a medida que se expande la adopción de la inteligencia artificial.
Las empresas a menudo enfatizan la necesidad de flexibilidad y acceso fácil a los datos para impulsar la innovación en inteligencia artificial. Desde tu perspectiva, ¿qué aspecto tiene la verdadera flexibilidad en el acceso a los datos, y por qué es tan esencial?
En una charla reciente que di, enfatizé la idea de archivado inteligente. La verdadera flexibilidad en el acceso a los datos comienza con la centralización de la información en un archivo estructurado y buscable. Eso significa unificar formatos diversos, normalizar y etiquetar para la coherencia, y habilitar la indexación para futuras consultas. Este enfoque garantiza que los datos no solo se almacenan, sino que se hacen útiles.
Es esencial porque establece la base para el análisis y la modelización. Cuando los datos están estructurados y son buscables, los equipos pueden moverse más rápido, experimentar con más libertad y reducir la latencia tanto en el entrenamiento como en la inferencia. Sin este tipo de flexibilidad, el almacenamiento se convierte rápidamente en un cuello de botella en lugar de un habilitador para la innovación en inteligencia artificial.
¿Puedes compartir casos de uso en el mundo real, como con clientes como Decart AI o Wynd Labs, que demuestran cómo el enfoque correcto de almacenamiento en la nube puede habilitar directamente la innovación en inteligencia artificial?
Estos son dos ejemplos excelentes de cómo el enfoque correcto de almacenamiento en la nube puede habilitar directamente la innovación en inteligencia artificial. Decart se centró en el entrenamiento de modelos, donde mover datos a la computación de manera eficiente era crítico. Con Backblaze B2, escaló a 16 PB en 90 días, se entrenó en múltiples clústeres de GPU con cero costo de egreso y logró diez veces la eficiencia de los competidores. Esa confiabilidad y eficiencia les permitió innovar más rápido.
Wynd Labs se centró en el acceso de los clientes a los datos. Ingiere petabytes diariamente y sirve decenas de petabytes mensualmente. Con el rendimiento de alto nivel y el egreso gratuito de Backblaze, pudieron escalar para satisfacer la demanda empresarial y reinvertir recursos en el desarrollo de productos. Esa capacidad para entregar el acceso a los datos a escala desbloqueó nuevas oportunidades para su plataforma.
En ambos casos, la estrategia de almacenamiento correcta transformó la infraestructura de una limitación en un habilitador, permitiendo a las empresas centrarse en innovar en inteligencia artificial en lugar de gestionar el costo y la complejidad.
A medida que los modelos y conjuntos de datos de inteligencia artificial crecen en complejidad, ¿qué orientación darías a las organizaciones que intentan equilibrar el rendimiento del almacenamiento con la eficiencia del costo?
Las organizaciones necesitan pensar en su uso de datos a largo plazo con su producto en mente. Recopilar, procesar, mover y ejecutar inferencia en los datos serán fundamentales para cómo evoluciona su producto. Si no tienen en cuenta eso ahora, los costos y los desafíos de almacenamiento solo se multiplicarán con el tiempo. Dado que la inteligencia artificial será una parte central de su producto y su organización, el almacenamiento debe diseñarse temprano para equilibrar el rendimiento con la eficiencia del costo para que pueda escalar suavemente a medida que crecen.
La seguridad y el cumplimiento son especialmente apremiantes en las industrias reguladas. ¿Cómo ves que el almacenamiento en la nube evoluciona para apoyar las necesidades de gobernanza mientras permite que los equipos innoven rápidamente?
La gobernanza es una parte clave del almacenamiento. Simplificar el acceso con una base sólida para cómo se gestiona, se segura y se audita los datos es crítico. Veo que el almacenamiento en la nube evoluciona con controles más sólidos integrados, como la cifrado por defecto, permisos granulares, registros de auditoría y opciones de residencia de datos. Tan importante como eso es la genealogía de los datos. En la inteligencia artificial, saber de dónde vienen los datos, cómo se han procesado y cómo alimentan a los modelos es esencial tanto para el cumplimiento como para la confianza.
Al mismo tiempo, las plataformas de almacenamiento están mejorando la usabilidad para que los equipos puedan moverse rápidamente. Cuando la gobernanza, la genealogía y la accesibilidad trabajan juntas, las organizaciones pueden cumplir con los requisitos regulatorios mientras continúan innovando con la inteligencia artificial a velocidad.
Para las organizaciones que evalúan o migran a B2, ¿qué consejo o orientación proporcionas en términos de implementación, particularmente en cuanto a la migración de datos, la integración con las pilas de computación o MLOps existentes, o la optimización para el rendimiento y el egreso?
Como B2 es compatible con S3, se integra directamente en las pilas de MLOps y computación existentes sin necesidad de re-arquitectura. A menudo trabajamos con clientes en un concepto de prueba para validar la migración, el rendimiento y la integración antes de escalar. A partir de ahí, el enfoque está en optimizar el rendimiento, el movimiento de datos y la orquestación de datos para que los equipos puedan entrenar en clústeres, ejecutar inferencia e iterar rápidamente sin ser frenados por cuellos de botella de infraestructura.
A medida que las cargas de trabajo de inteligencia artificial continúan escalando, especialmente con tendencias alrededor de LLM, conjuntos de datos a escala de exabytes y estrategias híbridas o multi-nube, ¿cómo está evolucionando Backblaze sus ofertas de almacenamiento para satisfacer estas necesidades emergentes?
En Backblaze, nos centramos no solo en cómo se utilizan los datos hoy en día, sino en cómo se orquestarán en el futuro. El almacenamiento ya no es solo un archivo; se está convirtiendo en una herramienta que habilita el acceso rápido, el movimiento eficiente y la orquestación confiable de los datos en todos los entornos. Con LLM y conjuntos de datos a escala de exabytes, esta base de acceso fácil y alto rendimiento será crítica no solo para el entrenamiento y la inferencia, sino también para la clase emergente de agentes de inteligencia artificial que dependen de los datos para hacer que los procesos sean más autónomos. El resultado es una base de almacenamiento que habilita la innovación ahora y prepara a las organizaciones para lo que viene a continuación.
Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar Backblaze.












