Entrevistas
Jay Mishra, COO de Astera Software – Serie de entrevistas

Jay Mishra es el Director de Operaciones (COO) de Astera Software, un proveedor de soluciones de datos de empresa en rápido crecimiento. Ayudan a los usuarios empresariales a cerrar la brecha entre los datos y las ideas con una suite de soluciones de extracción de datos, calidad de datos, integración de datos, almacenamiento de datos y intercambio de datos electrónicos, que son utilizadas por empresas de tamaño mediano y Fortune 500 en una variedad de industrias.
¿Qué te atrajo inicialmente a la informática?
Siempre he tenido una pasión profunda por las matemáticas, y mi entrada en la informática fue una extensión natural de eso. Mi educación universitaria fue en Matemáticas y Ciencias de la Computación, y fue la progresión lógica desde el mundo de las matemáticas al ámbito de la informática lo que me fascinó. Lo que particularmente llamó mi atención fueron los intrincados mecanismos de los algoritmos y los procesos algorítmicos avanzados, lo que me llevó a especializarme en algoritmos durante mi Maestría en Ciencias de la Computación. Desde entonces, mi conexión con la informática ha seguido siendo fuerte, y me esfuerzo constantemente por mantenerme al tanto de los últimos desarrollos en el campo.
Actualmente eres el COO de Astera, ¿podrías compartir con nosotros qué implica tu papel diario?
Como COO de Astera, mi papel es multifacético, reflejando la naturaleza dinámica de nuestra empresa. He estado con Astera desde su inicio, y mis responsabilidades han abarcado diversas áreas de la organización. Esto incluye todo, desde contribuir activamente al desarrollo y codificación de nuestros productos hasta asegurarme de que nuestras características se alineen con las necesidades cambiantes de nuestros clientes. Colaboro estrechamente con nuestros clientes, trabajando en conjunto con ellos para refinar nuestras soluciones. Mi papel va más allá del desarrollo de productos para abarcar las ventas y el marketing, donde llevamos nuestros productos al mercado.
Como estamos en una fase de crecimiento, he asumido responsabilidades adicionales, incluyendo la supervisión de nuestros objetivos de ingresos y la expansión estratégica de nuestro portafolio de productos para llegar a nuevos mercados. Esencialmente, tengo una mano en casi todos los aspectos de nuestras operaciones, asegurándome de que no solo construyamos productos excepcionales, sino que también los llevemos con éxito al mercado y logremos nuestros objetivos comerciales.
Para los lectores que no están familiarizados con este término, ¿qué es la gestión de datos?
La gestión de datos es un patrón arquitectónico utilizado para consolidar todos los datos empresariales en un repositorio centralizado que servirá como base para generar varios tipos de análisis, informes y paneles que presentarán una imagen real de dónde se encuentra su negocio y también predecirán cómo estará el negocio en el futuro. Para atender a todo esto, se reúnen los datos de una cierta manera y esa arquitectura se llama almacén de datos.
El término en realidad se toma de un almacén de la vida real donde los productos se almacenan en estantes organizados. Pero cuando se entra en el mundo de los datos, se reúnen los datos de diversas fuentes. Se reúnen los datos de la producción, el sitio web, los clientes, las ventas y el marketing, las finanzas y el departamento de recursos humanos. Se reúnen todos los datos en un lugar y eso es lo que se llamará almacén de datos y se diseña de una cierta manera para que los informes, especialmente basados en la línea de tiempo, sean fáciles. Ese es el propósito principal de un almacén de datos.
¿Cuáles son algunas de las tendencias clave en la gestión de datos hoy en día?
La gestión de datos ha evolucionado mucho en los últimos 20-25 años. Aproximadamente una década atrás, presenciamos el surgimiento de la gestión de datos automatizada, un cambio de paradigma que aceleró el proceso de creación de modelos de datos y almacenes de datos. Recientemente, la automatización ha ocupado el centro del escenario. Aborda la naturaleza repetitiva de las tareas de gestión de datos, racionalizando los procesos para ahorrar tiempo y recursos.
Nuestro producto, Astera Data Warehouse Builder, por ejemplo, ofrece un enfoque holístico para la automatización en la gestión de datos. Cubre todo, desde la automatización de pipelines ETL (Extraer, Transformar, Cargar) y modelado de datos hasta la carga automática de datos en estructuras como esquemas estrella o almacenes de datos. Además, mantiene eficientemente estas estructuras a través de mecanismos de captura de cambios de datos (CDC). Esta automatización integral ha surgido como una tendencia clave en el paisaje de la gestión de datos.
Además, la tendencia más reciente es la fusión entre la gestión de datos y la inteligencia artificial (IA). En particular, la IA generativa ha llevado la automatización a nuevas alturas. No solo automatiza tareas, sino que también ayuda a los usuarios en la toma de decisiones.
La configuración de los componentes de la gestión de datos, pipelines y puntos de decisión puede ser guiada por la IA, haciendo que la gestión de datos sea más poderosa y eficiente que nunca. En esencia, esto es la automatización a esteroides, y está transformando el paisaje de la gestión de datos. La intersección entre la IA y la gestión de datos es una tendencia que tiene un gran potencial para el futuro.
¿Cuáles son los cuatro principios fundamentales que las empresas deben considerar para el desarrollo de su almacén de datos?
1. Definir objetivos claros
Es esencial comenzar entendiendo exactamente qué se necesita del almacén de datos. Evite la trampa común de recopilar datos excesivos sin un propósito claro. En su lugar, identifique los objetivos específicos que se desean lograr con el almacén de datos. ¿Qué informes y perspectivas se buscan? Al centrarse en los objetivos, se puede asegurar que solo se recopilen los datos relevantes, en lugar de acumular grandes cantidades de información. Dada la disminución de los costos de almacenamiento y potencia de procesamiento, es crucial utilizar estos recursos de manera inteligente y ética.
2. Elegir el patrón arquitectónico adecuado
Los patrones arquitectónicos son muy importantes. Deciden si la solución de gestión de datos tendrá éxito o no. Hay varias opciones, que van desde la gestión de datos de estilo Inmon hasta los esquemas estrella de Ralph Kimball, así como patrones más nuevos como Data Vault y el enfoque de una gran tabla defendido por los vendedores de bases de datos columna. No todos los patrones serán adecuados para cada escenario.
Estamos viendo principalmente una combinación de esquema estrella en la parte superior de un almacén de datos. Entonces, una combinación de Data Vault y Esquema Estrella es todavía el patrón más ampliamente utilizado. Pero, como dije, para cada requisito o para cada escenario, habrá una respuesta diferente. Así que ejecútelo a través de los expertos, vea qué patrón arquitectónico es una buena opción para su escenario.
3. Seleccionar las herramientas adecuadas
Las herramientas son muy importantes y hacen una gran diferencia nuevamente en el tiempo y los recursos necesarios para construir una solución y también en la precisión y la calidad de su solución, que está determinada por los productos que se utilizarán para construir y mantener el almacén de datos. Preste mucha atención a la capacidad del producto y busque productos que puedan reunir la mayoría de los requisitos bajo un mismo paraguas. Hay ciertas áreas como ETL (Extraer, Transformar, Cargar), calidad de datos, modelado de datos, carga de datos y publicación de datos que juegan un papel significativo. Si intenta utilizar varios productos para cada una de estas áreas, será difícil. Así que busque productos que puedan hacer la mayoría, si no todos, los diferentes componentes.
4. Su equipo
Por último, pero no menos importante, el equipo de personas que se reúne para construir la solución de almacén de datos es la parte más importante. Recomendamos tener a alguien con una sólida formación en patrones arquitectónicos de datos. En términos de composición del equipo, los equipos multifuncionales son la mejor manera de abordarlo, donde se tiene una mezcla de usuarios empresariales y personas con algún conocimiento de programación o al menos experiencia en datos, y tener una estrecha colaboración entre los custodios de datos, las personas a cargo de los datos y, por supuesto, el negocio. Al fomentar una estrecha cooperación entre estos diferentes aspectos de su organización, se puede crear un equipo cohesivo y eficaz responsable de construir y mantener la solución de gestión de datos.
El éxito en la gestión de datos depende de lograr un equilibrio entre estos cuatro principios. Estos principios, cuando se siguen cuidadosamente, han demostrado ser una receta para el éxito en nuestra experiencia.
¿Por qué las empresas necesitan una pila de datos moderna?
Depende de cómo definamos “moderna” y eso cambia constantemente, a veces por año, mes e incluso por día. Debemos considerar conjuntos de herramientas modernas diseñados con el paisaje cambiante de los datos en mente. En los últimos años, ha habido cambios significativos en la naturaleza y el volumen de los datos. El surgimiento de Big Data ha transformado el paisaje de los datos, con datos que fluyen de fuentes como sitios web de comercio electrónico, bases de datos de producción y varias partes de su negocio. Estos datos están cambiando no solo en volumen, sino también en su naturaleza.
En el pasado, los datos eran en su mayoría estructurados, pero ahora los datos no estructurados desempeñan un papel significativo. Además, la velocidad a la que se generan y se hacen disponibles los datos ha aumentado. Dadas estas cambios en los datos, debemos evaluar y adaptar continuamente nuestro conjunto de herramientas para abordar eficazmente estos desafíos de datos en constante evolución.
La pila de datos moderna está diseñada para manejar todas las variaciones en las estructuras y la velocidad de los datos, y está bien equipada para adaptarse a los patrones arquitectónicos emergentes que han evolucionado en los últimos años. Por lo tanto, si desea aprovechar al máximo sus datos, debe considerar la modernización de su pila de datos. Esa es la única manera de mantenerse al día con los nuevos desafíos de los datos.
Hemos visto que las empresas se aferran a soluciones existentes que parecen funcionar. Es crucial reconocer que los datos en sí son inherentemente dinámicos. Continúan evolucionando, presentando nuevos desafíos y oportunidades. Las soluciones existentes pueden no estar equipadas para adaptarse a estos cambios. Por lo tanto, para aprovechar al máximo el potencial de sus datos, las empresas deben abrazar el concepto de modernizar su pila de datos. No se trata de romper lo que funciona; se trata de mantenerse ágil y responder a la naturaleza cambiante de los datos. Al evaluar y integrar continuamente los avances en la tecnología de los datos, las empresas pueden mantenerse competitivas y tomar decisiones informadas en un mundo cada vez más impulsado por los datos.
¿Cuáles son algunos de los desafíos actuales de gestión de datos que se ven en la industria?
1. Velocidad de los datos y integración
Uno de los grandes desafíos que enfrentamos hoy en día es el volumen masivo de datos que fluyen de diversas aplicaciones. Si se toma una organización de TI típica, lidian con nuevas aplicaciones que surgen todo el tiempo, docenas, a veces incluso cientos cada año, especialmente en organizaciones de tamaño mediano.
Ahora, todos estos datos generan datos valiosos. La principal preocupación aquí es la capacidad de integrar rápidamente estas nuevas fuentes de datos en los pipelines de datos existentes y consolidarlos en una vista unificada. La velocidad a la que las organizaciones pueden adaptarse e incorporar estos nuevos flujos de datos es el mayor desafío que vemos.
2. Formatos de datos variables
Otro desafío crítico proviene de la naturaleza de los datos en sí, particularmente del aumento de la prevalencia de datos no estructurados. Con los datos no estructurados, hay diferentes escuelas de pensamiento sobre cómo manejarlos.
Las organizaciones deben decidir si almacenar estos datos directamente en lagos de datos para su uso posterior o extraerlos y transformarlos en un formato más estructurado para su consumo inmediato. El desafío de cómo manejar los datos no estructurados sigue siendo un desafío, y vemos que incluso las empresas de tamaño mediano o pequeño se ven afectadas por ello. Así que idear estrategias efectivas para manejar los datos no estructurados es esencial.
3. Publicación y compartición de datos
Mientras que la integración y consolidación de datos son cruciales, la capacidad de compartir datos de manera efectiva es igualmente importante. Las organizaciones necesitan mecanismos para publicar y distribuir datos a departamentos internos, proveedores, socios y otras partes interesadas. Este desafío va más allá de simplemente hacer que los datos estén disponibles; implica garantizar la seguridad de los datos, la privacidad y el cumplimiento de las regulaciones. A medida que el intercambio de datos se convierte en una necesidad para las empresas de todos los tamaños, las tecnologías y productos en este espacio están evolucionando rápidamente para satisfacer la demanda.
¿De qué manera Astera ha integrado la IA en el flujo de trabajo de los clientes?
Consideramos la intersección de la IA con la gestión de datos de dos maneras distintas.
1. Mejorar la usabilidad con IA generativa
Nuestro compromiso profundo con la usabilidad es una piedra angular de nuestra filosofía de desarrollo de productos. En los últimos 12 a 13 años, hemos construido una sólida reputación por diseñar productos con una curva de aprendizaje corta, haciéndolos accesibles incluso para usuarios no técnicos. Con solo una modesta cantidad de capacitación, las personas pueden utilizar eficazmente nuestros productos para realizar tareas significativas con sus datos.
Con la introducción de la IA generativa, Astera ha llevado la usabilidad al siguiente nivel. Utilizamos la IA generativa para crear una interfaz de usuario que permite a los clientes interactuar con el producto utilizando comandos de lenguaje natural. Esta interfaz de IA simplifica las tareas de configuración, haciéndola más intuitiva y eficiente para los usuarios.
Además, Astera ha integrado la automatización impulsada por la IA para manejar tareas que anteriormente requerían varias horas de trabajo manual, especialmente en la configuración de productos de gestión de datos. El mayor factor de costo de construir una solución de gestión de datos no era solo comprar un producto, era el tiempo y el esfuerzo invertidos en configurarlo. Hemos intentado abordar eso con la IA. Este enfoque reduce significativamente el tiempo y los recursos tradicionalmente invertidos en la configuración del producto.
Como ejemplo, el producto de Astera, ReportMiner, simplifica la extracción de datos de documentos no estructurados permitiendo a los usuarios crear plantillas de extracción basadas en reglas. La IA puede generar la plantilla inicial en cuestión de segundos, una tarea que anteriormente tomaba dos o tres horas para un usuario típico. La primera versión de una plantilla generada por la IA puede que no sea perfecta, pero maneja aproximadamente el 90% de la carga de trabajo, permitiendo a los usuarios hacer ajustes rápidos y completar la tarea en minutos en lugar de horas. Este enfoque es solo un ejemplo de cómo Astera aprovecha la IA para mejorar la usabilidad en todos sus productos.
Estamos haciendo cosas similares en toda nuestra pila de datos, donde obtenemos un gran impulso en la usabilidad con la inteligencia artificial.
2. Funcionalidad de IA como conjunto de herramientas
Astera ofrece una pila de datos unificada que cubre varios aspectos de la gestión de datos, incluyendo la ingesta, la transformación, la calidad de los datos, el almacén de datos, las API y la publicación de datos. La empresa reconoce la importancia de proporcionar funcionalidad de IA como un conjunto de herramientas versátiles para sus usuarios. Dentro de este conjunto de herramientas, los clientes de Astera pueden acceder a la IA en todo el espectro de la ciencia de datos, desde la creación y despliegue de modelos de aprendizaje automático hasta el manejo de ML Ops (Operaciones de Aprendizaje Automático). Astera también admite el uso de modelos de código abierto, incluidos modelos de lenguaje grande (LLM), y facilita el ajuste fino para casos de uso específicos.
Esta funcionalidad de IA más amplia capacita a los usuarios de Astera para aprovechar la IA para diversas tareas relacionadas con los datos, incluyendo el despliegue de modelos de aprendizaje automático, la implementación de ML Ops y el ajuste fino de modelos de código abierto. Además, Astera trabaja continuamente en la expansión de su soporte para la IA, abarcando áreas como bases de datos vectoriales, búsquedas de similitud, incrustaciones y más.
¿Cuáles son algunas de las mejores prácticas para aprovechar la IA y los modelos de aprendizaje automático en la gestión de datos para grandes empresas?
1. Mantenerse a la vanguardia de los desarrollos de IA y aprendizaje automático
El campo de los grandes modelos de lenguaje está evolucionando rápidamente. Para obtener una ventaja competitiva, las grandes empresas deben mantenerse informadas sobre los últimos avances. Astera, por ejemplo, fue un adoptador temprano de la IA generativa, utilizando modelos como OpenAI y LAMA. La supervisión continua de las tecnologías emergentes garantiza que esté bien preparado para aprovecharlas eficazmente.
2. Experimentar con múltiples modelos y configuraciones
Al utilizar el ajuste fino de los LLM, pudimos desplegar tamaños pequeños, como modelos de 8 a 13 mil millones de parámetros, y desplegarlos localmente. Ha funcionado muy bien para nosotros y lo que recomendamos es que, en lugar de utilizar solo uno o el otro, pruebe diferentes modelos base y diferentes configuraciones y vea cuál funciona para usted.
Los grandes modelos de lenguaje vienen en diferentes sabores, cada uno con sus capacidades únicas. Cree una configuración que le permita elegir entre una amplia gama de opciones, similar a lo que los desarrolladores y científicos de datos hacen en sus viajes de ciencia de datos. Nuestro objetivo ha sido integrar estas opciones en nuestro producto de manera fluida, facilitando una experiencia dinámica y adaptable para los usuarios.
3. Priorizar la implementación local sobre las API
Cuando se trata de productos centrados en los datos, reducir los retrasos es fundamental. Depender únicamente de las API para el acceso a los modelos de IA y aprendizaje automático puede introducir retrasos inaceptables, particularmente cuando se manejan grandes volúmenes de datos. Es aconsejable priorizar la implementación de modelos ajustados localmente, dedicados a su escenario específico. Este enfoque puede mejorar significativamente los tiempos de respuesta y el rendimiento general.
¿Por qué Astera es una solución superior a las plataformas competidoras?
- Las soluciones de Astera tienen una interfaz visual intuitiva y sin código, junto con una mayor usabilidad impulsada por la IA, lo que facilita la ejecución de procesos de datos complejos para todos los usuarios, independientemente de sus habilidades técnicas.
- Las características de automatización de nuestra pila de datos reducen las tareas manuales repetitivas y ahorran tiempo y recursos de desarrollo.
- Nuestra plataforma unificada puede ayudar a los usuarios a ejecutar procesos de datos de extremo a extremo sin cambiar de solución. Esto elimina el gasto de aprender y administrar múltiples sistemas aislados.
Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar Astera Software.












