Entretiens
Jay Mishra, Directeur des Opérations d’Astera Software – Série d’entretiens

Jay Mishra est le Directeur des Opérations (COO) d’Astera Software, un fournisseur de solutions de données d’entreprise en pleine croissance. Ils aident les utilisateurs métier à combler le fossé entre les données et les informations avec une gamme de solutions de extraction de données, de qualité de données, d’intégration de données, de warehousing de données et d’échange de données électroniques, qui sont utilisées à la fois par les entreprises de taille moyenne et les entreprises du Fortune 500 dans une gamme d’industries.
Qu’est-ce qui vous a initialement attiré vers l’informatique ?
J’ai toujours eu une passion profondément enracinée pour les mathématiques, et mon parcours dans l’informatique a été une extension naturelle de cela. Mon éducation de premier cycle était en mathématiques et en informatique, et c’était la progression logique du monde des mathématiques au domaine de l’informatique qui m’a fasciné. Ce qui a particulièrement attiré mon attention étaient les mécanismes complexes des algorithmes et des processus algorithmiques avancés qui m’ont conduit à poursuivre une spécialisation en algorithmes pendant mon master en informatique. Depuis lors, ma connexion avec l’informatique est restée forte, et je m’efforce continuellement de rester au courant des derniers développements dans le domaine.
Vous êtes actuellement le COO d’Astera, pouvez-vous partager avec nous ce que votre rôle quotidien implique ?
En tant que COO d’Astera, mon rôle est multifacette, reflétant la nature dynamique de notre entreprise. J’ai rejoint Astera depuis sa création, et mes responsabilités ont couvert divers domaines de l’organisation. Cela inclut tout, de la contribution active au développement et à la programmation de nos produits à la garantie que nos fonctionnalités correspondent aux besoins changeants de nos clients. Je collabore étroitement avec nos clients, travaillant en tandem avec eux pour affiner nos solutions. Mon rôle s’étend au-delà du seul développement de produits pour englober les ventes et le marketing, où nous mettons nos offres sur le marché.
Alors que nous sommes en phase de croissance, j’ai pris des responsabilités supplémentaires, notamment la supervision de nos objectifs de revenus et l’expansion stratégique de notre portefeuille de produits pour atteindre de nouveaux marchés. Essentiellement, j’ai une main dans presque tous les aspects de nos opérations, en veillant à ce que nous ne construisions pas seulement des produits exceptionnels, mais que nous les mettions également avec succès sur le marché et que nous atteignions nos objectifs commerciaux.
Pour les lecteurs qui ne connaissent pas ce terme, qu’est-ce que le warehousing de données ?
Le warehousing de données est un modèle architectural utilisé pour consolider toutes vos données d’entreprise dans un référentiel centralisé qui servira de fondement pour générer divers types d’analyses, de rapports et de tableaux de bord qui présenteront la véritable image de l’état de votre entreprise et prédiront également la façon dont l’entreprise évoluera à l’avenir. Pour répondre à tout cela, vous rassemblez vos données d’une certaine manière et cette architecture est appelée un entrepôt de données.
Le terme est en fait emprunté à un entrepôt réel où vos produits sont stockés sur des étagères organisées. Mais lorsqu’il s’agit du monde des données, vous rassemblez vos données de diverses sources. Vous rassemblez vos données de production, de votre site Web, de vos clients, des ventes et du marketing, de la finance et de votre département des ressources humaines. Vous rassemblez toutes les données, les apportez dans un seul endroit, et c’est ce qui sera appelé un entrepôt de données et conçu d’une certaine manière afin que les rapports, en particulier basés sur la chronologie, soient faciles. C’est l’objectif principal d’un entrepôt de données.
Quelles sont certaines des tendances clés dans le domaine du warehousing de données aujourd’hui ?
Le warehousing de données a évolué considérablement au cours des 20 à 25 dernières années. Il y a environ une décennie, nous avons assisté à l’émergence du warehousing de données automatisé, un changement de paradigme qui a accéléré le processus de construction de modèles de données et d’entrepôts de données. Récemment, l’automatisation a pris le devant de la scène. Elle répond à la nature répétitive des tâches de warehousing de données, en rationalisant les processus pour économiser du temps et des ressources.
Notre produit, Astera Data Warehouse Builder, par exemple, offre une approche holistique de l’automatisation dans le warehousing de données. Il couvre tout, de l’automatisation des pipelines ETL (Extract, Transform, Load) et de la modélisation de données à la charge automatique de données dans des structures telles que des schémas étoilés ou des entrepôts de données. De plus, il maintient efficacement ces structures grâce à des mécanismes de capture de modifications de données (CDC). Cette automatisation globale est émergée comme une tendance clé dans le paysage du warehousing de données.
De plus, la tendance la plus récente est la fusion entre le warehousing de données et l’intelligence artificielle (IA). Plus précisément, l’IA générative a porté l’automatisation à de nouveaux sommets. Elle n’automatise pas seulement les tâches, mais aide également les utilisateurs dans la prise de décision.
La configuration des composants du warehousing de données, des pipelines et des points de décision peut être guidée par l’IA, ce qui rend le warehousing de données plus puissant et efficace que jamais. En essence, c’est l’automatisation à la puissance supérieure, et elle transforme le paysage du warehousing de données. L’intersection entre l’IA et le warehousing de données est une tendance qui promet beaucoup pour l’avenir.
Quels sont les quatre principes fondamentaux que les entreprises devraient considérer pour le développement de leur entrepôt de données ?
1. Définir des objectifs clairs
Il est essentiel de commencer par comprendre précisément ce dont vous avez besoin pour votre entrepôt de données. Évitez la erreur courante de collecter des données excessives sans but clair. Au lieu de cela, identifiez les objectifs spécifiques que vous souhaitez atteindre avec votre entrepôt de données. Quels rapports et quelles informations recherchez-vous ? En vous concentrant sur vos objectifs, vous pouvez vous assurer que vous n’apportez que les données pertinentes, plutôt que d’accumuler indistinctement de grandes quantités d’informations. Compte tenu de la diminution des coûts de stockage et de puissance de calcul, il est crucial d’utiliser ces ressources de manière intelligente et éthique.
2. Choisir le bon modèle architectural
Les modèles architecturaux sont très importants. Ils décident si votre solution de warehousing de données sera couronnée de succès ou non. Il existe diverses options, allant du warehousing de données de style Inmon au schéma étoilé de Ralph Kimball, ainsi que de nouveaux modèles comme Data Vault et l’approche d’une grande table préconisée par les fournisseurs de bases de données columna. Pas tous les modèles conviendront à chaque scénario.
Nous voyons principalement une combinaison de schéma étoilé au sommet d’un entrepôt de données. Donc, une combinaison de Data Vault et de schéma étoilé est toujours le modèle le plus largement utilisé. Mais, comme je l’ai dit, pour chaque exigence ou pour chaque scénario, il y aura une réponse différente. Alors, faites-le passer par les experts, voyez quel modèle architectural convient à votre scénario.
3. Sélectionner les bons outils
Ils sont très importants et font une grande différence à nouveau sur le temps et les ressources nécessaires pour construire une solution et également la précision et la qualité de votre solution, qui est déterminée par les produits que vous allez utiliser pour construire et maintenir votre entrepôt de données. Accordez beaucoup d’attention aux capacités du produit et regardez les produits qui peuvent apporter le plus d’exigences sous un seul parapluie. Il y a certaines zones telles que l’ETL (Extract, Transform, Load), la qualité des données, la modélisation des données, le chargement des données et la publication des données qui jouent tous un rôle important. Si vous essayez d’utiliser plusieurs produits pour chacune de ces zones, cela sera difficile. Alors, regardez les produits qui peuvent être utilisés pour faire la plupart, sinon la totalité, des différents composants.
4. Votre équipe
En dernier mais non le moindre, l’équipe de personnes que vous rassemblez pour construire votre solution d’entrepôt de données est la partie la plus importante. Nous recommandons d’avoir quelqu’un avec une solide expérience en modèles architecturaux de données. En termes de composition d’équipe, les équipes multifonctionnelles sont la meilleure façon de procéder, où vous avez un mélange d’utilisateurs métier et de personnes avec une certaine expérience de programmation ou au moins une expertise en données et une collaboration étroite entre vos gardiens de données, les personnes chargées des données et, bien sûr, les utilisateurs métier. En favorisant une coopération étroite entre ces différents aspects de votre organisation, vous pouvez créer une équipe cohérente et efficace responsable de la construction et de la maintenance de votre solution d’entrepôt de données.
Le succès dans le warehousing de données repose sur la réalisation d’un équilibre entre ces quatre principes. Ces principes, lorsqu’ils sont soigneusement suivis, se sont avérés être une recette pour le succès dans notre expérience.
Pourquoi les entreprises ont-elles besoin d’une pile de données modernisée ?
Cela dépend de la façon dont nous définissons le terme « moderne » et cela change constamment, parfois d’année en année, de mois en mois et même de jour en jour. Nous devons considérer les jeux d’outils modernes conçus avec le paysage de données changeant en tête. Au cours des dernières années, il y a eu des changements importants dans la nature et le volume des données. L’essor des Big Data a transformé le paysage des données, avec des données provenant de sources telles que des sites Web de commerce électronique, des bases de données de production et de diverses parties de votre entreprise. Ces données changent non seulement en volume mais également en nature.
Dans le passé, les données étaient principalement structurées, mais désormais, les données non structurées jouent un rôle important. De plus, la vitesse à laquelle les données sont générées et mises à disposition pour utilisation a augmenté. Compte tenu de ces changements dans les données, nous devons continuellement évaluer et adapter notre jeu d’outils pour répondre efficacement à ces défis de données changeants.
La pile de données modernisée est conçue pour gérer toutes les variations dans les structures et la vitesse des données, et elle est bien équipée pour s’adapter aux modèles architecturaux émergents qui ont évolué au cours des dernières années. Par conséquent, si vous souhaitez tirer le meilleur parti de vos données, vous devez regarder la modernisation de votre pile de données. C’est la seule façon de rester à jour avec les nouveaux défis de données.
Nous avons constaté que les entreprises s’accrochent à des solutions existantes qui semblent fonctionner. Il est crucial de reconnaître que les données elles-mêmes sont intrinsèquement dynamiques. Elles évoluent continuellement, présentant de nouveaux défis et opportunités. Les solutions existantes peuvent ne pas être équipées pour s’adapter à ces changements. Par conséquent, pour exploiter pleinement le potentiel de leurs données, les entreprises doivent adopter le concept de modernisation de leur pile de données. Ce n’est pas à propos de casser ce qui fonctionne ; c’est à propos de rester agile et réactif à la nature évolutive des données. En évaluant continuellement et en intégrant les progrès de la technologie des données, les entreprises peuvent rester compétitives et prendre des décisions éclairées dans un monde de plus en plus axé sur les données.
Quels sont certains des défis actuels de gestion des données qui sont observés dans l’industrie ?
1. Vitesse et intégration des données
L’un des grands défis auxquels nous sommes confrontés aujourd’hui est le volume énorme de données provenant de diverses applications. Si vous prenez une organisation informatique typique, ils traitent de nouvelles applications qui apparaissent tout le temps – des dizaines, parfois même des centaines par an, en particulier dans les organisations de taille moyenne.
Or, toutes ces applications génèrent des données, et ces données contiennent des informations précieuses. La principale préoccupation ici est la capacité à intégrer rapidement ces nouvelles sources de données dans les pipelines de données existants et à les consolider en une vue unifiée. La vitesse à laquelle les organisations peuvent s’adapter et intégrer ces nouveaux flux de données est le plus grand défi que nous voyons.
2. Formats de données variables
Un autre défi crucial découle de la nature des données elles-mêmes, en particulier de la prévalence croissante des données non structurées. Avec les données non structurées, il y a, bien sûr, différentes écoles de pensée sur la façon de les gérer.
Les organisations doivent décider s’ils stockent ces données directement dans des lacs de données pour une utilisation ultérieure ou s’ils les transforment en un format plus structuré pour une consommation immédiate. Le défi de savoir comment gérer les données non structurées persiste, et nous voyons même que les entreprises de taille moyenne ou petite sont touchées. Ainsi, élaborer des stratégies efficaces pour gérer les données non structurées est essentiel.
3. Publication et partage de données
Alors que l’intégration et la consolidation des données sont cruciales, la capacité à partager des données de manière efficace est tout aussi importante. Les organisations ont besoin de mécanismes pour publier et distribuer des données à des départements internes, à des fournisseurs tiers, à des partenaires et à d’autres parties prenantes. Ce défi va au-delà de la simple mise à disposition des données ; il s’agit de garantir la sécurité des données, la confidentialité et la conformité avec les réglementations. À mesure que le partage de données devient une nécessité pour les entreprises de toutes tailles, les technologies et les produits dans cet espace évoluent rapidement pour répondre à la demande.
Quelles sont certaines des façons dont Astera a intégré l’IA dans le flux de travail des clients ?
Nous considérons l’IA comme se croisant avec la gestion des données de deux manières distinctes.
1. Améliorer l’utilisabilité avec l’IA générative
Notre engagement profond en faveur de l’utilisabilité est une pierre angulaire de notre philosophie de développement de produits. Au cours des 12 à 13 dernières années, nous avons construit une solide réputation pour concevoir des produits avec une courbe d’apprentissage courte, les rendant accessibles même aux utilisateurs non techniques. Avec une formation modeste, les individus peuvent utiliser efficacement nos produits pour effectuer des tâches significatives avec leurs données.
Avec l’introduction de l’IA générative, Astera a porté l’utilisabilité à un niveau supérieur. Nous avons utilisé l’IA générative pour créer une interface utilisateur qui permet aux clients d’interagir avec le produit à l’aide de commandes de langage naturel. Cette interface IA simplifie les tâches de configuration, la rendant plus intuitive et efficace pour les utilisateurs.
De plus, Astera a intégré l’automatisation alimentée par l’IA pour gérer les tâches qui nécessitaient précédemment plusieurs heures de travail manuel, en particulier dans la configuration des produits de gestion de données. Le plus grand facteur de coût de construction d’une solution de gestion de données n’était pas seulement l’achat d’un produit, mais le temps et l’effort consacrés à la configuration. Nous avons essayé de répondre à cela avec l’IA. Cette approche réduit considérablement le temps et les ressources traditionnellement consacrés à la configuration du produit.
Par exemple, le produit d’Astera, ReportMiner, simplifie l’extraction de données à partir de documents non structurés en permettant aux utilisateurs de créer des modèles d’extraction basés sur des règles. L’IA peut désormais générer le modèle initial en quelques secondes, une tâche qui prenait auparavant deux à trois heures pour un utilisateur typique. La première version d’un modèle généré par l’IA peut ne pas être parfaite, mais elle gère environ 90 % de la charge de travail, permettant aux utilisateurs d’apporter des ajustements rapides et de terminer la tâche en quelques minutes au lieu d’heures. Cette approche n’est qu’un exemple de la façon dont Astera utilise l’IA pour améliorer l’utilisabilité dans l’ensemble de ses produits.
Nous faisons des choses similaires dans l’ensemble de notre pile de données, où nous obtenons un gain significatif en termes d’utilisabilité grâce à l’intelligence artificielle.
2. Fonctionnalité IA en tant que jeu d’outils
Astera propose une pile de données unifiée qui couvre divers aspects de la gestion des données, notamment l’ingestion, la transformation, la qualité des données, le warehousing de données, les API et la publication de données. L’entreprise reconnaît l’importance de fournir une fonctionnalité IA en tant que jeu d’outils polyvalent pour ses utilisateurs. Dans ce jeu d’outils, les clients d’Astera peuvent accéder à l’IA à travers l’ensemble du spectre de la science des données, de la construction et du déploiement de modèles d’apprentissage automatique à la gestion des opérations d’apprentissage automatique (ML Ops). Astera prend également en charge l’utilisation de modèles open source, y compris les grands modèles de langage (LLM), et facilite le réglage pour des cas d’utilisation spécifiques.
Cette fonctionnalité IA plus large permet aux utilisateurs d’Astera d’utiliser l’IA pour diverses tâches liées aux données, notamment le déploiement de modèles d’apprentissage automatique, la mise en œuvre de ML Ops et le réglage de modèles open source. De plus, Astera travaille continuellement à l’expansion de son soutien à l’IA, englobant des domaines tels que les bases de données vectorielles, les recherches de similarité, les embeddings et plus encore.
Quelles sont certaines des meilleures pratiques pour exploiter l’IA et les modèles d’apprentissage automatique dans la gestion des données pour les grandes entreprises ?
1. Rester à la pointe des développements de l’IA et de l’apprentissage automatique
Le domaine des grands modèles de langage évolue rapidement. Pour acquérir un avantage concurrentiel, les grandes entreprises devraient rester informées des dernières avancées. Astera, par exemple, a été un des premiers à adopter l’IA générative, en utilisant des modèles tels que OpenAI et LAMA. La surveillance continue des technologies émergentes garantit que vous êtes bien préparé pour les utiliser efficacement.
2. Expérimenter avec plusieurs modèles et configurations
En utilisant le réglage des LLM, nous avons pu déployer des tailles petites, comme des modèles de 8 à 13 milliards de paramètres, et les déployer localement. C’est quelque chose qui a très bien fonctionné pour nous et ce que nous recommandons, c’est d’essayer différents modèles de base et différentes configurations et de voir lequel fonctionne pour vous.
Les grands modèles de langage viennent dans différents parfums, chacun avec ses capacités uniques. Créez une configuration qui vous permet de choisir parmi une large gamme d’options, à l’image de ce que les développeurs et les scientifiques des données font dans leurs parcours de science des données.
Pour habiliter les utilisateurs, nous avons créé un système de configuration qui offre une large gamme d’options, similaire à ce que les développeurs et les scientifiques des données rencontrent lorsqu’ils travaillent avec des bibliothèques open source dans leurs entreprises axées sur les données. Notre objectif a été d’intégrer ces options de manière transparente dans notre produit, facilitant ainsi une expérience dynamique et adaptable pour les utilisateurs.
3. Donner la priorité au déploiement local plutôt qu’aux API
Lorsque vous travaillez avec des produits axés sur les données, la réduction des retards est primordiale. S’appuyer uniquement sur les API pour l’accès aux modèles d’IA et d’apprentissage automatique peut introduire des retards inacceptables, en particulier lors de la gestion de grands volumes de données. Il est conseillé de donner la priorité au déploiement de modèles réglés localement, dédiés à votre scénario spécifique. Cette approche peut améliorer considérablement les temps de réponse et les performances globales.
Pourquoi Astera est-elle une solution supérieure aux plates-formes concurrentes ?
- Les solutions d’Astera ont une interface visuelle intuitive et sans code, ainsi qu’une utilisabilité améliorée alimentée par l’IA, ce qui facilite l’exécution de processus de données complexes pour tous les utilisateurs, quelle que soit leur compétence technique.
- Les fonctionnalités d’automatisation de notre pile de données réduisent les tâches manuelles répétitives et économisent du temps et des ressources de développement.
- Notre plate-forme unifiée peut aider les utilisateurs à exécuter des processus de données de bout en bout sans avoir à basculer entre les solutions. Cela élimine les frais de formation et de gestion de plusieurs systèmes cloisonnés.
Merci pour cette grande interview, les lecteurs qui souhaitent en savoir plus devraient visiter Astera Software.












