Entrevistas
Jay Mishra, COO da Astera Software – Série de Entrevistas

Jay Mishra é o Diretor de Operações (COO) da Astera Software, um provedor de soluções de dados de empresa em rápida expansão. Eles ajudam os usuários de negócios a preencher a lacuna entre os dados e as informações com uma suíte de soluções de extração de dados, qualidade de dados, integração de dados, armazenamento de dados e intercâmbio de dados eletrônicos, que são usadas por empresas de médio e grande porte em uma variedade de setores.
O que o atraiu inicialmente para a ciência da computação?
Eu sempre tive uma paixão profunda por matemática, e minha jornada na ciência da computação foi uma extensão natural disso. Minha educação de graduação foi em Matemática e Ciência da Computação, e foi a progressão lógica do mundo da matemática para o reino da ciência da computação que me fascinou. O que me chamou particularmente a atenção foram os intricados funcionamentos dos algoritmos e processos algorítmicos avançados, o que me levou a me especializar em algoritmos durante meu mestrado em Ciência da Computação. Desde então, minha conexão com a ciência da computação permaneceu forte, e eu continuo a me esforçar para estar por dentro dos últimos desenvolvimentos no campo.
Você é atualmente o COO da Astera, pode compartilhar conosco o que seu papel diário envolve?
Como COO da Astera, meu papel é multifacetado, refletindo a natureza dinâmica da nossa empresa. Eu estou com a Astera desde sua criação, e minhas responsabilidades abrangem várias áreas da organização. Isso inclui tudo, desde contribuir ativamente para o desenvolvimento e codificação de nossos produtos até garantir que nossos recursos estejam alinhados com as necessidades evolutivas de nossos clientes. Eu colaboro estreitamente com nossos clientes, trabalhando em conjunto com eles para aprimorar nossas soluções. Meu papel se estende além do desenvolvimento de produtos para abranger vendas e marketing, onde trazemos nossas ofertas ao mercado.
Como estamos em uma fase de crescimento, eu assumi responsabilidades adicionais, incluindo a supervisão de nossos objetivos de receita e a expansão estratégica de nosso portfólio de produtos para atingir novos mercados. Basicamente, eu tenho uma mão em quase todos os aspectos de nossas operações, garantindo que não apenas construímos produtos excepcionais, mas também os levamos com sucesso ao mercado e atingimos nossos objetivos comerciais.
Para os leitores que não estão familiarizados com esse termo, o que é armazenamento de dados?
O armazenamento de dados é um padrão arquitetônico usado para consolidar todos os dados da empresa em um repositório centralizado que servirá de base para gerar vários tipos de análises, relatórios e painéis que apresentarão a verdadeira imagem de onde está o seu negócio e também prever como o negócio estará no futuro. Para atender a tudo isso, você traz seus dados juntos de uma certa maneira, e essa arquitetura é chamada de armazenamento de dados e é projetada de uma certa maneira para que a geração de relatórios, especialmente com base em linha do tempo, seja fácil.
O termo é realmente tirado de um armazém real onde seus produtos são armazenados em prateleiras organizadas. Mas quando você chega ao mundo dos dados, você está trazendo seus dados de várias fontes. Você está trazendo seus dados de produção, seu site, seus clientes, vendas e marketing, finanças e seu departamento de recursos humanos. Você traz todos os dados juntos, traz para um lugar e isso é o que será chamado de armazenamento de dados e é projetado de uma certa maneira para que a geração de relatórios, especialmente com base em linha do tempo, seja fácil. Essa é a finalidade principal do armazenamento de dados.
Quais são algumas das principais tendências no armazenamento de dados hoje?
O armazenamento de dados evoluiu bastante nos últimos 20 a 25 anos. Aproximadamente uma década atrás, testemunhamos o surgimento do armazenamento de dados automatizado, um paradigma que acelerou o processo de construir modelos de dados e armazenamento de dados. Recentemente, a automação assumiu o centro das atenções. Ela aborda a natureza repetitiva das tarefas de armazenamento de dados, simplificando processos para economizar tempo e recursos.
Nosso produto, Astera Data Warehouse Builder, por exemplo, oferece uma abordagem holística para a automação no armazenamento de dados. Ele abrange tudo, desde a automação de pipelines ETL (Extração, Transformação, Carregamento) e modelagem de dados até o carregamento automático de dados em estruturas como esquemas estrela ou armazenamento de dados. Além disso, ele mantém essas estruturas de forma eficiente por meio de mecanismos de Captura de Alterações de Dados (CDC). Essa automação abrangente surgiu como uma tendência fundamental no cenário de armazenamento de dados.
Além disso, a tendência mais recente é a fusão entre armazenamento de dados e inteligência artificial (IA). Especificamente, a IA geradora levou a automação a novas alturas. Ela não apenas automatiza tarefas, mas também ajuda os usuários na tomada de decisões.
A configuração de componentes de armazenamento de dados, pipelines e pontos de decisão pode ser orientada pela IA, tornando o armazenamento de dados mais poderoso e eficiente do que nunca. Em essência, é a automação em esteroides, e está transformando o cenário do armazenamento de dados. A interseção entre IA e armazenamento de dados é uma tendência que promete muito para o futuro.
Quais são os quatro princípios fundamentais que as empresas devem considerar para o desenvolvimento de seu armazenamento de dados?
1. Definir Objetivos Claros
É essencial começar entendendo exatamente o que você precisa do seu armazenamento de dados. Evite a armadilha comum de coletar dados excessivos sem um propósito claro. Em vez disso, identifique os objetivos específicos que você deseja alcançar com o seu armazenamento de dados. Quais relatórios e insights você está procurando? Ao se concentrar em seus objetivos, você pode garantir que traga apenas os dados relevantes, em vez de acumular grandes quantidades de informações. Dada a diminuição dos custos de armazenamento e poder de processamento, é crucial utilizar esses recursos de forma inteligente e ética.
2. Escolher o Padrão Arquitetônico Certo
Os padrões arquitetônicos são muito importantes. Eles decidem se a solução de armazenamento de dados será bem-sucedida ou não. Existem várias opções, desde o armazenamento de dados no estilo Inmon até os esquemas estrela de Ralph Kimball, bem como novos padrões como Data Vault e a abordagem de uma grande tabela defendida por fornecedores de bancos de dados. Nem todos os padrões serão adequados para cada cenário.
Estamos vendo principalmente uma combinação de esquema estrela sobre um Data Vault. Então, uma combinação de Data Vault e Esquema Estrela ainda é o padrão mais amplamente usado. Mas, como eu disse, para cada requisito ou para cada cenário, haverá uma resposta diferente. Então, execute-o através dos especialistas, veja qual padrão arquitetônico é uma boa escolha para o seu cenário.
3. Selecionar as Ferramentas Certas
Elas são muito importantes e fazem uma grande diferença novamente no tempo e nos recursos necessários para construir uma solução e também na precisão e na qualidade da sua solução, que é determinada pelos produtos que você estará usando para construir e manter seu armazenamento de dados. Preste muita atenção à capacidade do produto e olhe para os produtos que podem atender à maioria dos requisitos sob uma única estrutura. Existem certas áreas, como ETL (Extração, Transformação, Carregamento), qualidade de dados, modelagem de dados, carregamento de dados e publicação de dados, que desempenham um papel significativo. Se você tentar usar vários produtos para cada uma dessas áreas, será difícil. Então, olhe para os produtos que podem ser usados para fazer a maioria, se não todos, dos diferentes componentes.
4. Sua Equipe
Por último, mas não menos importante, a equipe de pessoas que você reúne para construir sua solução de armazenamento de dados é a parte mais importante. Recomendamos ter alguém com uma forte formação em padrões arquitetônicos de dados. Em termos de composição da equipe, equipes multifuncionais são a melhor maneira de fazer isso, onde você tem uma mistura de usuários de negócios e pessoas com alguma formação em programação ou, pelo menos, especialização em dados e ter uma colaboração estreita entre seus guardiões de dados, as pessoas que estão encarregadas dos dados e, claro, os negócios. Ao promover a cooperação estreita entre esses diferentes aspectos da sua organização, você pode criar uma equipe coesa e eficaz responsável por construir e manter sua solução de armazenamento de dados.
O sucesso no armazenamento de dados depende de alcançar um equilíbrio entre esses quatro princípios. Esses princípios, quando seguidos cuidadosamente, provaram ser uma receita para o sucesso em nossa experiência.
Por que as empresas precisam de uma pilha de dados moderna?
Depende de como definimos “moderno” e isso muda constantemente, às vezes por ano, mês e até por dia. Devemos considerar conjuntos de ferramentas modernos projetados com o cenário de dados em mente. Nos últimos anos, houve mudanças significativas na natureza e volume de dados. O surgimento de Big Data transformou o cenário de dados, com dados fluindo de fontes como sites de comércio eletrônico, bancos de dados de produção e várias partes do seu negócio. Esses dados estão mudando não apenas em volume, mas também em sua própria natureza.
No passado, os dados eram principalmente estruturados, mas agora os dados não estruturados desempenham um papel significativo. Além disso, a velocidade com que os dados são gerados e disponibilizados para uso aumentou. Dada essas mudanças nos dados, devemos avaliar e adaptar continuamente nosso conjunto de ferramentas para lidar eficazmente com os desafios de dados em evolução.
A pilha de dados moderna é projetada para lidar com todas as variações nas estruturas e na velocidade dos dados e está bem equipada para se adaptar aos padrões arquitetônicos emergentes que evoluíram nos últimos anos. Portanto, se você deseja aproveitar ao máximo seus dados, é necessário modernizar sua pilha de dados. Essa é a única maneira de acompanhar os novos desafios de dados.
Vimos que as empresas se apegam a soluções existentes que parecem estar funcionando. É crucial reconhecer que os dados em si são inherentemente dinâmicos. Eles continuam a evoluir, apresentando novos desafios e oportunidades. As soluções existentes podem não estar equipadas para se adaptar a essas mudanças. Portanto, para aproveitar ao máximo o potencial de seus dados, as empresas devem abraçar o conceito de modernizar sua pilha de dados. Não se trata de quebrar o que funciona; é sobre permanecer ágil e responsivo à natureza evolutiva dos dados. Ao avaliar continuamente e integrar avanços na tecnologia de dados, as empresas podem permanecer competitivas e tomar decisões informadas em um mundo cada vez mais impulsionado por dados.
Quais são alguns dos desafios atuais de gerenciamento de dados que são vistos na indústria?
1. Velocidade e Integração de Dados
Um dos grandes desafios que enfrentamos hoje é o volume maciço de dados que flui de várias aplicações. Se você pegar uma organização de TI típica, eles lidam com novos aplicativos surgindo o tempo todo – dezenas, às vezes até centenas por ano, especialmente em organizações de médio porte.
Agora, todos esses aplicativos geram dados, e esses dados contêm insights valiosos. A principal preocupação aqui é a capacidade de integrar rapidamente essas novas fontes de dados em pipelines de dados existentes e consolidá-los em uma visão unificada. A velocidade com que as organizações podem se adaptar e incorporar esses novos fluxos de dados é o maior desafio que enfrentamos.
2. Formatos de Dados Variados
Outro desafio crítico decorre da natureza dos dados em si, particularmente do aumento da prevalência de dados não estruturados. Com dados não estruturados, existem, claro, diferentes escolas de pensamento sobre como lidar com eles.
As organizações devem decidir se armazenam esses dados diretamente em lagos de dados para uso posterior ou se os transformam em um formato mais estruturado para consumo imediato. O desafio de como lidar com dados não estruturados permanece, e vemos que até mesmo empresas de médio ou pequeno porte são afetadas por isso. Portanto, elaborar estratégias eficazes para lidar com dados não estruturados é essencial.
3. Publicação e Compartilhamento de Dados
Enquanto a integração e consolidação de dados são cruciais, a capacidade de compartilhar dados de forma eficaz é igualmente importante. As organizações precisam de mecanismos para publicar e distribuir dados para departamentos internos, fornecedores terceirizados, parceiros e outras partes interessadas. Esse desafio vai além de apenas tornar os dados acessíveis; envolve garantir a segurança dos dados, privacidade e conformidade com regulamentos. À medida que o compartilhamento de dados se torna uma necessidade para empresas de todos os tamanhos, as tecnologias e produtos nesse espaço estão evoluindo rapidamente para atender à demanda.
Quais são algumas das maneiras pelas quais a Astera integrou a IA no fluxo de trabalho do cliente?
Nós olhamos para a IA se intersectando com o gerenciamento de dados de duas maneiras distintas.
1. Aumentando a Usabilidade com IA Geradora
Nosso compromisso profundo com a usabilidade é uma pedra angular de nossa filosofia de desenvolvimento de produtos. Ao longo dos últimos 12 a 13 anos, construímos uma sólida reputação por projetar produtos com uma curva de aprendizado curta, tornando-os acessíveis mesmo a usuários não técnicos. Com apenas uma quantidade modesta de treinamento, os indivíduos podem utilizar eficazmente nossos produtos para realizar tarefas significativas com seus dados.
Com a introdução da IA geradora, a Astera levou a usabilidade ao próximo nível. Nós utilizamos a IA geradora para criar uma interface de usuário que permite aos clientes interagir com o produto usando comandos de linguagem natural. Essa interface de IA simplifica as tarefas de configuração, tornando-as mais intuitivas e eficientes para os usuários.
Além disso, a Astera integrou a automação impulsionada por IA para lidar com tarefas que anteriormente exigiam várias horas de trabalho manual, especialmente na configuração de produtos de gerenciamento de dados. O maior fator de custo de construir uma solução de gerenciamento de dados não era apenas comprar um produto, mas o tempo e o esforço gastos na configuração. Nós tentamos abordar isso com a IA. Essa abordagem reduz significativamente o tempo e os recursos tradicionalmente gastos na configuração do produto.
Como exemplo, o produto da Astera, ReportMiner, simplifica a extração de dados de documentos não estruturados permitindo que os usuários criem modelos de extração com base em regras. A IA pode agora gerar o modelo inicial em questão de segundos, uma tarefa que anteriormente levava de duas a três horas para um usuário típico. A primeira versão de um modelo gerado por IA pode não ser perfeita, mas lida com aproximadamente 90% do trabalho, permitindo que os usuários façam ajustes rápidos e completem a tarefa em minutos em vez de horas. Essa abordagem é apenas um exemplo de como a Astera aproveita a IA para melhorar a usabilidade em todos os seus produtos.
Nós estamos fazendo coisas semelhantes em toda a nossa pilha de dados, onde estamos obtendo um aumento significativo na usabilidade com inteligência artificial.
2. Funcionalidade de IA como Conjunto de Ferramentas
A Astera oferece uma pilha de dados unificada que abrange vários aspectos do gerenciamento de dados, incluindo ingestão, transformação, qualidade de dados, armazenamento de dados, APIs e publicação de dados. A empresa reconhece a importância de fornecer funcionalidade de IA como um conjunto de ferramentas versátil para seus usuários. Dentro desse conjunto de ferramentas, os clientes da Astera podem acessar a IA em todo o espectro de ciência de dados, desde a construção e implantação de modelos de aprendizado de máquina até a manipulação de ML Ops (Operações de Aprendizado de Máquina). A Astera também suporta o uso de modelos baseados em código aberto, incluindo grandes modelos de linguagem (LLMs), e facilita o ajuste fino para casos de uso específicos.
Essa funcionalidade de IA mais ampla capacita os usuários da Astera a aproveitar a IA para várias tarefas relacionadas a dados, incluindo a implantação de modelos de aprendizado de máquina, a implementação de ML Ops e o ajuste fino de modelos baseados em código aberto. Além disso, a Astera trabalha continuamente para expandir seu suporte à IA, abrangendo áreas como bancos de dados vetoriais, buscas de semelhança, incorporações e muito mais.
Quais são algumas das melhores práticas para aproveitar a IA e os modelos de ML no gerenciamento de dados para grandes empresas?
1. Permanecer à Frente dos Desenvolvimentos de IA e ML
O campo dos grandes modelos de linguagem está evoluindo rapidamente. Para obter uma vantagem competitiva, as grandes empresas devem se manter informadas sobre os últimos avanços. A Astera, por exemplo, foi uma das primeiras a adotar a IA geradora, utilizando modelos como OpenAI e LAMA. O monitoramento contínuo de tecnologias emergentes garante que você esteja bem preparado para aproveitá-las de forma eficaz.
2. Experimentar com Múltiplos Modelos e Configurações
Usando o ajuste fino de LLMs, conseguimos implantar tamanhos pequenos, como 8 a 13 bilhões de parâmetros, e implantá-los localmente. Isso funcionou muito bem para nós e o que recomendamos é que, em vez de usar apenas um versus o outro, tente diferentes modelos base e diferentes configurações e veja qual funciona para você.
Os grandes modelos de linguagem vêm em diferentes sabores, cada um com suas capacidades únicas. Crie uma configuração que permita escolher entre uma ampla gama de opções, refletindo o que os desenvolvedores e cientistas de dados fazem em suas jornadas de ciência de dados.
Para empoderar os usuários, criamos um sistema de configuração que oferece uma ampla gama de opções, semelhante ao que os desenvolvedores e cientistas de dados encontram ao trabalhar com bibliotecas de código aberto em suas empreitadas impulsionadas por dados. Nosso objetivo tem sido integrar essas opções de forma transparente em nossos produtos, facilitando uma experiência dinâmica e adaptável para os usuários.
3. Priorizar a Implantação Local sobre APIs
Quando se lida com produtos centrados em dados, reduzir os atrasos é fundamental. Depender apenas de APIs para o acesso a modelos de IA e ML pode introduzir atrasos inaceitáveis, especialmente ao lidar com grandes volumes de dados. É aconselhável priorizar a implantação de modelos ajustados finamente localmente, dedicados ao seu cenário específico. Essa abordagem pode melhorar significativamente os tempos de resposta e o desempenho geral.
Por que a Astera é uma solução superior em comparação com plataformas concorrentes?
- As soluções da Astera têm uma interface visual intuitiva e sem código, juntamente com usabilidade aprimorada com IA, o que facilita a execução de processos de dados complexos para todos os usuários, independentemente de suas habilidades técnicas.
- Os recursos de automação da nossa pilha de dados reduzem as tarefas manuais repetitivas e economizam tempo e recursos de desenvolvimento.
- Nossa plataforma unificada pode ajudar os usuários a executar processos de dados de ponta a ponta sem precisar mudar de solução. Isso elimina a despesa de aprender e gerenciar vários sistemas isolados.
Obrigado pela grande entrevista, leitores que desejam aprender mais devem visitar Astera Software.












