Entrevistas
Dr. Mike Flaxman, VP de Produto da HEAVY.AI – Série de Entrevistas

Dr. Mike Flaxman é atualmente o VP de Produto da HEAVY.AI, tendo anteriormente servido como Gerente de Produto e liderado a prática de Ciência de Dados Espaciais em Serviços Profissionais. Ele passou os últimos 20 anos trabalhando em planejamento ambiental espacial. Antes de ingressar na HEAVY.AI, ele fundou a Geodesign Technologies, Inc e cofundou a GeoAdaptive LLC, duas startups que aplicam tecnologias de análise espacial ao planejamento. Antes de se tornar empreendedor, ele foi professor de planejamento no MIT e Gerente de Indústria na ESRI.
HEAVY.AI é uma plataforma acelerada por hardware para análise de dados em tempo real e de alto impacto. Ela aproveita tanto o processamento de GPU quanto de CPU para consultar grandes conjuntos de dados rapidamente, com suporte a SQL e dados geoespaciais. A plataforma inclui ferramentas de análise visual para dashboards interativos, filtragem cruzada e visualizações de dados escaláveis, permitindo uma análise de grandes dados eficiente em várias indústrias.
Você pode nos contar sobre sua formação profissional e o que o levou a se juntar à HEAVY.AI?
Antes de me juntar à HEAVY.AI, passei anos na academia, ensinando análise espacial no MIT. Eu também dirigi uma pequena empresa de consultoria, com uma variedade de clientes do setor público. Estive envolvido em projetos de GIS em 17 países. Meu trabalho me levou desde aconselhar organizações como o Banco Interamericano de Desenvolvimento até gerenciar tecnologia de GIS para arquitetura, engenharia e construção na ESRI, o maior desenvolvedor de GIS do mundo.
Lembro-me vividamente do meu primeiro encontro com o que é agora a HEAVY.AI, que foi quando, como consultor, fui responsável por planejamento de cenários para o Programa de Conservação de Habitat de Praias da Flórida. Meus colegas e eu estávamos lutando para modelar o habitat de tartarugas marinhas usando dados Landsat de 30m e um amigo me apontou para alguns dados novos e muito relevantes – LiDAR de 5cm. Era exatamente o que precisávamos cientificamente, mas algo como 3600 vezes maior do que o que havíamos planejado usar. Não era provável que alguém aumentasse meu orçamento nem mesmo por uma fração disso. Então, naquele dia, eu desisti das ferramentas que havia usado e ensinado por várias décadas e fui procurar algo novo. A HEAVY.AI cortou e renderizou esses dados de forma suave e sem esforço, e eu fiquei instantaneamente viciado.
Avançando alguns anos, e eu ainda acho que o que a HEAVY.AI faz é bastante único, e sua aposta inicial em análise de GPU foi exatamente para onde a indústria ainda precisa ir. A HEAVY.AI está firmemente focada em democratizar o acesso a grandes dados. Isso tem o componente de volume de dados e velocidade de processamento, essencialmente dando a todos seu próprio supercomputador. Mas um aspecto cada vez mais importante com o advento de grandes modelos de linguagem é tornar a modelagem espacial acessível a muitas mais pessoas. Hoje em dia, em vez de passar anos aprendendo uma interface complexa com milhares de ferramentas, você pode simplesmente começar uma conversa com a HEAVY.AI na linguagem humana de sua escolha. O programa não apenas gera os comandos necessários, mas também apresenta visualizações relevantes.
Por trás das cenas, entregar facilidade de uso é, claro, muito difícil. Atualmente, como VP de Gerenciamento de Produto na HEAVY.AI, estou muito envolvido em determinar quais recursos e capacidades priorizamos para nossos produtos. Minha extensa formação em GIS me permite realmente entender as necessidades de nossos clientes e orientar nossa estrada de desenvolvimento de acordo.
Como sua experiência anterior em planejamento ambiental espacial e startups influenciou seu trabalho na HEAVY.AI?
O planejamento ambiental é um domínio particularmente desafiador, pois você precisa levar em conta tanto diferentes conjuntos de necessidades humanas quanto o mundo natural. A solução geral que aprendi cedo foi combinar um método conhecido como planejamento participativo com as tecnologias de sensoriamento remoto e GIS. Antes de decidir um plano de ação, criávamos múltiplos cenários e simulávamos seus impactos positivos e negativos no computador usando visualizações. Usar processos participativos nos permitia combinar várias formas de expertise e resolver problemas muito complexos.
Embora não façamos normalmente planejamento ambiental na HEAVY.AI, esse padrão ainda funciona muito bem em ambientes de negócios. Então, ajudamos os clientes a construir gêmeos digitais de partes-chave de seus negócios e permitimos que eles criem e avaliem cenários de negócios rapidamente.
Suponho que minha experiência de ensino tenha me dado uma profunda empatia por usuários de software, particularmente de sistemas de software complexos. Onde um aluno tropeça em um ponto é aleatório, mas onde dezenas ou centenas de pessoas cometem erros semelhantes, você sabe que tem um problema de design. Talvez minha parte favorita do design de software seja aplicar essas lições e projetar novas gerações de sistemas.
Você pode explicar como o HeavyIQ aproveita o processamento de linguagem natural para facilitar a exploração e visualização de dados?
Esses dias, parece que todos e seus irmãos estão promovendo um novo modelo de IA, a maioria deles clones esquecíveis uns dos outros. Nós seguimos um caminho muito diferente. Acreditamos que precisão, reprodutibilidade e privacidade são características essenciais para qualquer ferramenta de análise de negócios, incluindo aquelas geradas com grandes modelos de linguagem. Então, construímos essas características em nosso oferecimento em um nível fundamental. Por exemplo, restringimos as entradas do modelo estritamente a bancos de dados de empresa e a documentos dentro de um perímetro de segurança da empresa. Também restringimos as saídas aos últimos HeavySQL e Charts. Isso significa que, independentemente da pergunta que você faça, tentaremos responder com seus dados e mostraremos exatamente como derivamos essa resposta.
Com essas garantias no lugar, importa menos para nossos clientes exatamente como processamos as consultas. Mas por trás das cenas, outra diferença importante em relação à IA de consumidor é que afinamos os modelos extensivamente contra os tipos de perguntas que os usuários de negócios fazem sobre dados de negócios, incluindo dados espaciais. Então, por exemplo, nosso modelo é excelente em realizar junções espaciais e de séries temporais, que não estão nos benchmarks clássicos de SQL, mas que nossos usuários usam diariamente.
Empacotamos essas capacidades centrais em uma interface de Notebook que chamamos de HeavyIQ. O IQ é sobre tornar a exploração de dados e visualização tão intuitiva quanto possível, usando processamento de linguagem natural. Você faz uma pergunta em inglês – como “Quais foram os padrões climáticos na Califórnia na semana passada?” – e o HeavyIQ traduz isso em consultas SQL que nosso banco de dados acelerado por GPU processa rapidamente. Os resultados são apresentados não apenas como dados, mas como visualizações – mapas, gráficos, o que for mais relevante. É sobre permitir consultas interativas rápidas, especialmente ao lidar com grandes ou rápidos conjuntos de dados. O que é fundamental aqui é que nem sempre é a primeira pergunta que você faz, mas talvez a terceira, que realmente chega à insight central, e o HeavyIQ é projetado para facilitar essa exploração mais profunda.
Quais são os principais benefícios de usar o HeavyIQ em vez de ferramentas de BI tradicionais para empresas de telecomunicações, serviços públicos e agências governamentais?
O HeavyIQ se destaca em ambientes onde você lida com dados de grande escala e alta velocidade – exatamente o tipo de dados que as empresas de telecomunicações, serviços públicos e agências governamentais lidam. As ferramentas de inteligência de negócios tradicionais frequentemente lutam com o volume e a velocidade desses dados. Por exemplo, em telecomunicações, você pode ter bilhões de registros de chamadas, mas é a pequena fração de chamadas caídas que você precisa se concentrar. O HeavyIQ permite que você peneire esses dados 10 a 100 vezes mais rápido, graças à nossa infraestrutura de GPU. Essa velocidade, combinada com a capacidade de consultar e visualizar dados interativamente, torna-o inestimável para análise de risco em serviços públicos ou planejamento de cenários em tempo real para agências governamentais.
Outra vantagem, já aludida acima, é que as consultas SQL espaciais e temporais são extremamente poderosas analiticamente – mas podem ser lentas ou difíceis de escrever à mão. Quando um sistema opera na “velocidade da curiosidade”, os usuários podem fazer mais perguntas e perguntas mais nuances. Então, por exemplo, um engenheiro de telecomunicações pode notar um pico temporal em falhas de equipamento de um sistema de monitoramento, ter a intuição de que algo está errado em uma instalação específica e verificar isso com uma consulta espacial que retorna um mapa.
Quais medidas estão em vigor para prevenir a perda de metadados ao usar o HeavyIQ?
Como descrito acima, construímos o HeavyIQ com privacidade e segurança em seu núcleo. Isso inclui não apenas dados, mas também vários tipos de metadados. Usamos metadados de nível de coluna e tabela extensivamente para determinar quais tabelas e colunas contêm as informações necessárias para responder a uma consulta. Também usamos documentos internos da empresa, quando fornecidos, para ajudar naquilo que é conhecido como geração aumentada de recuperação (RAG). Por fim, os próprios modelos de linguagem geram mais metadados. Todos esses, mas especialmente os dois últimos, podem ser de alta sensibilidade comercial.
Ao contrário de modelos de terceiros, onde seus dados são normalmente enviados para servidores externos, o HeavyIQ é executado localmente na mesma infraestrutura de GPU que o restante de nossa plataforma. Isso garante que seus dados e metadados permaneçam sob seu controle, sem risco de perda. Para organizações que exigem os mais altos níveis de segurança, o HeavyIQ pode até ser implantado em um ambiente completamente isolado, garantindo que informações sensíveis nunca deixem equipamentos específicos.
Como a HEAVY.AI alcança alto desempenho e escalabilidade com conjuntos de dados massivos usando infraestrutura de GPU?
O segredo é essencialmente evitar o movimento de dados prevalente em outros sistemas. No núcleo, isso começa com um banco de dados projetado do zero para rodar em GPUs da NVIDIA. Estamos trabalhando nisso por mais de 10 anos agora, e acreditamos que temos a solução de classe mundial quando se trata de análise acelerada por GPU.
Até mesmo os melhores sistemas baseados em CPU perdem o vapor bem antes de um GPU mediano. A estratégia, uma vez que isso acontece no CPU, requer distribuir dados por várias cores e, em seguida, por vários sistemas (chamado “escalabilidade horizontal”). Isso funciona bem em alguns contextos onde as coisas são menos críticas em termos de tempo, mas geralmente começa a ser engarrafado no desempenho da rede.
Além de evitar esse movimento de dados em consultas, também evitamos em muitas outras tarefas comuns. A primeira é que podemos renderizar gráficos sem mover os dados. Em seguida, se você quiser modelagem de inferência de ML, fazemos isso sem mover os dados. E se você interrogar os dados com um grande modelo de linguagem, fazemos isso novamente sem mover os dados. Mesmo que você seja um cientista de dados e queira interrogar os dados do Python, fornecemos métodos para fazer isso na GPU sem mover os dados.
O que isso significa na prática é que podemos realizar não apenas consultas, mas também renderizações 10 a 100 vezes mais rápido do que bancos de dados e servidores de mapas tradicionais baseados em CPU. Quando você lida com conjuntos de dados massivos e de alta velocidade com os quais nossos clientes trabalham – coisas como modelos climáticos, registros de chamadas de telecomunicações ou imagens de satélite – esse tipo de impulso de desempenho é absolutamente essencial.
Como a HEAVY.AI mantém sua vantagem competitiva no cenário em rápida evolução da análise de grandes dados e IA?
Essa é uma ótima pergunta, e é algo em que pensamos constantemente. O cenário da análise de grandes dados e IA está evoluindo a um ritmo incrivelmente rápido, com novas descobertas e inovações acontecendo o tempo todo. Certamente não machuca que temos uma vantagem de 10 anos em tecnologia de banco de dados de GPU.
Acho que a chave para nós é manter o foco laser em nossa missão central – democratizar o acesso a grandes dados geoespaciais. Isso significa continuar empurrando os limites do que é possível com análise acelerada por GPU e garantir que nossos produtos forneçam desempenho e capacidades inigualáveis nesse domínio. Uma grande parte disso é nosso investimento contínuo no desenvolvimento de modelos de linguagem personalizados e afinados que realmente entendem as nuances de SQL espacial e análise geoespacial.
Construímos uma biblioteca extensa de dados de treinamento, indo muito além de benchmarks genéricos, para garantir que nossas ferramentas de análise conversacional possam se engajar com os usuários de uma maneira natural e intuitiva. Mas também sabemos que a tecnologia sozinha não é suficiente. Temos que manter um vínculo profundo com nossos clientes e suas necessidades em evolução. No final do dia, nossa vantagem competitiva vem de nosso foco implacável em entregar valor transformador para nossos usuários. Não estamos apenas acompanhando o mercado – estamos empurrando os limites do que é possível com grandes dados e IA. E continuaremos a fazer isso, não importa quão rapidamente o cenário evolua.
Como a HEAVY.AI apoia esforços de resposta a emergências por meio do HeavyEco?
Construímos o HeavyEco quando vimos alguns de nossos maiores clientes de serviços públicos enfrentando desafios significativos apenas para ingerir as saídas atuais dos modelos climáticos, bem como visualizá-los para comparações conjuntas. Foi necessário quatro horas para um cliente apenas carregar os dados, e quando você está lidando com condições climáticas extremas em movimento rápido, como incêndios… isso simplesmente não é bom o suficiente.
O HeavyEco é projetado para fornecer insights em tempo real em situações de alto risco, como durante um incêndio ou inundação. Nesses cenários, você precisa tomar decisões rapidamente e com base nos melhores dados possíveis. Então, o HeavyEco serve primeiro como um pipeline de dados profissionalmente gerenciado para modelos autoritativos, como os da NOAA e do USGS. Além disso, o HeavyEco permite que você execute cenários, modele impactos de edifícios e visualize dados em tempo real. Isso fornece aos primeiros respondentes as informações críticas de que precisam quando importa. É sobre transformar conjuntos de dados complexos e de grande escala em inteligência ação que pode orientar a tomada de decisão imediata.
Em última análise, nosso objetivo é dar aos nossos usuários a capacidade de explorar seus dados à velocidade do pensamento. Sejam eles executando modelos espaciais complexos, comparando previsões climáticas ou tentando identificar padrões em séries temporais geoespaciais, queremos que eles possam fazer isso de forma perfeita, sem barreiras técnicas no caminho.
O que distingue o LLM proprietário da HEAVY.AI de outros LLMs de terceiros em termos de precisão e desempenho?
Nosso LLM proprietário é especificamente ajustado para os tipos de análise em que nos concentramos – como texto-para-SQL e texto-para-visualização. Inicialmente, tentamos modelos tradicionais de terceiros, mas descobrimos que não atendiam aos altos requisitos de precisão de nossos usuários, que frequentemente tomam decisões críticas. Então, afinamos uma série de modelos de código aberto e os testamos contra benchmarks da indústria.
Nosso LLM é muito mais preciso para os conceitos de SQL avançados que nossos usuários precisam, particularmente em dados geoespaciais e temporais. Além disso, porque ele é executado em nossa infraestrutura de GPU, também é mais seguro.
Além das capacidades do modelo incorporado, também fornecemos uma interface de usuário interativa completa para administradores e usuários adicionarem metadados relevantes de domínio ou negócios. Por exemplo, se o modelo base não atende às expectativas, você pode importar ou ajustar metadados de nível de coluna, ou adicionar informações de orientação e obter feedback imediatamente.
Como a HEAVY.AI vê o papel da análise de dados geoespaciais e temporais em moldar o futuro de várias indústrias?
Acreditamos que a análise de dados geoespaciais e temporais será fundamental para o futuro de muitas indústrias. O que realmente nos concentramos é ajudar nossos clientes a tomar melhores decisões, mais rápido. Seja você de telecomunicações, serviços públicos, governo ou outro – ter a capacidade de analisar e visualizar dados em tempo real pode ser um divisor de águas.
Nossa missão é tornar esse tipo de análise poderosa acessível a todos, não apenas aos grandes jogadores com recursos maciços. Queremos garantir que nossos clientes possam aproveitar os dados que têm, para ficar à frente e resolver problemas à medida que surgem. À medida que os dados continuam a crescer e se tornar mais complexos, vemos nosso papel como garantir que nossas ferramentas evoluam lado a lado, para que nossos clientes estejam sempre preparados para o que está por vir.
Obrigado pela ótima entrevista, leitores que desejam aprender mais devem visitar HEAVY.AI.












