Interviste
Dott. Mike Flaxman, VP of Product at HEAVY.AI – Intervista

Dott. Mike Flaxman è attualmente il VP of Product at HEAVY.AI, dopo aver ricoperto il ruolo di Product Manager e aver guidato la pratica di Spatial Data Science nel settore dei servizi professionali. Ha trascorso gli ultimi 20 anni lavorando nella pianificazione ambientale spaziale. Prima di HEAVY.AI, ha fondato Geodesign Technologies, Inc e cofondato GeoAdaptive LLC, due startup che applicano tecnologie di analisi spaziale alla pianificazione. Prima di entrare nel mondo delle startup, è stato professore di pianificazione al MIT e Industry Manager presso ESRI.
HEAVY.AI è una piattaforma hardware-accelerata per l’analisi dei dati in tempo reale e ad alto impatto. Sfrutta sia l’elaborazione GPU che CPU per eseguire query su grandi set di dati in modo rapido, con supporto per SQL e dati geospaziali. La piattaforma include strumenti di analisi visiva per dashboard interattive, cross-filtering e visualizzazioni di dati scalabili, consentendo un’analisi efficiente dei big data in vari settori.
Ci può parlare del suo background professionale e di cosa l’ha portato a unirsi a HEAVY.AI?
Prima di unirmi a HEAVY.AI, ho trascorso anni nel mondo accademico, insegnando analisi spaziali al MIT. Ho anche gestito una piccola società di consulenza, con una varietà di clienti del settore pubblico. Sono stato coinvolto in progetti di GIS in 17 paesi. Il mio lavoro mi ha portato a consigliare organizzazioni come la Banca di Sviluppo Interamericana e a gestire la tecnologia GIS per l’architettura, l’ingegneria e la costruzione presso ESRI, il più grande sviluppatore di GIS al mondo
Ricordo vividamente il mio primo incontro con ciò che ora è HEAVY.AI, quando, come consulente, ero responsabile della pianificazione di scenari per il programma di conservazione degli habitat delle spiagge della Florida. I miei colleghi e io stavamo lottando per modellare l’habitat delle tartarughe marine utilizzando dati Landsat da 30m e un amico mi ha fatto notare alcuni dati nuovi e molto rilevanti – dati LiDAR da 5cm. Era esattamente ciò di cui avevamo bisogno dal punto di vista scientifico, ma qualcosa come 3600 volte più grande di quanto avessimo pianificato di utilizzare. Nessuno avrebbe aumentato il mio budget di anche solo una frazione di quella somma. Quel giorno ho messo da parte gli strumenti che avevo utilizzato e insegnato per diverse decadi e ho iniziato a cercare qualcosa di nuovo. HEAVY.AI ha tagliato e reso quei dati in modo così fluido e senza sforzo che sono stato istantaneamente conquistato.
Proiettiamoci alcuni anni nel futuro, e credo ancora che ciò che fa HEAVY.AI sia abbastanza unico e che la sua scommessa precoce sull’analisi GPU sia esattamente dove l’industria deve ancora andare. HEAVY.AI si concentra fermamente sulla democratizzazione dell’accesso ai big data. Ciò include il componente di volume dei dati e la velocità di elaborazione, essenzialmente dando a tutti una loro supercalcolatrice. Ma un aspetto sempre più importante, con l’avvento dei grandi modelli linguistici, è rendere la modellazione spaziale accessibile a molte più persone. Oggi, invece di trascorrere anni a imparare un’interfaccia complessa con migliaia di strumenti, puoi semplicemente iniziare una conversazione con HEAVY.AI nel linguaggio umano della tua scelta. Il programma non solo genera i comandi necessari, ma presenta anche visualizzazioni rilevanti.
Dietro le quinte, offrire facilità d’uso è ovviamente molto difficile. Attualmente, come VP of Product Management at HEAVY.AI, sono fortemente coinvolto nella determinazione delle funzionalità e delle capacità che priorizziamo per i nostri prodotti. La mia vasta esperienza in GIS mi consente di comprendere veramente le esigenze dei nostri clienti e di guidare la nostra roadmap di sviluppo di conseguenza.
Come la sua esperienza precedente nella pianificazione ambientale spaziale e nelle startup ha influenzato il suo lavoro a HEAVY.AI?
La pianificazione ambientale è un dominio particolarmente impegnativo in quanto è necessario tenere conto sia di diversi insiemi di esigenze umane che del mondo naturale. La soluzione generale che ho imparato presto è stata quella di abbinare un metodo noto come pianificazione partecipativa con le tecnologie di telerilevamento e GIS. Prima di stabilire un piano d’azione, creavamo più scenari e simulavamo i loro impatti positivi e negativi nel computer utilizzando visualizzazioni. Utilizzare processi partecipativi ci ha permesso di combinare varie forme di esperienza e di risolvere problemi molto complessi.
Sebbene non facciamo normalmente pianificazione ambientale a HEAVY.AI, questo modello funziona ancora molto bene in ambienti aziendali. Quindi, aiutiamo i clienti a costruire gemelli digitali di parti chiave del loro business e li lasciamo creare e valutare scenari aziendali in modo rapido.
Suppongo che la mia esperienza di insegnamento mi abbia dato una profonda empatia per gli utenti di software, in particolare di sistemi software complessi. Dove uno studente inciampa in un punto è casuale, ma dove decine o centinaia di persone fanno errori simili, sai di avere un problema di progettazione. Forse la mia parte preferita della progettazione del software è prendere queste conoscenze e applicarle nella progettazione di nuove generazioni di sistemi.
Può spiegare come HeavyIQ sfrutta l’elaborazione del linguaggio naturale per facilitare l’esplorazione e la visualizzazione dei dati?
Questi giorni sembra che tutti e loro fratello stiano promuovendo un nuovo modello di intelligenza artificiale generale, la maggior parte dei quali sono cloni dimenticabili gli uni degli altri. Noi abbiamo intrapreso una strada molto diversa. Crediamo che l’accuratezza, la riproducibilità e la privacy siano caratteristiche essenziali per qualsiasi strumento di analisi aziendale, compresi quelli generati con grandi modelli linguistici (LLM). Quindi, abbiamo costruito queste caratteristiche nella nostra offerta a livello fondamentale. Ad esempio, limitiamo rigorosamente gli input del modello ai database aziendali e ai documenti all’interno di un perimetro di sicurezza aziendale. Limitiamo anche gli output agli ultimi HeavySQL e Charts. Ciò significa che, indipendentemente dalla domanda che si pone, cercheremo di rispondere con i dati dell’utente e mostreremo esattamente come abbiamo derivato quella risposta.
Con queste garanzie in atto, importa meno ai nostri clienti esattamente come elaboriamo le query. Ma dietro le quinte, un’altra differenza importante rispetto ai modelli di intelligenza artificiale generale dei consumatori è che affiniamo i modelli in modo estensivo contro i tipi di domande che gli utenti aziendali pongono ai dati aziendali, compresi i dati spaziali. Quindi, ad esempio, il nostro modello è eccellente nell’eseguire join spaziali e di serie temporali, che non sono presenti nei benchmark SQL classici, ma che i nostri utenti utilizzano quotidianamente.
Impacchettiamo queste capacità core in un’interfaccia Notebook che chiamiamo HeavyIQ. IQ è fare in modo che l’esplorazione dei dati e la visualizzazione siano il più intuitive possibile utilizzando l’elaborazione del linguaggio naturale (NLP). Chiedi una domanda in inglese – come “Quali sono stati i modelli meteorologici in California la scorsa settimana?” – e HeavyIQ traduce quella domanda in query SQL che il nostro database GPU-accelerato elabora rapidamente. I risultati vengono presentati non solo come dati, ma come visualizzazioni – mappe, grafici, qualsiasi cosa sia più rilevante. Si tratta di consentire una query interattiva rapida, specialmente quando si ha a che fare con grandi o dati in movimento veloce. Ciò che è fondamentale qui è che spesso non è la prima domanda che si pone, ma forse la terza, che arriva veramente all’insight fondamentale, e HeavyIQ è progettato per facilitare quell’esplorazione più approfondita.
Quali sono i principali vantaggi dell’utilizzo di HeavyIQ rispetto agli strumenti di business intelligence tradizionali per le aziende di telecomunicazioni, le utility e le agenzie governative?
HeavyIQ eccelle in ambienti in cui si ha a che fare con dati su larga scala e ad alta velocità – esattamente il tipo di dati che le aziende di telecomunicazioni, le utility e le agenzie governative gestiscono. Gli strumenti di business intelligence tradizionali spesso lottano con il volume e la velocità di questi dati. Ad esempio, nel settore delle telecomunicazioni, potresti avere miliardi di registri di chiamate, ma è la piccola frazione di chiamate interrotte che devi concentrarti. HeavyIQ ti consente di setacciare quei dati 10-100 volte più velocemente grazie alla nostra infrastruttura GPU. Questa velocità, combinata con la capacità di interrogare e visualizzare interattivamente i dati, la rende inestimabile per l’analisi dei rischi nelle utility o la pianificazione di scenari in tempo reale per le agenzie governative.
L’altro vantaggio già accennato sopra è che le query SQL spaziali e temporali sono estremamente potenti dal punto di vista analitico – ma possono essere lente o difficili da scrivere a mano. Quando un sistema opera alla “velocità della curiosità” gli utenti possono porre sia più domande che più domande sfumate. Quindi, ad esempio, un ingegnere di telecomunicazioni potrebbe notare un picco temporale nei guasti dell’attrezzatura da un sistema di monitoraggio, avere l’intuizione che qualcosa non va in una particolare struttura e verificarlo con una query spaziale che restituisce una mappa.
Quali misure sono in atto per prevenire la perdita di metadati quando si utilizza HeavyIQ?
Come descritto sopra, abbiamo costruito HeavyIQ con la privacy e la sicurezza al suo nucleo. Ciò include non solo i dati, ma anche diversi tipi di metadati. Utilizziamo metadati a livello di colonna e tabella in modo estensivo per determinare quali tabelle e colonne contengono le informazioni necessarie per rispondere a una query. Utilizziamo anche documenti interni all’azienda, se forniti, per assistere nella cosiddetta generazione aumentata di recupero (RAG). Infine, i modelli linguistici stessi generano ulteriori metadati. Tutti questi, ma soprattutto gli ultimi due, possono essere di alta sensibilità aziendale.
A differenza dei modelli di terze parti in cui i tuoi dati vengono normalmente inviati a server esterni, HeavyIQ funziona localmente sulla stessa infrastruttura GPU del resto della nostra piattaforma. Ciò garantisce che i tuoi dati e metadati rimangano sotto il tuo controllo, senza alcun rischio di perdita. Per le organizzazioni che richiedono i più alti livelli di sicurezza, HeavyIQ può anche essere distribuito in un ambiente completamente isolato, garantendo che le informazioni sensibili non lascino mai attrezzature specifiche.
Come HEAVY.AI raggiunge prestazioni elevate e scalabilità con set di dati massicci utilizzando l’infrastruttura GPU?
Il segreto è essenzialmente evitare il movimento dei dati prevalente in altri sistemi. Al suo nucleo, questo inizia con un database appositamente progettato per funzionare su GPU NVIDIA. Stiamo lavorando a questo per oltre 10 anni ormai e crediamo veramente di avere la soluzione migliore in classe quando si tratta di analisi accelerate da GPU.
Anche i migliori sistemi basati su CPU si esauriscono ben prima di una GPU media. La strategia una volta che questo accade su CPU richiede la distribuzione dei dati su più core e poi su più sistemi (cosiddetto “scaling orizzontale”). Ciò funziona bene in alcuni contesti in cui le cose sono meno critiche per il tempo, ma in generale inizia a essere bloccato dalle prestazioni della rete.
In aggiunta all’evitare questo movimento dei dati nelle query, evitiamo anche di farlo in molte altre attività comuni. Il primo è che possiamo renderizzare grafici senza spostare i dati. Poi, se desideri il modeling di inferenza ML, facciamo di nuovo ciò senza spostare i dati. E se interroghi i dati con un grande modello linguistico, facciamo ancora una volta ciò senza spostare i dati. Anche se sei uno scienziato dei dati e vuoi interroghi i dati da Python, forniamo metodi per farlo su GPU senza spostare i dati.
Ciò significa che possiamo eseguire non solo query, ma anche rendering 10-100 volte più veloce rispetto ai database e ai server di mappe basati su CPU tradizionali. Quando si ha a che fare con set di dati massicci e ad alta velocità con cui lavorano i nostri clienti – come modelli meteorologici, registri di chiamate di telecomunicazioni o immagini satellitari – quel tipo di aumento delle prestazioni è assolutamente essenziale.
Come HEAVY.AI mantiene il suo vantaggio competitivo nel panorama in rapida evoluzione dell’analisi dei big data e dell’intelligenza artificiale?
È una grande domanda e ci pensiamo costantemente. Il panorama dell’analisi dei big data e dell’intelligenza artificiale sta evolvendo a un ritmo incredibilmente rapido, con nuove scoperte e innovazioni che si verificano tutto il tempo. Non fa certo male che abbiamo un vantaggio di 10 anni sulla tecnologia del database GPU.
Credo che la chiave per noi sia rimanere laser-focalizzati sulla nostra missione principale – democratizzare l’accesso ai big data geospaziali. Ciò significa continuare a spingere i confini di ciò che è possibile con l’analisi accelerata da GPU e assicurarsi che i nostri prodotti offrano prestazioni e capacità senza pari in questo dominio. Una grande parte di ciò è il nostro investimento continuo nello sviluppo di modelli linguistici personalizzati e affinati che comprendono veramente le sfumature del SQL spaziale e dell’analisi geospaziale.
Abbiamo costruito un’ampia libreria di dati di training, andando ben oltre i benchmark generici, per assicurare che i nostri strumenti di analisi conversazionale possano interagire con gli utenti in modo naturale e intuitivo. Ma sappiamo anche che la tecnologia da sola non è sufficiente. Dobbiamo rimanere profondamente connessi con i nostri clienti e le loro esigenze in evoluzione. Alla fine, il nostro vantaggio competitivo si riduce alla nostra focalizzazione implacabile nel fornire un valore trasformativo ai nostri utenti. Non stiamo solo tenendo il passo con il mercato – stiamo spingendo i confini di ciò che è possibile con i big data e l’intelligenza artificiale. E continueremo a farlo, indipendentemente da quanto rapidamente il panorama si evolva.
Come HEAVY.AI supporta gli sforzi di risposta alle emergenze attraverso HeavyEco?
Abbiamo costruito HeavyEco quando abbiamo visto alcuni dei nostri più grandi clienti utility avere difficoltà significative nell’ingestire gli output dei modelli meteorologici odierni, nonché nella visualizzazione per confronti congiunti. Stava impiegando fino a quattro ore per caricare i dati e, quando sei di fronte a condizioni meteorologiche estreme in movimento come incendi… non è affatto sufficiente.
HeavyEco è progettato per fornire informazioni in tempo reale in situazioni ad alta posta in gioco, come durante un incendio o un’alluvione. In tali scenari, è necessario prendere decisioni rapidamente e sulla base dei migliori dati possibili. Quindi, HeavyEco serve in primo luogo come pipeline di dati gestita professionalmente per modelli autorevoli come quelli della NOAA e dell’USGS. Inoltre, HeavyEco consente di eseguire scenari, costruire modelli di impatto a livello di edificio e visualizzare i dati in tempo reale. Ciò fornisce ai primi rispondenti le informazioni critiche di cui hanno bisogno quando più conta. Si tratta di trasformare set di dati complessi e su larga scala in intelligence azionabile che possa guidare la presa di decisioni immediate.
Infine, il nostro obiettivo è dare ai nostri utenti la capacità di esplorare i loro dati alla velocità del pensiero. Che stiano eseguendo modelli spaziali complessi, confrontando previsioni meteorologiche o cercando di identificare pattern in serie temporali geospaziali, vogliamo che possano farlo in modo fluido, senza barriere tecniche che si frappongano.
Cosa distingue il modello di linguaggio proprietario di HEAVY.AI dagli altri modelli di linguaggio di terze parti in termini di accuratezza e prestazioni?
Il nostro modello di linguaggio proprietario è specificamente ottimizzato per i tipi di analisi su cui ci concentriamo – come text-to-SQL e text-to-visualizzazione. Abbiamo inizialmente provato modelli tradizionali di terze parti, ma abbiamo scoperto che non soddisfacevano i requisiti di accuratezza elevata dei nostri utenti, che spesso prendono decisioni critiche. Quindi, abbiamo affinato una serie di modelli open-source e li abbiamo testati contro benchmark di settore.
Il nostro modello di linguaggio è molto più preciso per i concetti SQL avanzati di cui i nostri utenti hanno bisogno, in particolare nei dati geospaziali e temporali. Inoltre, poiché funziona sulla nostra infrastruttura GPU, è anche più sicuro.
In aggiunta alle capacità di modello integrate, forniamo anche un’interfaccia utente interattiva completa per gli amministratori e gli utenti per aggiungere metadati rilevanti a livello di dominio o aziendale. Ad esempio, se il modello di base non funziona come previsto, puoi importare o regolare metadati a livello di colonna, aggiungere informazioni di guida e ottenere immediatamente un feedback.
Come HEAVY.AI prevede il ruolo dell’analisi dei dati geospaziali e temporali nel plasmare il futuro di vari settori?
Crediamo che l’analisi dei dati geospaziali e temporali sarà fondamentale per il futuro di molti settori. Ciò di cui ci occupiamo veramente è aiutare i nostri clienti a prendere decisioni migliori, più velocemente. Che tu sia nel settore delle telecomunicazioni, delle utility o del governo, o in altri – avere la capacità di analizzare e visualizzare i dati in tempo reale può essere un fattore di svolta.
La nostra missione è rendere questo tipo di analisi potente accessibile a tutti, non solo ai grandi player con risorse massive. Vogliamo assicurarci che i nostri clienti possano trarre vantaggio dai dati che hanno, per rimanere avanti e risolvere i problemi man mano che si presentano. Man mano che i dati continuano a crescere e diventare più complessi, vediamo il nostro ruolo come garanti che i nostri strumenti evolvano parallelamente, in modo che i nostri clienti siano sempre pronti per ciò che verrà.
Grazie per la grande intervista, i lettori che desiderano saperne di più possono visitare HEAVY.AI.












