Rozhovory
Dr. Mike Flaxman, VP of Product at HEAVY.AI – Rozhovorová série

Dr. Mike Flaxman je目前 viceprezidentem pro produkt v HEAVY.AI, dříve působil jako produktový manažer a vedl praxi prostorové datové vědy v profesionálních službách. Posledních 20 let se věnoval prostorovému environmentálnímu plánování. Před HEAVY.AI založil společnost Geodesign Technologies, Inc. a spoluzaložil GeoAdaptive LLC, dvě startupy, které aplikovaly prostorovou analytickou technologii na plánování. Předtím, než se stal součástí startupů, byl profesorem plánování na MIT a manažerem průmyslu v ESRI.
HEAVY.AI je hardwarově akcelerovaná platforma pro analýzu dat v reálném čase s velkým dopadem. Utilizuje jak procesory GPU, tak CPU pro rychlé dotazování rozsáhlých datových sad, s podporou SQL a geoprostorových dat. Platforma zahrnuje nástroje pro vizuální analýzu pro interaktivní řídicí panely, křížové filtrování a škálovatelné datové visualizace, což ermögňuje efektivní analýzu velkých dat v různých odvětvích.
Můžete nám říci o svém profesním pozadí a co vás vedlo k připojení se k HEAVY.AI?
Předtím, než jsem se připojil k HEAVY.AI, jsem strávil roky v akademické sféře, kde jsem nakonec učil prostorovou analytiku na MIT. Také jsem vedl malou poradenskou firmu s různými klienty z veřejného sektoru. Byl jsem zapojen do projektů GIS v 17 zemích. Moje práce mě zavedla od poradenské činnosti pro organizace, jako je Interamerická rozvojová banka, až po správu technologie GIS pro architekturu, inženýrství a stavebnictví v ESRI, největšího vývojáře GIS na světě.
Dobře si pamatuji svůj první kontakt s tím, co je nyní HEAVY.AI, a to, když jako konzultant jsem byl odpovědný za plánování scénářů pro program ochrany přírody na plážích ve Floridě. Moji kolegové a já jsme měli potíže s modelem habitatu mořských želv pomocí dat Landsat 30m a kamarád mě upozornil na nová a velmi relevantní data – 5cm LiDAR. Byla to přesně ta data, která jsme potřebovali z vědeckého hlediska, ale byla to data asi 3600krát větší, než jsme plánovali použít. Bezpečně lze říci, že nikdo by mi nezvýšil rozpočet ani o zlomek této částky. Takže ten den jsem odložil nástroje, které jsem používal a učil po několik desetiletí, a začal jsem hledat něco nového. HEAVY.AI prošlo těmito daty tak hladce a bez námahy, že jsem byl okamžitě uchvácen.
O několik let později si stále myslím, že to, co dělá HEAVY.AI, je bastante jedinečné a jeho raná sázka na GPU-analýzu byla přesně tam, kde průmysl stále potřebuje jít. HEAVY.AI je pevně zaměřeno na demokratizaci přístupu k velkým datům. To zahrnuje nejen složku objemu dat a rychlosti zpracování, ale také to, že dává každému svou vlastní superpočítač. Ale stále důležitějším aspektem s příchodem velkých jazykových modelů je zpřístupnění prostorového modelování mnoha více lidem. Tyto dny, místo toho, abyste strávili roky učením se komplexního rozhraní s tisíci nástrojů, můžete jednoduše zahájit konverzaci s HEAVY.AI v lidském jazyce své volby. Program nejen generuje příkazy, které jsou vyžadovány, ale také představuje relevantní visualizace.
V pozadí je samozřejmě obtížné zajistit snadné použití. V současné době, jako viceprezident pro produktový management v HEAVY.AI, jsem silně zapojen do určování funkcí a schopností, které priorizujeme pro naše produkty. Má rozsáhlá zkušenost v GIS mi umožňuje skutečně pochopit potřeby našich zákazníků a vést náš vývojový roadmap podle toho.
Jak vaše předchozí zkušenosti se prostorovým environmentálním plánováním a startupy ovlivnily vaši práci v HEAVY.AI?
Environmentální plánování je zvláště náročné téma, protože je nutné zohlednit jak lidské potřeby, tak přírodní svět. Obecné řešení, které jsem se naučil brzy, spočívá v kombinaci metody participativního plánování s technologiemi dálkového průzkumu a GIS. Předtím, než jsme se usnesli na plánu činnosti, jsme vytvořili několik scénářů a simulovali jejich pozitivní a negativní dopady v počítači pomocí visualizací. Používání participativních procesů nám umožnilo kombinovat různé formy odbornosti a řešit velmi komplexní problémy.
Tento vzorec stále funguje velmi dobře v obchodním prostředí. Pomáháme zákazníkům vytvářet digitální dvojčata klíčových částí jejich podnikání a umožňujeme jim rychle vytvářet a vyhodnocovat obchodní scénáře.
Domeňuji, že má zkušenost s učením dala mi hluboké porozumění pro uživatele softwaru, zejména komplexních softwarových systémů. Kde jeden student zakopne na jednom místě, je náhodné, ale kde desítky nebo stovky lidí dělají podobné chyby, víte, že máte designový problém. Možná mi nejvíce záleží na softwarovém designu a aplikaci těchto znalostí při navrhování nových generací systémů.
Můžete vysvětlit, jak HeavyIQ využívá zpracování přirozeného jazyka pro usnadnění průzkumu a visualizace dat?
Dneska se zdá, že každý a jeho bratr chválí nový genAI model, většina z nich je zapomenutelnými klonами jeden od druhého. My jsme zvolili velmi odlišnou cestu. Věříme, že přesnost, reprodukovatelnost a soukromí jsou základní charakteristiky pro jakýkoli obchodní analytický nástroj, včetně těch generovaných velkými jazykovými modely (LLM). Takže jsme tyto funkce integrovali do našeho produktu na fundamentální úrovni. Například, omezujeme vstupy modelu přísně na firemní databáze a poskytujeme dokumenty uvnitř firemního bezpečnostního perimetru. Omezujeme také výstupy na nejnovější HeavySQL a Charts. To znamená, že ať jste otázku, na kterou se zeptáte, budeme se snažit odpovědět pomocí vašich dat a ukážeme vám přesně, jak jsme odpověď odvodili.
S těmito zárukami na místě, záleží méně na našich zákaznících, jak přesně zpracováváme dotazy. Ale v pozadí je další důležitý rozdíl ve srovnání s spotřebitelským genAI, že jsme jemně ladili modely proti konkrétním typům otázek, které obchodní uživatelé kladou obchodním datům, včetně prostorových dat. Takže například náš model je vynikající při provádění prostorových a časových spojení, které nejsou v klasických SQL benchmarcích, ale naše uživatelé je používají denně.
Balíme tyto základní funkce do rozhraní Notebook, které nazýváme HeavyIQ. IQ je o tom, aby průzkum a visualizace dat byly co nejintuitivnější pomocí zpracování přirozeného jazyka (NLP). Položíte otázku v angličtině – jako například, „Jaké byly počasí v Kalifornii minulý týden?“ – a HeavyIQ přeloží ji do SQL dotazů, které naše GPU akcelerovaná databáze zpracuje rychle. Výsledky jsou prezentovány nejen jako data, ale také jako visualizace – mapy, grafy, cokoliv, co je nejrelevantnější. Je to o umožnění rychlé, interaktivní dotazování, zejména při zpracování velkých nebo rychle se měnících datových sad. Co je klíčové, je to, že často není první otázka, kterou položíte, ale možná ta třetí, která skutečně přinese jádro insightu, a HeavyIQ je navržen tak, aby usnadnil tuto hlubší exploraci.
Jaké jsou hlavní výhody používání HeavyIQ oproti tradičním BI nástrojům pro telekomunikace, utility a vládní agentury?
HeavyIQ vyniká v prostředích, kde se pracuje s velkými, rychlými daty – přesně tím typem dat, se kterým pracují telekomunikace, utility a vládní agentury. Tradiční obchodní inteligence nástroje často zápasí s objemem a rychlostí těchto dat. Například v telekomunikacích můžete mít miliardy záznamů o hovorech, ale je to malá frakce dropped callů, na které se musíte zaměřit. HeavyIQ umožňuje vám procházet tato data 10 až 100krát rychleji díky našemu GPU infrastruktuře. Tato rychlost, kombinovaná se schopností interaktivně dotazovat a vizualizovat data, činí ji nepostradatelnou pro rizikovou analýzu v utilitách nebo pro plánování scénářů v reálném čase pro vládní agentury.
Další výhodou, již zmíněnou výše, je, že prostorové a časové SQL dotazy jsou extrémně analyticky silné – ale mohou být pomalé nebo obtížné na psaní ručně. Když systém funguje na „rychlosti zvědavosti“, uživatelé mohou klást více otázek a více nuancovaných otázek. Takže například inženýr telekomunikací může zaznamenat časový skok v selháních zařízení z monitorovacího systému, mít intuici, že něco není v pořádku na konkrétním zařízení, a zkontrolovat to pomocí prostorového dotazu, který vrátí mapu.
Jaká opatření jsou zavedena pro zabránění úniku metadata, když se používá HeavyIQ?
Jak je popsáno výše, jsme postavili HeavyIQ s důrazem na soukromí a bezpečnost na jeho jádru. To zahrnuje nejen data, ale také několik typů metadata. Používáme metadata na úrovni sloupců a tabulek rozsáhle při určování, které tabulky a sloupce obsahují informace potřebné pro odpověď na dotaz. Také používáme interní firemní dokumenty, pokud jsou poskytnuty, pro pomoc při takzvané generaci s podporou vyhledávání (RAG). Nakonec, jazykové modely samy generují další metadata. Všechny tyto, ale zejména ty poslední, mohou být vysoce citlivé pro obchodní činnost.
Na rozdíl od třetích stran, kde vaše data jsou obvykle odeslána na externí servery, HeavyIQ běží místně na stejné GPU infrastruktuře jako zbytek naší platformy. To zajišťuje, že vaše data a metadata zůstávají pod vaší kontrolou, bez rizika úniku. Pro organizace, které vyžadují nejvyšší úroveň zabezpečení, HeavyIQ může být nasazen i v kompletně izolovaném prostředí, což zajišťuje, že citlivé informace nikdy neopustí konkrétní zařízení.
Jak HEAVY.AI dosahuje vysoké výkonnosti a škálovatelnosti s masivními datovými sadami pomocí GPU infrastruktury?
Tajemství spočívá v podstatě v tom, že se vyhýbáme pohybu dat, který je běžný v jiných systémech. V jádru začíná to s databází, která je navržena od základu pro běh na NVIDIA GPU. Pracovali jsme na tom přes 10 let a skutečně věříme, že máme nejlepší řešení, když jde o GPU akcelerovanou analýzu.
Even the best CPU-based systems run out of steam well before a middling GPU. The strategy once this happens on CPU requires distributing data across multiple cores and then multiple systems (so-called ‘horizontal scaling’). This works well in some contexts where things are less time-critical, but generally starts getting bottlenecked on network performance.
Navíc k tomu, že se vyhýbáme pohybu dat při dotazech, vyhýbáme se mu také u mnoha dalších běžných úkolů. První je, že můžeme vykreslit grafiku bez pohybu dat. Pak, pokud chcete modelování ML inference, opět to děláme bez pohybu dat. A pokud se zeptáte dat pomocí velkého jazykového modelu, opět to děláme bez pohybu dat. Even if you are a data scientist and want to interrogate the data from Python, we again provide methods to do this on GPU without data movement.
Co to znamená v praxi, je, že můžeme provádět nejen dotazy, ale také vykreslování 10 až 100krát rychleji než tradiční CPU-based databáze a mapové servery. Když pracujete s masivními, rychlými datovými sadami, se kterými pracují naši zákazníci – jako jsou například modely počasí, záznamy o hovorech v telekomunikacích nebo satelitní snímky – takový výkonový boost je absolutně nezbytný.
Jak HEAVY.AI udržuje svou konkurenční výhodu v rychle se vyvíjejícím prostředí big data analýzy a AI?
That’s a great question, and it’s something we think about constantly. The landscape of big data analytics and AI is evolving at an incredibly rapid pace, with new breakthroughs and innovations happening all the time. It certainly doesn’t hurt that we have a 10 year headstart on GPU database technology. .
I think the key for us is to stay laser-focused on our core mission – democratizing access to big, geospatial data. That means continually pushing the boundaries of what’s possible with GPU-accelerated analytics, and ensuring our products deliver unparalleled performance and capabilities in this domain. A big part of that is our ongoing investment in developing custom, fine-tuned language models that truly understand the nuances of spatial SQL and geospatial analysis.
We’ve built up an extensive library of training data, going well beyond generic benchmarks, to ensure our conversational analytics tools can engage with users in a natural, intuitive way. But we also know that technology alone isn’t enough. We have to stay deeply connected to our customers and their evolving needs. At the end of the day, our competitive edge comes down to our relentless focus on delivering transformative value to our users. We’re not just keeping pace with the market – we’re pushing the boundaries of what’s possible with big data and AI. And we’ll continue to do so, no matter how quickly the landscape evolves.
Jak HEAVY.AI podporuje úsilí o reakci v případě nouze prostřednictvím HeavyEco?
We built HeavyEco when we saw some of our largest utility customers having significant challenges simply ingesting today’s weather model outputs, as well as visualizing them for joint comparisons. It was taking one customer up to four hours just to load data, and when you are up against fast-moving extreme weather conditions like fires…that’s just not good enough.
HeavyEco is designed to provide real-time insights in high-consequence situations, like during a wildfire or flood. In such scenarios, you need to make decisions quickly and based on the best possible data. So HeavyEco serves firstly as a professionally-managed data pipeline for authoritative models such as those from NOAA and USGS. On top of those, HeavyEco allows you to run scenarios, model building-level impacts, and visualize data in real time. This gives first responders the critical information they need when it matters most. It’s about turning complex, large-scale datasets into actionable intelligence that can guide immediate decision-making.
Ultimately, our goal is to give our users the ability to explore their data at the speed of thought. Whether they’re running complex spatial models, comparing weather forecasts, or trying to identify patterns in geospatial time series, we want them to be able to do it seamlessly, without any technical barriers getting in their way.
Co odlišuje proprietární LLM HEAVY.AI od třetích stran LLM v oblasti přesnosti a výkonu?
Our proprietary LLM is specifically tuned for the types of analytics we focus on—like text-to-SQL and text-to-visualization. We initially tried traditional third-party models, but found they didn’t meet the high accuracy requirements of our users, who are often making critical decisions. So, we fine-tuned a range of open-source models and tested them against industry benchmarks.
Our LLM is much more accurate for the advanced SQL concepts our users need, particularly in geospatial and temporal data. Additionally, because it runs on our GPU infrastructure, it’s also more secure.
In addition to the built-in model capabilities, we also provide a full interactive user interface for administrators and users to add domain or business-relevant metadata. For example, if the base model doesn’t perform as expected, you can import or tweak column-level metadata, or add guidance information and immediately get feedback.
Jak HEAVY.AI vidí roli geoprostorové a časové datové analýzy v budoucnosti různých odvětví?
We believe geospatial and temporal data analytics are going to be critical for the future of many industries. What we’re really focused on is helping our customers make better decisions, faster. Whether you’re in telecom, utilities, or government, or other – having the ability to analyze and visualize data in real-time can be a game-changer.
Our mission is to make this kind of powerful analytics accessible to everyone, not just the big players with massive resources. We want to ensure that our customers can take advantage of the data they have, to stay ahead and solve problems as they arise. As data continues to grow and become more complex, we see our role as making sure our tools evolve right alongside it, so our customers are always prepared for what’s next.
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit HEAVY.AI.












