Interviews
Dr. Mike Flaxman, VP of Product bei HEAVY.AI – Interview-Serie

Dr. Mike Flaxman ist derzeit VP of Product bei HEAVY.AI und war zuvor Product Manager und leitete die Spatial Data Science-Praxis in Professional Services. Er hat die letzten 20 Jahre im Bereich der räumlichen Umweltplanung gearbeitet. Vor HEAVY.AI gründete er Geodesign Technologies, Inc. und co-gründete GeoAdaptive LLC, zwei Start-ups, die räumliche Analysetechnologien auf die Planung anwendeten. Vor seiner Zeit als Start-up-Unternehmer war er Professor für Planung am MIT und Industry-Manager bei ESRI.
HEAVY.AI ist eine hardware-beschleunigte Plattform für Echtzeit-Analytics mit hohem Auswirkungspotenzial. Sie nutzt sowohl GPU- als auch CPU-Verarbeitung, um massive Datensätze schnell abzufragen, mit Unterstützung für SQL und geospatialen Daten. Die Plattform umfasst Visual-Analytics-Tools für interaktive Dashboards, Kreuzfilterung und skalierbare Datenvisualisierungen, um eine effiziente Big-Data-Analyse über verschiedene Branchen hinweg zu ermöglichen.
Können Sie uns über Ihren beruflichen Hintergrund und was Sie dazu gebracht hat, HEAVY.AI beizutreten, erzählen?
Bevor ich zu HEAVY.AI kam, verbrachte ich Jahre in der Wissenschaft, unterrichtete letztendlich räumliche Analytik am MIT und leitete ein kleines Beratungsunternehmen mit einer Vielzahl von öffentlichen Kunden. Ich war an GIS-Projekten in 17 Ländern beteiligt. Meine Arbeit hat mich von der Beratung von Organisationen wie der Interamerikanischen Entwicklungsbank bis zur Verwaltung von GIS-Technologie für Architektur, Ingenieurwesen und Bauwesen bei ESRI, dem größten GIS-Entwickler der Welt, geführt
Ich erinnere mich lebhaft an mein erstes Zusammentreffen mit dem, was jetzt HEAVY.AI ist, als ich als Berater für Szenarienplanung für das Florida Beaches Habitat Conservation Program verantwortlich war. Meine Kollegen und ich hatten Schwierigkeiten, das Meeres-Schildkröten-Habitat mit 30m-Landsat-Daten und einem Freund, der mich auf einige brandneue und sehr relevante Daten – 5cm-LiDAR – hinwies. Es war genau das, was wir wissenschaftlich benötigten, aber etwas wie 3600 Mal größer als das, was wir geplant hatten. Niemand würde mein Budget um auch nur einen Bruchteil davon erhöhen. Also legte ich an diesem Tag die Werkzeuge, die ich jahrzehntelang verwendet und gelehrt hatte, beiseite und suchte nach etwas Neuem. HEAVY.AI schnitt durch und zeigte diese Daten so reibungslos und mühelos, dass ich sofort davon begeistert war.
Einige Jahre später denke ich immer noch, dass das, was HEAVY.AI tut, ziemlich einzigartig ist, und ihr früher Einsatz auf GPU-Analytics war genau da, wo die Branche immer noch hingehen muss. HEAVY.AI konzentriert sich fest auf die Demokratisierung des Zugangs zu Big Data. Dies hat natürlich die Komponenten des Datenumsatzes und der Verarbeitungsgeschwindigkeit, was im Wesentlichen jedem seinen eigenen Supercomputer gibt. Aber ein zunehmend wichtiger Aspekt mit dem Aufkommen großer Sprachmodelle ist es, räumliche Modellierung für viele mehr Menschen zugänglich zu machen. Heute können Sie anstelle von jahrelangem Lernen einer komplexen Schnittstelle mit Tausenden von Tools einfach ein Gespräch mit HEAVY.AI in der Sprache Ihrer Wahl beginnen. Das Programm generiert nicht nur die erforderlichen Befehle, sondern präsentiert auch relevante Visualisierungen.
Hinter den Kulissen ist es natürlich sehr schwierig, eine einfache Bedienung zu bieten. Als VP of Product Management bei HEAVY.AI bin ich stark in die Bestimmung der Funktionen und Fähigkeiten involviert, die wir für unsere Produkte priorisieren. Mein umfassender Hintergrund in GIS ermöglicht es mir, die Bedürfnisse unserer Kunden wirklich zu verstehen und unsere Entwicklungsroadmap entsprechend zu leiten.
Wie hat Ihre vorherige Erfahrung in der räumlichen Umweltplanung und in Start-ups Ihre Arbeit bei HEAVY.AI beeinflusst?
Umweltplanung ist ein besonders herausforderndes Gebiet, da man sowohl verschiedene menschliche Bedürfnisse als auch die natürliche Welt berücksichtigen muss. Die allgemeine Lösung, die ich früh gelernt habe, war, eine Methode namens partizipative Planung mit den Technologien der Fernerkundung und GIS zu paaren. Bevor wir einen Plan von Maßnahmen festlegten, erstellten wir mehrere Szenarien und simulierten ihre positiven und negativen Auswirkungen im Computer mithilfe von Visualisierungen. Durch partizipative Prozesse konnten wir verschiedene Formen von Fachwissen kombinieren und sehr komplexe Probleme lösen.
Obwohl wir normalerweise keine Umweltplanung bei HEAVY.AI durchführen, funktioniert dieses Muster sehr gut in Geschäftsumgebungen. Wir helfen unseren Kunden also, digitale Zwillinge wichtiger Teile ihres Geschäfts zu erstellen und lassen sie Geschäftsszenarien schnell erstellen und bewerten.
Ich denke, meine Lehrerfahrung hat mir tiefes Mitgefühl für Software-Benutzer, insbesondere von komplexen Softwaresystemen, gegeben. Wo ein Student an einer Stelle stolpert, ist das zufällig, aber wo Dutzende oder Hunderte von Menschen ähnliche Fehler machen, weiß man, dass man ein Designproblem hat. Vielleicht ist mein Lieblingsteil der Software-Entwicklung, diese Erkenntnisse anzuwenden und neue Generationen von Systemen zu entwerfen.
Können Sie erklären, wie HeavyIQ die natürliche Sprachverarbeitung nutzt, um Datenexploration und -visualisierung zu erleichtern?
Heute scheint es, als ob jeder und sein Bruder ein neues GenAI-Modell anpreisen, die meisten davon sind vergessliche Klonen voneinander. Wir haben einen ganz anderen Weg eingeschlagen. Wir glauben, dass Genauigkeit, Reproduzierbarkeit und Privatsphäre wesentliche Eigenschaften für jedes Business-Analytics-Tool sind, einschließlich derer, die mit großen Sprachmodellen (LLM) generiert werden. Wir haben diese also auf fundamentaler Ebene in unser Angebot integriert. Zum Beispiel beschränken wir Modell-Eingaben strikt auf Unternehmensdatenbanken und bereitgestellte Dokumente innerhalb eines Unternehmens-Sicherheitsperimeters. Wir beschränken die Ausgaben auch auf die neuesten HeavySQL und Charts. Das bedeutet, dass wir, egal welche Frage Sie stellen, versuchen werden, sie mit Ihren Daten zu beantworten und Ihnen genau zu zeigen, wie wir diese Antwort ableiten.
Wenn diese Garantien vorhanden sind, ist es unseren Kunden weniger wichtig, wie genau wir die Abfragen verarbeiten. Hinter den Kulissen ist jedoch ein weiterer wichtiger Unterschied zu Consumer-GenAI, dass wir Modelle umfassend gegen die spezifischen Arten von Fragen feinjustieren, die Geschäftsanwender an Geschäftsdaten stellen, einschließlich räumlicher Daten. Zum Beispiel ist unser Modell hervorragend darin, räumliche und Zeitreihen-Verbindungen durchzuführen, was nicht in klassischen SQL-Benchmarks enthalten ist, aber unsere Benutzer täglich verwenden.
Wir verpacken diese Kernfähigkeiten in eine Notebook-Schnittstelle, die wir HeavyIQ nennen. IQ geht darum, Datenexploration und -visualisierung so intuitiv wie möglich zu machen, indem natürliche Sprachverarbeitung (NLP) verwendet wird. Sie stellen eine Frage auf Englisch – wie “Welche Wettermuster gab es in Kalifornien letzte Woche?” – und HeavyIQ übersetzt dies in SQL-Abfragen, die unsere GPU-beschleunigte Datenbank schnell verarbeitet. Die Ergebnisse werden nicht nur als Daten, sondern auch als Visualisierungen präsentiert – Karten, Diagramme, was auch immer am relevantesten ist. Es geht darum, schnelle, interaktive Abfragen zu ermöglichen, insbesondere bei der Arbeit mit großen oder schnell beweglichen Datensätzen. Was hier wichtig ist, ist, dass es oft nicht die erste Frage ist, die Sie stellen, sondern vielleicht die dritte, die wirklich zum Kern der Erkenntnis führt, und HeavyIQ ist dafür ausgelegt, diese tiefere Exploration zu erleichtern.
Was sind die primären Vorteile der Verwendung von HeavyIQ im Vergleich zu traditionellen BI-Tools für Telekommunikations-, Versorgungs- und Regierungsunternehmen?
HeavyIQ zeichnet sich in Umgebungen aus, in denen man mit großen, hochgeschwindigkeits-Daten zu tun hat – genau die Art von Daten, mit denen Telekommunikations-, Versorgungs- und Regierungsunternehmen zu tun haben. Traditionelle Business-Intelligence-Tools haben oft Schwierigkeiten mit dem Umfang und der Geschwindigkeit dieser Daten. Zum Beispiel haben Sie im Telekommunikationssektor möglicherweise Milliarden von Anrufdatensätzen, aber es sind die winzigen Bruchteile abgebrochener Anrufe, auf die Sie sich konzentrieren müssen. HeavyIQ ermöglicht es Ihnen, durch diese Daten 10 bis 100 Mal schneller zu suchen als traditionelle Business-Intelligence-Tools. Diese Geschwindigkeit, kombiniert mit der Fähigkeit, interaktiv zu abfragen und Daten zu visualisieren, macht es für Risikoanalysen in Versorgungsunternehmen oder Echtzeit-Szenarienplanung für Regierungsbehörden unverzichtbar.
Der andere Vorteil, auf den wir bereits oben hingewiesen haben, ist, dass räumliche und zeitliche SQL-Abfragen analytisch extrem leistungsfähig sind, aber auch langsam oder schwierig von Hand zu schreiben sein können. Wenn ein System mit der “Geschwindigkeit der Neugier” operiert, können Benutzer nicht nur mehr Fragen stellen, sondern auch nuanciertere Fragen. Zum Beispiel könnte ein Telekommunikations-Ingenieur einen zeitlichen Anstieg von Geräteausfällen aus einem Überwachungssystem bemerken, die Intuition haben, dass etwas an einem bestimmten Standort schief läuft, und dies mit einer räumlichen Abfrage überprüfen, die eine Karte zurückgibt.
Welche Maßnahmen sind ergriffen worden, um Metadaten-Lecks bei der Verwendung von HeavyIQ zu verhindern?
Wie oben beschrieben, haben wir HeavyIQ mit Privatsphäre und Sicherheit aufgebaut. Dies umfasst nicht nur Daten, sondern auch mehrere Arten von Metadaten. Wir verwenden Spalten- und Tabellenmetadaten umfassend, um zu bestimmen, welche Tabellen und Spalten die Informationen enthalten, die zur Beantwortung einer Abfrage erforderlich sind. Wir verwenden auch interne Unternehmensdokumente, wenn bereitgestellt, um bei der sogenannten retrieval-augmented Generation (RAG) zu helfen. Schließlich generieren die Sprachmodelle selbst weitere Metadaten. All diese, insbesondere die letzten beiden, können von hoher geschäftlicher Sensibilität sein.
Im Gegensatz zu Drittanbieter-Modellen, bei denen Ihre Daten normalerweise an externe Server gesendet werden, läuft HeavyIQ lokal auf derselben GPU-Infrastruktur wie der Rest unserer Plattform. Dies stellt sicher, dass Ihre Daten und Metadaten unter Ihrer Kontrolle bleiben, ohne Risiko von Lecks. Für Organisationen, die den höchsten Sicherheitsstandard erfordern, kann HeavyIQ sogar in einer vollständig abgekapselten Umgebung bereitgestellt werden, um sicherzustellen, dass sensible Informationen nie bestimmte Geräte verlassen.
Wie erreicht HEAVY.AI hohe Leistung und Skalierbarkeit mit massiven Datensätzen unter Verwendung von GPU-Infrastruktur?
Das Geheimnis besteht im Wesentlichen darin, die in anderen Systemen vorherrschende Datenbewegung zu vermeiden. Im Kern beginnt dies mit einer speziell für NVIDIA-GPUs entwickelten Datenbank. Wir arbeiten bereits seit über 10 Jahren daran und sind überzeugt, dass wir die beste Lösung für GPU-beschleunigte Analytics haben.
Sogar die besten CPU-basierten Systeme gehen lange vor einem mittelmäßigen GPU aus dem Dampf. Die Strategie, wenn dies auf CPU passiert, erfordert die Verteilung von Daten über mehrere Kerne und dann über mehrere Systeme (sogenanntes “horizontales Skalieren”). Dies funktioniert gut in einigen Kontexten, in denen Dinge weniger zeitkritisch sind, aber im Allgemeinen beginnt es, auf Netzwerkleistung zu verengen.
Zusätzlich zu der Vermeidung dieser Datenbewegung bei Abfragen vermeiden wir sie auch bei vielen anderen gängigen Aufgaben. Das erste ist, dass wir Grafiken ohne Datenbewegung rendern können. Wenn Sie dann ML-Schlussfolgerungen modellieren möchten, tun wir dies erneut ohne Datenbewegung. Und wenn Sie die Daten mit einem großen Sprachmodell abfragen, tun wir dies ebenfalls ohne Datenbewegung. Selbst wenn Sie ein Data-Scientist sind und die Daten aus Python abfragen möchten, bieten wir Methoden an, dies auf der GPU ohne Datenbewegung zu tun.
Was dies in der Praxis bedeutet, ist, dass wir nicht nur Abfragen, sondern auch Rendering 10 bis 100 Mal schneller durchführen können als traditionelle CPU-basierte Datenbanken und Karten-Server. Wenn Sie mit den massiven, hochgeschwindigkeits-Datensätzen arbeiten, mit denen unsere Kunden zu tun haben – Dinge wie Wettermodelle, Telekommunikationsanrufdaten oder Satellitenbilder – ist dieser Leistungsboost absolut unerlässlich.
Wie hält HEAVY.AI seinen Wettbewerbsvorteil in der sich schnell entwickelnden Landschaft der Big-Data-Analytics und KI aufrecht?
Diese Frage ist großartig, und darüber denken wir ständig nach. Die Landschaft der Big-Data-Analytics und KI entwickelt sich mit unglaublich hoher Geschwindigkeit, mit neuen Durchbrüchen und Innovationen, die ständig auftauchen. Es schadet sicherlich nicht, dass wir einen 10-jährigen Vorsprung bei der GPU-Datenbanktechnologie haben.
Ich denke, der Schlüssel für uns ist, uns auf unsere Kernmission konzentriert zu halten – die Demokratisierung des Zugangs zu großen, räumlichen Daten. Das bedeutet, ständig die Grenzen dessen zu erweitern, was mit GPU-beschleunigter Analytics möglich ist, und sicherzustellen, dass unsere Produkte eine unübertroffene Leistung und Fähigkeiten in diesem Bereich bieten. Ein wichtiger Teil davon ist unsere anhaltende Investition in die Entwicklung von maßgeschneiderten, fein abgestimmten Sprachmodellen, die die Nuancen von räumlichem SQL und geospatialer Analyse wirklich verstehen.
Wir haben eine umfangreiche Bibliothek von Trainingsdaten aufgebaut, die weit über allgemeine Benchmarks hinausgeht, um sicherzustellen, dass unsere konversationale Analytics-Tools mit Benutzern auf natürliche und intuitive Weise interagieren können. Aber wir wissen auch, dass Technologie allein nicht ausreicht. Wir müssen eng mit unseren Kunden und ihren sich entwickelnden Bedürfnissen verbunden bleiben. Letztendlich kommt unser Wettbewerbsvorteil auf unsere unermüdliche Konzentration auf die Bereitstellung von transformatorischem Wert für unsere Benutzer zurück. Wir halten nicht nur mit dem Markt Schritt – wir erweitern die Grenzen dessen, was mit Big Data und KI möglich ist. Und wir werden dies auch weiterhin tun, egal wie schnell sich die Landschaft entwickelt.
Wie unterstützt HEAVY.AI Katastrophenhilfe-Bemühungen durch HeavyEco?
Wir bauten HeavyEco, als wir sahen, dass einige unserer größten Versorgungskunden erhebliche Schwierigkeiten hatten, die heutigen Wettermodell-Ausgaben zu verarbeiten und zu visualisieren, sowie für gemeinsame Vergleiche. Es dauerte einen Kunden bis zu vier Stunden, nur um Daten zu laden, und wenn Sie gegen schnell bewegliche extreme Wetterbedingungen wie Brände sind… das ist einfach nicht gut genug.
HeavyEco ist darauf ausgelegt, Echtzeit-Einblicke in hochriskante Situationen wie bei einem Waldbrand oder einer Flut zu liefern. In solchen Szenarien müssen Sie schnell Entscheidungen treffen und basierend auf den besten verfügbaren Daten. HeavyEco dient also zunächst als professionell verwaltete Datenpipeline für autoritative Modelle wie die von NOAA und USGS. Auf diesen basierend ermöglicht HeavyEco es Ihnen, Szenarien zu erstellen, Gebäudeauswirkungen zu modellieren und Daten in Echtzeit zu visualisieren. Dies gibt Ersthelfern die kritischen Informationen, die sie benötigen, wenn es am wichtigsten ist. Es geht darum, komplexe, große Datensätze in handhabbare Intelligenz umzuwandeln, die unmittelbares Entscheidungsverhalten leiten kann.
Unser ultimatives Ziel ist es, unseren Benutzern die Fähigkeit zu geben, ihre Daten mit der Geschwindigkeit des Denkens zu erkunden. Ob sie komplexe räumliche Modelle ausführen, Wettervorhersagen vergleichen oder Muster in geospatialen Zeitreihen erkennen möchten, wir möchten, dass sie dies reibungslos tun können, ohne dass technische Barrieren ihnen im Weg stehen.
Was unterscheidet die proprietäre LLM von HEAVY.AI von anderen Drittanbieter-LLM in Bezug auf Genauigkeit und Leistung?
Unsere proprietäre LLM ist speziell für die Arten von Analytics abgestimmt, auf die wir uns konzentrieren – wie Text-zu-SQL und Text-zu-Visualisierung. Wir haben zunächst traditionelle Drittanbieter-Modelle ausprobiert, aber festgestellt, dass sie die hohen Genauigkeitsanforderungen unserer Benutzer nicht erfüllten, die oft kritische Entscheidungen treffen. Also feinjustierten wir eine Reihe von Open-Source-Modellen und testeten sie gegen Branchenbenchmarks.
Unsere LLM ist viel genauer für die fortgeschrittenen SQL-Konzepte, die unsere Benutzer benötigen, insbesondere in geospatialen und zeitlichen Daten. Zusätzlich ist es, da es auf unserer GPU-Infrastruktur läuft, auch sicherer.
Zusätzlich zu den integrierten Modellfunktionen bieten wir auch eine vollständige interaktive Benutzeroberfläche für Administratoren und Benutzer, um domänen- oder geschäftsrelevante Metadaten hinzuzufügen. Zum Beispiel können Sie, wenn das Basis-Modell nicht wie erwartet funktioniert, Spalten-Metadaten importieren oder anpassen oder Leitinformationen hinzufügen und sofort Feedback erhalten.
Wie sieht HEAVY.AI die Rolle der geospatialen und zeitlichen Datenanalyse bei der Gestaltung der Zukunft verschiedener Branchen?
Wir glauben, dass geospatialen und zeitlichen Datenanalyse für die Zukunft vieler Branchen von entscheidender Bedeutung sein werden. Was wir wirklich darauf abzielen, ist, unseren Kunden zu helfen, bessere Entscheidungen zu treffen, schneller. Ob Sie in der Telekommunikation, Versorgung oder Regierung tätig sind oder in anderen Bereichen, die Fähigkeit, Daten in Echtzeit zu analysieren und zu visualisieren, kann ein Game-Changer sein.
Unsere Mission ist es, diese Art leistungsfähiger Analytics für jeden zugänglich zu machen, nicht nur für die großen Spieler mit massiven Ressourcen. Wir möchten sicherstellen, dass unsere Kunden von den Daten profitieren können, die sie haben, um voranzukommen und Probleme zu lösen, sobald sie auftreten. Da Daten weiter wachsen und komplexer werden, sehen wir unsere Rolle darin, sicherzustellen, dass unsere Tools parallel dazu evolvieren, damit unsere Kunden immer auf dem neuesten Stand sind, was als Nächstes kommt.
Vielen Dank für das großartige Interview. Leser, die mehr erfahren möchten, sollten HEAVY.AI besuchen.












