Intervjuer

Dr. Mike Flaxman, VP of Product i HEAVY.AI – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Dr. Mike Flaxman er for tiden VP of Product i HEAVY.AI, etter å ha tidligere vært produktmanager og ledet Spatial Data Science-praksisen i Professional Services. Han har brukt de siste 20 årene på å arbeide med romlig miljøplanlegging. Før HEAVY.AI, grunnla han Geodesign Technologies, Inc og var medgrunnlegger av GeoAdaptive LLC, to startup-selskaper som anvender romlige analyse-teknologier til planlegging. Før han begynte i startup-verden, var han professor i planlegging ved MIT og industrijefører i ESRI.

HEAVY.AI er en plattform med maskinvare-akselerasjon for sanntids-, høy-impakt dataanalyse. Den utnytter både GPU- og CPU-behandling for å spørring store datasett raskt, med støtte for SQL og georomlige data. Plattformen inkluderer visuelle analyse-verktøy for interaktive dashboards, kryssfiltrering og skalerbare data-visualiseringer, som muliggjør effektiv stor-data-analyse over ulike bransjer.

Kan du fortelle oss om din profesjonelle bakgrunn og hva som ledet deg til å bli med i HEAVY.AI?

Før jeg ble med i HEAVY.AI, tilbrakte jeg mange år i akademiske miljøer, hvor jeg underviste i romlige analyser ved MIT. Jeg drev også et lite konsulentselskap med en rekke offentlige kunder. Jeg har vært involvert i GIS-prosjekter i 17 land. Min arbeid har ført meg fra å rådgive organisasjoner som Inter-Amerikanernes Utviklingsbank til å forvalte GIS-teknologi for arkitektur, ingeniørarbeid og konstruksjon i ESRI, verdens største GIS-utvikler.

Jeg husker tydelig min første møte med det som nå er HEAVY.AI, som var da jeg som konsulent var ansvarlig for scenarieplanlegging for Florida Beaches Habitat Conservation Program. Mine kolleger og jeg hadde problemer med å modellere havskilpadderes habitat ved hjelp av 30m Landsat-data, og en venn pekte meg i retning av noen helt nye og svært relevante data – 5cm LiDAR. Dette var akkurat det vi trengte vitenskapelig, men noe som var omtrent 3600 ganger større enn det vi hadde planlagt å bruke. Det var ingen som ville øke min budsjetter med så mye som en brøkdel av det beløpet. Så den dagen la jeg ned verktøyene jeg hadde brukt og undervist i i flere tiår, og gikk på jakt etter noe nytt. HEAVY.AI gikk gjennom og visualiserte disse dataene så smidig og uten anstrengelse at jeg ble umiddelbart fanget.

I løpet av noen år, og jeg tror fortsatt at det HEAVY.AI gjør er ganske unikt, og deres tidlige innsats på GPU-analyse var akkurat der industrien fortsatt trenger å gå. HEAVY.AI er sterkt fokusert på å demokratisere tilgangen til stor-data. Dette inkluderer både datavolum og prosesshastighet, og gir i praksis alle en egen superdatamaskin. Men et stadig viktigere aspekt med introduksjonen av store språkmodeller er å gjøre romlige modelleringer tilgjengelige for mange flere mennesker. Disse dagene, i stedet for å bruke år på å lære et komplekst grensesnitt med tusenvis av verktøy, kan du bare starte en samtale med HEAVY.AI på ditt eget språk. Programmet genererer ikke bare kommandoer, men også relevante visualiseringer.

Bak kulissene er det svært vanskelig å levere enkelhet i bruk. For tiden, som VP of Product Management i HEAVY.AI, er jeg sterkt involvert i å bestemme hvilke funksjoner og egenskaper vi prioriterer for våre produkter. Min omfattende bakgrunn i GIS gjør at jeg virkelig forstår kundenes behov og kan guide vår utviklingsvei deretter.

Hvordan har din tidligere erfaring i romlig miljøplanlegging og startup-virksomhet påvirket ditt arbeid i HEAVY.AI?

Miljøplanlegging er et særlig utfordrende område, fordi du må ta hensyn til både menneskelige behov og den naturlige verden. Den generelle løsningen jeg lærte tidlig, var å kombinere en metode kjent som deltakende planlegging, med teknologiene for fjernanalyse og GIS. Før vi bestemte oss for en handlingsplan, lagde vi flere scenarier og simulerte deres positive og negative virkninger i datamaskinen ved hjelp av visualiseringer. Bruken av deltakende prosesser lot oss kombinere ulike former for ekspertise og løse svært komplekse problemer.

Denne mønsteren fungerer fortsatt svært godt i forretningsmiljøer. Så vi hjelper kundene med å konstruere digitale tvillinger av nøkkelområder i deres forretning, og lar dem opprette og evaluere forretnings-scenarier raskt.

Jeg antar at min undervisningserfaring har gitt meg stor empati for brukere av komplekse programvaresystemer. Hvor en student snubler på ett punkt, er tilfeldig, men hvor dusinvis eller hundrevis av mennesker gjør lignende feil, vet du at du har et design-problem. Kanskje min favoritt-del av programvare-design er å ta disse lærdommene og anvende dem i design av nye generasjoner systemer.

Kan du forklare hvordan HeavyIQ utnytter naturlig språkbehandling for å lette data-utforskning og visualisering?

Disse dagene ser det ut til at alle og deres bror er i ferd med å lansere en ny generasjon AI-modell, de fleste av dem er glemte kloner av hverandre. Vi har valgt en svært annen vei. Vi tror at nøyaktighet, reproduserbarhet og personvern er essensielle egenskaper for alle forretningsanalyse-verktøy, inkludert de som genereres med store språkmodeller. Så vi har bygget disse inn i vårt tilbud på et grunnleggende nivå. For eksempel, begrenser vi modell-inndata strengt til bedrifts-databaser og dokumenter innenfor et selskaps sikkerhets-perimeter. Vi begrenser også utdata til de siste HeavySQL og Charts. Det betyr at uansett hvilken spørsmål du stiller, vil vi prøve å svare med dine data, og vi vil vise deg akkurat hvordan vi har avledet svaret.

Med disse garantiene på plass, er det mindre viktig for våre kunder akkurat hvordan vi prosesserer spørsmålene. Men bak kulissene er en annen viktig forskjell i forhold til forbruker- AI, at vi finjusterer modellene omfattende mot de spesifikke typene spørsmål forretningsbrukere stiller om forretningsdata, inkludert romlige data. Så for eksempel er vår modell utmerket til å utføre romlige og tids-serie- koblinger, som ikke er i klassiske SQL-benchmark, men våre brukere bruker daglig.

Vi pakker disse kjerne-egenskapene inn i et Notebook-grensesnitt vi kaller HeavyIQ. IQ handler om å gjøre data-utforskning og visualisering så intuitivt som mulig ved å bruke naturlig språkbehandling. Du stiller et spørsmål på engelsk – som “Hva var værmønsteret i California i fjor?” – og HeavyIQ oversetter det til SQL-spørsmål som vår GPU-akselererte database prosesserer raskt. Resultatene presenteres ikke bare som data, men som visualiseringer – kart, diagrammer, eller hva som er mest relevant. Det handler om å muliggjøre rask, interaktiv spørring, spesielt når du har å gjøre med store eller raskt-bevegelige datasett. Det viktigste her er at det ofte ikke er det første spørsmålet du stiller, men kanskje det tredje, som virkelig kommer til kjerne-innsikten, og HeavyIQ er designet for å muliggjøre denne dypere utforskningen.

Hva er de primære fordelene med å bruke HeavyIQ i stedet for tradisjonelle BI-verktøy for telekommunikasjon, utilitets- og regjeringsselskaper?

HeavyIQ utmerker seg i miljøer hvor du har å gjøre med store, høyhastighets-data – akkurat den type data telekommunikasjon, utilitets- og regjeringsselskaper håndterer. Tradisjonelle forretningsintelligens-verktøy har ofte problemer med datavolum og -hastighet. For eksempel i telekommunikasjon kan du ha milliarder av samtale-logger, men det er den lille brøkdel av avbrutte samtaler du må fokusere på. HeavyIQ lar deg gå gjennom denne dataen 10 til 100 ganger raskere takket være vår GPU-infrastruktur. Denne hastigheten, kombinert med evnen til å interaktivt spørre og visualisere data, gjør det uvurderlig for risiko-analyse i utilitets- eller sanntids-scenarieplanlegging for regjeringsselskaper.

Den andre fordelen, som allerede er nevnt ovenfor, er at romlige og tidsmessige SQL-spørsmål er ekstremt kraftfulle analytisk – men kan være treg eller vanskelig å skrive for hånd. Når et system opererer på det vi kaller “curiositetens hastighet”, kan brukerne stille både flere spørsmål og mer nuanserte spørsmål. For eksempel kan en telekommunikasjon-ingeniør merke en tidsmessig økning i utstyr-feil fra et overvåkningssystem, ha en intuition om at noe er galt på et bestemt anlegg, og sjekke dette med et romlig spørsmål som returnerer et kart.

Hva er det som er satt i verk for å forhindre metadata-lekkasje når man bruker HeavyIQ?

Som beskrevet ovenfor, har vi bygget HeavyIQ med personvern og sikkerhet som en integrert del. Dette inkluderer ikke bare data, men også flere typer metadata. Vi bruker kolonne- og tabell-nivå metadata omfattende i å bestemme hvilke tabeller og kolonner som inneholder informasjonen som trengs for å svare på et spørsmål. Vi bruker også interne selskapsdokumenter hvor tilgjengelig for å assistere i hva som kalles retrieval-augmented generation (RAG). Til slutt genererer språkmodellene selv ytterligere metadata. Alle disse, men spesielt de to siste, kan være av høy forretnings-sensitivitet.

I motsetning til tredjeparts-modeller hvor din data vanligvis sendes til eksterne servere, kjører HeavyIQ lokalt på samme GPU-infrastruktur som resten av vår plattform. Dette sikrer at din data og metadata forblir under din kontroll, uten noen risiko for lekkasje. For organisasjoner som krever de høyeste sikkerhetsnivå, kan HeavyIQ sogar deployes i en fullstendig lukket miljø, og sikrer at sensitiv informasjon aldri forlater bestemt utstyr.

Hvordan oppnår HEAVY.AI høy ytelse og skalerbarhet med massive datasett ved hjelp av GPU-infrastruktur?

Hemmeligheten er i realiteten å unngå data-bevegelsen som er vanlig i andre systemer. Ved kjernen er dette et målrettet design av en database som er bygget fra bunnen av for å kjøre på NVIDIA-GPU-er. Vi har arbeidet med dette i over 10 år nå, og vi tror virkelig at vi har den beste løsningen i klassen når det gjelder GPU-akselerert analyse.

Even de beste CPU-baserte systemer taper pusten lenge før en middelmådig GPU. Strategien når dette skjer på CPU, krever å distribuere data over flere kerner og deretter flere systemer (såkalt “horisontal skalering”). Dette fungerer godt i noen sammenhenger hvor ting er mindre tid-kritiske, men generelt begynner å bli bottlenecket på nettverks-prestasjoner.

I tillegg til å unngå all denne data-bevegelsen på spørsmål, unngår vi også den på mange andre vanlige oppgaver. Først og fremst kan vi rendre grafikk uten å flytte data. Deretter, hvis du ønsker ML-inferens-modellering, gjør vi det også uten data-bevegelse. Og hvis du spør data med en stor språkmodell, gjør vi det igjen uten data-bevegelse. Selv hvis du er en data-ekspert og ønsker å spørre data fra Python, tilbyr vi metoder for å gjøre det på GPU uten data-bevegelse.

Det betyr i praksis at vi kan utføre ikke bare spørsmål, men også rendering 10 til 100 ganger raskere enn tradisjonelle CPU-baserte databaser og kart-tjenester. Når du har å gjøre med massive, høyhastighets-datasett som våre kunder arbeider med – som værmodeller, telekommunikasjons-samtale-logger eller satellitt-bilder – er denne ytelsesforbedringen absolutt essensiell.

Hvordan opprettholder HEAVY.AI sin konkurransedyktighet i det raskt utviklende landskapet av stor-data-analyse og AI?

Dette er et svært godt spørsmål, og det er noe vi tenker på konstant. Landskapet av stor-data-analyse og AI utvikler seg i en ekstremt rask takt, med nye gjennombrudd og innovasjoner som skjer hele tiden. Det er absolutt ingen hinder at vi har en 10-års føring på GPU-database-teknologi.

Jeg tror at nøklen for oss er å forbli fokusert på vår kjerne-misjon – å demokratisere tilgangen til stor, georomlig data. Dette betyr å kontinuerlig å presse grensene for hva som er mulig med GPU-akselerert analyse, og å sikre at våre produkter leverer enestående ytelse og egenskaper i dette domenet. En stor del av dette er vår pågående investering i å utvikle tilpassede, finjusterte språkmodeller som virkelig forstår nuansene i romlig SQL og georomlig analyse.

Vi har bygget opp en omfattende bibliotek av treningsdata, som går langt ut over generiske benchmark, for å sikre at våre samtale-analyse-verktøy kan engasjere med brukere på en naturlig, intuitiv måte. Men vi vet også at teknologi alene ikke er nok. Vi må forbli dypt tilknyttet våre kunder og deres utviklende behov. Til slutt kommer vår konkurransedyktighet ned til vår uavbrutte fokus på å levere transformasjonell verdi til våre brukere. Vi holder ikke bare pace med markedet – vi presser grensene for hva som er mulig med stor-data og AI. Og vi vil fortsette å gjøre det, uansett hvor raskt landskapet utvikler seg.

Hvordan støtter HEAVY.AI redningsinnsatsen gjennom HeavyEco?

Vi bygde HeavyEco da vi så at noen av våre største kunder i utilitets-sektoren hadde betydelige utfordringer bare med å innlemme dagens værmodell-utdata, samt visualisere dem for sammenligninger. Det tok en kunde opp til fire timer bare for å laste data, og når du er oppe mot rask-bevegelige ekstreme vær-forhold som branner… det er bare ikke godt nok.

HeavyEco er designet for å gi sanntids-innsikt i høy-konsekvens-situasjoner, som under en brann eller flom. I slike scenarioer må du ta raske beslutninger basert på den beste mulige data. HeavyEco tjener først og fremst som en profesjonelt ledet data- pipeline for autoritative modeller som de fra NOAA og USGS. Over disse modellene lar HeavyEco deg kjøre scenarier, bygge-impakt-modeller og visualisere data i sanntid. Dette gir førstehjelpere den kritiske informasjonen de trenger når det betyr mest. Det handler om å omdanne komplekse, store datasett til handlebare innsikt som kan guide umiddelbar beslutning.

Til slutt er vårt mål å gi våre brukere evnen til å utforske deres data i tankens hastighet. Uansett om de kjører komplekse romlige modeller, sammenligner vær-prognoser eller prøver å identifisere mønster i georomlige tidsserier, ønsker vi at de skal kunne gjøre det uten tekniske barrierer i veien.

Hva skiller HEAVY.AIs egenutviklede LLM fra andre tredjeparts-LLM-er når det gjelder nøyaktighet og ytelse?

Vår egenutviklede LLM er spesifikt tilpasset for de typene analyser vi fokuserer på – som tekst-til-SQL og tekst-til-visualisering. Vi prøvde først tradisjonelle tredjeparts-modeller, men fant at de ikke møtte de høye nøyaktighets-kravene våre brukere hadde, som ofte tar kritiske beslutninger. Så vi finjusterte en rekke åpne modeller og testet dem mot bransje-benchmark.

Vår LLM er mye mer nøyaktig for de avanserte SQL-konseptene våre brukere trenger, spesielt i georomlig og tidsmessig data. I tillegg, siden den kjører på vår GPU-infrastruktur, er den også mer sikker.

I tillegg til de innebygde modell-egenskapene, tilbyr vi også et fullt interaktivt brukergrensesnitt for administratorer og brukere til å legge til domene- eller forretnings-relevant metadata. For eksempel, hvis basis-modellen ikke fungerer som forventet, kan du importere eller justere kolonne-nivå metadata, eller legge til veiledning-informasjon og umiddelbart få tilbakemelding.

Hvordan ser HEAVY.AI for seg rollen til georomlig og tidsmessig data-analyse i å forme fremtiden for ulike bransjer?

Vi tror at georomlig og tidsmessig data-analyse vil være kritisk for fremtiden til mange bransjer. Det vi virkelig fokuserer på, er å hjelpe våre kunder med å ta bedre beslutninger, raskere. Uansett om du er i telekommunikasjon, utilitets- eller regjerings-sektoren, eller andre – å ha evnen til å analysere og visualisere data i sanntid, kan være en game-changer.

Vår misjon er å gjøre denne type kraftfulle analyser tilgjengelig for alle, ikke bare de store aktørene med massive ressurser. Vi ønsker å sikre at våre kunder kan dra nytte av dataene de har, for å forbli foran og løse problemer som oppstår. Ettersom data fortsetter å vokse og bli mer komplekst, ser vi vår rolle som å sikre at våre verktøy utvikler seg i takt med det, så våre kunder alltid er forberedt på hva som kommer neste.

Takk for det flotte intervjuet, lesere som ønsker å lære mer, bør besøke HEAVY.AI.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.