AI-modellen en platforms
Omer Har, mede-oprichter en CTO, Explorium – Interviewreeks

Omer Har is een veteraan in datawetenschap en software-engineering met bijna een decennium ervaring in het bouwen van AI-modellen die grote bedrijven vooruit helpen.
Omer Har is de mede-oprichter en CTO van Explorium, een bedrijf dat een unieke datawetenschapsplatform biedt dat wordt aangedreven door augmented data discovery en feature engineering. Door automatisch te verbinden met duizenden externe gegevensbronnen en machine learning te gebruiken om de meest impactvolle signalen te destilleren, empoweren het Explorium-platform datawetenschappers en zakelijke leiders om beslissingen te nemen door de barrière voor het verkrijgen van de juiste gegevens te elimineren en superieure predictieve kracht te bieden.
Wanneer ontdekte je voor het eerst dat je betrokken wilde zijn bij datawetenschap?
Mijn interesse in datawetenschap gaat terug tot meer dan een decennium, wat ongeveer de tijd is die ik heb besteed aan het beoefenen en leiden van datawetenschapsteams. Ik begon als software-engineer, maar werd altijd aangetrokken door de complexe gegevens en algoritmische uitdagingen vanaf het begin. Ik had het geluk om de ambacht te leren bij Microsoft (MSFT ) Research, wat een van de weinige plaatsen was waar je echt kon werken aan complexe toegepaste machine learning-uitdagingen op grote schaal.
Je richtte Explorium op in 2017, kun je de inspiratie achter het lanceren van dit start-up bedrijf bespreken?
Explorium is gebaseerd op een eenvoudige en zeer krachtige behoefte — er is zo veel gegevens om ons heen die potentieel kunnen helpen om betere modellen te bouwen, maar er is geen manier om van tevoren te weten welke gegevensbronnen impactvol zullen zijn en hoe. Het oorspronkelijke idee kwam van Maor Shlomo, mede-oprichter en CEO van Explorium, die te maken had met ongekende gegevensvariëteit in zijn militaire dienst en manieren zocht om deze te benutten voor besluitvorming en modellering. Toen de drie van ons voor het eerst samenkwamen, was het onmiddellijk duidelijk voor ons dat deze ervaring de behoeften weergaf die we in de zakelijke wereld tegenkwamen, met name in snel groeiende datawetenschaps-gedreven gebieden zoals advertentie- en marketingtechnologie, waar zowel ik als Or Tamir (mede-oprichter en COO van Explorium) groei door data leidden.
Voordat Explorium bestond, was het vinden van relevante gegevensbronnen die echt impact hadden — om de nauwkeurigheid van je machine learning-model te verbeteren — een tijdrovend, duur en moeilijk proces met lage kans op succes. De reden is dat je eigenlijk aan het gokken bent en je duurste mensen — datawetenschappers — gebruikt om te experimenteren. Bovendien is gegevensacquisitie zelf een complex zakelijk proces en hebben datawetenschapsteams meestal niet de mogelijkheid om commercieel te onderhandelen met meerdere gegevensleveranciers.
Als datawetenschapsleider die werd gemeten door de zakelijke impact die door modellen werd gegenereerd, had ik niet de luxe om mijn team op een wilde gokjacht te sturen. Als gevolg daarvan geef je vaak de voorkeur aan het inzetten van je inspanningen op dingen die een veel lagere impact kunnen hebben dan een relevante nieuwe gegevensbron, alleen maar omdat ze veel meer binnen je controle liggen.
Explorium heeft onlangs met succes een extra 31 miljoen dollar aan financiering opgehaald in een Series B-rond. Ben je verrast door hoe snel je bedrijf is gegroeid?
Het is zeker een raketachtige rit geweest tot nu toe, en je kunt nooit aannemen dat dit zo zal blijven. Ik kan niet zeggen dat ik verrast was door hoe wijdverspreid de behoefte aan betere gegevens is, maar het is altijd een ongelooflijke ervaring om de impact te zien die je genereert voor klanten en hun bedrijf. De grootste analytische uitdaging die organisaties in de komende decennium zullen tegenkomen, is het vinden van de juiste gegevens om hun modellen en geautomatiseerde processen te voeden. De juiste gegevensactiva kunnen nieuwe marktleiders kronen, dus onze groei weerspiegelt de snel groeiende aantal klanten dat beseft dat en prioriteit geeft aan gegevens. In feite groeit het aantal “Data Hunters” — mensen die naar gegevens zoeken als onderdeel van hun dagelijkse werk — exponentieel in onze ervaring.
Kun je uitleggen wat het data-platform van Explorium is en wat het geautomatiseerde data-ontdekkingsproces is?
Explorium biedt een end-to-end datawetenschapsplatform dat wordt aangedreven door augmented data discovery en feature engineering. We zijn gericht op het “gegevens”-deel van datawetenschap — wat betekent dat we automatisch verbinden met duizenden externe gegevensbronnen en machine learning-processen gebruiken om de meest impactvolle signalen en kenmerken te destilleren. Dit is een complex en multi-stadiumproces, dat begint met het verbinden met een groot aantal contextueel relevante bronnen in wat we het Explorium-gegevenscatalogus noemen. Vervolgens automatiseren we het proces dat deze gegevensvariëteit verkent, door het testen van honderdduizenden ideeën voor betekenisvolle kenmerken en signalen om de optimale kenmerkenset te creëren, modellen op te bouwen en deze te serveren in flexibele wijzen.
Door de zoektocht naar de gegevens die je nodig hebt te automatiseren, niet alleen de gegevens die je intern hebt, doet het Explorium-platform hetzelfde voor datawetenschap als zoekmachines voor het web — we scannen, rangschikken en brengen je de meest relevante gegevens voor de predictieve vraag.
Dit empoweren datawetenschappers en zakelijke leiders om beslissingen te nemen door de barrière voor het verkrijgen van de juiste gegevens te elimineren en superieure predictieve kracht te bieden.
Welke soorten externe gegevensbronnen tapt Explorium aan?
We hebben toegang tot duizenden bronnen over vrijwel elke gegevenscategorie die je kunt bedenken, waaronder bedrijfs-, geospatiale-, gedrags-, tijdsgebonden-, websitegegevens en meer. We hebben meerdere expertteams die zich specialiseren in gegevensacquisitie via open, publieke en premiumbronnen, evenals partnerships. Onze toegang tot unieke talenten uit Israëls topinlichtingen- en technologie-eenheden brengt aanzienlijke knowhow en ervaring met zich mee om gegevensvariëteit te benutten voor besluitvorming.
Hoe gebruikt Explorium machine learning om te begrijpen welke soorten gegevens relevant zijn voor klanten?
Dit is onderdeel van onze “geheime saus”, dus ik kan er niet diep op ingaan, maar op hoog niveau gebruiken we machine learning om de betekenis achter de verschillende delen van je datasets te begrijpen en constant verbeterende algoritmes in te zetten om te identificeren welke bronnen in onze evoluerende catalogus potentieel relevant zijn. Door deze bronnen daadwerkelijk te verbinden met je gegevens, zijn we in staat om complexe data-ontdekkings- en kenmerkengineeringsprocessen uit te voeren, specifiek ontworpen om effectief te zijn voor externe en hoogdimensionale gegevens, om de meest impactvolle kenmerken te identificeren van de meest relevante bronnen. Door dit alles te doen in de context van machine learning-modellen maakt de impact statistisch meetbaar en stelt ons in staat om constant te leren en onze matching-, generatie- en ontdekkingsmogelijkheden te verbeteren.
Een van de oplossingen die wordt aangeboden is het mitigeren van toepassingsfraude-risico’s voor online leners door gebruik te maken van augmented data discovery. Kun je in details treden over hoe deze oplossing werkt?
Leningen gaan allemaal over het voorspellen en mitigeren van risico’s — of het nu gaat om de mogelijkheid van de lener om de lening terug te betalen (bijv. financiële prestaties) of hun intentie om dit te doen (bijv. fraude). Leningaanvragen zijn inherent een afweging tussen de wens van de lener om meer informatie te verzamelen en hun vermogen om te concurreren met andere aanbieders, aangezien langere en meer omslachtige vragenlijsten lagere voltooiingspercentages hebben, per definitie bevooroordeeld zijn enz.
Met Explorium kunnen zowel gevestigde banken als online uitdagers de aanvraagprocedure automatisch aanvullen met externe en objectieve bronnen die onmiddellijke context toevoegen en betekenisvolle relaties onthullen. Zonder te veel weg te geven om fraudeurs te helpen, kun je je voorstellen dat dit in de context van fraude kan betekenen dat verschillende gedragingen en eigenschappen opvallen versus echte aanvragers als je in staat bent om een 360-graadbeeld van hen te verzamelen. Alles van online aanwezigheid, officiële records, gedragspatronen op sociale media en fysieke voetafdrukken laten broodkruimels achter die als potentiële kenmerken en indicatoren getest kunnen worden als je toegang hebt tot de relevante gegevens en verticale knowhow. Simpel gezegd, betere gegevens zorgen voor betere predictieve modellen, die helpen om het verlaagde risico en hogere omzet voor leners te vertalen.
In een bredere visie, sinds COVID-19 wereldwijd toesloeg, hebben we een toename gezien van nieuwe fraudepatronen, evenals de behoefte van leners om terug te keren naar de basis, aangezien de pandemie alle modellen brak. Niemand nam echt dit soort “Black Swan”-evenement in overweging, en onderdeel van onze initiële reactie om deze bedrijven te helpen is het genereren van aangepaste signalen die helpen om bedrijfsrisico’s te beoordelen in deze onzekere en dynamische tijden.
Je kunt meer lezen over in een uitstekend artikel geschreven door Maor Shlomo, mede-oprichter en CEO van Explorium.
Bedankt voor het geweldige interview, lezers die meer willen leren, moeten Explorium bezoeken.












