Modelos e plataformas de IA
Omer Har, Co-Fundador e CTO, Explorium – Série de Entrevistas

Omer Har é um veterano da ciência de dados e engenharia de software com quase uma década de experiência em construir modelos de IA que impulsionam grandes negócios.
Omer Har é o Co-Fundador e CTO da Explorium, uma empresa que oferece uma plataforma de ciência de dados inovadora alimentada por descoberta de dados aumentada e engenharia de recursos. Ao se conectar automaticamente a milhares de fontes de dados externas e utilizar aprendizado de máquina para destilar os sinais mais impactantes, a plataforma Explorium permite que cientistas de dados e líderes empresariais tomem decisões informadas, eliminando a barreira para adquirir os dados certos e habilitando um poder de previsão superior.
Quando você primeiro descobriu que queria se envolver em ciência de dados?
Meu interesse em ciência de dados remonta a mais de uma década, que é aproximadamente o tempo que tenho praticado e liderado equipes de ciência de dados. Comecei como engenheiro de software, mas sempre fui atraído pelos desafios complexos de dados e algoritmos desde o início. Tive a sorte de aprender o ofício na Microsoft (MSFT ) Research, que era um dos poucos lugares na época onde você realmente podia trabalhar em desafios de aprendizado de máquina aplicada complexa em escala.
Você co-fundou a Explorium em 2017, poderia discutir a inspiração por trás do lançamento dessa startup?
A Explorium é baseada em uma necessidade simples e muito poderosa — há tantos dados ao nosso redor que poderiam potencialmente ajudar a construir melhores modelos, mas não há como saber antecipadamente quais fontes de dados serão impactantes e como. A ideia original veio de Maor Shlomo, co-fundador e CEO da Explorium, que lidava com uma variedade de dados sem precedentes em seu serviço militar e encontrava maneiras de aproveitá-los para tomar decisões e modelar. Quando os três nos reunimos, ficou claro para nós que essa experiência ecoa as necessidades que estávamos lidando no mundo dos negócios, particularmente em campos de ciência de dados em rápida expansão, como tecnologia de publicidade e marketing, onde eu e Or Tamir (co-fundador e COO da Explorium) liderávamos o crescimento por meio de dados.
Antes da Explorium, encontrar fontes de dados relevantes que realmente fizessem uma diferença — para melhorar a precisão do seu modelo de aprendizado de máquina — era um processo laborioso, demorado e caro, com baixas chances de sucesso. O motivo é que você está basicamente chutando e usando as pessoas mais caras — cientistas de dados — para experimentar. Além disso, a aquisição de dados em si é um processo de negócios complexo, e as equipes de ciência de dados normalmente não têm a capacidade de se engajar comercialmente com vários fornecedores de dados.
Como líder de ciência de dados que era medido pelo impacto empresarial gerado pelos modelos, eu não tive o luxo de enviar minha equipe em uma caça ao tesouro. Como resultado, você muitas vezes prefere deployar seus esforços em coisas que podem ter um impacto muito menor do que uma fonte de dados relevante nova, apenas porque elas estão muito mais dentro do seu controle.
A Explorium recentemente levantou com sucesso US$ 31 milhões em financiamento em uma rodada Série B. Você ficou surpreso com a rapidez com que sua empresa cresceu?
Definitivamente tem sido uma viagem de foguete até agora, e você nunca pode dar isso por garantido. Não posso dizer que fiquei surpreso com a amplitude da necessidade de melhores dados, mas é sempre uma experiência incrível ver o impacto que você gera para os clientes e seus negócios. O maior desafio analítico que as organizações enfrentarão nas próximas décadas é encontrar os dados certos para alimentar seus modelos e processos automatizados. Os ativos de dados certos podem coroar novos líderes de mercado, então o nosso crescimento reflete o número rapidamente crescente de clientes que percebem isso e estão tornando os dados uma prioridade. De fato, o número de “Caçadores de Dados” — pessoas que procuram dados como parte do seu trabalho diário — está crescendo exponencialmente em nossa experiência.
Poderia explicar o que é a plataforma de dados da Explorium e o que é o processo de descoberta de dados automatizado?
A Explorium oferece uma plataforma de ciência de dados de ponta a ponta alimentada por descoberta de dados aumentada e engenharia de recursos. Estamos focados na “parte de dados” da ciência de dados — o que significa se conectar automaticamente a milhares de fontes de dados externas e utilizar processos de aprendizado de máquina para destilar os sinais mais impactantes e recursos. Esse é um processo complexo e multietapas, que começa conectando-se a uma miríade de fontes contextualmente relevantes no que chamamos de catálogo de dados da Explorium. Em seguida, automatizamos o processo que explora essa variedade de dados interconectados, testando centenas de milhares de ideias para recursos e sinais significativos para criar o conjunto de recursos ótimo, construir modelos em cima disso e servir a produção de maneiras flexíveis.
Ao automatizar a busca pelos dados que você precisa, e não apenas pelos dados que você tem internamente, a plataforma da Explorium está fazendo para a ciência de dados o que os motores de busca fizeram para a web — estamos vasculhando, classificando e trazendo os dados mais relevantes para a pergunta preditiva em questão.
Isso permite que cientistas de dados e líderes empresariais tomem decisões informadas, eliminando a barreira para adquirir os dados certos e habilitando um poder de previsão superior.
Quais tipos de fontes de dados externas a Explorium acessa?
Nós temos acesso a milhares de fontes em praticamente qualquer categoria de dados que você possa pensar, incluindo empresa, geoespacial, comportamental, baseado em tempo, dados de site e mais. Temos várias equipes especializadas em aquisição de dados por meio de fontes abertas, públicas e premium, bem como parcerias. Nosso acesso a talentos únicos de unidades de inteligência e tecnologia de ponta de Israel traz conhecimento e experiência substanciais em aproveitar a variedade de dados para tomar decisões.
Como a Explorium usa aprendizado de máquina para entender quais tipos de dados são relevantes para os clientes?
Isso é parte do nosso “molho secreto”, então não posso mergulhar nele, mas em um nível alto, utilizamos aprendizado de máquina para entender o significado por trás das diferentes partes dos seus conjuntos de dados e empregamos algoritmos constantemente melhorados para identificar quais fontes no nosso catálogo em evolução são potencialmente relevantes. Ao conectar essas fontes aos seus dados, somos capazes de realizar processos complexos de descoberta de dados e engenharia de recursos, especificamente projetados para serem eficazes para dados externos e de alta dimensionalidade, para identificar os recursos mais impactantes das fontes mais relevantes. Fazer isso tudo no contexto de modelos de aprendizado de máquina torna o impacto estatisticamente mensurável e nos permite aprender e melhorar constantemente nossas capacidades de correspondência, geração e descoberta.
Uma das soluções oferecidas é mitigar o risco de fraude de aplicação para empréstimos online, utilizando a descoberta de dados aumentada. Poderia entrar em detalhes sobre como essa solução funciona?
Empréstimos são todos sobre prever e mitigar riscos — seja o risco de que o mutuário possa pagar o empréstimo (por exemplo, desempenho financeiro) ou a intenção de fazê-lo (por exemplo, fraude). Os pedidos de empréstimo são inherentemente uma troca entre o desejo do credor de coletar mais informações e sua capacidade de competir com outros provedores, pois questionários mais longos e mais complicados têm taxas de conclusão mais baixas, são viesados por definição, e assim por diante.
Com a Explorium, tanto os bancos tradicionais quanto os desafiantes online são capazes de automatizar o processo de solicitação com fontes externas e objetivas que adicionam contexto imediato e descobrem relacionamentos significativos. Sem dar muita informação para ajudar os fraudadores, você pode imaginar que, no contexto da fraude, isso poderia significar diferentes comportamentos e propriedades que se destacam versus aplicantes reais, se você for capaz de reunir uma visão 360 graus deles. Tudo, desde presença online, registros oficiais, padrões de comportamento nas mídias sociais e pegadas físicas, deixa migalhas que poderiam ser hipotetizadas e testadas como recursos e indicadores potenciais, se você puder acessar os dados relevantes e o conhecimento vertical. Simplesmente, dados melhores garantem modelos preditivos melhores, o que ajuda a traduzir o risco reduzido e a receita mais alta para os credores.
Em uma visão mais ampla, desde que a COVID-19 atingiu em escala global, estamos vendo um aumento em novos padrões de fraude, bem como a necessidade dos credores de voltar às bases, pois a pandemia quebrou todos os modelos. Ninguém realmente levou em consideração esse tipo de evento “Cisne Negro”, e parte de nossa resposta inicial para ajudar essas empresas tem sido gerar sinais personalizados que ajudam a avaliar o risco empresarial nesses tempos incertos e dinâmicos.
Você pode ler mais sobre em um excelente post escrito por Maor Shlomo, co-fundador e CEO da Explorium.
Obrigado pela grande entrevista, leitores que desejam aprender mais devem visitar Explorium.












