Entrevistas
Ingo Mierswa, Fundador e Presidente da RapidMiner, Inc – Série de Entrevistas

Ingo Mierswa é o Fundador e Presidente da RapidMiner, Inc. RapidMiner traz inteligência artificial para as empresas por meio de uma plataforma de ciência de dados aberta e extensível. Projetada para equipes de análise, a RapidMiner unifica todo o ciclo de vida da ciência de dados, desde a preparação de dados até o aprendizado de máquina e a implantação de modelos preditivos. Mais de 625.000 profissionais de análise usam os produtos da RapidMiner para impulsionar a receita, reduzir custos e evitar riscos.
Qual foi a sua inspiração para lançar a RapidMiner?
Eu havia trabalhado no negócio de consultoria de ciência de dados por muitos anos e vi a necessidade de uma plataforma que fosse mais intuitiva e acessível para pessoas sem formação formal em ciência de dados. Muitas das soluções existentes na época dependiam de codificação e script e não eram amigáveis ao usuário. Além disso, tornava-se difícil gerenciar e manter as soluções desenvolvidas dentro dessas plataformas. Basicamente, percebi que esses projetos não precisavam ser tão difíceis, então começamos a criar a plataforma da RapidMiner para permitir que qualquer pessoa se tornasse um grande cientista de dados.
Pode discutir a governança de transparência total que está sendo utilizada pela RapidMiner?
Quando você não pode explicar um modelo, é muito difícil ajustá-lo, confiá-lo e traduzi-lo. Muito do trabalho de ciência de dados é a comunicação dos resultados para os outros, para que as partes interessadas possam entender como melhorar os processos. Isso requer confiança e compreensão profunda. Além disso, problemas de confiança e tradução podem tornar muito difícil superar os requisitos corporativos para colocar um modelo em produção. Estamos lutando contra isso de várias maneiras:
Como uma plataforma de ciência de dados visual, a RapidMiner mapeia intrinsicamente uma explicação para todos os pipelines de dados e modelos em um formato altamente consumível que pode ser entendido por cientistas de dados ou não cientistas de dados. Isso torna os modelos transparentes e ajuda os usuários a entender o comportamento do modelo e avaliar suas forças e fraquezas e detectar possíveis vieses.
Além disso, todos os modelos criados na plataforma vêm com extensas visualizações para o usuário – normalmente o usuário que cria o modelo – para obter insights do modelo, entender o comportamento do modelo e avaliar os vieses do modelo.
A RapidMiner também fornece explicações de modelo – mesmo quando em produção: Para cada previsão criada por um modelo, a RapidMiner gera e adiciona os fatores de influência que levaram ou influenciaram as decisões tomadas por esse modelo em produção.
Finalmente – e isso é muito importante para mim pessoalmente, pois eu estava impulsionando isso com nossas equipes de engenharia há alguns anos – a RapidMiner também fornece uma capacidade de simulação de modelo extremamente poderosa, que permite que os usuários simulem e observem o comportamento do modelo com base nos dados de entrada fornecidos pelo usuário. Os dados de entrada podem ser definidos e alterados muito facilmente, permitindo que o usuário entenda o comportamento preditivo dos modelos em casos hipotéticos ou do mundo real. O simulador também exibe fatores que influenciam a decisão do modelo. O usuário – nesse caso, até mesmo um usuário de negócios ou especialista em domínio – pode entender o comportamento do modelo, validar a decisão do modelo contra resultados reais ou conhecimento de domínio e identificar problemas. O simulador permite que você simule o mundo real e olhe para o futuro – para o seu futuro, na verdade.
Como a RapidMiner usa o aprendizado profundo?
O uso da RapidMiner do aprendizado profundo é algo de que nos orgulhamos muito. O aprendizado profundo pode ser muito difícil de aplicar e os não cientistas de dados muitas vezes lutam para configurar essas redes sem suporte especializado. A RapidMiner torna esse processo o mais simples possível para usuários de todos os tipos. O aprendizado profundo, por exemplo, faz parte do nosso produto de aprendizado de máquina automático (ML) chamado RapidMiner Go. Aqui, o usuário não precisa saber nada sobre aprendizado profundo para usar esses tipos de modelos sofisticados. Além disso, os usuários poderosos podem ir mais fundo e usar bibliotecas de aprendizado profundo populares como Tensorflow, Keras ou DeepLearning4J diretamente a partir dos fluxos de trabalho visuais que estão construindo com a RapidMiner. Isso é como brincar com blocos de construção e simplifica a experiência para usuários com menos habilidades em ciência de dados. Por meio dessa abordagem, nossos usuários podem construir arquiteturas de rede flexíveis com diferentes funções de ativação e número de camadas e nós definidos pelo usuário, várias camadas com diferentes números de nós e escolher entre diferentes técnicas de treinamento.
Que outro tipo de aprendizado de máquina é usado?
Todos! Oferecemos centenas de diferentes algoritmos de aprendizado como parte da plataforma da RapidMiner – tudo o que você pode aplicar nas linguagens de programação de ciência de dados amplamente usadas Python e R. Entre outros, a RapidMiner oferece métodos para Naive Bayes, regressão como Modelos Lineares Generalizados, agrupamento como k-Means, FP-Growth, Árvores de Decisão, Florestas Aleatórias, Aprendizado Profundo Paralelo e Árvores de Boost de Gradiente. Esses e muitos mais fazem parte da biblioteca de modelagem da RapidMiner e podem ser usados com um único clique.
Pode discutir como o Auto Model sabe os valores ótimos a serem usados?
O AutoModel da RapidMiner usa automação inteligente para acelerar tudo o que os usuários fazem e garantir que modelos precisos e sólidos sejam construídos. Isso inclui seleção de instância e remoção automática de outliers, engenharia de recursos para tipos de dados complexos como datas ou textos e engenharia de recursos automática multi-objetivo completa para selecionar os recursos ótimos e construir novos. O AutoModel também inclui outros métodos de limpeza de dados para corrigir problemas comuns em dados, como valores ausentes, perfil de dados avaliando a qualidade e o valor das colunas de dados, normalização de dados e várias outras transformações.
O AutoModel também extrai metadados de qualidade de dados – por exemplo, como uma coluna se comporta como um ID ou se há muitos valores ausentes. Esses metadados são usados, além dos metadados básicos, para automatizar e ajudar os usuários a “usar os valores ótimos” e lidar com problemas de qualidade de dados.
Para mais detalhes, mapeamos tudo em nosso Blueprint do AutoModel. (Imagem abaixo para contexto adicional)
Há quatro fases básicas em que a automação é aplicada:
– Preparação de dados: Análise automática de dados para identificar problemas de qualidade comuns, como correlações, valores ausentes e estabilidade.
– Seleção e otimização de modelo automática, incluindo validação e comparação de desempenho completa, que sugere as melhores técnicas de aprendizado de máquina para os dados dados e determina os parâmetros ótimos.
– Simulação de modelo para ajudar a determinar as ações prescritivas específicas a serem tomadas para alcançar o resultado desejado previsto pelo modelo.
– Na fase de implantação e operação do modelo, os usuários são mostrados fatores como deriva, viés e impacto comercial, automaticamente, sem trabalho extra necessário.

Vieses de computador são um problema com qualquer tipo de IA, há controles em lugar para prevenir que vieses surjam nos resultados?
Sim, isso é extremamente importante para a ciência de dados ética. As funcionalidades de governança mencionadas anteriormente garantem que os usuários possam sempre ver exatamente quais dados foram usados para a construção do modelo, como foram transformados e se há viés na seleção de dados. Além disso, nossas funcionalidades de detecção de derivação são outra ferramenta poderosa para detectar vieses. Se um modelo em produção demonstra muita derivação nos dados de entrada, isso pode ser um sinal de que o mundo mudou dramaticamente. No entanto, também pode ser um indicador de que havia um viés severo nos dados de treinamento. No futuro, estamos considerando ir um passo além e construir modelos de aprendizado de máquina que possam ser usados para detectar vieses em outros modelos.
Pode discutir a RapidMiner AI Cloud e como ela se diferencia de produtos concorrentes?
Os requisitos para um projeto de ciência de dados podem ser grandes, complexos e intensivos em computação, o que tornou o uso da tecnologia de nuvem uma estratégia atraente para os cientistas de dados. Infelizmente, as várias plataformas de ciência de dados baseadas em nuvem nativas amarram você aos serviços de nuvem e ofertas de armazenamento de dados de um fornecedor de nuvem específico.
A RapidMiner AI Cloud é simplesmente nossa oferta de serviço de entrega da plataforma da RapidMiner. A oferta pode ser personalizada para o ambiente de qualquer cliente, independentemente de sua estratégia de nuvem. Isso é importante nos dias de hoje, pois a abordagem da maioria das empresas para a gestão de dados de nuvem está evoluindo muito rapidamente no clima atual. A flexibilidade é realmente o que diferencia a RapidMiner AI Cloud. Ela pode ser executada em qualquer serviço de nuvem, pilha de nuvem privada ou em um ambiente híbrido. Somos portáteis de nuvem, agnósticos de nuvem, multi-nuvem – como você preferir chamar.
A RapidMiner AI Cloud também é muito fácil de usar, pois, claro, oferecemos a capacidade de gerenciar toda ou parte da implantação para os clientes, para que eles possam se concentrar em executar seus negócios com IA, e não o contrário. Há até uma opção sob demanda, que permite que você inicie um ambiente conforme necessário para projetos curtos.
RapidMiner Radoop elimina parte da complexidade por trás da ciência de dados, pode nos dizer como o Radoop beneficia os desenvolvedores?
O Radoop é principalmente para não desenvolvedores que desejam aproveitar o potencial dos big data. O RapidMiner Radoop executa fluxos de trabalho da RapidMiner diretamente dentro do Hadoop de forma sem código. Podemos também incorporar o mecanismo de execução da RapidMiner no Spark, para que seja fácil empurrar fluxos de trabalho completos para o Spark sem a complexidade que vem de abordagens centradas em código.
Uma entidade governamental seria capaz de usar a RapidMiner para analisar dados para prever possíveis pandemias, semelhante à forma como a BlueDot opera?
Como uma plataforma geral de ciência de dados e aprendizado de máquina, a RapidMiner é projetada para agilizar e aprimorar o processo de criação e gerenciamento de modelos, independentemente do assunto ou domínio no centro do problema de ciência de dados/aprendizado de máquina. Embora nosso foco não esteja em prever pandemias, com os dados certos, um especialista em assunto (como um virologista ou epidemiologista, nesse caso) poderia usar a plataforma para criar um modelo que pudesse prever pandemias com precisão. Na verdade, muitos pesquisadores usam a RapidMiner – e nossa plataforma é gratuita para fins acadêmicos.
Há algo mais que você gostaria de compartilhar sobre a RapidMiner?
Experimente! Você pode se surpreender com quão fácil a ciência de dados pode ser e como uma boa plataforma pode melhorar a produtividade de você e sua equipe.
Obrigado por essa grande entrevista, leitores que desejam aprender mais devem visitar RapidMiner.












