Modelos e plataformas de IA
Stefano Pacifico e David Heeger, Co-Fundadores da Epistemic AI – Série de Entrevistas

Epistemic AI emprega processamento de linguagem natural de ponta (NLP), algoritmos de aprendizado de máquina e deep learning para mapear relações entre um corpo crescente de conhecimento biomédico, proveniente de múltiplas fontes públicas e privadas, incluindo documentos e bancos de dados. Por meio de um processo de Mapeamento de Conhecimento, os usuários trabalham interativamente com a plataforma para mapear e entender subconjuntos de conhecimento biomédico, revelando conceitos e relações que de outra forma seriam perdidos com a busca tradicional.
Entrevistamos ambos os co-fundadores da Epistemic AI para discutir esses últimos avanços.
Stefano Pacifico vem de 10+ anos de desenvolvimento de IA e NLP aplicados. Anteriormente na Bloomberg, onde passou 7 anos, e estava na Elemental Cognition antes de iniciar a Epistemic.
David Heeger é um professor de ciência de dados e neurociência da NYU e passou sua carreira conectando ciência da computação, IA e biosciência. Ele é membro da Academia Nacional de Ciências. Como fundadores, eles reúnem a expertise de construir sistemas de IA e NLP aplicados em larga escala para entender grandes coleções de conhecimento, com expertise em biologia computacional e ciência biomédica de anos de pesquisa na área.
O que é que os introduziu e atraiu para a IA e o Processamento de Linguagem Natural (NLP)?
Stefano Pacifico: Quando eu estava na faculdade em Roma, e a IA não era popular (na verdade, era muito marginal), eu perguntei ao meu então orientador qual especialização eu deveria ter escolhido entre as disponíveis. Ele disse: “Se você quer ganhar dinheiro, Engenharia de Software e Bancos de Dados, mas se você quer ser estranho, mas muito avançado, então escolha Inteligência Artificial”. Eu fui vendido em “estranho”. Eu então comecei a trabalhar na representação de conhecimento e raciocínio para estudar como agentes autônomos poderiam jogar futebol ou resgatar pessoas. Em seguida, duas realizações me fizeram apaixonar por NLP: primeiro, agentes autônomos podem precisar se comunicar com linguagem natural entre si! Segundo, construir bases de conhecimento formais à mão é difícil, enquanto a linguagem natural (em texto) já fornece a maior base de conhecimento de todos. Eu sei hoje que essas podem parecer observações óbvias, mas elas não eram tão mainstream antes.
Qual foi a inspiração por trás do lançamento da Epistemic AI?
Stefano Pacifico: Vou fazer uma afirmação ousada. Ninguém hoje tem ferramentas adequadas para entender e conectar o conhecimento presente em grandes coleções de documentos e dados. Eu havia trabalhado nesse problema no mundo da finanças. Pense em notícias, demonstrações financeiras, dados de preços, ações corporativas, registros, etc. Eu encontrei que o problema era intoxicante. E, claro, é um problema difícil; e importante! Quando eu conheci meu co-fundador, Dr. David Heeger, passamos um tempo considerável avaliando oportunidades de startup na indústria biomédica. Quando percebemos o volume maciço de informações geradas nesse campo, foi como se tudo caísse no lugar certo. Pesquisadores biomédicos lutam com a sobrecarga de informações, enquanto tentam lidar com a base vasta e rapidamente expansiva de conhecimento biomédico, incluindo documentos (por exemplo, artigos, patentes, ensaios clínicos) e bancos de dados (por exemplo, genes, proteínas, vias, drogas, doenças, termos médicos). Isso é um grande ponto de dor para os pesquisadores e, sem uma solução apropriada disponível, eles são forçados a usar ferramentas de busca básicas (PubMed e Google (GOOGL ) Scholar) e explorar bancos de dados manualmente curados. Essas ferramentas são adequadas para encontrar documentos que correspondam a palavras-chave (por exemplo, um gene ou um artigo publicado), mas não para adquirir conhecimento abrangente sobre uma área de tópico ou subdomínio (por exemplo, COVID-19), ou para interpretar os resultados de experimentos de biologia de alto rendimento, como sequenciamento de genes, expressão de proteínas ou triagem de compostos químicos. Iniciamos a Epistemic AI com a ideia de abordar esse problema com uma plataforma que permita que eles trabalhem de forma iterativa:
- Reduzir o tempo para coletar informações e construir mapas de conhecimento abrangentes
- Superfície de informações interdisciplinares que podem ser difíceis de encontrar (descobertas reais muitas vezes vêm de olhar para o espaço branco entre disciplinas);
- Identificar hipóteses causais encontrando caminhos e links perdidos em seu mapa de conhecimento.
Quais são algumas das fontes públicas e privadas usadas para mapear essas relações?
Stefano Pacifico: Neste momento, estamos ingerindo todas as fontes públicas disponíveis que podemos obter, incluindo Pubmed e clinicaltrials.gov. Ingerimos bancos de dados de genes, drogas, doenças e suas interações. Também incluímos fontes de dados privadas para clientes selecionados, mas não estamos em liberdade para divulgar detalhes ainda.
Quais são as tecnologias de aprendizado de máquina usadas para o mapeamento de conhecimento?
Stefano Pacifico: Uma das crenças profundamente mantidas na Epistemic AI é que o fanatismo não é útil para construir produtos. Construir uma arquitetura que integra várias técnicas de aprendizado de máquina foi uma decisão tomada desde cedo, e essas variam desde a Representação de Conhecimento até Modelos Transformer, passando por embeddings de grafos, mas também incluem modelos mais simples, como regressões e florestas aleatórias. Cada componente é tão simples quanto precisa ser, mas não mais simples. Embora acreditemos ter construído componentes de NLP que são de ponta para certas tarefas, não nos esquivamos de modelos mais simples de linha de base quando possível.
Pode nomear algumas das empresas, organizações sem fins lucrativos ou instituições acadêmicas que estão usando a plataforma Epistemic?
Stefano Pacifico: Embora eu ame fazer isso, não concordamos com nossos usuários para fazê-lo. Posso dizer que tivemos pessoas se inscrevendo de instituições de alto perfil em todos os três segmentos (empresas, organizações sem fins lucrativos e instituições acadêmicas). Além disso, pretendemos manter a plataforma gratuita para fins acadêmicos/sem fins lucrativos.
Como a Epistemic ajuda os pesquisadores a identificar biomarcadores específicos de doenças do sistema nervoso central (SNC) e outros biomarcadores de doenças?
Dr. David Heeger: A neurociência é um campo muito interdisciplinar, incluindo biologia molecular e celular e genômica, mas também psicologia, química e princípios de física, engenharia e matemática. É tão amplo que ninguém pode ser um especialista em tudo. Pesquisadores em instituições acadêmicas e empresas farmacêuticas/biotecnológicas são forçados a se especializar. Mas sabemos que as insights importantes são interdisciplinares, combinando conhecimento de subespecialidades. A plataforma de software de IA que estamos construindo permite que todos sejam mais interdisciplinares, vejam as conexões entre sua subárea de especialização e outros tópicos e identifiquem novas hipóteses. Isso é especialmente importante na neurociência, pois é um campo tão interdisciplinar para começar. A função e disfunção do cérebro humano é o problema mais difícil que a ciência já enfrentou. Estamos em uma missão para mudar a forma como os cientistas biomédicos trabalham e pensam.
A Epistemic também permite a descoberta de mecanismos genéticos de distúrbios do SNC. Pode nos guiar sobre como isso funciona?
Dr. David Heeger: A maioria das doenças neurológicas, transtornos psiquiátricos e distúrbios do desenvolvimento não tem uma explicação simples em termos de diferenças genéticas. Existem um punhado de distúrbios sindrômicos para os quais uma mutação específica é conhecida por causar o distúrbio. Mas isso não é típico. Existem centenas de diferenças genéticas, por exemplo, que foram associadas a distúrbios do espectro autista (DEA). Há algum entendimento sobre as funções que esses genes servem em termos de biologia básica. Por exemplo, alguns dos genes associados ao DEA mantêm sinapses unidas no cérebro (nota, no entanto, que os mesmos genes normalmente desempenham funções diferentes em outros sistemas orgânicos do corpo). Mas há muito pouco entendimento sobre como essas diferenças genéticas podem explicar a complexa suíte de diferenças comportamentais exibidas por indivíduos com DEA. Para piorar, dois indivíduos com a mesma diferença genética podem ter resultados completamente diferentes, um diagnosticado com DEA e o outro, não. E dois indivíduos com perfis genéticos completamente diferentes podem ter o mesmo resultado com déficits comportamentais muito semelhantes. Para entender tudo isso, é necessário fazer a conexão de genômica e biologia molecular para neurociência celular (como as diferenças genéticas causam neurônios individuais para funcionar de forma diferente) e, em seguida, para neurociência de sistemas (como as diferenças na função celular causam redes de grandes números de neurônios interconectados para funcionar de forma diferente) e, em seguida, para psicologia (como as diferenças na função da rede neural causam diferenças na cognição, emoção e comportamento). E tudo isso precisa ser entendido de uma perspectiva de desenvolvimento. Uma diferença genética pode causar um déficit em um aspecto particular da função neural. Mas o cérebro não simplesmente se senta e aceita. Os cérebros são altamente adaptáveis. Se houver um mecanismo perdido ou quebrado, então o cérebro se desenvolverá de forma diferente para compensar o máximo possível. Essa compensação pode ser molecular, por exemplo, regulando para cima outro receptor sináptico para substituir a função de um receptor sináptico quebrado. Ou a compensação pode ser comportamental. O resultado final depende não apenas da diferença genética inicial, mas também dos vários esforços para compensar, dependendo de outros mecanismos moleculares, celulares, de circuito, de sistemas e comportamentais.
Ninguém tem o conhecimento para entender tudo isso. Nós todos precisamos de ajuda. A plataforma de software de IA que estamos construindo permite que todos colem e liguem todo o conhecimento biomédico relevante, vejam as conexões e identifiquem novas hipóteses.
Como as instituições farmacêuticas e acadêmicas estão usando a Epistemic para enfrentar o desafio da COVID-19?
Stefano Pacifico: Lançamos uma versão pública de nossa plataforma que inclui conjuntos de dados específicos da COVID e é livremente acessível a qualquer pessoa que faça pesquisas sobre a COVID-19. Está disponível em https://covid.epistemic.ai
Quais são as outras doenças ou questões genéticas para as quais a Epistemic foi usada?
Stefano Pacifico: Colaboramos com pesquisadores de autismo e estamos mais recentemente montando um novo esforço de pesquisa para a fibrose cística. Mas estamos felizes em colaborar com qualquer outro pesquisador ou instituição que possa precisar de ajuda com sua pesquisa.
Há algo mais que você gostaria de compartilhar sobre a Epistemic?
Stefano Pacifico: Estamos construindo um movimento de pessoas que querem mudar a forma como os pesquisadores biomédicos trabalham e pensam. Esperamos sinceramente que muitos de seus leitores queiram se juntar a nós!
Obrigado a ambos por terem se dado ao trabalho de responder às nossas perguntas. Os leitores que desejam aprender mais devem visitar Epistemic AI.












