Modelos y plataformas de IA
Peter Staar, científico de IBM, COVID-19 Open Research Dataset – Serie de entrevistas

El científico de IBM Peter Staar ha desarrollado una herramienta de inteligencia artificial que está siendo utilizada por más de 300 expertos que están desarrollando un tratamiento o vacuna para el COVID-19.
Para ayudar a los investigadores a acceder rápidamente a datos estructurados y no estructurados, IBM ofrece un recurso de investigación de inteligencia artificial basado en la nube que ha sido entrenado en un corpus de miles de más de 45.000 artículos científicos contenidos en el conjunto de datos de investigación abierta COVID-19 (CORD-19), preparado por la Casa Blanca y una coalición de grupos de investigación, y bases de datos con licencia de DrugBank, Clinicaltrials.gov y GenBank.
El Dr. Peter Staar se unió al laboratorio de investigación de IBM en Zúrich en julio de 2015 como becario de investigación postdoctoral en el proyecto Fundamentos de soluciones cognitivas. El científico nacido en Bélgica llegó por primera vez a IBM Research como estudiante de verano en 2006.
Se unió al laboratorio de investigación de IBM en Zúrich en julio de 2015. ¿En qué tipo de proyectos ha trabajado en IBM?
Mi investigación inicial se centró en aplicaciones de computación de alto rendimiento y formé parte del equipo ganador del prestigioso premio ACM Gordon Bell.
Más recientemente, alrededor de 2017, comencé a centrarme en la inteligencia artificial y en agosto de 2018, mi equipo publicó un artículo en la Conferencia de la ACM sobre descubrimiento de conocimientos y minería de datos (KDD 2018) sobre un sistema de ingesta de documentos masivamente escalable, al que llamamos el Servicio de conversión de corpus. Esta herramienta de inteligencia artificial basada en la nube podía ingerir 100.000 páginas de PDF al día (incluso de documentos escaneados) con una precisión superior al 97 por ciento, y luego entrenar y aplicar modelos de aprendizaje automático avanzados que extraen el contenido de estos documentos a una escala nunca antes lograda. Ahora estamos aplicando esta misma tecnología para ayudar a los investigadores con el COVID-19.
¿Cuándo se le ocurrió a IBM la idea de utilizar el Servicio de conversión de corpus para abordar la epidemia de COVID-19?
A mediados de marzo, la Casa Blanca lideró un esfuerzo para publicar más de 45.000 documentos sobre el coronavirus y el COVID-19. Cuando vimos el corpus, nos dimos cuenta rápidamente de que nuestra tecnología podía ayudar, no solo para hacer que los PDF sean buscables, sino también para combinar el conocimiento dentro de esos PDF con conjuntos de datos adicionales como Drugbank, GenBank y Clinicaltrials.gov. Entramos en funcionamiento con el servicio el 3 de abril.
¿Cómo describiría mejor lo que es el Servicio de conversión de corpus?
Al igual que con cualquier gran volumen de fuentes de datos dispares, es difícil agregar y analizar esos datos de manera eficiente para obtener conocimientos científicos. Lo hacemos más fácil utilizando un gráfico de conocimiento que encuentra conexiones entre estas fuentes de datos para obtener posiblemente nuevos conocimientos.
¿Puede discutir el desafío principal de extraer datos de formato PDF a una forma buscable?
Según Adobe (ADBE ), hay aproximadamente 2,5 billones de archivos en formato Portable Document Format (PDF) en circulación. Piense en el conocimiento que contienen estos archivos: artículos científicos, literatura técnica y mucho más. Pero todo ese contenido es “oscuro” o no utilizado, porque hasta ahora no hemos tenido forma de ingerir un gran número de archivos PDF a escala y hacer que su contenido sea utilizable (o estructurado).
Los archivos PDF a menudo incluyen combinaciones de gráficos vectoriales, texto y gráficos de mapa de bits, todos los cuales hacen que la extracción de datos cualitativos y cuantitativos sea bastante desafiante. De hecho, la conversión de la reconstrucción automática de contenido ha sido un problema durante más de una década. Aunque hay muchas soluciones de conversión de documentos disponibles, ninguna de ellas aborda la escalabilidad o aplica la inteligencia artificial, lo que significa que deben confiar en un mantenimiento y actualización humanos costosos.
Hasta donde llega nuestro conocimiento, el Servicio de conversión de corpus es el primer sistema integral que utiliza inteligencia artificial a este nivel de escalabilidad. Mientras que las soluciones existentes solo pueden convertir un documento a la vez a un formato de salida deseado, nuestra herramienta puede ingerir colecciones enteras, un corpus de documentos, y construir modelos de aprendizaje automático sobre eso.
¿Cómo extrae no solo el texto contenido en un documento, sino también la estructura?
Un elemento clave es que diseñamos la interacción humano-computadora en el sistema para permitir una anotación muy rápida y masiva sin conocimientos de ciencias de la computación. Este intercambio a la inteligencia artificial da a nuestro servicio una gran flexibilidad, ya que puede adaptarse rápidamente a ciertos plantillas de documentos, lograr resultados muy precisos y, en última instancia, eliminar el ajuste costoso y tiempo que consume de los algoritmos basados en reglas tradicionales.
¿Puede discutir los desafíos de construir un modelo de aprendizaje automático que pueda escalar y responder rápidamente a cientos e incluso posiblemente miles de usuarios concurrentes?
Hemos desarrollado el Servicio de conversión de corpus sobre servicios de nube de última generación, como OpenShift en IBM Cloud. Esto nos permite escalar nuestra aplicación sin esfuerzo con la demanda aumentada. Los modelos de inteligencia artificial que aplicamos pueden ser utilizados por muchos usuarios concurrentes.
¿Cuántos documentos se han ingerido en el servicio?
Tenemos varios clientes industriales que utilizan las herramientas, así que no sabemos cuántos documentos han ingerido, ya que cada uno tiene su propia instancia de IBM Cloud. Pero para el COVID-19, ingerimos todos los 45.826 artículos de la Casa Blanca.
¿Cómo ha reaccionado la comunidad de investigación al uso de esta herramienta de inteligencia artificial?
Desde que anunciamos la disponibilidad gratuita de nuestra herramienta hace unas semanas, tenemos más de 400 usuarios de más de una docena de países, la mayoría de ellos médicos y profesores.
¿Hay algo más que le gustaría compartir sobre el Servicio de conversión de corpus y/o cómo se utiliza en el contexto del COVID-19?
Uno de nuestros clientes es la empresa energética italiana Eni, que está utilizando nuestra tecnología para la exploración de hidrocarburos, que es un negocio complejo y que requiere una gran cantidad de conocimientos que involucran varias disciplinas de ingeniería y ciencias trabajando juntas.
En Eni, el conocimiento se basa en el procesamiento de grandes cantidades de datos geológicos, físicos y geoquímicos, que se procesan en un gráfico de conocimiento. Los geocientíficos pueden utilizar la inteligencia artificial para contextualizar y presentar información relevante, lo que les ayudará a mejorar la toma de decisiones y la identificación y verificación de posibles escenarios de exploración alternativos. Más específicamente, para Eni, esto significa una representación más realista y precisa del modelo geológico.
Gracias por esta entrevista muy importante, esto ahorrará a los investigadores horas incontables. Los lectores que deseen obtener más información sobre la tecnología deben visitar el sitio web del Servicio de conversión de corpus. Los investigadores deben visitar la página de la herramienta de inteligencia artificial del COVID-19. Tenga en cuenta que el acceso a este recurso solo se otorgará a investigadores calificados.












