Líderes de opinión

Preparación de datos humanos para aprendizaje automático es intensiva en recursos: estos dos enfoques son fundamentales para reducir costos

mm
Añade Unite.AI a tus fuentes preferidas en Google

Por: Dattaraj Rao, Chief Data Scientist, Persistent Systems

Al igual que con cualquier sistema que depende de entradas de datos, el aprendizaje automático (ML) está sujeto al axioma de “basura dentro, basura fuera”. Los datos limpios y etiquetados con precisión son la base para construir cualquier modelo de ML. Un algoritmo de entrenamiento de ML entiende patrones a partir de los datos de verdad y, a partir de ahí, aprende a generalizar en datos no vistos. Si la calidad de tus datos de entrenamiento es baja, entonces será muy difícil para el algoritmo de ML aprender y extrapolar continuamente.

Piensa en ello en términos de entrenar a un perro. Si fallas al entrenar al perro con comandos de comportamiento fundamentales (entradas) o lo haces de manera incorrecta o imprecisa, nunca podrás esperar que el perro aprenda y se expanda a través de la observación en comportamientos positivos más complejos porque las entradas subyacentes estaban ausentes o defectuosas desde el principio. El entrenamiento adecuado es intensivo en tiempo y costoso si traes a un experto, pero la recompensa es grande si lo haces correctamente desde el principio.

Cuando se entrena un modelo de ML, crear datos de calidad requiere que un experto en el dominio dedique tiempo a anotar los datos. Esto puede incluir seleccionar una ventana con el objeto deseado en una imagen o asignar una etiqueta a una entrada de texto o un registro de base de datos. En particular, para datos no estructurados como imágenes, videos y texto, la calidad de la anotación juega un papel importante en la determinación de la calidad del modelo. Por lo general, los datos no etiquetados como imágenes y texto crudo son abundantes, pero la etiquetado es donde se necesita optimizar el esfuerzo. Esta es la parte del ciclo de vida de ML donde interviene el ser humano y generalmente es la parte más costosa y laboriosa de cualquier proyecto de ML.

Herramientas de anotación de datos como Prodigy, Amazon Sagemaker Ground Truth, NVIDIA RAPIDS y DataRobot human-in-the-loop están mejorando constantemente en calidad y proporcionando interfaces intuitivas para expertos en el dominio. Sin embargo, minimizar el tiempo necesario para que los expertos en el dominio anoten los datos sigue siendo un desafío importante para las empresas de hoy, especialmente en un entorno donde el talento en ciencia de datos es limitado pero está en alta demanda. Es aquí donde entran en juego dos nuevos enfoques para la preparación de datos.

Aprendizaje activo

El aprendizaje activo es un método donde un modelo de ML solicita activamente a un experto en el dominio anotaciones específicas. Aquí, el enfoque no está en obtener una anotación completa en datos no etiquetados, sino en obtener solo los puntos de datos anotados para que el modelo pueda aprender mejor. Por ejemplo, en el ámbito de la salud y las ciencias de la vida, una empresa de diagnóstico que se especializa en la detección temprana del cáncer para ayudar a los médicos a tomar decisiones informadas sobre el cuidado del paciente. Como parte de su proceso de diagnóstico, necesitan anotar imágenes de escaneos de tomografía computarizada con tumores que deben ser resaltados.

Después de que el modelo de ML aprende de unas pocas imágenes con bloques de tumor marcados, con el aprendizaje activo, el modelo solicitará a los usuarios que anoten solo las imágenes donde no esté seguro de la presencia de un tumor. Estos serán puntos límite, que, cuando se anoten, aumentarán la confianza del modelo. Donde el modelo esté seguro por encima de un umbral determinado, realizará una autoanotación en lugar de solicitar al usuario que anote. De esta manera, el aprendizaje activo intenta ayudar a construir modelos precisos mientras reduce el tiempo y el esfuerzo necesario para anotar los datos. Marcos como modAL pueden ayudar a aumentar el rendimiento de la clasificación solicitando inteligentemente a los expertos en el dominio que etiqueten las instancias más informativas.

Supervisión débil

La supervisión débil es un enfoque donde se pueden utilizar datos ruidosos e imprecisos o conceptos abstractos para proporcionar indicaciones para etiquetar una gran cantidad de datos no supervisados. Este enfoque suele utilizar etiquetadores débiles y trata de combinarlos en un enfoque de conjunto para construir datos anotados de calidad. El esfuerzo es tratar de incorporar conocimientos del dominio en una actividad de etiquetado automatizado.

Por ejemplo, si un proveedor de servicios de Internet (ISP) necesitara un sistema para marcar conjuntos de datos de correo electrónico como spam o no spam, podríamos escribir reglas débiles como buscar frases como “oferta”, “felicidades”, “gratis”, etc., que generalmente están asociadas con correos electrónicos spam. Otras reglas podrían ser correos electrónicos de patrones de direcciones de origen específicas que se pueden buscar mediante expresiones regulares. Estas funciones débiles podrían combinarse entonces por un marco de supervisión débil como Snorkel y Skweak para construir datos de entrenamiento de mejor calidad.

El aprendizaje automático en su núcleo se trata de ayudar a las empresas a escalar procesos de manera exponencial en formas que son físicamente imposibles de lograr manualmente. Sin embargo, el aprendizaje automático no es magia y todavía depende de los humanos para a) configurar y entrenar los modelos adecuadamente desde el principio y b) intervenir cuando sea necesario para asegurarse de que el modelo no se vuelva tan sesgado que los resultados ya no sean útiles y puedan ser contraproducentes o negativos.

El objetivo es encontrar formas que ayuden a optimizar y automatizar partes de la participación humana para aumentar el tiempo de comercialización y los resultados, pero manteniéndose dentro de los límites de la precisión óptima. Es universalmente aceptado que obtener datos anotados de calidad es la parte más costosa pero extremadamente importante de un proyecto de ML. Este es un espacio en evolución, y se está realizando un gran esfuerzo para reducir el tiempo que los expertos en el dominio dedican a anotar los datos y mejorar la calidad de las anotaciones de los datos. Explorar y aprovechar el aprendizaje activo y la supervisión débil es una estrategia sólida para lograr esto en múltiples industrias y casos de uso.

Dattaraj Rao, Chief Data Scientist en Persistent Systems, es el autor del libro “Keras to Kubernetes: The Journey of a Machine Learning Model to Production.” En Persistent Systems, Dattaraj lidera el AI Research Lab que explora algoritmos de última generación en Computer Vision, Natural Language Understanding, programación probabilística, Reinforcement Learning, Explainable AI, etc. y demuestra la aplicabilidad en los sectores de Salud, Banca y Industria. Dattaraj tiene 11 patentes en Machine Learning y Computer Vision.