Modelos y plataformas de IA

Nitin Madnani, Científico de Investigación Senior en ETS – Serie de Entrevistas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Nitin Madnani es un Científico de Investigación Senior con el grupo de investigación de Procesamiento de Lenguaje Natural (NLP) en el Servicio de Evaluación Educativa (ETS). ETS fue fundado en 1947 y es la organización privada sin fines de lucro más grande del mundo en evaluación y prueba educativa.

¿Podría comenzar explicando cuál es la misión de ETS?

La misión de ETS es avanzar en la calidad y la equidad en la educación para todos los estudiantes en todo el mundo. Esta misión subyace a nuestros productos, servicios, investigaciones y esfuerzos de desarrollo con el objetivo de promover el aprendizaje, apoyar la educación, el desarrollo profesional y medir el conocimiento y las habilidades de todos.

Creamos que cualquier persona, en cualquier lugar, puede hacer una diferencia en su vida a través del aprendizaje y el trabajo de ETS en investigación, evaluación, medición y política puede desempeñar un papel importante para hacer que ese aprendizaje sea posible.

¿Qué es lo que te apasiona del NLP?

Todos los lenguajes humanos son tan hermosamente complejos y desordenados. Permiten expresar una gama de emociones en el habla y incluso en la escritura, y evolucionan con el tiempo. Por otro lado, una computadora es tan determinista y clínica al procesar sus entradas. El Procesamiento de Lenguaje Natural (NLP) es un área de la inteligencia artificial que intenta hacer que este dispositivo no humano comprenda las hermosas complejidades del lenguaje humano combinando técnicas de Ciencias de la Computación, Lingüística y Estadística. ¿Cómo no encontrar esto fascinante?

Los científicos de NLP y habla de ETS han desarrollado recientemente RSMTool. ¿Podría compartir con nosotros qué hace RSMTool?

Como hemos visto en los últimos años, todos los modelos de aprendizaje automático pueden exhibir un comportamiento sesgado independientemente del campo en el que se apliquen, la educación no es una excepción. Los sistemas de calificación automática utilizados para asignar calificaciones o puntuaciones a los estudiantes en pruebas o en aulas a menudo utilizan modelos de aprendizaje automático. Por lo tanto, es absolutamente posible que dichos sistemas se comporten de manera sesgada. Dicho sesgo puede tener consecuencias graves, especialmente si las puntuaciones de dichos sistemas se utilizan para tomar decisiones de alto riesgo.

RSMTool es una herramienta de código abierto que mi colega Anastassia Loukina (anteriormente presentada en Unite.AI) y yo desarrollamos en ETS para ayudar a garantizar que cualquier sesgo sistemático y perjudicial en los sistemas de calificación automática se identifique lo antes posible, esperemos que incluso antes de que los sistemas se desplieguen en el mundo real. RSMTool está diseñado para proporcionar una evaluación integral de los motores de puntuación de IA, incluyendo no solo las métricas estándar de precisión de predicción, sino también medidas de equidad del modelo y métricas basadas en la teoría de la prueba, lo que ayuda a los desarrolladores de dichos motores a identificar posibles sesgos o problemas en sus sistemas.

¿De dónde viene el nombre RSMTool?

En el campo de la evaluación educativa, alguien que asigna una puntuación a un ensayo es a menudo denominado “calificador”. Hay calificadores humanos y calificadores automatizados. RSMTool – abreviatura de Rater Scoring Modeling Tool – está diseñado para ayudar a construir (y evaluar) los modelos de puntuación utilizados por calificadores automatizados.

¿Cómo puede esta herramienta ayudar a los desarrolladores a identificar posibles sesgos o problemas en sus motores de puntuación de IA?

En las últimas cinco décadas, los científicos de la medición educativa – incluidos muchos de nuestros colegas en ETS – han realizado valiosas investigaciones sobre lo que hace que la puntuación automática (y humana) sea justa. Como parte de esta investigación, han desarrollado muchos análisis estadísticos y psicométricos para calcular indicadores de sesgo sistemático. Sin embargo, como las comunidades de NLP y psicometría rara vez interactúan, hay poca oportunidad de intercambio de ideas. El resultado es que los investigadores y desarrolladores de NLP que están construyendo sistemas de puntuación automática – especialmente investigadores individuales y aquellos en empresas pequeñas – no tienen acceso fácil a los análisis psicométricos que deberían utilizar para verificar sus sistemas en busca de sesgos. RSMTool intenta resolver este problema proporcionando un conjunto grande y diverso de análisis psicométricos en un paquete de Python fácil de usar que puede ser incorporado fácilmente por cualquier investigador de NLP en su investigación o flujo de trabajo operativo.

En un caso de uso típico, un investigador proporcionaría como entrada un archivo o un marco de datos con las puntuaciones numéricas del sistema, puntuaciones estándar (humanas) y metadatos, si corresponde. RSMTool procesa estos datos y genera un informe HTML que contiene una evaluación integral, incluyendo estadísticas descriptivas, así como múltiples medidas de rendimiento y equidad del sistema, entre otros. Un informe de ejemplo de RSMTool se puede encontrar en https://bit.ly/fair-tool. RSMTool puede funcionar con modelos de aprendizaje automático tradicionales basados en características (por ejemplo, de la biblioteca scikit-learn) y con modelos de aprendizaje profundo. Aunque la salida principal de RSMTool es el informe HTML que facilita el intercambio, también genera archivos de datos tabulares (en formatos CSV, TSV o XLSX) como salidas intermedias para usuarios avanzados. Finalmente, para mantener las cosas extremadamente personalizables, RSMTool implementa cada sección de su informe como una notebook Jupyter para que los usuarios no solo puedan elegir qué secciones son relevantes para sus modelos de puntuación específicos, sino que también puedan implementar fácilmente análisis personalizados e incluirlos en el informe con muy poco trabajo.

Hay muchos estudios recientes sobre puntuación automática que han utilizado RSMTool para evaluar sus modelos de puntuación propuestos.

¿Cuáles son los tipos comunes de sesgo que pueden afectar los sistemas de puntuación automática?

El tipo más común de sesgo que afecta a un sistema de puntuación automática es el rendimiento diferencial de subgrupos, es decir, cuando el sistema automático se desempeña de manera diferente para diferentes subgrupos de la población. Por ejemplo, un sistema de puntuación sesgado podría producir puntuaciones sistemáticamente más bajas para ensayos escritos por, por ejemplo, mujeres negras en comparación con los de hombres blancos, incluso si no hay diferencias sistemáticas en las habilidades de escritura reales exhibidas por esos dos subgrupos en sus ensayos, desde la perspectiva de un humano.

ETS tiene una rica historia de investigación sobre equidad para motores de puntuación automática. Por ejemplo, hemos investigado si e-rater® – nuestro motor de puntuación automática de IA – exhibe algún rendimiento diferencial para subgrupos definidos por etnia, género y país (encontraron algunas diferencias menores que se abordaron con cambios de política posteriores). Los estudios también investigaron si e-rater® trata las respuestas escritas por personas con discapacidades de aprendizaje y/o TDAH de manera sistemáticamente diferente en promedio (no lo hace). Más recientemente, un estudio oportuno examina si un sistema automático para puntuar la competencia en habla exhibe algún sesgo sistemático hacia los examinados que se les requirió que usaran mascarillas faciales en comparación con aquellos que no usaron mascarillas faciales (no lo hace). RSMTool contiene varios análisis psicométricos que intentan cuantificar el rendimiento diferencial de subgrupos sobre subgrupos que el usuario puede definir en sus propios datos.

ETS eligió hacer que RSMTool sea de código abierto, ¿podría explicar el razonamiento y la importancia detrás de esto?

Sí, RSMTool está disponible en GitHub con una licencia Apache 2.0. Creemos que es importante que una herramienta como esta sea de código abierto y no propietaria para que la comunidad pueda (a) auditar el código fuente de los análisis ya disponibles para garantizar su cumplimiento con los estándares de equidad y (b) contribuir con nuevos análisis a medida que los estándares evolucionan y cambian. También queremos facilitar a los investigadores y desarrolladores de NLP el uso de RSMTool en su trabajo y ayudarnos a mejorar. Hacer que RSMTool sea de código abierto es un ejemplo claro del compromiso continuo de ETS con el uso responsable de la IA en la educación.

¿Qué lecciones aprendió al desarrollar y mantener RSMTool?

Durante los últimos cinco años que Anastassia y yo hemos desarrollado y mantenido RSMTool – con la ayuda de muchos colegas de ETS y contribuyentes de GitHub no pertenecientes a ETS – hemos aprendido dos lecciones generales. La primera es que diferentes usuarios tienen diferentes necesidades y tener un enfoque de “talla única” no funcionará para software interdisciplinario como RSMTool. La segunda lección que aprendimos fue que, para que el software de código abierto sea adoptado, realmente hay que ir el extra mile para hacerlo lo más robusto posible.

Durante nuestro tiempo como mantenedores de RSMTool, hemos identificado muchos tipos de usuarios de RSMTool. Algunos de ellos son “usuarios avanzados” (por ejemplo, investigadores y desarrolladores de NLP) que quieren seleccionar y elegir funciones específicas de RSMTool para integrarlas en su propio flujo de trabajo de aprendizaje automático, mientras también utilizan otros paquetes de Python. Para satisfacer a dichos usuarios, creamos una API bastante completa para exponer varias funciones de preprocesamiento y posprocesamiento, así como métricas personalizadas contenidas en RSMTool. Otro grupo de usuarios son lo que llamamos “minimalistas”: analistas de datos e ingenieros que pueden carecer de la formación estadística o de programación para interactuar con la API y prefieren un flujo de trabajo fuera de la caja. Para satisfacer a dichos usuarios, creamos herramientas de línea de comandos que pueden llamarse fácilmente en scripts de shell de envoltura, por ejemplo. También hemos encontrado que los usuarios minimalistas a menudo se resisten a leer la (admitidamente larga) lista de opciones de configuración de RSMTool. Por lo tanto, creamos un generador de configuración interactivo con autocompletado que puede ayudar a dichos usuarios a crear archivos de configuración según sus necesidades específicas.

Para satisfacer las necesidades de todos nuestros grupos de usuarios, hemos tenido que adoptar prácticas que creíamos necesarias para hacer que RSMTool sea robusto. ¿Qué queremos decir con software robusto? Para ser robusto, cualquier pieza de software debe cumplir con los siguientes criterios: el impacto de cualquier cambio de código en su precisión y rendimiento se puede medir (bien probado), su documentación siempre está actualizada (bien documentado) y el software (junto con sus dependencias) es fácil de instalar para los usuarios. Para RSMTool, hemos aprovechado varias herramientas y servicios de código abierto para hacer que cumpla con nuestra definición. Tenemos un conjunto de pruebas integral (>90% de cobertura de código) que ejecutamos automáticamente a través de la integración continua para cualquier cambio presentado al código. Mantenemos una documentación extensa (incluyendo varios tutoriales del mundo real) y cualquier nueva funcionalidad propuesta para RSMTool debe incluir un componente de documentación que también se revisa como parte de la revisión del código. Finalmente, lanzamos RSMTool como paquetes que se pueden instalar fácilmente (a través de pip o conda) y todas las dependencias necesarias también se instalan automáticamente.

¿Qué espera lograr ETS al lanzar RSMTool?

El sector de la educación ha visto una de las expansiones más significativas de la IA en los últimos años, con la puntuación automática de texto y habla convirtiéndose en una aplicación cada vez más común de NLP. ETS ha sido durante mucho tiempo un líder en el campo de la puntuación automática y, desde su inicio, ha estado comprometido con la construcción de productos y evaluaciones justas diseñadas para servir a los estudiantes en todo el mundo. Al lanzar RSMTool, desarrollado en estrecha colaboración entre científicos de NLP y psicometras, ETS quiere continuar su defensa del uso responsable de la IA en la educación de una manera muy tangible; específicamente, queremos hacer claro que cuando los investigadores de IA piensan en el “rendimiento” de un sistema de puntuación automática, deben considerar no solo las métricas estándar de precisión de predicción (por ejemplo, la correlación de Pearson), sino también aquellas de equidad del modelo. Más ampliamente, también nos gustaría que RSMTool sirva como un ejemplo de las formas en que los investigadores de NLP y los psicometras pueden y deben trabajar juntos.

¿Hay algo más que le gustaría compartir sobre RSMTool?

Queremos animar a los lectores a ayudarnos a mejorar RSMTool. No necesitan ser un psicometra o un experto en NLP para contribuir. Tenemos muchos problemas abiertos relacionados con la documentación y la programación en Python que serían perfectos para cualquier programador de Python principiante o intermedio. También invitamos a contribuir a SKLL (Scikit-Learn Laboratory), – otro paquete de código abierto de ETS para ejecutar experimentos de aprendizaje automático configurables por el usuario y en lotes de manera eficiente – que se utiliza subyacentemente por RSMTool.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.