Modelos y plataformas de IA
Appen Limited lanza conjuntos de datos de entrenamiento diversificados para NLP
Appen Limited, un proveedor líder de datos de entrenamiento de alta calidad para empresas que buscan construir sistemas de inteligencia artificial a gran escala, está lanzando nuevos conjuntos de datos de entrenamiento diversificados para iniciativas de procesamiento de lenguaje natural (NLP). Estos conjuntos de datos permitirán a los usuarios finales recibir la misma experiencia independientemente de la variedad de lenguaje, dialecto, etnolecto, acento, raza o género.
Según un informe de PNAS en marzo de 2020, los sistemas de reconocimiento de habla automatizados (ASR) populares, especialmente aquellos utilizados para asistentes virtuales, subtítulos cerrados y computación sin manos, a menudo exhiben disparidades raciales en el rendimiento. Gran parte de esto se debe a que los sistemas se basan en datos sesgados o incompletos, y es por eso que es tan crucial desarrollar conjuntos de entrenamiento diversificados.
Con el nuevo lanzamiento, Appen busca reducir las diferencias de rendimiento y crear un entorno más inclusivo para la tecnología de reconocimiento de habla. Los mismos desafíos están presentes en la interpretación de lenguaje y los sistemas de NLP.
Mark Brayan es el director ejecutivo de Appen.
“La calidad y diversidad de los datos de entrenamiento impactan directamente el rendimiento y el sesgo presentes en los modelos de inteligencia artificial”, dijo Brayan. “Como socio de datos, podemos suministrar datos de entrenamiento completos para muchos casos de uso para garantizar que los modelos de inteligencia artificial funcionen para todos. Es fundamental que involucremos a un grupo diverso de individuos para producir, etiquetar y validar los datos para garantizar que el modelo que se está entrenando no solo sea equitativo, sino también construido de manera responsable”.
Proyectos de lenguaje de Appen
Appen intenta crear un entorno de inteligencia artificial diversificado a través de sus diferentes proyectos y asociaciones, incluyendo:
- Asociación con Translators without Borders (TWB): Appen ha asociado con TWB, Amazon (AMZN ), la Universidad Carnegie Mellon, Facebook (META ), Google (GOOGL ), la Universidad Johns Hopkins, Microsoft (MSFT ) y Translated. La asociación se ha unido a la Iniciativa de traducción para COVID-19 (TICO-19), que intentó ampliar el acceso a la información sobre COVID-19 apoyando el desarrollo de la tecnología del lenguaje en múltiples lenguas. Estas incluyen países en desarrollo como el swahili del Congo, el tigrinya y el fulfulde nigeriano.
- Proyecto de traducción canadiense-francés: Appen ayudó a Microsoft a agregar “canadiense-francés” como una opción de lenguaje en Microsoft Translator después de coordinar con consultores de lenguaje nativos.
- Proyecto de traducción inuktitut: Appen colaboró con el gobierno de Nunavut, lo que ayudó a que Microsoft agregara inuktitut a Microsoft Translator. El lenguaje indígena se habla en el Ártico canadiense.
- Conjuntos de datos de venta anticipada de inglés vernáculo africano-americano (AAVE): Al trabajar con hablantes de AAVE y recopilar datos para un conjunto de datos de venta anticipada basado en conversaciones sobre diversos temas, Appen intenta crear nuevos conjuntos de datos de entrenamiento que representen AAVE.
La Dra. Judith Bishop es la directora sénior de especialistas en inteligencia artificial de Appen.
“Los datos de inteligencia artificial sesgados llevan a proyectos que pueden no lograr los resultados comerciales esperados y dañar a las personas a las que se supone que deben beneficiar”, dijo la Dra. Bishop. “La escala y la complejidad de los proyectos de inteligencia artificial hacen que sea imposible para la mayoría de las empresas adquirir datos de alta calidad y sin sesgo sin asociarse con un experto en datos de inteligencia artificial. El compromiso de Appen de desarrollar la multitud más diversa y experta de anotadores de datos proporciona a la industria un recurso claramente diferenciado para construir proyectos de inteligencia artificial justos y éticos”.
Appen cuenta con la ayuda de anotadores de datos de entrenamiento de más de 170 países, y las representaciones de lenguaje incluyen 235 lenguas únicas y 395 dialectos. También ofrece conjuntos de datos de venta anticipada (OTS), que permiten a las empresas adquirir datos de entrenamiento de alta calidad más rápido para sus proyectos de inteligencia artificial.












