Модели и платформы ИИ
Appen Limited Запускает Разнообразные Обучающие Наборы Данных для NLP
Appen Limited, ведущий поставщик высококачественных обучающих данных для компаний, стремящихся построить системы ИИ в крупном масштабе, запускает новые разнообразные обучающие наборы данных для инициатив по обработке естественного языка (NLP). Эти наборы данных позволят конечным пользователям получать одинаковый опыт, независимо от языковых вариаций, диалектов, этнолектов, акцентов, расы или пола.
Согласно отчету PNAS от марта 2020 года, популярные автоматические системы распознавания речи (ASR), особенно те, которые используются для виртуальных помощников, субтитров и бесконтактного вычисления, часто демонстрируют расовые различия в производительности. Большая часть этого связана с тем, что системы основаны на предвзятых или неполных данных, и именно поэтому так важно разработать разнообразные обучающие наборы.
С помощью нового запуска Appen стремится сократить различия в производительности и создать более инклюзивную среду для технологии распознавания речи. Аналогичные проблемы присутствуют в системах интерпретации языка и NLP.
Марк Брайан является генеральным директором Appen.
«Качество и разнообразие обучающих данных напрямую влияют на производительность и предвзятость моделей ИИ», – сказал Брайан. «Как партнер по данным, мы можем предоставить полные обучающие данные для многих случаев использования, чтобы гарантировать, что модели ИИ работают для всех. Это крайне важно, чтобы мы привлекли разнообразную группу людей для создания, маркировки и проверки данных, чтобы гарантировать, что модель, которую мы обучаем, не только справедлива, но и построена ответственно».
Проекты Языка Appen
Appen пытается создать разнообразную среду ИИ через свои различные проекты и партнерства, включая:
- Партнерство с Translators without Borders (TWB): Appen сотрудничает с TWB, Amazon (AMZN ), Университетом Карнеги-Меллона, Facebook (META ), Google (GOOGL ), Университетом Джонса Хопкинса, Microsoft (MSFT ) и Translated. Партнерство присоединилось к Переводческой инициативе для COVID-19 (TICO-19), которая попыталась расширить доступ к информации о COVID-19, поддерживая разработку языковой технологии на нескольких языках. Это включает страны с развивающейся экономикой, такие как Конголезский суахили, тигринья и нигерийский фульфульде.
- Проект перевода канадского французского языка: Appen помог Microsoft добавить «канадский французский» в качестве языкового варианта в Microsoft Translator после координации с консультантами по родным языкам.
- Проект перевода языка инуитов: Appen сотрудничал с правительством Нунавута, что помогло Microsoft добавить инуитский язык в Microsoft Translator. Этот коренной язык распространен в канадской Арктике.
- Готовые наборы данных афроамериканского разговорного английского (AAVE): Работая с носителями AAVE и собирая данные для готового набора данных на основе разговоров на различные темы, Appen пытается создать новые обучающие наборы данных, представляющие AAVE.
Доктор Джудит Бишоп является старшим директором по специалистам ИИ в Appen.
«Предвзятые данные ИИ приводят к проектам, которые могут не дать ожидаемых бизнес-результатов и нанести вред людям, которых они должны были бы помочь», – сказала доктор Бишоп. «Масштаб и сложность проектов ИИ делают невозможным для большинства компаний получить достаточное количество беспристрастных высококачественных данных без партнерства с экспертом по данным ИИ. Коммит Appen к разработке наиболее разнообразной и экспертной толпы аннотаторов данных предоставляет отрасли явно дифференцированный ресурс для создания справедливых и этических проектов ИИ».
Appen помогают аннотаторы обучающих данных из более чем 170 стран, и языковые представления включают 235 уникальных языков и 395 диалектов. Кроме того, она предлагает готовые (OTS) наборы данных, которые позволяют бизнесу получить высококачественные обучающие данные быстрее для своих проектов ИИ.












