Лидеры мнений

Генеративный ИИ не является приговором для исчезающих языков

mm
Добавьте Unite.AI в избранные источники в Google

Согласно ЮНЕСКО, до половины языков может исчезнуть к 2100 году. Многие люди говорят, что генеративный ИИ способствует этому процессу.

Уменьшение языкового разнообразия не началось с ИИ или Интернета. Но ИИ может ускорить исчезновение коренных и языков с ограниченными ресурсами.

Большинство из более 7 000 языков мира не имеют достаточных ресурсов для обучения моделей ИИ, и многие не имеют письменной формы. Это означает, что несколько основных языков доминируют в запасе потенциальных данных для обучения ИИ, в то время как большинство остаются позади в ИИ-революции и могут исчезнуть совсем.

Простая причина заключается в том, что большинство доступных данных для обучения ИИ находится на английском языке. Английский язык является основным движущим силой крупных языковых моделей (LLM), и люди, говорящие на менее распространенных языках, обнаруживают, что они недопредставлены в технологии ИИ.

Рассмотрите эти статистические данные от Всемирного экономического форума:

  • Две трети всех веб-сайтов находятся на английском языке.
  • Большая часть данных, которые GenAI изучает, скрапится из веба.
  • Менее 20% населения мира говорит на английском языке.

Когда ИИ становится более встроенным в нашу повседневную жизнь, мы все должны думать о языковом равенстве. ИИ имеет беспрецедентный потенциал для решения проблем в масштабе, и его обещание не должно быть ограничено только англоязычным миром. ИИ создает удобства и инструменты, которые улучшают личную и профессиональную жизнь людей в богатых, развитых странах.

Говорящие на языках с ограниченными ресурсами привыкли находить нехватку представительства в технологиях – от отсутствия веб-сайтов на их языке до отсутствия признания их диалекта Siri. Большая часть текста, который доступен для обучения ИИ на языках с ограниченными ресурсами, является низкокачественной (переведенной с сомнительной точностью) и узкой по объему.

Как общество может обеспечить, чтобы языки с ограниченными ресурсами не были оставлены без учета в ИИ-уравнении? Как мы можем обеспечить, чтобы язык не был барьером для обещания ИИ?

В рамках усилий по языковому включению некоторые крупные технологические игроки имеют инициативы по обучению огромных многоязычных языковых моделей (MLM). Microsoft (MSFT ) Translate, например, пообещал поддержать “каждый язык, где бы он ни был”. И Meta имеет обещание “Ни один язык не останется позади”. Это похвально, но реалистично ли?

Стремление к одной модели, которая может справиться с каждым языком в мире, отдает предпочтение привилегированным, поскольку существует гораздо больше данных из основных языков мира. Когда мы начинаем иметь дело с языками с ограниченными ресурсами и языками с не-латинскими скриптами, обучение моделей ИИ становится более трудным, длительным – и более дорогим. Подумайте об этом как о непреднамеренном налоге на недопредставленные языки.

Прогресс в технологии речи

Модели ИИ в основном обучаются на тексте, что естественным образом отдает предпочтение языкам с более глубокими запасами текстового контента. Языковое разнообразие было бы лучше поддержано системами, которые не полагаются на текст. Человеческое взаимодействие когда-то было полностью основано на речи, и многие культуры сохраняют этот устный фокус. Чтобы лучше удовлетворить глобальной аудитории, индустрия ИИ должна перейти от текстовых данных к речевым данным.

Исследования делают огромные шаги в технологии речи, но они все еще отстают от текстовых технологий. Исследования в области обработки речи прогрессируют, но прямая технология речь-к-речи еще не созрела. Реальность заключается в том, что индустрия склонна двигаться осторожно и только тогда, когда технология достигает определенного уровня.

Недавно выпущенная платформа интерпретации GlobalLink Live от TransPerfect использует более зрелые формы технологии речи – автоматическое распознавание речи (ASR) и текст-в-речь (TTS) – снова, потому что прямые системы речь-к-речи еще не достаточно зрелые на данный момент. Однако наши исследовательские команды готовятся к тому дню, когда полностью речевые конвейеры будут готовы к использованию.

Модели перевода речь-к-речи предлагают огромную перспективу в сохранении устных языков. В 2022 году Meta объявила о первом ИИ-управляемом системе перевода речь-к-речи для хоккиен, в основном устного языка, на котором говорят около 46 миллионов человек в китайской диаспоре. Это часть проекта Meta Universal Speech Translator, который разрабатывает новые модели ИИ, которые, как надеются, позволят осуществлять перевод речь-к-речи в режиме реального времени на многие языки. Meta решила открыть исходный код своих моделей перевода хоккиен, наборов данных для оценки и исследовательских работ, чтобы другие могли воспроизвести и построить на их работе.

Обучение с меньшим

Тот факт, что у нас как глобального сообщества не хватает ресурсов вокруг определенных языков, не является приговором для этих языков. Это то место, где многоязычные модели имеют преимущество, поскольку языки учатся друг у друга. Все языки следуют закономерностям. Благодаря передаче знаний между языками необходимость в обучающих данных уменьшается.

Предположим, у вас есть модель, которая учит 90 языков, и вы хотите добавить инуит (группу коренных североамериканских языков). Благодаря передаче знаний вам понадобится меньше данных на инуите. Мы находим способы учиться с меньшим. Количество данных, необходимое для настройки двигателей, ниже.

Я надеюсь на будущее с более инклюзивным ИИ. Я не верю, что мы обречены видеть исчезновение языков – ни я не думаю, что ИИ останется доменом англоязычного мира. Уже сейчас мы видим больше осведомленности вокруг проблемы языкового равенства. От более разнообразного сбора данных до построения более языковых моделей мы делаем прогресс.

Рассмотрите фон, язык, на котором говорят около 4 миллионов человек в Бенине и соседних африканских странах. Не так давно популярная модель ИИ описала фон как вымышленный язык. Компьютерный ученый по имени Бонавентюр Доссу, чья мать говорит на фон, привык к такому типу исключения. Доссу, который говорит на французском, вырос без переводческой программы, чтобы помочь ему общаться с матерью. Сегодня он может общаться с матерью благодаря переводчику фон-французский, который он тщательно построил. Сегодня также есть зародышевый Википедия на фон.

В рамках усилий по использованию технологий для сохранения языков турецкий художник Рефик Анадол запустил создание открытого ИИ-инструмента для коренных народов. На Всемирном экономическом саммите он спросил: “Как на Земле мы можем создать ИИ, который не знает всего человечества?”

Мы не можем, и мы не будем.

Жюльен Дидье является вице-президентом по технологиям в TransPerfect, крупнейшем в мире поставщике языковых и ИИ-решений для глобального бизнеса. TransPerfect предлагает полный спектр услуг на более чем 200 языках клиентам по всему миру. Более 6 000 глобальных организаций используют технологию GlobalLink ® TransPerfect для упрощения управления контентом на нескольких языках. TransPerfect имеет глобальную штаб-квартиру в Нью-Йорке, с региональными штаб-квартирами в Лондоне и Гонконге.