Модели и платформы ИИ

Новая модель ИИ работает с более широким спектром человеческих языков

mm
Добавьте Unite.AI в избранные источники в Google

Исследователи Университета Ватерлоо разработали модель ИИ, которая позволяет компьютерам обрабатывать более широкий спектр человеческих языков. Это важный шаг вперед в этой области, учитывая, сколько языков часто остается без внимания в процессе программирования. Африканские языки часто не привлекают внимание компьютерных ученых, что привело к ограничению возможностей обработки естественного языка (NLP) на континенте.

Новая языковая модель была разработана командой исследователей в школе компьютерных наук Университета Ватерлоо имени Дэвида Р. Черитона.

Исследование было представлено на Мультлингвальной конференции по представлению языка на Конференции по эмпирическим методам обработки естественного языка 2021 года.

Модель играет ключевую роль в помощи компьютерам анализировать текст на африканских языках для многих полезных задач, и ее называют AfriBERTa. Она использует методы глубокого обучения для достижения впечатляющих результатов для языков с ограниченными ресурсами.

Работа с 11 африканскими языками

AfriBERTa работает с 11 конкретными африканскими языками, включая амхарский, хауса и суахили, на которых говорят более 400 миллионов человек. Модель продемонстрировала качество вывода, сравнимое с лучшими существующими моделями, и она сделала это, изучив только один гигабайт текста. Другие подобные модели часто требуют тысяч раз больше данных.

Келечи Огеджи – студент магистратуры по компьютерным наукам в Университете Ватерлоо.

«Предобученные языковые модели изменили способ, которым компьютеры обрабатывают и анализируют текстовые данные для задач, варьирующихся от машинного перевода до ответов на вопросы», – сказал Огеджи. «К сожалению, африканские языки получили мало внимания от исследовательского сообщества».

«Одной из проблем является то, что нейронные сети невероятно требовательны к тексту и вычислениям для построения. И в отличие от английского языка, для которого имеется огромное количество доступного текста, большинство из 7 000 языков, на которых говорят в мире, можно охарактеризовать как языки с ограниченными ресурсами, поскольку существует нехватка данных для кормления голодных нейронных сетей».

Техника предварительного обучения

Большинство этих моделей полагаются на технику предварительного обучения, которая включает в себя представление модели исследователем текста, в котором некоторые слова скрыты или замаскированы. Модель затем должна угадать скрытые слова и продолжает повторять этот процесс миллиарды раз. Она в конечном итоге учится статистическим связям между словами, что похоже на человеческие знания языка.

Джимми Лин – профессор компьютерных наук и научный руководитель Огеджи.

«Способность предварительно обучать модели, которые столь же точны для определенных задач, но используют значительно меньшие объемы данных, имеет много преимуществ», – сказал Лин. «Необходимость меньших объемов данных для обучения языковой модели означает, что требуется меньше вычислений и, как следствие, меньше выбросов углекислого газа, связанных с эксплуатацией огромных центров данных. Меньшие наборы данных также делают курирование данных более практичным, что является одним из подходов к снижению предвзятости моделей».

«Эта работа делает небольшой, но важный шаг к тому, чтобы предоставить возможности обработки естественного языка более чем 1,3 миллиардам человек на африканском континенте».

В исследовании также принимал участие Юксин Чжу, который недавно завершил обучение на степень бакалавра по компьютерным наукам в университете.

Алекс Макфарленд - журналист и писатель в области искусственного интеллекта, исследующий последние разработки в этой области. Он сотрудничал с многочисленными стартапами и изданиями в области искусственного интеллекта во всем мире.