Модели и платформы ИИ

Как обработка языка улучшается с помощью открытой модели BERT от Google

mm
Добавьте Unite.AI в избранные источники в Google

Бидирекциональные представления от трансформеров, или BERT, – это модель обучения, которая значительно улучшила эффективность и результативность моделей обработки естественного языка (NLP). Теперь, когда Google (GOOGL ) сделала модели BERT открытыми, это позволяет улучшить модели NLP во всех отраслях. В этой статье мы рассматриваем, как BERT делает NLP одной из самых мощных и полезных решений искусственного интеллекта в современном мире.

Применение моделей BERT к поиску

Поисковая система Google известна своей способностью представлять релевантный контент, и они сделали эту программу обработки естественного языка открытым исходным кодом для всего мира.

Способность системы читать и интерпретировать естественный язык становится все более важной, поскольку мир экспоненциально производит новые данные. Библиотека значений слов, фраз и общая способность представлять релевантный контент Google открыта. Помимо обработки естественного языка, их модель BERT может извлекать информацию из больших объемов неструктурированных данных и может быть применена для создания поисковых интерфейсов для любой библиотеки. В этой статье мы рассмотрим, как эта технология может быть применена в энергетическом секторе.

BERT (Бидирекциональные представления от трансформеров) – это подход предобучения, предложенный группой Google AI Language, разработанный для преодоления общей проблемы ранних моделей NLP: недостатка достаточного количества данных для обучения.

Давайте объясним, не вдаваясь в слишком много деталей:

Обучение моделей

Низкоуровневые (например, распознавание именованных сущностей, сегментация тем) и высокоуровневые (например, анализ настроений, распознавание речи) задачи NLP требуют задачно-специфических аннотированных наборов данных. Хотя они трудно доступны и дороги в сборе, помеченные наборы данных играют решающую роль в производительности как мелких, так и глубоких нейронных сетевых моделей. Высококачественные результаты вывода могли быть достигнуты только тогда, когда были доступны миллионы или даже миллиарды аннотированных примеров обучения. И это была проблема, которая сделала многие задачи NLP недоступными. До тех пор, пока не была разработана BERT.

BERT – это общая модель представления языка, обученная на больших корпорах неаннотированного текста. Когда модель подвергается воздействию больших объемов текстового контента, она учится понимать контекст и отношения между словами в предложении. В отличие от предыдущих моделей обучения, которые представляли意义 только на уровне слова (банк означал бы одно и то же в «банковском счете» и «берегу реки»), BERT действительно учитывает контекст. То есть, что предшествует и следует за словом в предложении. Контекст оказался значительной недостающей возможностью моделей NLP, с прямым влиянием на производительность модели. Разработка контекстно-осведомленной модели, такой как BERT, известна многими как начало новой эры в NLP.

Обучение BERT на больших объемах текстового контента – это техника, известная как предобучение. Это означает, что веса модели корректируются для общих задач понимания текста, и что более тонкие модели могут быть построены на основе нее. Авторы доказали превосходство такой техники, когда они использовали модели на основе BERT на 11 задачах NLP и достигли результатов на уровне состояния искусства.

Предобученные модели

Лучшее в этом: предобученные модели BERT открыты и доступны публично. Это означает, что любой может решать задачи NLP и строить свои модели на основе BERT. Ничто не может сравниться с этим, верно? Подождите: это также означает, что модели NLP теперь могут быть обучены (тонко настроены) на меньших наборах данных, без необходимости обучения с нуля. Начало новой эры, действительно.

Эти предобученные модели помогают компаниям сократить стоимость и время развертывания моделей NLP для внутреннего или внешнего использования. Эффективность хорошо обученных моделей NLP подчеркивается Майклом Алексисом, генеральным директором виртуальной компании по построению команды, teambuilding.com.

«Самая большая польза от NLP – это масштабируемый и последовательный вывод и обработка информации». – Майкл Алексис, генеральный директор teambuilding.com

Майкл объясняет, как NLP может быть применена к программам по выращиванию культуры, таким как айсбрейкеры или опросы. Компания может получить ценную информацию о том, как компания культура проходит, анализируя ответы сотрудников. Это достигается не только путем анализа текста, но и путем анализа аннотации текста. По сути, модель также «читает между строк», чтобы сделать выводы об эмоциях, чувствах и общем настроении. BERT может помочь в таких ситуациях, предварительно обучая модели на основе индикаторов, которые она может использовать, чтобы обнаружить нюансы языка и предоставить более точные идеи.

Улучшение запросов

Способность моделировать контекст превратила BERT в героя NLP и революционизировала сам поиск Google. Ниже приведена цитата из команды продукта Google Search и их опыта тестирования, пока они настраивали BERT, чтобы понять намерение за запросом.

«Вот некоторые примеры, которые демонстрируют способность BERT понимать намерение за вашим поиском. Вот поиск «2019 бразильский путешественник в США нуждается в визе». Слово «в» и его связь с другими словами в запросе особенно важны для понимания смысла. Это о бразильце, путешествующем в США, а не наоборот. Ранее наши алгоритмы не понимали важности этой связи и возвращали результаты о гражданах США, путешествующих в Бразилию. С BERT поиск может понять эту нюанс и знать, что очень распространенное слово «в» на самом деле имеет большое значение здесь, и мы можем предоставить более релевантный результат для этого запроса».Понимание поисковых запросов лучше, чем когда-либо, от Панду Наяка, вице-президента поиска Google.

Пример поиска BERT

Пример поиска BERT, до и после. Источник блог

В нашей предыдущей статье о NLP и OCR, мы проиллюстрировали некоторые случаи использования NLP в секторе недвижимости. Мы также упомянули, как «инструменты NLP идеальны для извлечения информации». Давайте посмотрим на энергетический сектор и увидим, как разрушительные технологии NLP, такие как BERT, позволяют создавать новые случаи использования.

Модели NLP могут извлекать информацию из больших объемов неструктурированных данных

Одним из способов, которыми модели NLP могут быть использованы, является извлечение критической информации из неструктурированных текстовых данных. Электронные письма, журналы, заметки, журналы и отчеты – все это примеры текстовых данных, которые являются частью повседневной деятельности бизнеса. Некоторые из этих документов могут оказаться важными в организационных усилиях по увеличению операционной эффективности и снижению затрат.

Когда целью является внедрение предсказуемого технического обслуживания ветряных турбин, отчеты о неисправностях могут содержать критическую информацию о поведении различных компонентов. Но поскольку разные производители ветряных турбин имеют разные нормы сбора данных (т.е. отчеты о техническом обслуживании поступают в разных форматах и даже на разных языках), ручная идентификация релевантных данных могла бы быстро стать дорогой для владельца завода. Инструменты NLP могут извлекать релевантные понятия, атрибуты и события из неструктурированного контента. Текстовый анализ может быть затем использован для нахождения корреляций и закономерностей в разных источниках данных. Это дает владельцам заводов возможность внедрить предсказуемое техническое обслуживание на основе количественных показателей, выявленных в отчетах о неисправностях.

Модели NLP могут предоставлять интерфейсы поиска естественного языка

Аналогично, геологи, работающие в нефтяных и газовых компаниях, обычно должны просматривать множество документов, связанных с прошлыми операциями по бурению, журналами скважин и сейсмическими данными. Поскольку такие документы также поступают в разных форматах и обычно распространены по нескольким местам (как физическим, так и цифровым), они тратят много времени на поиск информации в неправильных местах. Решением в таком случае может быть интерфейс поиска, работающий на NLP, который позволит пользователям искать данные на естественном языке. Затем модель NLP может коррелировать данные по сотням документов и возвращать набор ответов на запрос. Работники могут затем проверить вывод на основе своего собственного опыта, и обратная связь еще больше улучшит модель.

Однако также существуют технические соображения при развертывании таких моделей. Одним из аспектов будет то, что отраслевые жаргонизмы могут запутать традиционные модели обучения, не имеющие соответствующего семантического понимания. Во-вторых, производительность моделей может быть затронута размером обучающего набора данных. Это именно тот случай, когда предобученные модели, такие как BERT, могут оказаться полезными. Контекстные представления могут моделировать правильное значение слова и устранить любую путаницу, вызванную отраслевыми терминами. Используя предобученные модели, можно обучать сеть на меньших наборах данных. Это экономит время, энергию и ресурсы, которые в противном случае потребовались бы для обучения с нуля.

Что насчет вашего собственного бизнеса?

Можете ли вы подумать о каких-либо задачах NLP, которые могли бы помочь вам сократить затраты и повысить операционную эффективность?

Команда Blue Orange Digital по науке о данных с удовольствием настроит BERT для вашей пользы!

Джош Мирамант является генеральным директором и основателем Blue Orange Digital, ведущего агентства по науке о данных и машинному обучению с офисами в Нью-Йорке и Вашингтоне. Мирамант является популярным спикером, футурологом и стратегическим бизнес- и технологическим консультантом для крупных компаний и стартапов. Он помогает организациям оптимизировать и автоматизировать свой бизнес, реализовывать аналитические методы, основанные на данных, и понимать последствия новых технологий, таких как искусственный интеллект, большие данные и Интернет вещей.