Модели и платформы ИИ
Исследователи обнаружили высокоэффективные подсети внутри нейронных сетей глубокого обучения
Нейронные сети глубокого обучения часто бывают огромными и требуют огромных вычислительных мощностей, но новое открытие демонстрирует, как это можно сократить, чтобы выполнить задачи более эффективно. Джонатан Франкл и его команда из MIT разработали “гипотезу лотерейного билета”, которая показывает, как внутри более крупных нейронных сетей существуют более лёгкие подсети. Эти подсети могут выполнить задачу более эффективно с меньшей вычислительной мощностью, и одной из самых больших проблем является поиск этих подсетей, или выигрышных лотерейных билетов, как их называет команда.
Команда обнаружила эти подсети внутри BERT, лучшего метода машинного обучения для обработки естественного языка (NLP). NLP, который является подполем искусственного интеллекта (AI), отвечает за расшифровку и анализ человеческого языка и используется в приложениях, таких как генерация предсказательного текста и чат-боты.
Однако BERT большой и требует сверхвычислительной мощности, которая недоступна большинству пользователей. С новым открытием этих подсетей это может открыть доступ, позволяя более широкому кругу пользователей использовать технологию для разработки инструментов NLP.
«Мы достигаем точки, когда нам придётся сделать эти модели более лёгкими и эффективными», – говорит Франкл.
По его словам, это развитие может «снизить барьеры входа» для NLP.
BERT – «Оскорбительно дорогой»
BERT является фундаментальным для таких вещей, как поисковая система Google , и получил много внимания после выпуска Google в 2018 году. Это метод создания нейронных сетей и обучается путем многократных попыток заполнить пробелы в тексте. Одним из самых впечатляющих свойств BERT является его огромная первоначальная обучающая база данных.
Затем его можно настроить пользователями для конкретных задач, таких как чат-боты для обслуживания клиентов, но снова же это требует огромных вычислительных мощностей, с возможностью достижения 1 миллиарда параметров.
«Стандартная модель BERT в настоящее время – обычная – имеет 340 миллионов параметров», – говорит Франкл. «Это просто оскорбительно дорого. Это далеко за пределами вычислительных возможностей вас или меня».
По словам ведущего автора Тяньлун Чена из Университета Техаса в Остине, модели, такие как BERT, «страдают от огромного размера сети», но благодаря новому исследованию «гипотеза лотерейного билета кажется решением».
Эффективные подсети
Чен и его команда искали более мелкую модель, расположенную внутри BERT, и сравнили производительность открытых подсетей с исходной моделью BERT. Это было протестировано на различных задачах NLP, включая ответы на вопросы и заполнение пробелов в предложении.
Команда обнаружила успешные подсети, которые были на 40-90% меньше, чем исходная модель BERT, с фактическим процентом, зависящим от задачи. Кроме того, они смогли определить их до задачи-специфической настройки, что привело к дальнейшему снижению вычислительных затрат. Другим преимуществом было то, что некоторые из подсетей, выбранных для конкретной задачи, можно было повторно использовать для другой.
«Я был немного шокирован, что это сработало», – говорит Франкл. «Это не то, что я принимал как должное. Я ожидал гораздо более запутанного результата, чем мы получили».
По словам Ари Моркоса, ученого в Facebook (META ) AI Research, это открытие «убедительно», и «Эти модели становятся всё более распространенными. Поэтому важно понять, действует ли гипотеза лотерейного билета».
Моркос также говорит, что если эти подсети могут работать с значительно меньшей вычислительной мощностью, то это «будет очень влиятельным, учитывая, что эти чрезвычайно крупные модели в настоящее время очень дороги в эксплуатации».
«Я не знаю, как много больше мы можем расти, используя эти суперкомпьютерные вычисления», – добавляет Франкл. «Нам придётся снизить барьер входа».
«Надежда заключается в том, что это снизит стоимость, что это сделает его более доступным для всех… для маленьких парней, у которых есть только ноутбук», – заключает он.
Исследование должно быть представлено на Конференции по обработке нейронной информации.












