Взгляд Anderson
Исследователи Google выявили бутылочное горлышко в гипермасштабных подходах к ИИ
Новая статья исследователей Google указывает на то, что текущая тенденция к созданию очень объемных наборов данных может быть контрпродуктивной для разработки эффективных систем искусственного интеллекта. Фактически, исследования показывают, что лучшие продукты машинного обучения могут быть получены путем обучения на менее точных (т.е. технически “худших”) наборах данных.
Если принципы, полученные исследователями, являются действительными, это означает, что “гипермасштабные” наборы данных, такие как недавно выпущенный LAION-400M (который содержит 400 миллионов пар текст/изображение), и данные, лежащие в основе нейронного языкового движка GPT-3 (содержащего 175 миллиардов параметров), потенциально подвержены某种 “термическому пределу” в традиционных и популярных архитектурах и методологиях машинного обучения, при котором огромный объем данных “насыщает” приложения вниз по потоку и предотвращает их обобщение полезным образом.
Исследователи также предлагают альтернативные методы для пересмотра архитектуры гипермасштабных наборов данных, чтобы устранить дисбаланс.
Статья гласит:
‘Изучая более глубоко причины, которые приводят к этим явлениям, мы показываем, что насыщенное поведение, которое мы наблюдаем, тесно связано с тем, как представления развиваются через слои моделей. Мы демонстрируем еще более экстремальный сценарий, в котором производительность на верхнем и нижнем потоке противоречат друг другу. То есть, чтобы иметь лучшую производительность на нижнем потоке, нам нужно ухудшить точность верхнего потока.’
Исследование называется Изучение пределов крупномасштабной предварительной подготовки и было проведено четырьмя авторами из Google Research.
Изучение ‘насыщения’
Авторы оспаривают преобладающие предположения о отношениях между машинным обучением и данными в эпоху гипермасштабных данных: что масштабирование моделей и размера данных значительно улучшает производительность (убеждение, которое было укреплено в ажиотаже вокруг GPT-3 с момента его запуска); и что эта улучшенная производительность “передается” на задачи вниз по потоку линейным (т.е. желательным) образом, так что алгоритмы, которые в конечном итоге запускаются на устройстве, полученные из огромных наборов данных и недистиллированных обученных моделей, полностью пользуются идеями полномасштабных верхних архитектур.
‘Эти взгляды,’ отмечают исследователи ‘предполагают, что расходование вычислительных ресурсов и исследовательских усилий на улучшение производительности на одном огромном корпусе окупится, потому что это позволит нам решить многие задачи вниз по потоку почти бесплатно.’
Но статья утверждает, что нехватка вычислительных ресурсов и последующие “экономические” методы оценки моделей способствуют ложному впечатлению о динамике отношений между объемом данных и полезными системами ИИ. Авторы определяют эту привычку как “основной недостаток”, поскольку исследовательское сообщество обычно предполагает, что локальные (положительные) результаты будут переводиться в полезные последующие реализации:
‘[Из-за] ограничений вычислительных ресурсов, производительность для различных вариантов выбора гиперпараметров не сообщается. Графики масштабирования кажутся более благоприятными, если гиперпараметр, выбранный для каждого масштаба, фиксирован или определяется простой функцией масштабирования.’
Исследователи进一步 заявляют, что многие исследования масштабирования измеряются не по абсолютным шкалам, а как инкрементальные улучшения по сравнению с текущим состоянием (SotA), наблюдая, что “нет причины, a priori, для того, чтобы масштабирование сохранялось вне изучаемого диапазона”.
Предварительная подготовка
Статья затрагивает практику “предварительной подготовки”, меру, предназначенную для экономии вычислительных ресурсов и сокращения часто ужасающих временных рамок, необходимых для обучения модели на крупномасштабных данных с нуля. Снимки предварительной подготовки обрабатывают “азбуку” того, как данные внутри одного домена будут обобщены во время обучения, и обычно используются в различных секторах и специальностях машинного обучения, от обработки естественного языка (NLP) до глубоких фейков.
Предыдущие академические исследования показали, что предварительная подготовка может значительно улучшить устойчивость и точность модели, но новая статья предполагает, что сложность функций, даже в относительно коротких предварительно обученных шаблонах, может быть более полезной, если передана на более поздние процессы в конвейере.
Однако это не может произойти, если исследователи продолжают полагаться на предварительно обученные модели, которые используют текущую лучшую практику в применении скоростей обучения, которые, как заключает исследование, могут значительно повлиять на окончательную точность окончательных приложений работы. В этом отношении авторы отмечают, что “нельзя надеяться найти одну предварительно обученную контрольную точку, которая работает хорошо на всех возможных задачах вниз по потоку”.
Исследование
Чтобы установить эффект насыщения, авторы провели 4800 экспериментов на Vision Transformers, ResNets и MLP-Mixers, каждый с разным количеством параметров, от 10 миллионов до 10 миллиардов, все обученные на самых объемных наборах данных, доступных в соответствующих секторах, включая ImageNet21K и собственный набор данных Google JFT-300M.
Результаты, как утверждает статья, показывают, что разнообразие данных должно быть рассмотрено как дополнительная ось при попытке “масштабировать” данные, параметры моделей и время вычислений. Как оно стоит, тяжелая концентрация тренировочных ресурсов (и внимания исследователей) на верхней части конвейера ИИ эффективно бомбардирует приложения вниз по потоку лавиной параметров до точки “насыщения”, снижая способность развернутых алгоритмов ориентироваться через функции и выполнять вывод или преобразования.
Статья заключает:
‘Через обширное исследование мы устанавливаем, что когда мы улучшаем производительность верхней задачи либо путем масштабирования, либо выбором гиперпараметров и архитектурных решений, производительность задач вниз по потоку показывает насыщающее поведение. Кроме того, мы предоставляем сильные эмпирические доказательства того, что, вопреки распространенному нарративу, масштабирование не приводит к решению “один-модель-подходит-всем”.’












