Модели и платформы ИИ

LoReFT: Представление Fine-тюнинга для Моделей Языка

mm
Добавьте Unite.AI в избранные источники в Google

Параметро-эффективное тонкое настройка или PeFT методы стремятся адаптировать крупные модели языка через обновления небольшого количества весов. Однако большинство существующих работ по интерпретируемости продемонстрировали, что представления кодируют богатую семантическую информацию, что предполагает, что редактирование этих представлений может быть лучшим и более мощным альтернативным подходом. Предобученные крупные модели часто дообучаются для использования в новых доменах или задачах, и во время процесса дообучения одна базовая модель может быть адаптирована к широкому спектру задач даже при наличии только небольшого количества данных в области. Однако процесс дообучения всей модели является ресурсоёмким и дорогим, особенно для моделей языка с значительно большим количеством размеров и параметров.

Параметро-эффективное тонкое настройка или PeFT методы предлагают решить высокие затраты, связанные с дообучением всей модели, обновляя только небольшую часть доступных весов, что помогает уменьшить время обучения и использование памяти. Что более важно, параметро-эффективное тонкое настройка или PeFT методы продемонстрировали подобную производительность тонкой настройке в нескольких практических сценариях. Адаптеры, распространенная семья параметро-эффективного тонкого настройки или PeFT методов, учат редактирование, которое может быть добавлено к дополнительному набору весов, работающих вместе с замороженной базовой моделью, и недавние адаптеры, такие как LoRA, уменьшают количество обучаемых параметров в обновлениях весов, используя низкоранговые аппроксимации вместо полных матриц весов при обучении адаптеров.

С учетом того, что предыдущие работы продемонстрировали, что редактирование представлений может быть лучшим альтернативным подходом к параметро-эффективному тонкому настройке или PeFT методам, в этой статье мы будем говорить о методах тонкой настройки представлений или ReFT, которые работают на замороженной модели и учат задачеспецифические вмешательства в скрытые представления. Эта статья направлена на глубокое освещение рамки ReFT или тонкой настройки представлений и мы исследуем механизм, методологию, архитектуру рамки, а также ее сравнение с современными рамками. Итак, давайте начнем.

ReFT: Тонкая Настройка Представлений для Моделей Языка

В попытке адаптировать предобученные модели языка к новым доменам и задачам, текущие рамки часто дообучают эти предобученные модели языка, и с помощью процесса дообучения одна базовая модель может быть адаптирована к широкому спектру задач даже при наличии только небольшого количества данных в области. Хотя процесс дообучения повышает общую производительность, он является дорогим процессом, особенно если модель языка имеет значительно большое количество размеров и параметров. Чтобы решить эту проблему и уменьшить связанные затраты, параметро-эффективное тонкое настройка или PeFT рамки обновляют только небольшую часть доступных весов, что не только уменьшает время обучения, но и уменьшает использование памяти, позволяя параметро-эффективным тонким настройкам или PeFT рамкам достигать подобной производительности по сравнению с полной тонкой настройкой в практических сценариях. Адаптеры, распространенная семья параметро-эффективного тонкого настройки или PeFT методов, работают, обучая редактирование, которое может быть добавлено к дополнительному набору весов вместе с подмножеством весов, работающих вместе с замороженной базовой моделью. Недавние адаптерные рамки, такие как LoRA и QLoRA, продемонстрировали, что возможно обучать адаптеры полной точности на основе уменьшенных моделей без влияния на производительность.

Одним из главных преимуществ современных параметро-эффективных тонких настройок или PeFT рамок является то, что вместо модификации представлений они модифицируют веса. Однако рамки, связанные с интерпретируемостью, продемонстрировали, что представления кодируют богатую семантическую информацию, что предполагает, что редактирование представлений может быть лучшим и более мощным подходом по сравнению с обновлениями весов. Это предположение о том, что редактирование представлений является лучшим подходом, является основой рамки ReFT или тонкой настройки представлений, которая обучает вмешательства вместо адаптации весов модели, позволяя модели манипулировать небольшой частью всех представлений в попытке направить поведение модели для решения задач во время вывода. Методы ReFT или тонкой настройки представлений являются заменами для весовых параметро-эффективных тонких настройок или PeFT рамок. Подход ReFT черпает вдохновение из недавних моделей, работающих с интерпретируемостью крупных моделей, которые вмешиваются в представления, чтобы найти верные причинно-следственные механизмы и направляют поведение модели во время вывода, и поэтому может быть рассмотрен как обобщение моделей редактирования представлений. Основываясь на этом, LoReFT или низкоранговая подпространственная ReFT является сильной и эффективной реализацией ReFT и является параметризацией ReFT, которая вмешивается в скрытые представления в линейном пространстве, порождаемом низкоранговой проекционной матрицей, и строится直接 на основе рамки DAS или Распределенного Поиска Выравнивания.

Двигаясь дальше, в отличие от полной тонкой настройки, параметро-эффективное тонкое настройка или PeFT рамка обучает только небольшую часть параметров модели и адаптирует модель к задачам. Параметро-эффективное тонкое настройка или PeFT рамка может быть классифицирована на три основные категории:

  • Методы на основе адаптеров: Методы на основе адаптеров обучают дополнительные модули, такие как полностью связанные слои, на основе предобученной модели с замороженными весами. Серийные адаптеры вставляют компоненты между многослойным перцептроном или MLP и большим моделью внимания или LM, в то время как параллельные адаптеры добавляют модули рядом с существующими компонентами. Поскольку адаптеры добавляют новые компоненты, которые не могут быть легко сложены в существующие веса модели, они представляют дополнительную нагрузку во время вывода.
  • LoRA: LoRA, вместе с ее недавними вариантами, аппроксимирует добавочные веса во время обучения, используя низкоранговые матрицы, и они не требуют дополнительных накладных расходов во время вывода, поскольку обновления весов могут быть объединены в модель, и это является причиной, по которой они считаются текущими наиболее сильными PeFT рамками.
  • Методы на основе подсказок: Методы на основе подсказок добавляют мягкие токены, которые инициализируются случайным образом в входные данные, и обучают их вложения, сохраняя веса модели языка замороженными. Производительность, предлагаемая этими методами, часто не удовлетворительна по сравнению с другими подходами PeFT, и они также несут значительную нагрузку во время вывода.

Вместо обновления весов рамка ReFT обучает вмешательства для модификации небольшой части всех представлений. Кроме того, недавние работы по редактированию представлений и направлению активации продемонстрировали, что добавление фиксированных векторных направлений к остаточному потоку может обеспечить определенный уровень контроля над генерацией крупных предобученных моделей без необходимости ресурсоёмкого дообучения.

ReFT: Методология и Архитектура

Чтобы сохранить процесс сохранения стиля простым, рамка ReFT предполагает, что целевая модель является трансформерной крупной моделью, способной производить контекстуализированные представления последовательности токенов. Для данной последовательности с n входными токенами рамка ReFT сначала встраивает эти входные токены в список представлений, после чего m слоев вычисляют список скрытых представлений последовательно как функцию предыдущего списка скрытых представлений. Каждое скрытое представление является вектором, и модель языка использует окончательные скрытые представления для производства прогнозов. Рамка ReFT учитывает как модели языка с маскированием, так и автoregressive модели языка. Теперь, согласно линейному представлению гипотезы, в нейронных сетях концепции кодируются внутри линейных подпространств представлений. Недавние модели обнаружили, что это утверждение верно для нейронных сетей, обученных на естественном языке и других входных распределениях.

Кроме того, в исследованиях интерпретируемости рамка причинной абстракции использует взаимные вмешательства для установления роли компонентов нейронной сети при реализации конкретных поведений. Логика взаимных вмешательств заключается в том, что если одно представление фиксируется на том, что оно было бы для контрфактического входа, и это вмешательство влияет на выход модели последовательно в том же смысле, что и утверждения, сделанные рамкой ReFT о компоненте, ответственного за производство этого представления, то компонент играет причинную роль в поведении. Хотя существуют несколько методов, распределенное взаимное вмешательство является идеальным подходом для проверки, закодирована ли концепция в линейном подпространстве представления, как утверждает линейная представление гипотеза. Кроме того, метод DAS был использован ранее для поиска линейных представлений в языковых моделях сущности, атрибутов, сентиментальных особенностей, лингвистических особенностей и математического рассуждения. Однако несколько экспериментов показали, что метод DAS является высоко выраженным и обладает способностью находить причинно-эффективные подпространства даже тогда, когда трансформерная модель языка была инициализирована случайным образом, и поэтому еще не выучила никаких задачеспецифических представлений, что привело к дебатам о том, является ли DAS эффективным и достаточным для задач интерпретируемости.

Выраженность, предлагаемая DAS, предполагает, что этот подход может быть идеальным инструментом для контроля поведения модели языка, а также для работы над контролируемой генерацией и ответственным редактированием. Следовательно, для адаптации моделей языка к задачам рамка ReFT использует распределенное взаимное вмешательство для создания нового параметро-эффективного метода. Кроме того, метод ReFT является набором вмешательств, и рамка обеспечивает, чтобы для любых двух вмешательств, работающих на одном и том же слое, позиции вмешательств должны быть разъединены, с параметрами всех функций вмешательств, оставаясь независимыми. В результате ReFT является общей рамкой, охватывающей вмешательства в скрытые представления во время прямого прохода модели.

ReFT: Эксперименты и Результаты

Чтобы оценить свою производительность по сравнению с существующими PeFT рамками, рамка ReFT проводит эксперименты на четырех различных естественно-языковых задачах, охватывающих более 20 наборов данных, с основной целью предоставления богатой картины того, как рамка LoReFT работает в разных сценариях. Кроме того, когда рамка LoReFT реализуется в реальной жизни, разработчикам необходимо решить, сколько вмешательств необходимо выучить, а также позиции входных данных и слоев, на которых необходимо применить каждое из них. Чтобы выполнить эту задачу, рамка ReFT настраивает четыре гиперпараметра.

  1. Количество префиксных позиций для вмешательства.
  2. Количество суффиксных позиций для вмешательства.
  3. Набор слоев для вмешательства.
  4. Связать ли параметры вмешательств между разными позициями в одном и том же слое.

Таким образом, рамка ReFT упрощает пространство поиска гиперпараметров и обеспечивает фиксированную дополнительную нагрузку во время вывода, которая не масштабируется с длиной подсказки.

Таблица выше сравнивает точность рамок LLaMA-7B и LLaMA-13B с существующими PeFT моделями на 8 наборах данных для вывода общего смысла. Как можно наблюдать, модель LoReFT превосходит существующие подходы PeFT на приличный отрыв, несмотря на то, что имеет значительно меньше параметров, с средней производительностью трех запусков, сообщаемой с разными семенами параметров для модели LoReFT. Param(%) рассчитывается путем деления количества обучаемых параметров на количество общих параметров базовой крупной модели.

Таблица выше суммирует сравнение точности рамок LLaMA-7B и LLaMA-13B с существующими PeFT моделями на 4 разных наборах данных для арифметического рассуждения, с рамкой, сообщающей среднюю производительность трех запусков с разными случайными семенами. Как можно наблюдать, несмотря на то, что имеет значительно меньше параметров, рамка LoReFT превосходит существующие подходы PeFT на значительный отрыв.

Таблица выше суммирует сравнение точности рамок RoBERTa-base и RoBERTa-large с существующими PeFT моделями на наборе данных GLUE, с рамкой, сообщающей среднюю производительность пяти запусков с разными случайными семенами. Как можно наблюдать, несмотря на то, что имеет значительно меньше параметров, рамка LoReFT превосходит существующие подходы PeFT на значительный отрыв.

Окончательные Мысли

В этой статье мы говорили о LoReFT, мощной альтернативе существующим PeFT рамкам, которая достигает сильной производительности на наборах данных из четырех разных доменов, предлагая до 50-кратную эффективность по сравнению с предыдущими моделями PeFT. Предобученные крупные модели часто дообучаются для использования в новых доменах или задачах, и во время процесса дообучения одна базовая модель может быть адаптирована к широкому спектру задач даже при наличии только небольшого количества данных в области. Однако процесс дообучения всей модели является ресурсоёмким и дорогим, особенно для моделей языка с значительно большим количеством размеров и параметров. Параметро-эффективное тонкое настройка или PeFT методы предлагают решить высокие затраты, связанные с дообучением всей модели, обновляя только небольшую часть доступных весов, что помогает уменьшить время обучения и использование памяти. Заметно, что LoReFT устанавливает новые результаты на уровне состояния искусства для вывода общего смысла, выполнения инструкций и понимания естественного языка против сильнейших PeFT.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.