Модели и платформы ИИ

Salmonn: К шагам к GENERIC слышимым способностям для крупных языковых моделей

mm
Добавьте Unite.AI в избранные источники в Google

Слух, который включает в себя восприятие и понимание общей аудиоинформации, имеет решающее значение для агентов ИИ в реальных средах. Эта аудиоинформация охватывает три основных типа звуков: музыку, аудиособытия и речь. Недавно текстовые основанные рамки крупных языковых моделей (LLM) показали замечательные способности, достигая человеческого уровня производительности в широком диапазоне задач обработки естественного языка (NLP). Кроме того, настраиваемое обучение, метод обучения с использованием пар ссылочных ответов и подсказок пользователя, стало популярным. Этот подход обучает крупные языковые модели более эффективно следовать открытому подсказке пользователя. Однако текущие исследования все больше сосредоточены на повышении крупных языковых моделей с возможностью воспринимать многомодальное содержание.

Сосредоточившись на том же, в этой статье мы будем говорить о SALMONN или Speech Audio Language Music Open Neural Network, рамки государственного искусства открытой речи аудио языка музыки нейронной сети, построенной путем включения речи и аудиоэнкодеров с предварительно обученной текстовой крупной языковой моделью в единую аудио-текстовую многомодальную модель. Модель SALMONN позволяет крупным языковым моделям понимать и обрабатывать общие аудиовходы напрямую и обеспечивать конкурентоспособную производительность в широком диапазоне аудио- и речевых задач, используемых в обучении, включая вопросы, основанные на аудиоинформации, распознавание и перевод речи, проверку говорящего, распознавание эмоций, аудио- и музыкальное подписывание и многое другое. Мы будем глубже погружаться в рамку SALMONN и исследовать ее работу, архитектуру и результаты в широком диапазоне задач NLP. Итак, давайте начнем.

SALMONN: Введение в единую аудио-текстовую многомодальную крупную языковую модель

SALMONN означает Speech Audio Language Music Open Neural Network, и это рамка единой аудио-текстовой многомодальной крупной языковой модели, способной воспринимать и понимать три основных аудио- или звуковых типа, включая речь, аудиособытия и музыку. Модель SALMONN позволяет крупным языковым моделям понимать и обрабатывать общие аудиовходы напрямую и обеспечивать конкурентоспособную производительность в широком диапазоне аудио- и речевых задач.

Чтобы повысить свою производительность как на речевых, так и на неречевых аудиозадачах, рамка SALMONN использует двойную структуру энкодера, состоящую из аудиоэнкодера BEATs и речевого энкодера, полученного из модели Whisper. Кроме того, рамка SALMONN также использует оконный уровень Q-Former или запросный трансформер в качестве модуля соединения для эффективного преобразования выходной последовательности переменной длины энкодера в аудиотокены переменного числа и, в конечном итоге, достижения высокой временной разрешающей способности для аудио-текстового выравнивания. Подход LoRA или низкоранговой адаптации используется в качестве межмодального адаптера для рамки Vicuna для выравнивания его выходного пространства с его дополненным входным пространством в попытке еще больше повысить его производительность. В рамке SALMONN способность выполнять межмодальные задачи, не видимые во время фазы обучения, потеряна во время обучения инструкций как межмодальные эмерджентные способности, что является основной причиной, по которой рамка SALMONN реализует дополнительную фазу активации, чтобы вернуть общую эмерджентную способность рамки LLM.

Кроме того, рамка использует широкий диапазон аудиособытий, музыкальных эталонов и речевых эталонов для оценки своих когнитивных слуховых способностей и делит эталоны на три уровня. На первом уровне эталонной задачи рамка обучает восемь задач в обучении инструкций, включая перевод, аудиоаннотацию и распознавание речи. Другие два уровня эталонных задач являются незаученными задачами, а второй уровень эталонной задачи состоит из пяти речевых задач NLP, таких как заполнение слотов и перевод на незаученные языки, полагаясь на высококачественные многоязычные выравнивания между текстовыми и речевыми токенами. Последний уровень эталонных задач пытается понять речевую и неречевую аудиоинформацию для речевого и аудио-со-рассуждения и аудиоосновного рассказывания.

Чтобы суммировать, рамка SALMONN – это

  1. Первая многомодальная крупная языковая модель, способная понимать и воспринимать общие аудиовходы, включая аудиособытия, речь и музыку, до предела своих возможностей.
  2. Попытка проанализировать межмодальные эмерджентные способности, предложенные путем реализации коэффициента масштабирования LoRA и использования дополнительной бюджетной фазы активации во время обучения для активации межмодальных эмерджентных способностей рамки.

SALMONN: Архитектура и методология

В этом разделе мы рассмотрим архитектуру, метод обучения и экспериментальную установку для рамки SALMONN.

Модельная архитектура

В основе своей архитектуры рамка SALMONN синхронизирует и объединяет выходы из двух аудиоэнкодеров, после чего рамка реализует Q-Former на уровне кадра в качестве модуля соединения. Выходная последовательность, сгенерированная Q-Former, объединяется с текстовыми инструкциями и затем вводится в подход адаптации LoRA для генерации необходимого ответа.

Аудиоэнкодеры

Рамка SALMONN использует два аудиоэнкодера: неречевой аудиоэнкодер BEATs и речевой энкодер, полученный из модели Whisper. Аудиоэнкодер BEATs обучен использовать самоподдерживающийся итеративный подход к обучению для извлечения неречевых высокоуровневых аудиосемантики, в то время как речевой энкодер обучен на большом количестве слабо контролируемых данных для задач распознавания и перевода речи, с выходными особенностями энкодера, подходящими для включения фонового шума и речевой информации. Модель сначала токенизирует входной аудио, а затем маскирует и прогнозирует его в обучении. Результатирующие аудиоособенности этих двух энкодеров дополняют друг друга и подходят как для речевой, так и для неречевой информации.

Оконный уровень Q-Former

Реализация структуры Q-Former является общим подходом, используемым в рамках LLM для преобразования выхода изображения в текстовые токены, и некоторые модификации необходимы при работе с аудиотокенами переменной длины. Более конкретно, рамка рассматривает выход энкодера входного изображения как объединенную последовательность выхода энкодера, и Q-Former развертывает фиксированное количество обучаемых запросов для преобразования выходной последовательности энкодера в текстовые токены с использованием стековых блоков Q-Former. Стековый блок Q-Former похож на блок декодера трансформера, за исключением удаления казуальных масок в слоях самообращения и использования фиксированного количества обучаемых статических запросов в начальных блоках.

LoRA и LLM

Рамка SALMONN также развертывает крупную языковую модель Vicuna, которая представляет собой рамку LLaMA, дообученную для более точного выполнения инструкций, и эффективно. Рамка LoRA является общим методом, используемым для параметроэффективного дообучения, и ее включение в рамку SALMONN для оценки весовых матриц и адаптации запроса в слоях самообращения.

Метод обучения

Рамка SALMONN использует трехэтапный подход к межмодальному обучению. Этап обучения включает в себя предварительное обучение и этап настройки инструкций, которые включены в большинство рамок визуальных LLM, и дополнительный этап активации реализуется для решения проблем переобучения, встречающихся во время задач аудиоаннотации и распознавания речи.

Предварительный этап обучения

Чтобы ограничить разрыв, наблюдаемый между предварительно обученными параметрами, включая энкодеры и LLM, и случайно инициализированными параметрами, включая адаптер и модули соединения, рамка SALMONN использует большое количество данных аудиоаннотации и распознавания речи для предварительного обучения компонентов LoRA и Q-Former. Эти задачи содержат важную аудиоинформацию о ключевом содержании аудиособытий как речи, так и неречи, и ни одна из них не требует сложного понимания или рассуждения для обучения выравнивания между текстовой и аудиоинформацией.

Этап настройки инструкций

Этап настройки инструкций, реализованный в рамке SALMONN, похож на тот, который реализован в рамках NLP и визуальных LLM, используя список аудиособытий, музыкальных задач и речевых событий для настройки аудиотекстовых инструкций. Задачи отдают приоритет на основе их важности в различных тестах, включая распознавание телефона, перекрывающееся распознавание речи и музыкальные аннотации. Кроме того, текстовая информация, сопряженная с аудиоданными, образует основу для генерации инструктивных подсказок.

Переобучение задач

Даже при реализации только первых двух этапов обучения рамка SALMONN обеспечивает конкурентоспособные результаты на задачах настройки инструкций, хотя производительность не на высшем уровне при выполнении межмодальных задач, особенно на задачах, требующих межмодального со-рассуждения. Конкретно, модель иногда нарушает инструктивные подсказки, что приводит к генерации нерелевантных или неправильных ответов, и это явление называется переобучением задач в рамке SALMONN, и этап активации реализуется для решения этих проблем переобучения.

Этап активации

Эффективный подход к решению проблем переобучения заключается в регуляризации внутренних условных языковых моделей с использованием более длинных и разнообразных ответов, таких как задачи вопросов и ответов, основанных на аудиоинформации, или аудиооснованное вопросно-ответное. Затем рамка генерирует парные данные обучения для таких задач, используя текст, сопряженный с аудио- или речевыми аннотациями.

Спецификации задач

Чтобы оценить межмодальные эмерджентные способности SALMONN, разработчики включили 15 речевых, аудио- и музыкальных задач, разделенных на три уровня.

Уровень 1

На первом уровне задачи используются для настройки инструкций и, следовательно, они являются наиболее простыми задачами, которые рамка SALMONN должна выполнить.

Уровень 2

Второй уровень состоит из незаученных задач, и уровень сложности выше по сравнению с задачами уровня 1. На уровне 2 задачи являются задачами NLP, включая извлечение ключевых слов из речи, используемое для оценки точности рамки при извлечении определенных ключевых слов с помощью речи. Другие задачи включают SQQA или задачи вопросов и ответов, основанные на речи, которые оценивают общие знания, которые рамка извлекает с помощью речевых вопросов, задачу SF или задачу заполнения слотов на основе речи для оценки точности значений слотов, и, наконец, есть две задачи AST для перевода с английского на немецкий и с английского на японский.

Уровень 3

Сложность задач на уровне 3 является максимальной по сравнению с двумя другими уровнями и включает задачи SAC или речевого и аудио-со-рассуждения и аудиоосновного рассказывания. Задача SAC требует от рамки SALMONN понять вопрос, включенный в аудиоклип, поданный в модель, найти поддерживающие доказательства, используя аудиособытия или музыку на фоне, и, наконец, сгенерировать подходящую причину для ответа на вопрос. Задачи аудиоосновного рассказывания требуют от модели сгенерировать осмысленную историю на основе аудиоинформации, полученной из общих аудиовходов.

Результаты

Задачи уровня 1

Следующая таблица демонстрирует результаты на задачах уровня 1, и, как можно наблюдать, рамка SALMONN возвращает конкурентоспособные результаты на задачах уровня 1 с или без активации.

Задачи уровня 2 и 3

Хотя рамка SALMONN возвращает конкурентоспособные результаты на задачах уровня 1 даже без дообучения, то же самое нельзя сказать о задачах уровня 2 и 3, поскольку без активации рамка SALMONN сильно страдает от переобучения на задачах. Производительность падает еще больше на задачах SQQA, SAC и рассказывания, с акцентом на мультимодальные взаимодействия, и рамка SALMONN борется с выполнением инструкций без активации. Однако с активацией результаты значительно улучшаются, и результаты включены в следующем изображении.

Коэффициент масштабирования LoRA

Коэффициент масштабирования LoRA оценивает влияние использования временного коэффициента масштабирования LoRA для минимизации проблем переобучения на задачах. Как можно наблюдать в следующей фигуре, уменьшение коэффициента масштабирования LoRA до 2,0 повышает способность межмодального рассуждения рамки SALMONN на задачах ASR и PR, SQQA, рассказывания и SAC соответственно.

Оценка переобучения задач

Чтобы подчеркнуть активацию, рамка SALMONN анализирует изменения в перплексии во время трех этапов обучения, и, как можно видеть в следующем изображении, изменения перплексии для задач AAC и ASR имеют небольшие окончательные значения после первого этапа обучения, указывая на обучение модели межмодальных выравниваний.

Кроме того, перплексия задачи PR также падает после настройки инструкций из-за ее зависимости от компонента LoRA для обучения выходным токенам. Также наблюдается, что хотя настройка инструкций помогает уменьшить перплексию на задачах рассказывания и SAC, разрыв все еще достаточно велик, чтобы выполнить задачи успешно, если не добавить дополнительный этап активации или не удалить компонент LoRA.

Активация

Рамка SALMONN изучает различные методы активации, включая обучение модели на задачах вопросов и ответов с длинными ответами или использование аудиооснованных длинных письменных историй, тогда как использование длинных речевых транскрипций для задач ASR. Оба компонента Q-Former и LoRA дообучены с использованием этих трех методов. Кроме того, рамка игнорирует аудио- и входные данные Q-Former для дообучения компонентов LoRA и Vicuna в качестве адаптивного текстового крупного языкового моделирования, и результаты демонстрируются в следующем изображении, и, как можно видеть, модель не может быть активирована с помощью ASR (обучение ASR с длинными метками), ни Story или Text-based с помощью обучения компонента LoRA с помощью текстовых входных данных.

Окончательные мысли

В этой статье мы говорили о SALMONN или Speech Audio Language Music Open Neural Network, рамки единой аудио-текстовой многомодальной крупной языковой модели, способной воспринимать и понимать три основных аудио- или звуковых типа, включая речь, аудиособытия и музыку. Модель SALMONN позволяет крупным языковым моделям понимать и обрабатывать общие аудиовходы напрямую и обеспечивать конкурентоспособную производительность в широком диапазоне аудио- и речевых задач.

Рамка SALMONN обеспечивает конкурентоспособную производительность в широком диапазоне обученных задач, включая аудиоаннотацию, перевод и распознавание речи, и многое другое, а также обобщается на широкий спектр незаученных задач, включая перевод речи для извлечения ключевых слов и незаученные языки. Благодаря своим способностям рамка SALMONN может быть рассмотрена как следующий шаг к повышению общих слуховых способностей крупных языковых моделей.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.