Модели и платформы ИИ
Ferret: Высшее Показатели в Задачах Ссылок и Оснований
Обеспечение пространственного понимания в моделях обучения языка и зрения остается основной проблемой исследований. Это понимание является основой для двух важных возможностей: основания и ссылки. Ссылка позволяет модели точно интерпретировать семантику конкретных регионов, а основание предполагает использование семантических описаний для локализации этих регионов.
Разработчики представили Ferret, Мультимодальную Большую Языковую Модель (MLLM), способную понимать пространственные ссылки на любом уровне детализации или форме в изображении и точно основывать описания с открытым словарем. Ferret использует новое гибридное представление, сочетающее непрерывные визуальные особенности с дискретными координатами для представления регионов изображения. Его пространственно-осведомленный визуальный выборщик обрабатывает изменяющуюся плотность форм, позволяя ему обрабатывать разнообразные входные данные регионов, такие как свободные формы, ограничивающие рамки и точки.
Ferret’s подход позволяет ему превосходить в классических задачах основания и ссылки и превосходить другие MLLM в задачах, требующих локализации и многомодального общения. В этой статье мы рассмотрим архитектуру и методологию Ferret, подчеркивая его впечатляющие результаты в различных многомодальных языковых задачах. Давайте углубимся в это дальше.
Ferret: Высшее Показатели в Задачах Ссылок и Оснований
Ссылка в модели – это возможность, позволяющая модели точно понять семантику заданных конкретных регионов, тогда как основание делает необходимым для модели использовать заданные семантические описания для локализации этих регионов. Хотя они могут различаться в своих задачах, и ссылка, и основание имеют одну и ту же фундаментальную концепцию: выравнивание пространственных семантик и информации. Однако, несмотря на то, что они имеют одну и ту же концепцию, существующие модели изучают основание и ссылку индивидуально. Хотя этот метод работает, он создает препятствие для достижения человеческих возможностей, поскольку люди могут учиться на одной задаче и применять эти знания к другим задачам без проблем, и могут легко интегрировать возможности основания/ссылки с рассуждением и повседневным диалогом. Фреймворк Ferret черпает вдохновение из вышеупомянутого пробела в существующих фреймворках MLLM и изучает три основных вопроса:
- Как объединить возможности основания и ссылки в фреймворке, и как их объединение будет полезно для друг друга?
- Люди используют различные типы регионов, такие как коробка, точка, каракули, свободные формы для ссылки? Как представить эти разнообразные регионы?
- Как сделать основание и ссылку инструкциями, прочными и открытыми словарем, что критически важно для их практического и реального применения?
Фреймворк Ferret – это новая ссылка и основание Мультимодальная Большая Языковая Модель, которая пытается решить эти вопросы. Фреймворк Ferret выбирает Мультимодальную Большую Языковую Модель в качестве своей основы благодаря их замечательным глобальным возможностям зрения и понимания языка. Кроме того, для объединения возможностей основания и ссылки фреймворк Ferret представляет координаты регионов в естественной языковой числовой форме. Однако на практике неэффективно использовать координаты коробки или даже отдельные точки для представления разнообразных форм регионов, таких как каракули, штрихи или сложные многоугольники, поскольку эти формы имеют решающее значение для повышения точности и более универсального взаимодействия человека и модели. Чтобы решить эту проблему, фреймворк Ferret использует пространственно-осведомленный визуальный выборщик, который получает визуальные регионы для регионов, независимо от формы, тем самым ведя переговоры с изменяющейся плотностью этих форм. Фреймворк затем объединяет непрерывные визуальные особенности с дискретными координатами для представления визуальных регионов на входе, в результате чего создается гибридное представление региона в Ferret.
Фреймворк Ferret использует вышеуказанные методы для решения входных данных, которые смешивают свободный текст с ссылками на регионы, и может без проблем генерировать координаты для каждого объекта с генерацией текста для основания упомянутых объектов в выходных данных. Таким образом, Ferret является первым фреймворком, который обрабатывает входные регионы свободной формы в Мультимодальных Большых Языковых Моделях. Кроме того, фреймворк Ferret поглощает замечательные возможности открытого словаря пространственной локализации и понимания, что позволяет фреймворку достигать высших результатов при оценке на традиционных задачах основания и ссылки.
Двигаясь дальше, фреймворк Ferret черпает вдохновение из трех существующих фреймворков ИИ, включая Мультимодальные Большие Языковые Модели, MLLM для ссылки и основания, и объединение основания и понимания языка и зрения.
Введение Больших Языковых Моделей, включая GPT, DALL-E, PaLM, LLaMA и BLOOM, изменило ландшафт исследований в области обработки естественного языка, что привело к значительным достижениям в области мультимодальных языковых моделей. Ранее мультимодальные языковые модели были сосредоточены в основном на крупномасштабном генерировании изображений и текста, с некоторыми заметными примерами, такими как PaLI, SimVLM, GIT, BLIP-2, FLAMINGO, CM3 и PaLI-X. Однако, поскольку фреймворк Flamingo достиг эффективного интегрирования LLM с предварительно обученным кодировщиком изображений CLIP через блоки кросс-гейтед внимания, что привело к замечательным возможностям многомодального обучения с несколькими примерами. Текущие исследования направлены на использование предварительно обученных больших языковых моделей для настройки визуальных инструкций, с заметными примерами, такими как MiniGPT-4, Otter, InstructBLIP и другие. Что еще более важно, так что недавние модели, такие как Emu и GILL, показали замечательный успех в использовании MLLM для генерации и поиска изображений. Фреймворк Ferret также ссылается на предыдущие исследования, которые фокусируются на объединении текста и выхода ограничивающей коробки для моделей языка и зрения.
Ferret: Методология и Архитектура
Гибридные Представления Регионов
Точка, коробка и свободная форма – три доминирующих формата, которые языковая модель использует при ссылке на конкретные регионы. С одной стороны, точка и коробка могут быть точно представлены координатами, но отображение свободных форм немного сложнее, поскольку свободные формы могут включать широкий спектр регионов, включая маски, многоугольники и каракули. Использование координат для описания свободных форм – сложная задача, которая препятствует способности модели учиться устанавливать связь между регионами и соответствующими координатами. Кроме того, использование координат для свободных форм вычислительно дорого и неясно.
Чтобы решить эту проблему и обобщить все три формата, фреймворк Ferret предлагает гибридное представление региона, которое сочетает непрерывные визуальные особенности с дискретными координатами для ссылки на конкретный регион.

Для непрерывных визуальных особенностей для заданного региона фреймворк Ferret сначала строит 2D-бинарную маску того же размера, что и изображение, и помечает значение 1 внутри целевого региона, а снаружи региона – значение 0. Модель затем извлекает бинарную маску вместе с извлеченной картой особенностей изображения и отправляет ее в пространственно-осведомленный визуальный выборщик.
Архитектура
Архитектура модели Ferret состоит из трех основных компонентов
- Кодировщик изображения для извлечения вложений изображения.
- Пространственно-осведомленный визуальный выборщик для извлечения региональных непрерывных особенностей.
- Большая языковая модель для совместного моделирования текста, изображения и региональных особенностей.

Изображение сначала подается в предварительно обученный визуальный кодировщик для извлечения вложений изображения. Для текстовых входных данных фреймворк сначала использует предварительно обученный токенизатор LLM для токенизации текстовой последовательности, а затем проецирует эти токены в текстовые вложения. Для ссылок на регионы Ferret добавляет специальный токен и координаты в качестве заполнителя для непрерывных особенностей после имени региона. Если имя региона неизвестно или сложно описать из-за включения нескольких объектов, фреймворк использует только название области или региона.
Одной из основных проблем, связанных с ссылками на регионы, является то, что их форма может быть довольно изменчивой, то есть они могут иметь разные формы и не ограничиваются только прямоугольными коробками или точками. Регионы с нерегулярными формами не могут быть обработаны традиционными методами, такими как сетчатая обработка, включая внимание к патчам или сверткам. Чтобы решить эту проблему, фреймворк Ferret предлагает пространственно-осведомленный визуальный выборщик. Для извлеченной карты особенностей с бинарной маской региона модель Ferret сначала случайным образом выбирает N точек внутри бинарной маски региона.
Для каждой отдельной точки модель получает свою особенность, выполняя билинейную интерполяцию. N точек затем подают в каскад блоков, каждый из которых проходит через три различных этапа: выборка, сбор и пулинг. На этапе выборки фиксированное количество точек выбирается из N доступных точек с использованием алгоритма FPS или алгоритма выборки дальнего точки, который гарантирует достаточное покрытие. На втором этапе для каждой выборочной точки фреймворк ищет ее k ближайших соседей из пула доступных N точек. Для каждой группы модель затем объединяет особенности выборочной точки с особенностями соседних точек. На заключительном этапе фреймворк Ferret выполняет пулинг, чтобы объединить k особенностей соседей в одну особенность, которая будет представлять выборочную точку. Выполняя эти три этапа, фреймворк Ferret остается с меньшим количеством точек, но с особенностями пространства с более высокой плотностью, поскольку он включает не только особенности местных соседей, но и их относительные положения.
GPT-Помощь в Генерации Визуальных Данных
Данные настройки диалоговых инструкций имеют решающее значение для Мультимодальных Больших Языковых Моделей, поскольку они не только помогают преобразовать существующие наборы данных с помощью шаблонов, но также помогают модели понять человеческие намерения и генерировать соответствующие ответы. Большинство MLLM используют метод нескольких примеров для получения визуальных инструкций, где модель предоставляет текстовое описание сцен в изображении вместе с человеческими аннотированными диалогами в качестве нескольких примеров. Однако существующие методы настройки инструкций в основном фокусируются на описании всего изображения без явного указания пространственно-ориентированной информации. Фреймворк Ferret подчеркивает регионные знания для сбора ссылок и оснований инструкций в три этапа.
- В дополнение к использованию глобальных подписей и объектов фреймворк предоставляет символическое описание сцены, которое описывает физические отношения между подписями регионов и объектами, а также их координаты.
- Для человеческих аннотированных диалогов фреймворк добавляет координаты после объектов или регионов, которые можно основать, либо на входе, либо на выходе, либо на обоих, с диалогами, которые фокусируются в основном на конкретных регионах, что помогает модели следовать подобным шаблонам для генерации новых диалогов.
- Возможно, что диалог, сгенерированный фреймворком, не будет следовать правилам и шаблонам, заданным несколькими примерами и системными подсказками. Чтобы решить эту проблему, фреймворк снова использует языковую модель для уточнения диалогов, сгенерированных моделью изначально.
Пространственная Отрицательная Добыча
Предыдущие исследования показали, что мультимодальные большие языковые модели имеют высокую вероятность галлюцинаций при ответах на вопросы “Да” или “Нет”. Чтобы обеспечить, что модель Ferret не галлюцинирует в подобных условиях, фреймворк использует подход пространственной отрицательной добычи с локализацией категорий изображений и семантической локализацией категорий. Оба этих метода просят модель локализовать конкретные категории объектов, что позволяет модели распознавать отсутствие определенных объектов в изображении.
Ferret: Результаты и Экспериментирование
Чтобы проанализировать его производительность, фреймворк Ferret оценивается на традиционных задачах основания и ссылки, после чего фреймворк оценивается в более сложной задаче многомодального общения и тестирования его возможностей ссылки и основания.

Возможность модели понимать ссылки оценивается тем, насколько точно модель может понять семантику ссылочного региона, заданного ссылочным регионом в изображении или вопросом. Чтобы оценить точность модели, объекты, наиболее基本ная семантика, рассматриваются первыми, поскольку они не только фундаментальны, но и легко определяются. Чтобы имитировать человеческую универсальность, фреймворк заменяет местоположение объекта внутри изображения на свободную форму, коробку и точку. Для свободной формы модель случайным образом генерирует штрихи внутри объекта Ground Truth для симуляции. Для коробки фреймворк Ferret использует коробку Ground Truth, предоставленную компонентом LVIS. Наконец, для точки модель случайным образом выбирает точку внутри объекта Ground Truth, которая также находится рядом с границей объекта Ground Truth. Результаты на трех типах ссылок показаны на следующем изображении.

Фреймворк Ferret демонстрирует замечательные результаты в задачах диалогов ссылок, что позволяет интегрировать его с различными задачами визуального обучения, особенно с теми, которые имеют выходы основания. Чтобы оценить его возможность основания, фреймворк Ferret сначала подвергается задачам визуального основания с генеративным парадигмой. Затем фреймворк оценивает его способность в задачах основания подписей, чтобы измерить соответствие между регионами и словами.
В задачах визуального основания фреймворк стремится основать языковые запросы в выровненные регионы изображения, и, как можно увидеть на следующем изображении, фреймворк Ferret демонстрирует замечательные результаты во всех задачах, и его результаты сравнимы с результатами, достигнутыми методами специализированной настройки.

Для задач основания подписей модель должна сгенерировать подпись, а затем основать сгенерированные именные фразы в регионах изображения. Окончательный прогноз, сделанный моделью, состоит из трех компонентов: визуальные регионы в виде коробок, текстовые подписи и соответствия между коробками и словами. Результаты показаны на следующем изображении, и, как можно увидеть, фреймворк обеспечивает результаты, сравнимые с результатами современных методов.

Наконец, многомодальное общение является одной из наиболее желаемых возможностей в MLLM, и существующие MLLM в основном оценивают подробные описания, разговоры и сложные рассуждения с языковой моделью в качестве судьи. Однако, поскольку нет набора данных, который оценивает многомодальное общение с обязательными ссылками или действиями основания, это оставляет пробел. Чтобы закрыть этот пробел, фреймворк Ferret включает три вопроса, основанных на регионах, для оценки его возможностей ссылки и основания в задачах многомодального общения.

Наконец, фреймворк Ferret сравнивается напрямую с современным фреймворком GPT, и результаты показаны ниже.

Окончательные Мысли
В этой статье мы говорили о Ferret, мультимодальной большой языковой модели, демонстрирующей замечательные возможности основания и ссылки. Фреймворк Ferret может ссылаться на регионы изображения, независимо от их формы, и может основать текст, предсказанный моделью, автоматически. Ferret использует пространственно-осведомленный визуальный выборщик, способный обрабатывать изменяющуюся плотность, демонстрируемую разными формами, для извлечения непрерывных особенностей разнообразных регионов. В результате фреймворк Ferret может обрабатывать разнообразные входные данные регионов, включая свободные формы, ограничивающие коробки и точки.












