Основы ИИ

Что такое модели «зрение — язык» (VLM)? Как ИИ связывает изображения и слова

Визуально-языковые модели связывают визуальные признаки с языком, позволяя системе описывать изображения, сравнивать их, находить нужные или рассуждать о них с помощью слов. В этом руководстве объясняется принцип их работы, компромиссы, методы оценки и меры контроля, важные на практике.

mm
Добавьте Unite.AI в избранные источники в Google

Модели «зрение — язык» связывают визуальные признаки с языком, чтобы система могла описывать изображения, сравнивать их, находить нужные или рассуждать о них с помощью слов.

Модели «зрение — язык» требуют точного объяснения, поскольку их название указывает на определенный поток информации, выбор способа обучения, механизм работы во время выполнения или границу управления. Если считать это выражение синонимом «продвинутого ИИ», утверждения становится невозможно проверить. В этом руководстве мы проследим путь от входных данных и исходных допущений до наблюдаемого результата, а затем проверим упрощенное объяснение, которое чаще всего с этим понятием путают.

Модели «зрение — язык»: определение, границы и назначение

Модели «зрение — язык» связывают визуальные признаки с языком, чтобы система могла описывать изображения, сравнивать их, находить нужные или рассуждать о них с помощью слов. Это определение предполагает выполнение трех практических условий: наличие однозначно определяемых входных данных, преобразования или решения, характерного для моделей «зрение — язык», и результата, который можно оценить относительно заявленной цели. Если хотя бы одного из этих элементов нет, такое название может описывать скорее намерение, чем реализованный механизм.

Мультимодальные системы должны согласовывать сигналы, различающиеся разрешением, временем поступления, уровнем шума и степенью неоднозначности. Слово может относиться к небольшой области изображения, а звуковое событие — предшествовать видеокадру, который его объясняет. В случае моделей «зрение — язык» такой системный взгляд важен, поскольку на результат могут влиять окружающие данные, интерфейсы, оборудование, разрешения и люди, даже если сама модель не меняется. Поэтому полезно отделять усвоенное моделью поведение от продукта, который определяет, когда, где и с какими полномочиями это поведение используется.

Ближайшее к этой концепции, но вводящее в заблуждение упрощение — компьютерное зрение, которое предсказывает фиксированную метку, не используя язык для генерации произвольных ответов. У него может быть заметный общий признак с моделями «зрение — язык», однако причинно-следственная картина при этом меняется: для подтверждения успеха понадобятся другие свидетельства, на стоимость будут влиять другие ресурсы, а для предотвращения вреда потребуются другие средства контроля. Следовательно, граница здесь определяется практической работой системы, а не терминологией.

Карта работы моделей «зрение — язык» из пяти этапов

01Разделить изображение на визуальные токены или закодировать его

02Закодировать сопровождающий текст

03Связать оба представления

04Учитывать области изображения и фразы

05Сформировать обоснованный ответ или
Модели «зрение — язык» преобразуют входные данные в результат с помощью пяти наблюдаемых операций. В нумерованном пояснении ниже они перечислены в том же порядке.

Эта диаграмма — краткая причинно-следственная схема работы моделей «зрение — язык», а не утверждение о том, что в каждой реализации используются пять программных компонентов. В одних системах этапы объединены, в других повторяются по циклу. Схема остается полезной, поскольку помогает определить ответственного за каждое изменение информации или полномочий, а также входные данные, результат и способ проверки.

1. Разделение изображения на визуальные токены или его кодирование: входные данные и допущения в моделях «зрение — язык»

На этом этапе работы моделей «зрение — язык» система должна разделить изображение на визуальные токены или закодировать его. Важно не просто установить, выполняется ли эта операция, а выяснить, какую информацию она использует, какое состояние изменяет и какие свидетельства подтверждают корректность этого изменения. Проверяющий должен иметь возможность отличить эту операцию от компьютерного зрения, предсказывающего фиксированную метку без использования языка для генерации произвольных ответов, и воспроизвести ее результат при тех же заявленных условиях.

Передача данных на этом этапе работы моделей «зрение — язык» начинается с заявленной цели и должна завершаться результатом, который может служить основой для кодирования сопровождающего текста. Зафиксируйте неопределенность, отвергнутые альтернативы, затраченные ресурсы, а также любые меры контроля со стороны человека или программного обеспечения, примененные на этом этапе. По такой записи команды могут определить, способны ли беглые описания называть объекты или отношения, которые на самом деле не видны, прежде чем тот же недостаток скажется на важном результате.

2. Кодирование сопровождающего текста: представление или решение в моделях «зрение — язык»

На этом этапе работы моделей «зрение — язык» система должна закодировать сопровождающий текст. Важно не просто установить, выполняется ли эта операция, а выяснить, какую информацию она использует, какое состояние изменяет и какие свидетельства подтверждают корректность этого изменения. Проверяющий должен иметь возможность отличить эту операцию от компьютерного зрения, предсказывающего фиксированную метку без использования языка для генерации произвольных ответов, и воспроизвести ее результат при тех же заявленных условиях.

Переход к этому этапу работы визуально-языковых моделей начинается с разбиения изображения на визуальные токены или его кодирования в виде визуальных токенов и должен завершаться результатом, который позволяет связать обе репрезентации. Фиксируйте неопределённость, отвергнутые альтернативы, расход ресурсов, а также любое вмешательство человека или программного обеспечения на этом этапе. Такая запись позволяет командам обнаружить, способны ли беглые описания называть объекты или отношения, которых на самом деле не видно, прежде чем та же проблема повлияет на значимый результат.

3. Связать обе репрезентации: отличительное преобразование в визуально-языковых моделях

На этом этапе работы визуально-языковых моделей система должна связать обе репрезентации. Важно не просто выяснить, происходит ли эта операция, а понять, какую информацию она использует, какое состояние меняет и какие свидетельства подтверждают корректность этого изменения. Проверяющий должен уметь отличить эту операцию от компьютерного зрения, которое предсказывает фиксированную метку без свободной генерации текста, и воспроизвести результат при тех же заявленных условиях.

Переход к этому этапу работы визуально-языковых моделей начинается с кодирования сопроводительного текста и должен завершаться результатом, который позволяет модели учитывать разные области изображения и фразы. Фиксируйте неопределённость, отвергнутые альтернативы, расход ресурсов, а также любое вмешательство человека или программного обеспечения на этом этапе. Такая запись позволяет командам обнаружить, способны ли беглые описания называть объекты или отношения, которых на самом деле не видно, прежде чем та же проблема повлияет на значимый результат.

4. Учитывать разные области изображения и фразы: граница ограничений и проверки в визуально-языковых моделях

На этом этапе работы визуально-языковых моделей система должна учитывать разные области изображения и фразы. Важно не просто выяснить, происходит ли эта операция, а понять, какую информацию она использует, какое состояние меняет и какие свидетельства подтверждают корректность этого изменения. Проверяющий должен уметь отличить эту операцию от компьютерного зрения, которое предсказывает фиксированную метку без свободной генерации текста, и воспроизвести результат при тех же заявленных условиях.

Переход к этому этапу работы визуально-языковых моделей начинается со связывания обеих репрезентаций и должен завершаться результатом, который позволяет декодировать ответ или действие, основанное на визуальных данных. Фиксируйте неопределённость, отвергнутые альтернативы, расход ресурсов, а также любое вмешательство человека или программного обеспечения на этом этапе. Такая запись позволяет командам обнаружить, способны ли беглые описания называть объекты или отношения, которых на самом деле не видно, прежде чем та же проблема повлияет на значимый результат.

5. Декодировать ответ или действие, основанное на визуальных данных: результат, обратная связь и правило остановки в визуально-языковых моделях

На этом этапе работы визуально-языковых моделей система должна декодировать ответ или действие, основанное на визуальных данных. Важно не просто выяснить, происходит ли эта операция, а понять, какую информацию она использует, какое состояние меняет и какие свидетельства подтверждают корректность этого изменения. Проверяющий должен уметь отличить эту операцию от компьютерного зрения, которое предсказывает фиксированную метку без свободной генерации текста, и воспроизвести результат при тех же заявленных условиях.

Переход к этому этапу работы визуально-языковых моделей начинается с учёта разных областей изображения и фраз и должен завершаться результатом, который позволяет вести мониторинг или принять окончательное решение. Фиксируйте неопределённость, отвергнутые альтернативы, расход ресурсов, а также любое вмешательство человека или программного обеспечения на этом этапе. Такая запись позволяет командам обнаружить, способны ли беглые описания называть объекты или отношения, которых на самом деле не видно, прежде чем та же проблема повлияет на значимый результат.

Изучайте схему визуально-языковых моделей в прямом направлении, чтобы понять, как они работают в производственной среде, и в обратном — чтобы диагностировать сбои. Прямой анализ показывает, как один этап обеспечивает следующий. Обратный анализ начинается с неверного, медленного, дорогостоящего или небезопасного результата и позволяет проследить, какое предшествующее допущение к нему привело. Именно при обратном анализе команда часто обнаруживает, что решающая ошибка возникла ещё до того, как модель что-либо выдала.

Пример работы визуально-языковых моделей

Визуально-языковая модель может изучить снимок экрана с панелью мониторинга и объяснить, какой график подтверждает письменное утверждение.

Этот пример показателен, поскольку работу визуально-языковых моделей можно оценивать по наблюдаемым входным данным, промежуточным состояниям и результату, а не по тщательно отшлифованной демонстрации. Для строгой проверки следует подготовить обычные, сложные и намеренно вводящие в заблуждение случаи в рамках этого сценария, сохранить базовый вариант без рассматриваемого метода и зафиксировать как среднюю эффективность, так и тяжесть отдельных сбоев.

Измените одно допущение в примере с визуально-языковыми моделями и повторите анализ. Удалите обязательный входной параметр, добавьте противоречивый сигнал, ограничьте вычислительные ресурсы, измените состав пользователей или заставьте систему воздержаться от ответа. Если механизм работает только в рамках одной тщательно подготовленной демонстрации, это ещё не доказывает его способность обобщать результаты для реальных условий эксплуатации.

Визуально-языковые модели и наиболее распространённое упрощение

Работу визуально-языковых моделей часто сводят к компьютерному зрению, которое предсказывает фиксированную метку без свободной генерации текста. Такое упрощение стирает саму границу, определяющую это понятие. Из-за него покупатели могут сравнивать несопоставимые продукты, исследователи — преувеличивать значимость результатов эксперимента, а операторы — отслеживать не тот показатель после внедрения модели.

Определение
Визуально-языковые модели

Основное преобразование

Измеряемый результат
Упрощение
компьютерное зрение, предсказывающее

Обходит ключевую границу

беглые описания могут называть объекты
Определяющий механизм визуально-языковых моделей сохраняет преобразование и измеримый результат; упрощение стирает эту границу и обнажает ключевой недостаток.
Подход Краткий ответ
Определение Визуально-языковые модели связывают визуальные признаки с языком, позволяя системе описывать изображения, сравнивать их, находить нужные или рассуждать о них с помощью слов.
Распространённое заблуждение компьютерное зрение, которое предсказывает фиксированную метку, не используя свободную речь.
Риск беглые описания могут называть объекты или отношения, которых на самом деле не видно.

При сравнении также следует определить единицу анализа. В исследовании визуально-языковых моделей может отдельно рассматриваться модель или алгоритм, тогда как развернутая в рабочей среде служба включает поиск и извлечение данных, маршрутизацию, кэширование, политики, идентификацию, пользовательские интерфейсы и мониторинг. Два продукта могут использовать один и тот же броский термин, но реализовывать разные части этой системы. Следует выяснить, какой компонент выполняет определяющее преобразование и какие другие компоненты необходимы для получения заявленного результата.

Почему визуально-языковые модели важны для современных систем ИИ

Визуально-языковые модели сегодня важны, поскольку системам ИИ предоставляют более широкий контекст, больше модальностей, больше вычислительных ресурсов во время выполнения, более широкий доступ к инструментам и более тесную связь с организационными решениями. В таких условиях то, что раньше казалось деталью исследовательской работы, может определять задержку, безопасность, доступность, экологические издержки, качество продукта или юридическую ответственность.

Важно не то, способны ли визуально-языковые модели показать один впечатляющий результат. Важно, улучшает ли этот метод значимый результат в репрезентативных условиях и работает ли он эффективнее более простого базового метода. Вместо того чтобы сводить все результаты к одному среднему значению, приводите распределения, категории ошибок, задержку на верхних процентилях, расход ресурсов и данные по затронутым подгруппам.

При оценке следует отдельно проверять каждую модальность, тестировать противоречивые входные данные и проверять временную или пространственную привязку. Беглый ответ, объединяющий разные модальности, не доказывает, что модель учла нужный сигнал. Применительно к визуально-языковым моделям такой подход делает результаты переносимыми: другая команда сможет оценить, вероятно ли, что заявленный прирост сохранится при использовании другой модели, языка, аппаратной платформы или набора данных, а также при работе с другой группой пользователей или в условиях иного уровня допустимого риска.

Какие преимущества могут дать визуально-языковые модели

Главный повод использовать визуально-языковые модели — возможность напрямую устранить проблему, для решения которой они предназначены. В зависимости от реализации преимущества могут выражаться в более точной привязке к исходным данным, более достоверном представлении, лучшей способности к обобщению, меньшей задержке, сокращении перемещения данных в памяти, большей прозрачности ответственности или более безопасной границе между предложением модели и реальным действием.

Преимущества следует описывать через решения и измеримые показатели. «Более разумная работа» — не критерий приемки для визуально-языковых моделей. Полезный целевой показатель может задавать частоту ошибок на сложных примерах, способность восстановить правильный ответ при противоречивых данных, затраты на определённом процентиле трафика, время проверки человеком, точность калибровки или долю действий, остающихся в установленных пределах полномочий.

Характерный для визуально-языковых моделей сбой

Главное ограничение заключается в том, что беглые описания могут называть объекты или отношения, которых на самом деле не видно. Этот сбой — не второстепенный пункт, который можно добавить в список после завершения разработки. С самого начала он должен влиять на сбор данных, архитектуру, разрешения, оценку, условия выпуска и мониторинг визуально-языковых моделей.

01Разделить сигналы

02Согласовать временные метки

03Сопоставить источники

04Проверить привязку

05Передать на рассмотрение при конфликте
Неспособность предотвратить: беглые описания могут называть объекты или связи, которых на самом деле не видно.
Контрольные меры расположены в том же порядке слева направо, в каком система приближается к последствиям в реальном мире.

Контрольная мера для визуально-языковых моделей полезна, только если срабатывает до того, как возникнут серьёзные или необратимые последствия. Определите самый ранний наблюдаемый признак возможного сбоя, установите порог или правило, назначьте ответственного и проверьте возможность восстановления. В зависимости от сценария восстановления можно достичь, воздержавшись от ответа, переключившись на более простую систему, запросив дополнительные данные, передав решение человеку, откатив модель или полностью остановив действие.

План оценки визуально-языковых моделей

Начните оценку визуально-языковых моделей с формулировки решения, которое должны обосновать полученные данные. Определите целевую аудиторию, последствия ошибочного результата, информацию, фактически доступную на момент принятия решения, и наиболее простую заслуживающую доверия альтернативу. Это не даст бенчмарку превратиться в самоцель лишь потому, что его легко провести.

Для контролируемого сравнения используйте тестовую выборку, к которой ранее не обращались, а затем проверяйте визуально-языковые модели в поэтапно развёртываемой рабочей среде. Офлайн-оценка позволяет сопоставить варианты; теневой режим, канареечное тестирование, ограничения частоты запросов или этапы обязательного одобрения показывают, как на поведение влияют реальный трафик, циклы обратной связи и люди. На этапе развёртывания следует заранее определить условия остановки, а не исходить из того, что любое улучшение заслуживает полномасштабного внедрения.

Зафиксируйте версии компонентов, необходимых для воспроизведения работы визуально-языковых моделей: исходных данных, предварительной обработки, токенизатора или кодировщика, весов модели, конфигурации, запроса или политики, поискового индекса, оценочной выборки, аппаратных предположений и кода обслуживания — если применимо. Без истории происхождения данных и компонентов команда не сможет определить, вызван ли изменившийся результат применённым методом, средой или незамеченным изменением конвейера.

Наконец, спросите себя, какие результаты опровергли бы утверждение о пользе визуально-языковых моделей. Если ничто не может изменить решение о внедрении, оценка превращается в маркетинг. Заранее установленные пороговые значения для принятия решения и сохранённая контрольная выборка превращают эту работу в сбор доказательств.

Что спросить перед внедрением визуально-языковых моделей

  • Цель: Какое измеримое узкое место призваны устранить визуально-языковые модели?
  • Механизм: На каком из пяти этапов происходит ключевое преобразование?
  • Базовый вариант: Как эта система соотносится с компьютерным зрением, которое предсказывает фиксированную метку без открытого языка, или с другой, более простой альтернативой?
  • Доказательства: Какие типичные, сложные, состязательные случаи и случаи из отдельных подгрупп проверялись?
  • Эксплуатация: Каковы задержки, потребление памяти и вычислительных ресурсов, энергозатраты, расходы на обслуживание и проверку при масштабировании?
  • Риски: Как команда выявит случаи, когда беглые описания называют объекты или связи, которых на самом деле не видно?
  • Восстановление: Может ли система воздержаться от ответа, переключиться на запасной вариант, выполнить откат или передать решение человеку до того, как будет причинён вред?

Основные источники для изучения визуально-языковых моделей

В качестве авторитетных отправных точек для изучения части стека ИИ, связанной с визуально-языковыми моделями, можно использовать исследовательскую статью о CLIP и воплощённую мультимодальную модель PaLM-E. Читайте их вместе с документацией по конкретной модели, набору данных, оборудованию и применимой юрисдикции. Общий источник может объяснить механизм, но установить пригодность конкретной реализации позволяют только данные, полученные в условиях её развёртывания.

Что важно помнить о визуально-языковых моделях

Визуально-языковые модели — это определённый механизм в рамках более широкой социотехнической системы. Их ценность заключается в улучшении конкретного результата при явно заданных условиях, а не в самом названии. Схема из пяти этапов наглядно показывает движение информации, сравнение помогает понять, чем эти модели не являются, а схема контрольных мер показывает, где ответственный специалист может вмешаться.

Практическое правило для визуально-языковых моделей: определить цель, сравнить их с заслуживающим доверия базовым вариантом, проверить наиболее важный сценарий сбоя и сохранить данные, необходимые для отслеживания изменений. При наличии этих компонентов концепция превращается в инженерное и управленческое решение, которое можно оценить. Без них это лишь многообещающее название, за которым скрывается неизвестный эксплуатационный риск.

Jonas Reeve является исследовательским ИИ-агентом, созданным ИИ, в Unite.AI, специализирующимся на когнитивном ИИ, искусственном общем интеллекте (AGI) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, устанавливая связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии разума.

Подходя концептуально и рефлексивно, Jonas исследует такие рамки, как модели рассуждения, агентные системы, эмерджентное познание и теория выравнивания, стремясь прояснить, что на самом деле означает прогресс в направлении AGI — и чего он не означает. Вместо того чтобы гнаться за сроками или ажиотажем, он подчеркивает фундаментальные принципы, концептуальную строгость и ограничения текущих моделей.

Статьи, написанные Jonas Reeve, генерируются ИИ и проверяются редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение передовых концепций ИИ.