Модели и платформы ИИ

Мультимодальный ИИ эволюционирует: ChatGPT получает зрение с GPT-4V(ision)

mm
Добавьте Unite.AI в избранные источники в Google

В рамках постоянных усилий по созданию ИИ, подобного человеку, модели GPT от OpenAI постоянно расширяют границы. GPT-4 теперь может принимать запросы как текста, так и изображений.

Мультимодальность в генеративном ИИ обозначает способность модели производить различные выходные данные, такие как текст, изображения или аудио, на основе входных данных. Эти модели, обученные на конкретных данных, учатся распознавать основные закономерности для генерации подобных новых данных, обогащая приложения ИИ.

Недавние достижения в мультимодальном ИИ

Одним из заметных шагов в этой области является интеграция DALL-E 3 в ChatGPT, значительное улучшение технологии текст-изображение от OpenAI. Это сочетание позволяет осуществлять более плавное взаимодействие, где ChatGPT помогает создавать точные запросы для DALL-E 3, превращая идеи пользователей в яркое искусство, сгенерированное ИИ. Таким образом, хотя пользователи могут直接 взаимодействовать с DALL-E 3, наличие ChatGPT в этом процессе делает создание искусства ИИ намного более удобным для пользователей.

Узнайте больше о DALL-E 3 и его интеграции с ChatGPT здесь. Это сотрудничество не только демонстрирует прогресс в мультимодальном ИИ, но и делает создание искусства ИИ легким для пользователей.

Google’s health на другой стороне представил Med-PaLM M в июне этого года. Это мультимодальная генеративная модель, способная кодировать и интерпретировать различные биомедицинские данные. Это было достигнуто путем дообучения PaLM-E, языковой модели, для адаптации к медицинским областям с использованием открытой бенчмарк, MultiMedBench. Этот бенчмарк состоит из более чем 1 миллиона образцов по 7 биомедицинским типам данных и 14 задачам, таким как медицинский вопрос-ответ и генерация отчетов радиологии.

Различные отрасли принимают инновационные мультимодальные инструменты ИИ для стимулирования бизнес-расширения, оптимизации операций и повышения вовлеченности клиентов. Прогресс в возможностях голоса, видео и текста ИИ стимулирует рост мультимодального ИИ.

Корпорации ищут мультимодальные приложения ИИ, способные революционизировать бизнес-модели и процессы, открывая новые пути роста по всей экосистеме генеративного ИИ, от инструментов данных до новых приложений ИИ.

После запуска GPT-4 в марте некоторые пользователи заметили снижение качества ответов с течением времени, проблема, отраженная известными разработчиками и на форумах OpenAI. Первоначально отклоненная OpenAI, более позднее исследование подтвердило проблему. Оно показало снижение точности GPT-4 с 97,6% до 2,4% между мартом и июнем, указывая на снижение качества ответов с последующими обновлениями модели.

chatgpt-ai

ChatGPT (Синий) & Искусственный интеллект (Красный) Google Search Trend

Ажиотаж вокруг Open AI’s ChatGPT вернулся. Теперь он поставляется с функцией зрения GPT-4V, позволяющей пользователям анализировать изображения, предоставляемые ими. Это последняя функция, открытая для пользователей.

Добавление анализа изображений к большим языковым моделям (LLM) как GPT-4 рассматривается некоторыми как большой шаг вперед в исследованиях и разработке ИИ. Этот тип мультимодальной LLM открывает новые возможности, выводя языковые модели за пределы текста для предложения новых интерфейсов и решения новых типов задач, создавая новые впечатления для пользователей.

Обучение GPT-4V было завершено в 2022 году, с ранним доступом, предоставленным в марте 2023 года. Визуальная функция в GPT-4V работает на основе технологии GPT-4. Процесс обучения остался тем же. Первоначально модель была обучена предсказывать следующее слово в тексте, используя огромную базу данных текста и изображений из различных источников, включая интернет.

Позже она была дообучена с помощью большего количества данных, используя метод, называемый обучением с подкреплением от человеческой обратной связи (RLHF), для генерации выходных данных, которые люди предпочитают.

Механика зрения GPT-4

Замечательные возможности языка и зрения GPT-4, хотя и впечатляют, имеют лежащие в основе методы, которые остаются на поверхности.

Чтобы изучить эту гипотезу, была представлена новая модель языка и зрения, MiniGPT-4 с использованием передовой LLM под названием Vicuna. Эта модель использует визуальный кодировщик с предварительно обученными компонентами для визуального восприятия, выравнивая закодированные визуальные особенности с моделью языка Vicuna через один слой проекции. Архитектура MiniGPT-4 проста, но эффективна, с фокусом на выравнивании визуальных и языковых особенностей для улучшения возможностей визуального разговора.

MiniGPT-4

Архитектура MiniGPT-4 включает визуальный кодировщик с предварительно обученными ViT и Q-Former, один линейный слой проекции и передовую языковую модель Vicuna.

Тренд автoreгрессивных языковых моделей в задачах языка и зрения также вырос, используя трансфер знаний между языковыми и мультимодальными областями.

MiniGPT-4 соединяет визуальные и языковые области, выравнивая визуальную информацию из предварительно обученного визуального кодировщика с передовой LLM. Модель использует Vicuna в качестве декодера языка и следует двустадийному подходу к обучению. Первоначально она обучается на большой базе данных пар изображений и текста, чтобы освоить знания языка и зрения, а затем дообучается на меньшей, высококачественной базе данных для улучшения надежности и удобства использования генерации.

Чтобы улучшить естественность и удобство использования сгенерированного языка в MiniGPT-4, исследователи разработали двухстадийный процесс выравнивания, решая проблему отсутствия достаточных баз данных выравнивания языка и зрения. Они создали специальную базу данных для этой цели.

Первоначально модель генерировала подробные описания входных изображений, улучшая детали с помощью разговорного запроса, выровненного с форматом модели языка Vicuna. Эта стадия была направлена на генерирование более полных описаний изображений.

Первоначальный запрос описания изображения:

###Человек: <Изображение><Особенность изображения></Изображение>Опишите это изображение подробно. Дайте как можно больше деталей. Скажите все, что вы видите. ###Помощник:

Для постобработки данных любые несоответствия или ошибки в сгенерированных описаниях были исправлены с помощью ChatGPT, а затем проверены вручную, чтобы обеспечить высокое качество.

Запрос дообучения на второй стадии:

###Человек: <Изображение><Особенность изображения></Изображение><Инструкция>###Помощник:

Это исследование открывает окно в понимание механики мультимодального генеративного ИИ, такого как GPT-4, проливая свет на то, как визуальные и языковые модальности могут быть эффективно интегрированы для генерации связных и контекстно богатых выходных данных.

Изучение GPT-4 Vision

Определение источников изображений с ChatGPT

GPT-4 Vision улучшает способность ChatGPT анализировать изображения и определять их географические источники. Эта функция переводит взаимодействие пользователей из простого текста в сочетание текста и визуальных элементов, становясь полезным инструментом для тех, кто интересуется различными местами через данные изображений.

Chatgpt-vision-GPT-4

Спрашивая ChatGPT, где было сделано изображение достопримечательности

Сложные математические концепции

GPT-4 Vision преуспевает в изучении сложных математических идей, анализируя графические или рукописные выражения. Эта функция служит полезным инструментом для людей, стремящихся решить сложные математические проблемы, отмечая GPT-4 Vision как заметный помощник в образовательных и академических областях.

Chatgpt-vision-GPT-4

Спрашивая ChatGPT понять сложную математическую концепцию

Преобразование рукописного ввода в коды LaTeX

Одной из замечательных способностей GPT-4V является его возможность переводить рукописные входные данные в коды LaTeX. Эта функция является благом для исследователей, академиков и студентов, которые часто нуждаются в преобразовании рукописных математических выражений или другой технической информации в цифровой формат. Преобразование из рукописного в LaTeX расширяет горизонт цифровизации документов и упрощает технический процесс написания.

Способность GPT-4V преобразовывать рукописный ввод в коды LaTeX

Способность GPT-4V преобразовывать рукописный ввод в коды LaTeX

Извлечение деталей таблицы

GPT-4V демонстрирует умение извлекать детали из таблиц и отвечать на связанные запросы, что является важным активом в анализе данных. Пользователи могут использовать GPT-4V для просмотра таблиц, сбора ключевых выводов и решения вопросов, делая его мощным инструментом для аналитиков данных и других специалистов.

GPT-4V понимает детали таблицы и отвечает на связанные вопросы

GPT-4V понимает детали таблицы и отвечает на связанные вопросы

Понимание визуального указания

Уникальная способность GPT-4V понимать визуальное указание добавляет новый измерение к взаимодействию пользователя. Понимая визуальные подсказки, GPT-4V может отвечать на запросы с более высоким контекстным пониманием.

GPT-4V демонстрирует уникальную способность понимать визуальное указание

GPT-4V демонстрирует уникальную способность понимать визуальное указание

Создание простых макетов веб-сайтов с помощью рисунка

Вдохновленный этим твитом, я попытался создать макет для веб-сайта unite.ai.

Хотя результат не совсем соответствовал моему первоначальному видению, вот результат, которого я достиг.

Вывод ChatGPT Vision на основе HTML-интерфейса

Вывод ChatGPT Vision на основе HTML-интерфейса

Ограничения и недостатки GPT-4V(ision)

Для анализа GPT-4V команда Open AI провела качественные и количественные оценки. Качественные оценки включали внутренние тесты и внешние экспертные обзоры, а количественные измеряли отказы модели и точность в различных сценариях, таких как выявление вредоносного контента, демографическое распознавание, проблемы конфиденциальности, геолокация, кибербезопасность и мультимодальные обходы.

Однако модель еще не идеальна.

Статья выделяет ограничения GPT-4V, такие как неверные выводы и отсутствующие текст или символы в изображениях. Она может галлюцинировать или изобретать факты. В частности, она не подходит для выявления опасных веществ на изображениях, часто неправильно определяя их.

В медицинской визуализации GPT-4V может давать несовместимые ответы и не осознает стандартных практик, что может привести к потенциальным неправильным диагнозам.

Ненадежная производительность для медицинских целей.

Ненадежная производительность для медицинских целей (Источник)

Она также не понимает нюансов определенных символов ненависти и может генерировать неуместный контент на основе визуальных входных данных. OpenAI советует не использовать GPT-4V для критических интерпретаций, особенно в медицинских или чувствительных контекстах.

Подводя итоги

Создано с помощью Fast Stable Diffusion XL

Создано с помощью Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl

Приход GPT-4 Vision (GPT-4V) приносит множество интересных возможностей и новых препятствий. Перед его выпуском было приложено много усилий для минимизации рисков, особенно когда речь идет о фотографиях людей. Это впечатляет, как GPT-4V шагнул вперед, показав многообещающие результаты в сложных областях, таких как медицина и наука.

Теперь есть большие вопросы на столе. Например, должны ли эти модели быть способны определять знаменитых людей на фотографиях? Должны ли они угадывать пол, расу или эмоции человека по изображению? И должны ли быть особые настройки, чтобы помочь людям с нарушениями зрения? Эти вопросы открывают банку червей о конфиденциальности, справедливости и том, как ИИ должен вписываться в нашу жизнь, что является тем, о чем каждый должен иметь возможность высказаться.

Я провел последние пять лет, погружаясь в увлекательный мир машинного обучения и глубокого обучения. Моя страсть и экспертиза привели меня к участию в более чем 50 различных проектах программной инженерии, с особым акцентом на ИИ/МО. Мое непрекращающееся любопытство также привело меня к обработке естественного языка, области, которую я с нетерпением жду возможности изучить дальше.