Моделі та платформи ШІ

Розробка багатомодальної штучної інтелектуальної системи: GPT-4 Vision

mm
Додайте Unite.AI до бажаних джерел у Google

У рамках зусиль щодо створення штучної інтелектуальної системи, подібної до людської, моделі GPT від OpenAI постійно розширюють межі можливостей. GPT-4 тепер здатний приймати проміжні дані у вигляді тексту та зображень.

Багатомодальність у генеративній штучній інтелектуці позначає здатність моделі генерувати різноманітні виходи, такі як текст, зображення чи аудіо, на основі вхідних даних. Ці моделі, треновані на певних даних, вивчають основні закономірності для генерації подібних нових даних, збагачуючи застосування штучної інтелектуальної системи.

Останні досягнення у багатомодальній штучній інтелектуці

Одним із останніх помітних стрибків у цій галузі є інтеграція DALL-E 3 до ChatGPT, суттєве оновлення технології генерації зображень від тексту в OpenAI. Це поєднання дозволяє більш плавну взаємодію, при якій ChatGPT допомагає у створенні точних проміжних даних для DALL-E 3, перетворюючи ідеї користувачів на яскраве штучно згенероване мистецтво. Отже, хоча користувачі можуть безпосередньо взаємодіяти з DALL-E 3, наявність ChatGPT полегшує процес створення штучного мистецтва.

Детальніше про DALL-E 3 та її інтеграцію з ChatGPT можна дізнатися тут. Ця співпраця не тільки демонструє розвиток багатомодальної штучної інтелектуальної системи, але й робить створення штучного мистецтва простішим для користувачів.

GPT-4 Vision Mechanics

Вражаючі візуально-мовні можливості GPT-4, хоча й вражаючі, мають основні методи, які залишаються на поверхні.

Для вивчення цієї гіпотези було представлено нову візуально-мовну модель MiniGPT-4, яка використовує просунуту великомасштабну мовну модель Vicuna. Ця модель використовує візуальний кодувальник з попередньо тренованими компонентами для візуального сприйняття, вирівнюючи закодовані візуальні ознаки з мовною моделлю Vicuna через один проєкційний шар. Архітектура MiniGPT-4 проста, але ефективна, з фокусом на вирівнюванні візуальних та мовних ознак для покращення візуальної розмовної здатності.

Дослідження GPT-4 Vision

Визначення походження зображень за допомогою ChatGPT

GPT-4 Vision підвищує здатність ChatGPT аналізувати зображення та визначати їх географічне походження. Ця функція переводить взаємодію користувачів від чистого тексту до поєднання тексту та візуальних елементів, ставши корисним інструментом для тих, хто цікавиться різними місцями через дані зображень.

Складні математичні концепції

GPT-4 Vision excels у вивченні складних математичних ідей шляхом аналізу графічних або рукописних виразів. Ця функція слугує корисним інструментом для осіб, які шукають рішення складних математичних проблем, роблячи GPT-4 Vision помітним допоміжним засобом у освітніх та академічних галузях.

Перетворення рукописного введення у формат LaTeX

Однією з вражаючих можливостей GPT-4V є її здатність перекладати рукописні введення у формат LaTeX. Ця функція є благом для дослідників, вчених та студентів, які часто потребують перекладу рукописних математичних виразів або іншої технічної інформації у цифровий формат. Перетворення з рукописного у формат LaTeX розширює горизонти документації та спрощує технічне письмо.

Вилучення деталей таблиць

GPT-4V демонструє свою здатність вилучати деталі з таблиць та відповідати на пов’язані питання, що є важливим активом у даних аналізах. Користувачі можуть використовувати GPT-4V для сифонування таблиць, збору ключових висновків та вирішення питань, роблячи його потужним інструментом для аналітиків даних та інших фахівців.

Понимание візуальної вказівки

Унікальна здатність GPT-4V до розуміння візуальної вказівки додає новий вимір взаємодії з користувачем. Розуміючи візуальні підказки, GPT-4V може відповідати на запитання з вищим контекстним розумінням.

Створення простих макетів веб-сайтів за допомогою малюнків

Через цю повідомлення у Твіттері, я спробував створити макет для веб-сайту unite.ai.

Хоча результат не зовсім збігся з моїми початковими очікуваннями, ось те, що я досяг.

Обмеження та недоліки GPT-4V(ision)

Для аналізу GPT-4V команда Open AI провела якісні та кількісні оцінки. Якісні оцінки включали внутрішні тести та зовнішні експертні огляди, тоді як кількісні оцінки вимірювали відмови моделі та точність у різних сценаріях, таких як ідентифікація шкідливого вмісту, демографічне визнання, проблеми конфіденційності, геолокація, кібербезпека та багатомодальна утечка.

Модель ще не досконала.

У медичній візуалізації GPT-4V може надавати несумісні відповіді та не володіє знанням стандартних практик, що може привести до потенційних неправильних діагнозів.

Підсумок

Приходження GPT-4 Vision (GPT-4V) приносить багато нових можливостей та нових перешкод. Перед тим, як випустити цю технологію, було зроблено багато зусиль, щоб зменшити ризики, особливо щодо зображень людей.

Тепер є великі питання на порядку денному. Наприклад, повинні ці моделі能够 ідентифікувати відомих осіб на фотографіях? повинні вони визначати стать, расу чи емоції людини на основі зображення? І чи повинні бути особливі налаштування, щоб допомогти людям з порушеннями зору? Ці питання відкривають банку черв’яків щодо конфіденційності, справедливості та того, як штучна інтелектова система повинна входити до нашого життя, у чому кожен повинен мати слово.

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.