Моделі та платформи ШІ
Генеративний AI: Ідея за CHATGPT, Dall-E, Midjourney та ін.
Світ мистецтва, спілкування та сприйняття реальності швидко трансформується. Якщо ми оглянемося назад на історію людських інновацій, ми можемо вважати винахід колеса або відкриття електрики монументальними стрибками. Сьогодні відбувається нова революція – містить розрив між людською творчістю та обчислювальною технікою. Це Генеративний AI.
Генеративні моделі стерли межу між людьми та машинами. З появою моделей типу GPT-4, які використовують трансформерні модулі, ми зробили крок ближче до природної та контекстно-багатої генерації мови. Ці досягнення сприяли застосуванню в створенні документів, діалогових систем чат-ботів та навіть синтезі музики.
Нещодавні рішення великих технологічних компаній підкреслюють його значення. Microsoft (MSFT ) вже закриває свій додаток Cortana цього місяця, щоб пріоритизувати нові інновації Генеративного AI, такі як Bing Chat. Apple (AAPL ) також виділила значну частку свого $22,6 млрд бюджету досліджень та розробок на Генеративний AI, як зазначив генеральний директор Тім Кук.
Нова Ера Моделей: Генеративні Відмінності
Історія Генеративного AI не тільки про його застосування, але й про його внутрішню роботу. У екосистемі штучного інтелекту існують два типи моделей: дискримінативні та генеративні.
Дискримінативні моделі – це те, з чим більшість людей стикається в повсякденному житті. Ці алгоритми приймають вхідні дані, такі як текст або зображення, та поєднують їх з цільовим виходом, таким як переклад слова або медичний діагноз. Вони займаються відображенням та передбаченням.
Генеративні моделі, з іншого боку, – це творці. Вони не тільки інтерпретують або передбачають, а й генерують нові, складні виходи з векторів чисел, які часто не пов’язані з реальними значеннями.
Технології За Генеративними Моделями
Генеративні моделі зобов’язані своєю появою глибоким нейронним мережам, складним структурам, розробленим для імітації функціональності людського мозку. Захоплюючи та обробляючи багатоманітні варіації даних, ці мережі служать основою численних генеративних моделей.
Як ці генеративні моделі стають живими? Зазвичай вони будуються з глибокими нейронними мережами, оптимізованими для захоплення багатоманітних варіацій даних. Прикладом цього є Генеративна Адверсарна Мережа (GAN), де дві нейронні мережі, генератор та дискримінатор, змагаються та вчаться одна в одній у унікальних вчителі-учень відносинах. Від картин до стилістичної трансформації, від музичної композиції до гри, ці моделі розвиваються та розширюються способами, раніше неможливими.
Це не зупиняється на GAN. Варіаційні Автоенкодери (VAE), – це ще один ключовий гравець у сфері генеративних моделей. VAE виділяються своєю здатністю створювати фотореалістичні зображення з випадкових чисел. Як? Обробляючи ці числа через латентний вектор, народжується мистецтво, яке віддзеркалює складності людської естетики.
Типи Генеративного AI: Текст у Текст, Текст у Зображення
Трансформери та LLM
Стаття “Увага – це все, що тобі потрібно” від Google (GOOGL ) Brain позначила зміну у方式 думання про текстову модель. Замість складних та послідовних архітектур, таких як Рекурентні Нейронні Мережі (RNN) або Конволюційні Нейронні Мережі (CNN), модель Трансформера ввела концепцію уваги, яка суттєво означала фокусування на різних частинах вхідного тексту залежно від контексту. Одним з основних переваг цього було полегшення паралелізму. На відміну від RNN, які обробляють текст послідовно, роблячи їх важчими для масштабування, Трансформери можуть обробляти частини тексту одночасно, роблячи навчання швидшим та ефективнішим на великих наборах даних.
У довгому тексті не кожне слово чи речення, яке ви читаєте, має однакову важливість. Деякі частини вимагають більше уваги залежно від контексту. Ця здатність зміщувати наш фокус залежно від актуальності – це те, що механізм уваги імітує.
Щоб зрозуміти це, подумайте про речення: “Unite AI публікує новини про AI та робототехніку.” Тепер передбачення наступного слова вимагає розуміння того, що найважливіше в попередньому контексті. Термін ‘робототехніка’ може вказувати на те, що наступне слово може бути пов’язане з певним прогресом або подією в галузі робототехніки, тоді як ‘публікує’ може вказувати на те, що наступний контекст може бути пов’язаний з недавньою публікацією або статтею.
Механізми уваги в Трансформерах розроблені для досягнення цього селективного фокусу. Вони оцінюють важливість різних частин вхідного тексту та вирішують, де “дивитися”, коли генерують відповідь. Це відхід від старих архітектур, таких як RNN, які намагалися стиснути суть всього вхідного тексту в один “стан” або “пам’ять”.
Робота уваги можна порівняти з системою ключ-значення. При спробі передбачити наступне слово в реченні кожне попереднє слово пропонує “ключ”, який вказує на його потенційну актуальність, і залежно від того, як добре ці ключі збігаються з поточним контекстом (або запитом), вони дають “значення” або вагу передбаченню.
Ці передові моделі глибокого навчання безперебійно інтегруються в різні застосування, від покращення пошукової системи Google з BERT до GitHub’s Copilot, який використовує можливості Великих Моделей Мови (LLM), щоб перетворити прості кодові фрагменти в повністю функціональні джерельні коди.
Великі Моделі Мови (LLM), такі як GPT-4, Bard та LLaMA, – це колосальні конструкції, розроблені для розшифровки та генерації людської мови, коду та іншого. Їх величезний розмір, який варіюється від мільярдів до трильйонів параметрів, – це одна з визначальних ознак. Ці LLM навчаються на величезних кількостях текстових даних, що дозволяє їм зрозуміти тонкощі людської мови. Вражаючою особливістю цих моделей є їхня здатність до “few-shot” навчання. На відміну від традиційних моделей, які потребують великих кількостей конкретних навчальних даних, LLM можуть узагальнювати з дуже обмеженої кількості прикладів (або “стріл”).
Стан Великих Моделей Мови (LLM) на серпень 2023
| Назва Моделі | Розробник | Параметри | Доступність та Доступ | Видатні Особливості та Примітки |
| GPT-4 | OpenAI | 1,5 Трильйона | Не Відкритий Джерел, Доступ тільки через API | Вражаючі результати на різних завданнях, може обробляти зображення та текст, максимальна довжина вхідного тексту – 32 768 токенів |
| GPT-3 | OpenAI | 175 Мільярдів | Не Відкритий Джерел, Доступ тільки через API | Демонструє можливості few-shot та zero-shot навчання. Виконує текстове доповнення в природній мові. |
| BLOOM | BigScience | 176 Мільярдів | Модель можна завантажити, доступна через API | Багатомовна LLM, розроблена глобальною співпрацею. Підтримує 13 мов програмування. |
| LaMDA | 173 Мільярди | Не Відкритий Джерел, немає API чи можливості завантаження | Навчена на діалогах, може навчиться говорити практично про все. | |
| MT-NLG | Nvidia /Microsoft | 530 Мільярдів | Доступ через API після подачі заявки | Використовує архітектуру Megatron на основі трансформерів для різних завдань NLP. |
| LLaMA | Meta AI | 7Б-65Б) | Модель можна завантажити після подачі заявки | Призначена для демократизації AI, пропонуючи доступ тим, хто займається дослідженнями, державними установами та академічними закладами. |
Як Використовуються LLM?
LLM можна використовувати різними способами, включаючи:
- Прямий Використання: Просто використання попередньо натренованої LLM для генерації тексту або обробки. Наприклад, використання GPT-4 для написання статті без додаткової настройки.
- Настройка: Адаптація попередньо натренованої LLM для конкретного завдання, метод відомий як перехресне навчання. Наприклад, налаштування T5 для генерації підсумків документів у певній галузі.
- Пошук Інформації: Використання LLM, таких як BERT або GPT, як частини більших архітектур для розробки систем, які можуть пошукати та категоризувати інформацію.
Багатокомпонентна Увага: Чому Одного, Коли Можна Мати Багато?
Однак, покладання на один механізм уваги може бути обмежувальним. Різні слова або послідовності в тексті можуть мати різні типи актуальності або асоціацій. Саме тут вступає в дію багатокомпонентна увага. Замість одного набору ваг уваги, багатокомпонентна увага використовує кілька наборів, що дозволяє моделі захопити більш багату різноманітність відносин у вхідному тексті. Кожна “головка” уваги може фокусуватися на різних частинах або аспектах вхідного тексту, і їхнє спільне знання використовується для остаточного передбачення.
ChatGPT: Найпопулярніший Інструмент Генеративного AI
Починаючи з появи GPT у 2018 році, модель була побудована на основі 12 шарів, 12 голів уваги та 120 мільйонів параметрів, в основному навчених на наборі даних BookCorpus. Це був вражаючий старт, який дав змогу побачити майбутнє мовних моделей.
GPT-2, представлений у 2019 році, мав чотирикратне збільшення кількості шарів та голів уваги. Значно, його кількість параметрів стрімко зросла до 1,5 мільярдів. Ця покращена версія була навчена на наборі даних WebText, який містив 40 ГБ тексту з різних лінків Reddit.
GPT-3, запущений у травні 2020 року, мав 96 шарів, 96 голів уваги та величезну кількість параметрів – 175 мільярдів. Що відрізняло GPT-3, так це його різноманітний навчальний набір даних, який включав CommonCrawl, WebText, англійську Вікіпедію, корпуси книг та інші джерела, загалом складаючись з 570 ГБ.
Деталі роботи ChatGPT залишаються суворо охоронюваною таємницею. Однак процес, відомий як “залізна навчальна селекція з людською обратною зв’язкою” (RLHF), відомий як ключовий у вдосконаленні моделі GPT-3.5 для виконання написаних інструкцій.
Навчання ChatGPT складається з трирівневого підходу:
- Фінішна настройка під наглядом: Це включає в себе підготовку людських розмовних вхідних та вихідних даних для уточнення базової моделі GPT-3.5.
- Моделювання винагороди: Люди ранжують різні виходи моделі за якістю, допомагаючи тренувати модель винагороди, яка оцінює кожен вихід, враховуючи контекст розмови.
- Залізна навчальна селекція: Розмовний контекст служить фоном, де базова модель пропонує відповідь. Ця відповідь оцінюється моделлю винагороди, і процес оптимізується за допомогою алгоритму, відомого як проксимальна політика оптимізації (PPO).
Для тих, хто тільки починає працювати з ChatGPT, повний посібник можна знайти тут. Якщо ви хочете глибше зануритися в інженерію промптів з ChatGPT, у нас також є розширений посібник, який висвітлює останні та найкращі техніки промптів, доступний на ‘ChatGPT та Розширена Інженерія Промптів: Провокуючи Еволюцію AI‘.
Дифузійні та Мультимодальні Моделі
Хоча моделі типу VAE та GAN генерують свої виходи за допомогою одного проходу, тобто вони “замкнені” на те, що вони виробляють, дифузійні моделі ввели концепцію “ітеративного уточнення“. Через цей метод вони повертаються, уточнюючи помилки з попередніх кроків, і поступово виробляють більш поліпшений результат.
Центральним для дифузійних моделей є мистецтво “корупції” та “уточнення”. На етапі навчання типове зображення поступово корумпується шляхом додавання різних рівнів шуму. Цей шумовий варіант подається моделі, яка намагається “деноїзити” або “декорумпувати” його. Через багаторазові повторення цього процесу модель стає майстром у відновленні, розуміючи як тонкі, так і суттєві відхилення.
Процес генерації нових зображень після навчання інтригуючий. Починаючи з випадково згенерованого вхідного сигналу, він безперервно уточнюється за допомогою передбачень моделі. Метою є досягнення ідеального зображення за мінімальної кількості кроків. Контроль рівня корупції здійснюється за допомогою “графіка шуму”, механізму, який керує тим, скільки шуму застосовується на різних етапах. Планувальник, як можна побачити в бібліотеках типу “diffusers“, диктує характер цих шумових версій на основі встановлених алгоритмів.
Архітектурною основою для багатьох дифузійних моделей є U-Net – це конволюційна нейронна мережа, призначена для завдань, які вимагають виходів, що віддзеркалюють просторові розміри вхідних даних. Це поєднання шарів знизування та підвищення роздільної здатності, які складно пов’язані для збереження даних високої роздільної здатності, що є важливим для виходів, пов’язаних із зображеннями.
Глибше в царині генеративних моделей виділяється DALL-E 2 від OpenAI як яскравий приклад об’єднання текстових та візуальних можливостей AI. Він використовує трирівневу структуру:
DALL-E 2 демонструє трирівневу архітектуру:
- Текстовий Кодувальник: Він перетворює текстовий промпт у концептуальне вкладення в латентному просторі. Ця модель не починається з нуля. Вона спирається на набір даних OpenAI Contrastive Language–Image Pre-training (CLIP) як свою основу. CLIP служить мостом між візуальними та текстовими даними, вивчаючи візуальні концепції за допомогою природної мови. Через механізм контрастного навчання він ідентифікує та поєднує зображення з відповідними текстовими описами.
- Приорітет: Вкладення тексту, отримане з кодувальника, потім перетворюється в зображеннєве вкладення. DALL-E 2 протестував як автoregresивні, так і дифузійні методи для цього завдання, з останнім, демонструючи кращі результати. Авторегресивні моделі, як можна побачити в Трансформерах та PixelCNN, генерують виходи послідовно. З іншого боку, дифузійні моделі, як та, що використовується в DALL-E 2, перетворюють випадковий шум у передбачувані зображеннєві вкладення за допомогою текстових вкладень.
- Декодувальник: Кульмінація процесу, цей етап генерує остаточний візуальний вихід на основі текстового промпту та зображеннєвого вкладення з попередньої фази. Декодувальник DALL-E 2 зобов’язаний своєю архітектурою іншій моделі, GLIDE, яка також здатна виробляти реалістичні зображення з текстових підказок.
Користувачі Python, які цікавляться Langchain, повинні ознайомитися з нашим детальним посібником, який охоплює все – від основ до просунутих технік.
Застосування Генеративного AI
Текстові Домени
Починаючи з тексту, Генеративний AI суттєво змінився завдяки чат-ботам типу ChatGPT. Спираючись на обробку природної мови (NLP) та великі мовні моделі (LLM), ці сутності здатні виконувати завдання, починаючи від генерації коду та перекладу мови до підсумків та аналізу настрою. ChatGPT, наприклад, став широко прийнятим, ставши основою для мільйонів. Це ще більше посилюється платформами конверсаційного AI, які базуються на LLM, таких як GPT-4, PaLM та BLOOM, які легко генерують текст, допомагають у програмуванні та навіть пропонують математичне обґрунтування.
З комерційної точки зору, ці моделі стають невід’ємними. Бізнес використовує їх для різноманітних операцій, включаючи управління ризиками, оптимізацію запасів та прогнозування попиту. Наприклад, Bing AI, Google’s BARD та ChatGPT API.
Мистецтво
Світ зображень зазнав драматичних трансформацій завдяки Генеративному AI, особливо після появи DALL-E 2 у 2022 році. Ця технологія, яка може генерувати зображення з текстових промптів, має як художнє, так і професійне значення. Наприклад, midjourney використала цю технологію для створення вражаючно реалістичних зображень. Остання публікація роз’яснює midjourney у детальному посібнику, висвітлюючи як саму платформу, так і тонкощі інженерії промптів. Крім того, платформи типу Alpaca AI та Photoroom AI використовують Генеративний AI для просунутих функцій редагування зображень, таких як видалення фону, видалення об’єктів та навіть відновлення обличчя.
Виробництво Відео
Виробництво відео, хоча ще в зародковому стані в царині Генеративного AI, демонструє перспективні досягнення. Платформи типу Imagen Video, Meta Make A Video та Runway Gen-2 розширюють межі того, що можливо, хоча真正о реалістичні виходи ще на горизонті. Ці моделі пропонують суттєву користь для створення цифрових відео з людьми, з застосуваннями типу Synthesia та SuperCreator на чолі. Значно, Tavus AI пропонує унікальну пропозицію, персоналізуючи відео для окремих членів аудиторії, що є благом для бізнесу.
Створення Кодів
Кодування, невід’ємна частина нашого цифрового світу, не залишилося поза впливом Генеративного AI. Хоча ChatGPT є улюбленим інструментом, кілька інших застосунків AI були розроблені для цілей програмування. Ці платформи, такі як GitHub Copilot, Alphacode та CodeComplete, служать помічниками з кодування та можуть навіть генерувати код з текстових промптів. Що цікаво, так це їхня адаптивність. Codex, який стоїть за GitHub Copilot, може бути налаштований на індивідуальний стиль програмування, підкреслюючи потенціал персоналізації Генеративного AI.
Висновок
Об’єднуючи людську творчість з обчислювальною технікою, Генеративний AI еволюціонував у невід’ємний інструмент, з платформами типу ChatGPT та DALL-E 2, які розширюють межі того, що можливо. Від створення текстового контенту до створення візуальних шедеврів, їхнє застосування різноманітне та широке.
Як і з будь-якою технологією, етичні наслідки мають першорядне значення. Хоча Генеративний AI обіцяє безмежну творчість, важливо використовувати його відповідально, бути обізнаним про потенційні упередження та силу маніпуляції даними.
З появою інструментів типу ChatGPT现在 є ідеальний час, щоб почати досліджувати та експериментувати. Чи ви художник, програміст чи ентузіаст технологій, царина Генеративного AI багата можливостями, які чекають на своє відкриття. Революція не на горизонті; вона тут і зараз. Тому, Погрузіть у неї!


















