Основи ШІ

Що таке трансформерні нейронні мережі?

mm
Додайте Unite.AI до бажаних джерел у Google

Трансформер — це архітектура нейронної мережі, яка обробляє взаємозв’язки між токенами за допомогою уваги. На відміну від рекурентної мережі, якій потрібно передавати прихований стан від однієї позиції до іншої, трансформер може одночасно обчислювати багато взаємодій токен‑до‑токен під час навчання.

Трансформери живлять багато систем у галузях мови, зору, аудіо та мультимодальності, проте архітектура не є базою даних і не гарантує логічного мислення. Її виходи залишаються передбаченнями, що залежать від навчених параметрів, наданого контексту та процедури декодування.

Ключові висновки

  • Само‑увага дозволяє кожному токену створювати контекстно‑залежне представлення з інших дозволених токенів.
  • Інформація про позицію додається, оскільки лише увага не кодує порядок токенів.
  • Трансформери лише‑енкодер, лише‑декодер та енкодер‑декодер слугують різним цілям.
  • Довжина контексту, обчислення, навчальні дані та оцінка — а не лише увага — формують можливості та надійність.
What Are Transformer Neural Networks? diagram showing tokens, embed + position, self-attention, feed-forward, stack blocks, output
Увага створює контекстуальні представлення; маски та цілі визначають, яка інформація доступна.

Токени, вбудовування та позиція

Текст спочатку розбивається на токени, якими можуть бути слова, субслова або символи. Кожен ідентифікатор токена вибирає навчений вектор вбудовування. Візуальний трансформер може вбудовувати патчі зображення; аудіо‑трансформер — кадри або навчені акустичні одиниці.

Оскільки базова операція уваги є перестановочно‑еквівалентною, моделі потрібна інформація про позицію. Реалізації можуть додавати навчені або фіксовані позиційні кодування, або змінювати оцінки уваги за допомогою відносних чи ротаційних схем позиціонування. Результат поєднує те, що таке токен, і де він розташований.

Масштабований скалярний добуток та багатоголова увага

Для кожної позиції навчені проекції створюють запит, ключ і значення. Подібність між запитом і дозволеними ключами генерує ваги уваги; їх зважені значення формують вихід. Масштабування скалярного добутку допомагає зберігати чисельну стабільність softmax при збільшенні розмірності вектору.

Багатоголова увага повторює цю операцію у кількох навчених підпросторах. Різні голови можуть спеціалізуватися на різних взаємозв’язках, хоча візуально привабливий шаблон уваги не слід автоматично сприймати як достовірне пояснення рішення моделі.

Блок трансформера

Субшар уваги супроводжується позиційно‑залежною мережею прямого проходу. Резидуальні зв’язки передають попередні представлення навколо кожного субшару, а нормалізація та регуляризація підтримують оптимізацію. Стекування багатьох блоків створює все більш контекстуальні ознаки за допомогою глибокого навчання.

Під час причинної генерації маска запобігає читанню майбутніх токенів. Під час інференсу декодер передбачає один токен, додає його та повторює процес. Кеш ключ‑значення дозволяє уникнути повторного обчислення всіх попередніх проекцій уваги, зменшуючи, але не усуваючи, витрати на генерацію.

Сімейства енкодер, декодер та енкодер‑декодер

Моделі лише‑енкодер навчаються двостороннім представленням, придатним для класифікації, пошуку та маркування токенів. Моделі лише‑декодер використовують причинну увагу для генерації наступного токену. Моделі енкодер‑декодер дозволяють декодеру звертатися до закодованого вводу, що корисно для перекладу та інших задач послідовність‑у‑послідовність.

Сучасні системи часто починаються з широкого передтренування, а потім використовують переносне навчання, налаштування за інструкціями або оптимізацію за уподобаннями. Тому одна й та сама архітектура може підтримувати дуже різну поведінку залежно від цілі та даних.

Обмеження, ефективність та оцінка

Повна увага над послідовністю має квадратичну кількість парних взаємодій за довжиною послідовності, що створює навантаження на пам’ять та обчислення. Рідкісна або лінійна увага, розбиття на блоки, пошук, квантування та кешування компромісують між точністю, доступом до контексту, затримкою та складністю реалізації.

Більше вікно контексту не гарантує, що кожен наданий факт буде використаний правильно. Оцінюйте фактичність, стійкість, калібрування, затримку, вартість та специфічні для задачі режими відмов. Для інтерактивних систем промпт‑інженерія може формувати поведінку, проте вона не може перетворити ймовірнісну модель у безпомилкове джерело.

Обчислення трансформера від токенів до контексту

Трансформер перетворює токени у вектори, додає позиційну інформацію та пропускає їх через повторювані блоки уваги та прямого проходу. У само‑увазі навчені проекції створюють запити, ключі та значення. Масштабовані скалярні добутки порівнюють кожен запит з ключами, softmax генерує ваги, а зважені значення формують контекст. Кілька голів навчаються різним просторам проекцій. Резидуальні зв’язки та нормалізація стабілізують глибокі стеки, тоді як мережа прямого проходу трансформує кожен токен незалежно між шарами уваги.

Моделі лише‑енкодер використовують двосторонній контекст і підходять для задач класифікації або представлення. Моделі лише‑декодер застосовують причинну маску, тому кожна позиція передбачає на основі попередніх токенів і домінують у генеративному мовному моделюванні. Моделі енкодер‑декодер дозволяють декодеру звертатися до закодованого вводу для перекладу та структурованої генерації. Вартість уваги зростає квадратично зі збільшенням довжини послідовності у стандартній формі, що спонукає до використання рідкісних, лінійних, розбитих, рекурентних та просторових альтернатив. Довший контекст збільшує доступну доказову базу, а не гарантує правильне відтворення чи міркування.

Навчання, адаптація та інференс

Цілі передтренування включають передбачення наступного токену, відновлення замаскованих токенів та спотворення послідовність‑у‑послідовність. Суміш даних, дедуплікація, токенізатор, упакування контексту, оптимізатор, графік та обчислювальні ресурси формують можливості. Тонке налаштування може оновлювати всі параметри або використовувати адаптери та методи низького рангу; інструкційне та уподобальне налаштування змінює поведінку. Пошук часто кращий для оновлення фактів, тоді як налаштування корисне для формату та поведінки задачі. Зберігайте незмінний набір оцінки та перевіряйте на забруднення від публічних бенчмарків.

Авторегресивний інференс зберігає проекції ключ‑значення для попередніх токенів, щоб уникнути повторних обчислень. Затримка залежить від обробки промпту та послідовного декодування; пропускна здатність залежить від батчування, пам’яті, управління кешем, точності та обладнання. Жадібний, температурний, top‑k, top‑p та beam‑методи компромісують між детермінізмом і різноманітністю. Квантування зменшує пам’ять, але може впливати на рідкісні можливості. Перевірте точну розгорнуту модель, токенізатор, шаблон промпту, семплер та середовище виконання на реалістичних довжинах послідовності.

Оцінка та контроль

Трансформери можуть галюцинировать, слідувати шкідливим отриманим інструкціям, розкривати запам’ятовані дані або погіршуватися в різних мовах та довгих контекстах. Оцінюйте успішність задачі, фактичну підтримку, калібрування, відмову, стійкість, безпеку, затримку та вартість; окремо аналізуйте докази та дії інструментів. Використовуйте пошук, що враховує дозволи, типізовані інструменти, зовнішню авторизацію, обмеження швидкості та людське схвалення для важливих дій. Слідкуйте за версіями моделі та промпту, розподілом вводу, помилками інструментів та виправленнями користувачів. Трансформер — це архітектура для обчислення послідовностей, а не доказ розуміння чи гарантія правдивого виходу.

Практичний приклад: трансформер‑асистент документів

Компанія індексує затверджені інструкції за ідентифікатором документа, версією, розділом, дозволами та датою набрання чинності. Асистент на базі трансформера здійснює пошук та переранжування доказів, а потім відповідає лише з дозволених фрагментів з посиланнями. Набір оцінки включає питання, на які можна відповісти, не можна відповісти, неоднозначні та суперечливі питання для різних ролей та типів документів. Показники: відновлення пошуку, точність посилань, правильність обґрунтованих відповідей, відмова, поведінка при довгому контексті, затримка та вартість оцінюються окремо.

Отримані документи розглядаються як ненадійні дані, тому вбудовані інструкції не можуть перевищити політику системи або уповноважити інструменти. Користувачі автентифікуються перед пошуком, а наслідкові дії залишаються поза моделлю. Журнали зберігають ідентифікатори доказів та їх версії без зайвого вмісту документів. Моніторинг виявляє зміни корпусу, непідтримувані відповіді, помилки дозволів та виправлення користувачів. Зміна моделі чи токенізатора повторно тестується на повному наборі тестів, а попередня конфігурація залишається доступною, доки нова система не продемонструє рівну або кращу безпеку та якість.

Докази впровадження та готовність до експлуатації

Рішення про впровадження потребує більше, ніж успішна демонстрація. Визначте цільових користувачів, робоче середовище, вхідні та вихідні дані, залежності, власника та наслідки кожної важливої відмови. Встановіть відтворювану базову лінію та версіонований набір оцінки перед налаштуванням. Тестуйте звичайні випадки, граничні умови, некоректний або відсутній ввід, зсув розподілу, відсутність залежностей, зловживання та групи чи середовища, які найчастіше залишаються без підтримки. Вимірюйте якість задачі разом з калібруванням або невизначеністю, затримкою, пропускною здатністю, витратами ресурсів, доступністю, конфіденційністю та безпекою. Фіксуйте кожне перетворення та поріг, щоб незалежний рецензент міг відтворити результат і розрізнити докази від привабливого прототипу.

Перед запуском призначте відповідальність за випуск, винятки, зміни, відкат та виведення з експлуатації. Використовуйте поетапний розгортання, зберігайте безпечний резерв та перевіряйте моніторинг за допомогою навмисно введених збоїв. Операційна телеметрія повинна виявляти якість вводу, поведінку виходу, версію моделі чи правила, стан залежностей, людські втручання та підтверджені результати без збору зайвих конфіденційних даних. Визначте пороги сповіщень та відповідального за реакцію, а потім перегляньте реальні докази після розгортання, а не припускайте, що офлайн‑продуктивність залишиться. Переоцінюйте щоразу, коли змінюються джерела даних, користувачі, моделі, постачальники, політики, обладнання чи цілі. Підтримувана система також потребує задокументованих процедур відновлення, навчання на інцидентах, видалення та зберігання, а також чіткого моменту, коли її слід вимкнути або замінити.

Часті запитання

Чи є кожна велика мовна модель трансформером?

Більшість сучасних великих мовних моделей використовують варіанти трансформера, проте мовні моделі можна будувати з використанням рекурентних, просторових станів або гібридних архітектур.

Чи означає само‑увага, що модель розуміє текст, як людина?

Ні. Увага — це навчений механізм зважування. Людське мовне поводження саме по собі не встановлює людське розуміння, правдивість чи намір.

Основні джерела

Блогер і програміст з спеціалізацією у темах Machine Learning і Deep Learning. Даніель сподівається допомогти іншим використовувати силу штучного інтелекту для соціальної добробути.