Моделі та платформи ШІ
Розуміння рідких автоенкодерів, GPT-4 та Claude 3: Глибоке технічне дослідження

By
Aayush Mittal Міттал
Введення в автоенкодери

Фото: Michela Massi via Wikimedia Commons,(https://commons.wikimedia.org/wiki/File:Autoencoder_schema.png)
Автоенкодери – це клас нейронних мереж, які мають на меті вивчити ефективні представлення вхідних даних шляхом кодування та подальшої реконструкції. Вони складаються з двох основних частин: кодувальника, який стискає вхідні дані в латентне представлення, та декодувальника, який реконструює оригінальні дані з цього латентного представлення. Мінімізуючи різницю між вхідними та реконструйованими даними, автоенкодери можуть витягувати значущі особливості, які можна використовувати для різних завдань, таких як зниження розмірності, виявлення аномалій та витягування особливостей.
Що роблять автоенкодери?
Автоенкодери вчаться стискати та реконструювати дані через несупервізоване навчання, зосереджуючись на зменшенні похибки реконструкції. Кодувальник відображає вхідні дані на простір нижчої розмірності, захоплюючи основні особливості, тоді як декодувальник намагається реконструювати оригінальний вхід з цього стиснутого представлення. Цей процес аналогічний традиційним методам стиснення даних, але здійснюється за допомогою нейронних мереж.
Кодувальник, E(x), відображає вхідні дані, x, на простір нижчої розмірності, z, захоплюючи основні особливості. Декодувальник, D(z), намагається реконструювати оригінальний вхід з цього стиснутого представлення.
Математично кодувальник та декодувальник можна представити як:
z = E(x)
x̂ = D(z) = D(E(x))
Мета – мінімізувати похибку реконструкції, L(x, x̂), яка вимірює різницю між оригінальним вхідним та реконструйованим виходом. Поширений вибір функції втрат – середня квадратична похибка (MSE):
L(x, x̂) = (1/N) ∑ (xᵢ – x̂ᵢ)²
Автоенкодери мають кілька застосувань:
- Зниження розмірності: Знижуючи розмірність вхідних даних, автоенкодери можуть спрощувати складні набори даних, зберігаючи при цьому важливу інформацію.
- Витягування особливостей: Латентне представлення, вивчене кодувальником, можна використовувати для витягування корисних особливостей для завдань, таких як класифікація зображень.
- Виявлення аномалій: Автоенкодери можна тренувати для реконструкції нормальних закономірностей даних, що робить їх ефективними у виявленні аномалій, які відхиляються від цих закономірностей.
- Генерація зображень: Варіанти автоенкодерів, такі як варіаційні автоенкодери (VAE), можуть генерувати нові зразки даних, подібні до тренувальних даних.
Рідкі автоенкодери: Спеціалізований варіант
Рідкі автоенкодери – це варіант, розроблений для отримання рідких представлень вхідних даних. Вони вводять обмеження рідкості на приховані одиниці під час тренування, заохочуючи мережу активувати тільки невелику кількість нейронів, що допомагає у захопленні високорівневих особливостей.
Як працюють рідкі автоенкодери?
Рідкі автоенкодери працюють подібно до традиційних автоенкодерів, але включають пенальті рідкості у функцію втрат. Це пенальті заохочує більшість прихованих одиниць бути неактивними (тобто мати нульові або близькі до нуля активації), забезпечуючи, щоб тільки невелика підмножина одиниць була активною в будь-який момент часу. Обмеження рідкості можна реалізувати різними способами:
- Пенальті рідкості: Додавання терміну до функції втрат, який штрафує нерідкі активації.
- Регуляризація рідкості: Використання методів регуляризації для заохочення рідких активацій.
- Пропорція рідкості: Встановлення гіперпараметра, який визначає бажаний рівень рідкості в активаціях.
Реалізація обмежень рідкості
Обмеження рідкості можна реалізувати різними способами:
- Пенальті рідкості: Додавання терміну до функції втрат, який штрафує нерідкі активації. Це часто досягається шляхом додавання терміну регуляризації L1 до активацій прихованого шару: Lₛₚₐᵣₛₑ = λ ∑ |hⱼ| де hⱼ – активація j-ї прихованої одиниці, а λ – параметр регуляризації.
- Кульбак-Лейблер розходження: Заохочення рідкості шляхом мінімізації розходження Кульбака-Лейблера між середньою активацією прихованих одиниць та малим цільовим значенням, ρ: Lₖₗ = ∑ (ρ log(ρ / ρ̂ⱼ) + (1-ρ) log((1-ρ) / (1-ρ̂ⱼ))) де ρ̂ⱼ – середня активація j-ї прихованої одиниці за тренувальні дані.
- Пропорція рідкості: Встановлення гіперпараметра, який визначає бажаний рівень рідкості в активаціях. Це можна реалізувати шляхом прямого обмеження активацій під час тренування для підтримання певної пропорції активних нейронів.
Об’єднана функція втрат
Загальна функція втрат для тренування рідкого автоенкодера включає похибку реконструкції та пенальті рідкості: Lₜₒₜₐₗ = L( x, x̂ ) + λ Lₛₚₐᵣₛₑ
За допомогою цих методів рідкі автоенкодери можуть вивчити ефективні та значущі представлення даних, роблячи їх цінними інструментами для різних завдань машинного навчання.
Важливість рідких автоенкодерів
Рідкі автоенкодери особливо цінні за їхню здатність вивчити корисні особливості з неозначених даних, які можна застосовувати до завдань, таких як виявлення аномалій, очищення даних та зниження розмірності. Вони особливо корисні при роботі з високовимірними даними, оскільки можуть вивчити представлення нижчої розмірності, які захоплюють найважливіші аспекти даних. Крім того, рідкі автоенкодери можна використовувати для попереднього тренування глибоких нейронних мереж, забезпечуючи хорошу ініціалізацію ваг та потенційно покращуючи результати на супервізованих завданнях машинного навчання.
Розуміння GPT-4
GPT-4, розроблений компанією OpenAI, – це великомасштабна мова модель, заснована на архітектурі трансформера. Він будується на успіх своїх попередників, GPT-2 та GPT-3, включно більше параметрів та тренувальних даних, що призводить до покращеної продуктивності та можливостей.
Ключові особливості GPT-4
- Масштабованість: GPT-4 має значно більше параметрів, ніж попередні моделі, що дозволяє йому захоплювати більш складні закономірності та нюанси в даних.
- Універсальність: Він може виконувати широкий спектр завдань обробки природної мови (NLP), включаючи генерацію тексту, переклад, підсумовування та відповіді на питання.
- Інтерпретовані закономірності: Дослідники розробили методи для витягування інтерпретованих закономірностей з GPT-4, допомагаючи зрозуміти, як модель генерує відповіді.
Виклики у розумінні великомасштабних мовних моделей
Незважаючи на свої вражаючі можливості, великомасштабні мовні моделі, такі як GPT-4, ставлять значні виклики щодо інтерпретації. Складність цих моделей робить їх важкими для розуміння того, як вони приймають рішення та генерують виходи. Дослідники працюють над розробкою методів для інтерпретації внутрішньої роботи цих моделей, спрямованих на покращення прозорості та довіри.
Інтеграція рідких автоенкодерів з GPT-4
Одним з перспективних підходів до розуміння та інтерпретації великомасштабних мовних моделей є використання рідких автоенкодерів. Тренуючи рідкі автоенкодери на активаціях моделей, таких як GPT-4, дослідники можуть витягувати інтерпретовані особливості, які надають уявлення про поведінку моделі.
Витягування інтерпретованих особливостей
Останні досягнення дозволили масштабувати рідкі автоенкодери для обробки великої кількості особливостей, присутніх у великих моделях, таких як GPT-4. Ці особливості можуть захоплювати різні аспекти поведінки моделі, включаючи:
- Понятнє розуміння: Особливості, які відповідають конкретним поняттям, таким як “правові тексти” або “послідовності ДНК.”
- Закономерності поведінки: Особливості, які впливають на поведінку моделі, такі як “упередженість” або “обман.”
Методологія тренування рідких автоенкодерів
Тренування рідких автоенкодерів включає кілька кроків:
- Нормалізація: Передобробка активацій моделі для забезпечення їхньої одиницевої норми.
- Проектування кодувальника та декодувальника: Будування мереж кодувальника та декодувальника для відображення активацій на рідке латентне представлення та реконструкції оригінальних активацій відповідно.
- Обмеження рідкості: Введення обмеження рідкості у функцію втрат для заохочення рідких активацій.
- Тренування: Тренування автоенкодера за допомогою поєднання похибки реконструкції та пенальті рідкості.
Кейс-стадія: Масштабування рідких автоенкодерів до GPT-4
Дослідники успішно тренували рідкі автоенкодери на активаціях GPT-4, відкривши велику кількість інтерпретованих особливостей. Наприклад, вони ідентифікували особливості, пов’язані з поняттями, такими як “людські недоліки”, “збільшення цін” та “риторичні питання.” Ці особливості надають цінні уявлення про те, як GPT-4 обробляє інформацію та генерує відповіді.
Приклад: Особливість людської недосконалості
Одна з особливостей, витягнутих з GPT-4, пов’язана з поняттям людської недосконалості. Ця особливість активується у контекстах, де текст обговорює людські недоліки або недосконалості. Аналізуючи активації цієї особливості, дослідники можуть глибше зрозуміти, як GPT-4 сприймає та обробляє такі поняття.
Вплив на безпеку та довіру AI
Спроможність витягувати інтерпретовані особливості з великомасштабних мовних моделей має значні наслідки для безпеки та довіри AI. Розуміння внутрішньої роботи цих моделей дозволить ідентифікувати потенційні упередженості, вразливості та області для покращення. Ці знання можна використовувати для розробки безпечніших та більш надійних систем AI.
Дослідження рідких автоенкодерів онлайн
Для тих, хто цікавиться дослідженням особливостей, витягнутих рідкими автоенкодерами, OpenAI надала інтерактивний інструмент, доступний за адресою Рідкий автоенкодер Viewer. Цей інструмент дозволяє користувачам глибоко вивчити деталі особливостей, ідентифікованих у моделях, таких як GPT-4 та GPT-2 SMALL. Переглядач пропонує комплексний інтерфейс для дослідження окремих особливостей, їхніх активацій та контекстів, у яких вони з’являються.
Як використовувати Рідкий автоенкодер Viewer
- Доступ до Переглядача: Перейдіть до Рідкого автоенкодера Viewer.
- Виберіть модель: Виберіть модель, яку ви хочете дослідити (наприклад, GPT-4 або GPT-2 SMALL).
- Дослідіть особливості: Перегляньте список особливостей, витягнутих рідким автоенкодером. Натисніть на окремі особливості, щоб побачити їхні активації та контексти, у яких вони з’являються.
- Аналізуйте активації: Використовуйте інструменти візуалізації для аналізу активацій вибраних особливостей. Розумійте, як ці особливості впливають на поведінку моделі.
- Ідентифікація закономірностей: Шукайте закономірності та уявлення, які розкривають, як модель обробляє інформацію та генерує відповіді.
Розуміння Claude 3: Уявлення та інтерпретації
Claude 3, виробничий модель Anthropic, представляє значний крок у масштабуванні інтерпретації трансформерних мовних моделей. За допомогою застосування рідких автоенкодерів команда інтерпретації Anthropic успішно витягнула високоякісні особливості з Claude 3, які розкривають як абстрактне розуміння моделі, так і потенційні питання безпеки. Тут ми глибоко вивчимо методології, використані та ключові результати досліджень.
Рідкі автоенкодери та їх масштабування
Рідкі автоенкодери (SAE) були вирішальними у розшифровці активацій Claude 3. Загальний підхід полягає у розкладанні активацій моделі на інтерпретовані особливості за допомогою лінійної трансформації, за якою слідує нелінійність ReLU. Цей метод раніше був успішно застосований до менших моделей, і викликом було масштабування його до моделі такого розміру, як Claude 3.
Три різні SAE були треновані на Claude 3, різнячись кількістю особливостей: 1 мільйон, 4 мільйона та 34 мільйона. Незважаючи на обчислювальну інтенсивність, ці SAE змогли пояснити значну частину варіансу моделі, з менше ніж 300 активними особливостями в середньому на токен. Закони масштабування, використані для тренування, забезпечили оптимальну продуктивність у рамках заданого обчислювального бюджету.
Різноманітні та абстрактні особливості
Особливості, витягнуті з Claude 3, охоплюють широкий спектр понятій, включаючи відомих людей, країни, міста та навіть сигнатури коду. Ці особливості є високоабстрактними, часто багатомовними та багатомодальними, і узагальнюються між конкретними та абстрактними посиланнями. Наприклад, деякі особливості активуються як текстом, так і зображеннями, вказуючи на міцне розуміння поняття у різних модальностях.
Особливості, пов’язані з безпекою
Критичним аспектом цього дослідження було ідентифікування особливостей, які можуть бути пов’язані з безпекою. Ці особливості включають ті, що пов’язані з уразливостями безпеки, упередженістю, обманом, сикофантією та небезпечним контентом, таким як біозброї. Хоча існування цих особливостей не означає, що модель сам по собі здійснює шкідливі дії, їхня присутність підкреслює потенційні ризики, які потребують подальшого дослідження.
Методологія та результати
Методологія включала нормалізацію активацій моделі, а потім використання рідкого автоенкодера для розкладання цих активацій на лінійну комбінацію напрямків особливостей. Тренування включало мінімізацію похибки реконструкції та забезпечення рідкості через регуляризацію L1. Ця конфігурація дозволила витягнути особливості, які надають приблизний розклад активацій моделі на інтерпретовані частини.
Результати показали, що особливості не тільки інтерпретовані, але й впливають на поведінку моделі передбачуваним чином. Наприклад, блокування особливості, пов’язаної з мостом Золоті Ворота, змусило модель генерувати текст, пов’язаний з мостом, демонструючи чітку зв’язок між особливістю та виходом моделі.
Оцінка інтерпретованості особливостей
Інтерпретованість особливостей оцінювалася як ручними, так і автоматизованими методами. Специфічність оцінювалася тим, наскільки надійно особливість активувалася у відповідних контекстах, а вплив на поведінку перевірявся шляхом втручання в активації особливостей та спостереження за змінами у виході моделі. Ці експерименти показали, що сильні активації особливостей є високоспецифічними для їхніх призначених понятій та суттєво впливають на поведінку моделі.
Майбутні напрямки та наслідки
Успіх у масштабуванні рідких автоенкодерів до моделі Claude 3 відкриває нові шляхи для розуміння великомасштабних мовних моделей. Це свідчить про те, що подібні методи можна застосовувати до ще більших моделей, потенційно відкриваючи більш складні та абстрактні особливості. Крім того, ідентифікація особливостей, пов’язаних з безпекою, підкреслює важливість подальших досліджень інтерпретації моделей для мінімізації потенційних ризиків.
Висновок
Дослідження у сфері масштабування рідких автоенкодерів до моделей, таких як GPT-4 та Claude 3, підкреслюють потенціал цих методів для революціонізування нашого розуміння складних нейронних мереж. При подальшому розвитку та удосконаленні цих методів знання, здобуте завдяки їм, буде вирішальним для забезпечення безпеки, надійності та довіри систем AI.
Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.
Дізнайтеся більше


Від передбачення до відповідальної дії: проектування неоднозначності в Femtech AI


Управління штучним інтелектом: проблема для більшості, перевага для небагатьох


Як використання штучного інтелекту перевищує рівень грамотності: лідери галузі повинні підвищити рівень


Проблема обману: чому розширені моделі штучного інтелекту вчаться ховати свої справжні цілі


AI-Перший означає Безпека-Перша


Вирівнювання багатокомпонентних систем: Нова межа безпеки штучного інтелекту


