AGI та майбутній ШІ

Еволюційний ландшафт генерації штучного інтелекту: огляд суміші експертів, мультимодальності та пошуку штучного загального інтелекту

mm
Додайте Unite.AI до бажаних джерел у Google

Область штучного інтелекту (ШІ) пережила значний розвиток у 2023 році. Генеративний ШІ, який зосереджується на створенні реалістичних контентів, таких як зображення, аудіо, відео та текст, був на передньому краї цих досягнень. Моделі, такі як DALL-E 3, Stable Diffusion та ChatGPT, продемонстрували нові творчі можливості, але також викликали занепокоєння щодо етики, упередженості та неправильного використання.

Поки генеративний ШІ продовжує розвиватися швидкими темпами, суміші експертів (MoE), мультимодальне навчання та прагнення до штучного загального інтелекту (ШЗІ) виглядають як майбутні напрямки досліджень та застосувань. Ця стаття надає комплексний огляд поточного стану та майбутньої траєкторії генеративного ШІ, аналізуючи, як інновації, такі як Google’s Gemini та очікувані проекти, такі як OpenAI’s Q*, трансформують ландшафт. Вона буде вивчати реальні наслідки в галузі охорони здоров’я, фінансів, освіти та інших галузей, а також висвітлювати нові виклики щодо якості досліджень та відповідності ШІ цінностям людини.

Випуск ChatGPT у кінці 2022 року викликав нове збудження та занепокоєння щодо ШІ, від його вражаючих можливостей обробки природної мови до потенціалу поширення дезінформації. Тим часом, нова модель Google’s Gemini демонструє суттєве покращення конверсаційної здатності порівняно з попередниками, такими як LaMDA, завдяки вдосконаленням, таким як спайк-і-слаб-увага. Проекти, такі як OpenAI’s Q*, намагаються поєднати конверсаційний ШІ з підкріпленням навчання.

Ці інновації свідчать про зміщення пріоритетів у бік мультимодальних, універсальних генеративних моделей. Конкуренція між компаніями, такими як Google, Meta, Anthropic та Cohere, продовжується, оскільки вони намагаються розширити межі відповідальності розвитку ШІ.

Еволюція досліджень ШІ

Поки можливості зростали, тенденції та пріоритети досліджень також змінилися, часто відповідаючи технологічним віхам. Виникнення глибокого навчання знову викликало інтерес до нейронних мереж, тоді як обробка природної мови зросла з моделями рівня ChatGPT. Тим часом, увага до етики залишається постійним пріоритетом серед швидкого прогресу.

Репозиторії попередніх публікацій, такі як arXiv, також побачили експоненційний зростання публікацій ШІ, що дозволяє швидше поширення, але зменшує рецензування та збільшує ризик неконтрольованих помилок або упередженості. Взаємодія між дослідженнями та реальним впливом залишається складною, що вимагає більш координованих зусиль для керування прогресом.

MoE та мультимодальні системи – наступна хвиля генерації ШІ

Щоб забезпечити більш універсальні та складні ШІ для різних застосувань, два підходи набувають популярності: суміші експертів (MoE) та мультимодальне навчання.

Архітектури MoE поєднують кілька спеціалізованих нейронних мереж-експертів, оптимізованих для різних завдань або типів даних. Google’s Gemini використовує MoE для освоєння як довгих конверсаційних обмінів, так і лаконічних питань-відповідей. MoE дозволяє обробляти ширший діапазон входів без збільшення розміру моделі.

Мультимодальні системи, такі як Google’s Gemini, встановлюють нові стандарти, обробляючи різні модальності за межами простого тексту. Однак, реалізації потенціалу мультимодального ШІ вимагають подолання ключових технічних перешкод та етичних викликів.

Gemini: переозначення стандартів у мультимодальності

Gemini – це мультимодальний конверсаційний ШІ, розроблений для розуміння зв’язків між текстом, зображеннями, аудіо та відео. Його двійкова структура кодування, міжмодальна увага та мультимодальне декодування дозволяють складне контекстуальне розуміння. Gemini, як вважають, перевершує системи з одним кодувальником у асоціації текстових концепцій з візуальними регіонами. Інтегруючи структуровану знання та спеціалізоване навчання, Gemini перевершує попередників, таких як GPT-3 та GPT-4 у:

  • Ширині модальностей, які обробляються, включаючи аудіо та відео
  • Виконанні на стандартах, таких як масове багатозадачне розуміння мови
  • Генерації коду у різних мовах програмування
  • Масштабованості за допомогою спеціалізованих версій, таких як Gemini Ultra та Nano
  • Прозорості через виправдання для виходів

Технічні перешкоди у мультимодальних системах

Реалізація надійного мультимодального ШІ вимагає вирішення питань різноманітності даних, масштабованості, оцінки та інтерпретації. Несбалансовані набори даних та несумісності анотацій призводять до упередженості. Обробка кількох потоків даних навантажує обчислювальні ресурси, вимагаючи оптимізованої архітектури моделей. Потрібні вдосконалення механізмів уваги та алгоритмів для інтеграції суперечливих мультимодальних входів. Проблеми масштабованості тривають через великий обчислювальний наклад. Удосконалення метрик оцінки через комплексні стандарти є важливим. Покращення довіри користувачів за допомогою пояснюваного ШІ також залишається важливим. Вирішення цих технічних перешкод буде ключем до розблокування можливостей мультимодального ШІ.

Вдосконалені методи навчання, такі як самоорганізоване навчання, мета-навчання та тонке налаштування, знаходяться на передньому краї досліджень ШІ, підвищуючи автономію, ефективність та універсальність моделей ШІ.

Самоорганізоване навчання: автономія у навчанні моделей

Самоорганізоване навчання підкреслює автономне навчання моделей за допомогою необроблених даних, тим самим зменшуючи зусилля з ручної анотації та упередженості моделей. Воно включає генеративні моделі, такі як автоенкодери та GAN, для навчання розподілу даних та реконструкції входів, і використовує контрастні методи, такі як SimCLR та MoCo, для розрізнення позитивних та негативних пар зразків. Само-передбачувальні стратегії, натхненні NLP та вдосконалені останнім Vision Transformers, відіграють значну роль у самоорганізованому навчанні, демонструючи свій потенціал у розвитку автономних можливостей навчання ШІ.

Мета-навчання

Мета-навчання, або “навчання навчанню”, зосереджується на оснащенні моделей ШІ здатністю швидко адаптуватися до нових завдань за допомогою обмежених даних. Цей метод критичний у ситуаціях з обмеженою доступністю даних, забезпечуючи можливість моделям швидко адаптуватися та виконувати завдання у різних контекстах. Воно підкреслює узагальнення з декількома зразками, дозволяючи ШІ обробляти широкий спектр завдань з мінімальними даними, підкреслюючи його важливість у розвитку універсальних та адаптивних систем ШІ.

Тонке налаштування: налаштування ШІ для конкретних потреб

Тонке налаштування включає адаптацію попередньо навчених моделей до конкретних доменів або уподобань користувачів. Його два основних підходи включають повне тонке налаштування, яке регулює всі ваги кодувальника та класифікатора, та налаштування витягування функцій, де ваги кодувальника заморожені для подальшої класифікації. Цей метод забезпечує ефективну адаптацію генеративних моделей до конкретних потреб користувачів або вимог домену, підвищуючи їхню застосовність у різних контекстах.

Вирівнювання цінностей людини: гармонізування ШІ з етикою

Вирівнювання цінностей людини зосереджується на гармонізуванні моделей ШІ з цінностями та етикою людини, забезпечуючи, щоб їхні рішення відображали суспільні норми та етичні стандарти. Цей аспект критичний у сценаріях, де ШІ взаємодіє тісно з людьми, наприклад, у сфері охорони здоров’я та персональних помічників, для забезпечення того, щоб системи ШІ приймали рішення, які є етично та соціально відповідальними.

Розробка ШЗІ

ШЗІ зосереджується на розробці ШІ з можливістю загального розуміння та складного мислення, що відповідає можливостям людини. Ця довгострокова амбіція продовжує стимулювати дослідження та розвиток ШІ. Безпека та утримання ШЗІ звертають увагу на потенційні ризики, пов’язані з розширенням ШІ, підкреслюючи необхідність суворих протоколів безпеки та етичної відповідності цінностям людини та суспільним нормам.

Інноваційний MoE

Архітектура суміші експертів (MoE) представляє значний прогрес у трансформерних моделях мови, забезпечуючи неперевершену масштабованість та ефективність. Моделі MoE, такі як Switch Transformer та Mixtral, швидко переозначають масштаб та продуктивність моделей у різних мовних завданнях.

Основна концепція

Моделі MoE використовують архітектуру, керовану розрідженістю, з кількома мережами експертів та навчуваним механізмом управління, оптимізуючи обчислювальні ресурси та адаптуючись до складності завдань. Вони демонструють суттєві переваги у швидкості попереднього навчання, але стикаються з викликами у тонкому налаштуванні та вимагають значної пам’яті для висновку.

Моделі MoE відомі своєю вищою швидкістю попереднього навчання, з інноваціями, такими як DeepSpeed-MoE, які оптимізують висновок для досягнення кращої затримки та ефективності витрат. Останні досягнення успішно подолали перешкоди у спілкуванні типу “всі-до-усіх”, підвищуючи ефективність навчання та висновку.

Збирання будівельних блоків для штучного загального інтелекту

ШЗІ представляє гіпотетичну можливість ШІ, який дорівнює або перевершує людський інтелект у будь-якій галузі. Хоча сучасний ШІ excels у вузьких завданнях, ШЗІ залишається далеко та суперечливим через потенційні ризики.

Однак, інкрементні досягнення у таких областях, як переносне навчання, багатозадачне навчання, конверсаційна здатність та абстракція, поступово наближаються до високої мети ШЗІ. Спекулятивний проект OpenAI’s Q* спрямований на інтеграцію підкріплення навчання у великі мови моделей як ще один крок вперед.

Етичні межі та ризики маніпулювання моделями ШІ

Вириви дозволяють атакувальникам обійти етичні межі, встановлені під час процесу тонкого налаштування ШІ. Це призводить до генерації шкідливого контенту, такого як дезінформація, ненависть, фішинг-повідомлення та шкідливий код, що становить ризики для окремих осіб, організацій та суспільства в цілому. Наприклад, виривна модель могла б генерувати контент, який підтримує роз’єднуючі нарративи або підтримує кіберзлочинну діяльність. (Дізнайтеся більше)

Хоча ще не було жодних повідомлень про кібератаки з використанням виривів, існує кілька концепцій виривів, доступних онлайн та на темній мережі. Ці інструменти забезпечують запити, розроблені для маніпулювання моделями ШІ, такими як ChatGPT, потенційно дозволяючи хакерам витягувати конфіденційну інформацію через корпоративні чат-боти. Поширення цих інструментів на платформах, таких як кіберзлочинні форуми, підкреслює терміновість вирішення цієї загрози. (Прочитайте більше)

Мінімізація ризиків виривів

Щоб протидіяти цим загрозам, необхідний багатогранний підхід:

  1. Надійне тонке налаштування: Включення різноманітних даних у процес тонкого налаштування покращує стійкість моделі до маніпулятивних атак.
  2. Адверсарне навчання: Навчання з адверсарними прикладами підвищує здатність моделі розпізнавати та протидіяти маніпульованим входам.
  3. Регулярна оцінка: Постійний моніторинг виходів допомагає виявити відхилення від етичних керівних принципів.
  4. Нагляд людини: Включення людських рецензентів додає додатковий рівень безпеки.

Загрози, підтримувані ШІ: експлуатація галюцинацій

Галюцинація ШІ, коли моделі генерують виходи, не засновані на їхніх навчальних даних, можуть бути використані як зброя. Наприклад, атакувальники маніпулювали ChatGPT, щоб рекомендувати неіснуючі пакети, що призвело до поширення шкідливого програмного забезпечення. Це підкреслює необхідність постійної уваги та суворих контрзаходів проти таких експлуатацій. (Дізнайтеся більше)

Хоча етика прагнення до ШЗІ залишається суперечливою, його амбіційна мета продовжує впливати на напрямки досліджень генерації ШІ – чи сучасні моделі виглядають як кроки до людського рівня ШІ.

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.