AGI та майбутній ШІ
Еволюційний ландшафт генерації штучного інтелекту: огляд суміші експертів, мультимодальності та пошуку штучного загального інтелекту
Область штучного інтелекту (ШІ) пережила значний розвиток у 2023 році. Генеративний ШІ, який зосереджується на створенні реалістичних контентів, таких як зображення, аудіо, відео та текст, був на передньому краї цих досягнень. Моделі, такі як DALL-E 3, Stable Diffusion та ChatGPT, продемонстрували нові творчі можливості, але також викликали занепокоєння щодо етики, упередженості та неправильного використання.
Поки генеративний ШІ продовжує розвиватися швидкими темпами, суміші експертів (MoE), мультимодальне навчання та прагнення до штучного загального інтелекту (ШЗІ) виглядають як майбутні напрямки досліджень та застосувань. Ця стаття надає комплексний огляд поточного стану та майбутньої траєкторії генеративного ШІ, аналізуючи, як інновації, такі як Google’s Gemini та очікувані проекти, такі як OpenAI’s Q*, трансформують ландшафт. Вона буде вивчати реальні наслідки в галузі охорони здоров’я, фінансів, освіти та інших галузей, а також висвітлювати нові виклики щодо якості досліджень та відповідності ШІ цінностям людини.
Випуск ChatGPT у кінці 2022 року викликав нове збудження та занепокоєння щодо ШІ, від його вражаючих можливостей обробки природної мови до потенціалу поширення дезінформації. Тим часом, нова модель Google’s Gemini демонструє суттєве покращення конверсаційної здатності порівняно з попередниками, такими як LaMDA, завдяки вдосконаленням, таким як спайк-і-слаб-увага. Проекти, такі як OpenAI’s Q*, намагаються поєднати конверсаційний ШІ з підкріпленням навчання.
Ці інновації свідчать про зміщення пріоритетів у бік мультимодальних, універсальних генеративних моделей. Конкуренція між компаніями, такими як Google, Meta, Anthropic та Cohere, продовжується, оскільки вони намагаються розширити межі відповідальності розвитку ШІ.
Еволюція досліджень ШІ
Поки можливості зростали, тенденції та пріоритети досліджень також змінилися, часто відповідаючи технологічним віхам. Виникнення глибокого навчання знову викликало інтерес до нейронних мереж, тоді як обробка природної мови зросла з моделями рівня ChatGPT. Тим часом, увага до етики залишається постійним пріоритетом серед швидкого прогресу.
Репозиторії попередніх публікацій, такі як arXiv, також побачили експоненційний зростання публікацій ШІ, що дозволяє швидше поширення, але зменшує рецензування та збільшує ризик неконтрольованих помилок або упередженості. Взаємодія між дослідженнями та реальним впливом залишається складною, що вимагає більш координованих зусиль для керування прогресом.
MoE та мультимодальні системи – наступна хвиля генерації ШІ
Щоб забезпечити більш універсальні та складні ШІ для різних застосувань, два підходи набувають популярності: суміші експертів (MoE) та мультимодальне навчання.
Архітектури MoE поєднують кілька спеціалізованих нейронних мереж-експертів, оптимізованих для різних завдань або типів даних. Google’s Gemini використовує MoE для освоєння як довгих конверсаційних обмінів, так і лаконічних питань-відповідей. MoE дозволяє обробляти ширший діапазон входів без збільшення розміру моделі.
Мультимодальні системи, такі як Google’s Gemini, встановлюють нові стандарти, обробляючи різні модальності за межами простого тексту. Однак, реалізації потенціалу мультимодального ШІ вимагають подолання ключових технічних перешкод та етичних викликів.
Gemini: переозначення стандартів у мультимодальності
Gemini – це мультимодальний конверсаційний ШІ, розроблений для розуміння зв’язків між текстом, зображеннями, аудіо та відео. Його двійкова структура кодування, міжмодальна увага та мультимодальне декодування дозволяють складне контекстуальне розуміння. Gemini, як вважають, перевершує системи з одним кодувальником у асоціації текстових концепцій з візуальними регіонами. Інтегруючи структуровану знання та спеціалізоване навчання, Gemini перевершує попередників, таких як GPT-3 та GPT-4 у:
- Ширині модальностей, які обробляються, включаючи аудіо та відео
- Виконанні на стандартах, таких як масове багатозадачне розуміння мови
- Генерації коду у різних мовах програмування
- Масштабованості за допомогою спеціалізованих версій, таких як Gemini Ultra та Nano
- Прозорості через виправдання для виходів
Технічні перешкоди у мультимодальних системах
Реалізація надійного мультимодального ШІ вимагає вирішення питань різноманітності даних, масштабованості, оцінки та інтерпретації. Несбалансовані набори даних та несумісності анотацій призводять до упередженості. Обробка кількох потоків даних навантажує обчислювальні ресурси, вимагаючи оптимізованої архітектури моделей. Потрібні вдосконалення механізмів уваги та алгоритмів для інтеграції суперечливих мультимодальних входів. Проблеми масштабованості тривають через великий обчислювальний наклад. Удосконалення метрик оцінки через комплексні стандарти є важливим. Покращення довіри користувачів за допомогою пояснюваного ШІ також залишається важливим. Вирішення цих технічних перешкод буде ключем до розблокування можливостей мультимодального ШІ.
Збирання будівельних блоків для штучного загального інтелекту
ШЗІ представляє гіпотетичну можливість ШІ, який дорівнює або перевершує людський інтелект у будь-якій галузі. Хоча сучасний ШІ excels у вузьких завданнях, ШЗІ залишається далеко та суперечливим через потенційні ризики.
Однак, інкрементні досягнення у таких областях, як переносне навчання, багатозадачне навчання, конверсаційна здатність та абстракція, поступово наближаються до високої мети ШЗІ. Спекулятивний проект OpenAI’s Q* спрямований на інтеграцію підкріплення навчання у великі мови моделей як ще один крок вперед.
Етичні межі та ризики маніпулювання моделями ШІ
Вириви дозволяють атакувальникам обійти етичні межі, встановлені під час процесу тонкого налаштування ШІ. Це призводить до генерації шкідливого контенту, такого як дезінформація, ненависть, фішинг-повідомлення та шкідливий код, що становить ризики для окремих осіб, організацій та суспільства в цілому. Наприклад, виривна модель могла б генерувати контент, який підтримує роз’єднуючі нарративи або підтримує кіберзлочинну діяльність. (Дізнайтеся більше)
Хоча ще не було жодних повідомлень про кібератаки з використанням виривів, існує кілька концепцій виривів, доступних онлайн та на темній мережі. Ці інструменти забезпечують запити, розроблені для маніпулювання моделями ШІ, такими як ChatGPT, потенційно дозволяючи хакерам витягувати конфіденційну інформацію через корпоративні чат-боти. Поширення цих інструментів на платформах, таких як кіберзлочинні форуми, підкреслює терміновість вирішення цієї загрози. (Прочитайте більше)
Мінімізація ризиків виривів
Щоб протидіяти цим загрозам, необхідний багатогранний підхід:
- Надійне тонке налаштування: Включення різноманітних даних у процес тонкого налаштування покращує стійкість моделі до маніпулятивних атак.
- Адверсарне навчання: Навчання з адверсарними прикладами підвищує здатність моделі розпізнавати та протидіяти маніпульованим входам.
- Регулярна оцінка: Постійний моніторинг виходів допомагає виявити відхилення від етичних керівних принципів.
- Нагляд людини: Включення людських рецензентів додає додатковий рівень безпеки.
Загрози, підтримувані ШІ: експлуатація галюцинацій
Галюцинація ШІ, коли моделі генерують виходи, не засновані на їхніх навчальних даних, можуть бути використані як зброя. Наприклад, атакувальники маніпулювали ChatGPT, щоб рекомендувати неіснуючі пакети, що призвело до поширення шкідливого програмного забезпечення. Це підкреслює необхідність постійної уваги та суворих контрзаходів проти таких експлуатацій. (Дізнайтеся більше)
Хоча етика прагнення до ШЗІ залишається суперечливою, його амбіційна мета продовжує впливати на напрямки досліджень генерації ШІ – чи сучасні моделі виглядають як кроки до людського рівня ШІ.












