AGI и будущее ИИ

Эволюционирующий ландшафт генеративного ИИ: обзор смеси экспертов, многомодальности и поиска ИИ общего назначения

mm
Добавьте Unite.AI в избранные источники в Google

Область искусственного интеллекта (ИИ) в 2023 году пережила значительный рост. Генеративный ИИ, который фокусируется на создании реалистичного контента, такого как изображения, аудио, видео и текст, был в авангарде этих достижений. Модели, такие как DALL-E 3, Stable Diffusion и ChatGPT, продемонстрировали новые творческие возможности, но также вызвали обеспокоенность по поводу этики, предвзятости и неправильного использования.

По мере того, как генеративный ИИ продолжает развиваться с быстрой скоростью, смеси экспертов (MoE), многомодальное обучение и стремление к искусственному интеллекту общего назначения (ИИОП) выглядят как определяющие следующий рубеж исследований и применения. Эта статья предоставит всесторонний обзор текущего состояния и будущей траектории генеративного ИИ, анализируя, как инновации, такие как Google’s Gemini и предстоящие проекты, такие как OpenAI’s Q*, трансформируют ландшафт. Она будет исследовать реальные последствия в таких областях, как здравоохранение, финансы, образование и другие, а также подчеркивать возникающие проблемы вокруг качества исследований и соответствия ИИ человеческим ценностям.

Выпуск ChatGPT в конце 2022 года вызвал возобновление интереса и обеспокоенности по поводу ИИ, от его впечатляющих возможностей обработки естественного языка до потенциала распространения дезинформации. Тем временем, новая модель Google’s Gemini демонстрирует значительно улучшенные возможности разговора по сравнению с предшественниками, такими как LaMDA, благодаря достижениям, таким как механизм внимания spike-and-slab. Руморные проекты, такие как OpenAI’s Q*, намекают на объединение разговорного ИИ с обучением с подкреплением.

Эти инновации сигнализируют о сдвиге приоритетов в сторону многомодальных, универсальных генеративных моделей. Конкуренция между компаниями, такими как Google, Meta, Anthropic и Cohere, продолжает усиливаться, поскольку они стремятся расширить границы ответственного развития ИИ.

Эволюция исследований ИИ

По мере того, как возможности ИИ росли, также смещались тренды и приоритеты исследований, часто соответствуя технологическим вехам. Возрождение глубокого обучения возродило интерес к нейронным сетям, в то время как обработка естественного языка пережила всплеск с появлением моделей, таких как ChatGPT. Тем временем, внимание к этике сохраняется как постоянный приоритет среди быстрого прогресса.

Репозитории препринтов, такие как arXiv, также испытали экспоненциальный рост подач ИИ, что позволяет быстрее распространять информацию, но снижает уровень рецензирования и увеличивает риск непроверенных ошибок или предвзятости. Взаимодействие между исследованиями и реальным воздействием остается сложным, требуя более скоординированных усилий для управления прогрессом.

MoE и многомодальные системы – следующая волна генеративного ИИ

Для того, чтобы обеспечить более универсальный и сложный ИИ в различных приложениях, два подхода набирают популярность: смеси экспертов (MoE) и многомодальное обучение.

Архитектуры MoE объединяют несколько специализированных нейронных сетей “экспертов”, оптимизированных для различных задач или типов данных. Google’s Gemini использует MoE, чтобы овладеть как длинными разговорными обменами, так и краткими ответами на вопросы. MoE позволяет обрабатывать более широкий диапазон входных данных без увеличения размера модели.

Многомодальные системы, такие как Google’s Gemini, устанавливают новые стандарты, обрабатывая различные модальности за пределами простого текста. Однако, для реализации потенциала многомодального ИИ необходимо преодолеть ключевые технические препятствия и этические проблемы.

Gemini: переопределение стандартов в многомодальности

Gemini – это многомодальный разговорный ИИ, предназначенный для понимания связей между текстом, изображениями, аудио и видео. Его двойная структура кодировщика, кросс-модальное внимание и многомодальное декодирование позволяют обеспечить сложное контекстуальное понимание. Gemini, как полагают, превосходит системы с одним кодировщиком в ассоциации текстовых понятий с визуальными регионами. Интегрируя структурированные знания и специализированную подготовку, Gemini превосходит своих предшественников, таких как GPT-3 и GPT-4, в:

  • Широте модальностей, обрабатываемых, включая аудио и видео
  • Производительности на стандартах, таких как массовое многозадачное понимание языка
  • Генерации кода на различных языках программирования
  • Масштабируемости через адаптированные версии, такие как Gemini Ultra и Nano
  • Прозрачности через обоснования выводов

Технические препятствия в многомодальных системах

Для реализации прочного многомодального ИИ необходимо решить проблемы разнообразия данных, масштабируемости, оценки и интерпретируемости. Несбалансированные наборы данных и несоответствия в аннотациях приводят к предвзятости. Обработка нескольких потоков данных создает нагрузку на вычислительные ресурсы, требуя оптимизированных архитектур моделей. Необходимы достижения в механизмах внимания и алгоритмах для интеграции противоречивых многомодальных входных данных. Проблемы масштабируемости сохраняются из-за обширной вычислительной нагрузки. Уточнение метрик оценки через всесторонние стандарты имеет решающее значение. Усиление доверия пользователей через объяснимый ИИ также остается важным. Решение этих технических препятствий будет ключом к разблокировке возможностей многомодального ИИ.

Передовые методы обучения, такие как самообучение, метаобучение и тонкая настройка, находятся на переднем крае исследований ИИ, повышая автономность, эффективность и универсальность моделей ИИ.

Самообучение: автономность в обучении моделей

Самообучение подчеркивает автономное обучение моделей с использованием неаннотированных данных, тем самым снижая ручные усилия по аннотации и предвзятость моделей. Оно включает генеративные модели, такие как автоэнкодеры и GAN, для обучения распределения данных и реконструкции входных данных, и использует контрастные методы, такие как SimCLR и MoCo, для различения положительных и отрицательных пар образцов. Стратегии самообучения, вдохновленные NLP и усиленные недавними Vision Transformers, играют значительную роль в самообучении, демонстрируя его потенциал в продвижении автономных возможностей обучения ИИ.

Метаобучение

Метаобучение, или “обучение обучению”, фокусируется на оснащении моделей ИИ способностью быстро адаптироваться к новым задачам с использованием ограниченных образцов данных. Этот метод имеет решающее значение в ситуациях с ограниченной доступностью данных, гарантируя, что модели могут быстро адаптироваться и выполнять различные задачи. Он подчеркивает обобщение с несколькими выстрелами, позволяя ИИ обрабатывать широкий спектр задач с минимальными данными, подчеркивая его важность в разработке универсальных и адаптируемых систем ИИ.

Тонкая настройка: адаптация ИИ для конкретных потребностей

Тонкая настройка предполагает адаптацию предварительно обученных моделей к конкретным доменам или предпочтениям пользователей. Ее два основных подхода включают полную тонкую настройку, которая корректирует все веса кодировщика и классификатора, и извлечение признаков с тонкой настройкой, где веса кодировщика замораживаются для последующей классификации. Этот метод гарантирует, что генеративные модели эффективно адаптируются к конкретным потребностям пользователей или требованиям домена, повышая их применимость в различных контекстах.

Соответствие человеческим ценностям: гармонизация ИИ с этикой

Соответствие человеческим ценностям фокусируется на гармонизации моделей ИИ с человеческой этикой и ценностями, гарантируя, что их решения отражают социальные нормы и этические стандарты. Этот аспект имеет решающее значение в сценариях, где ИИ тесно взаимодействует с людьми, таких как в здравоохранении и персональных помощниках, для обеспечения того, что системы ИИ принимают решения, которые являются этически и социально ответственными.

Разработка ИИ общего назначения

ИИ общего назначения фокусируется на разработке ИИ с возможностью целостного понимания и сложного рассуждения, соответствующего человеческим когнитивным способностям. Это долгосрочная амбиция непрерывно толкает границы исследований и разработки ИИ. Безопасность и содержание ИИ общего назначения решают потенциальные риски, связанные с продвинутыми системами ИИ, подчеркивая необходимость строгих протоколов безопасности и этической гармонизации с человеческими ценностями и социальными нормами.

Инновационная MoE

Архитектура модели MoE представляет собой значительный прорыв в трансформерных моделях языка, предлагая беспрецедентную масштабируемость и эффективность. Модели MoE, такие как Switch Transformer и Mixtral, быстро переопределяют масштаб и производительность моделей в различных языковых задачах.

Основная концепция

Модели MoE используют архитектуру, управляемую разреженностью, с несколькими сетями экспертов и обучаемым механизмом шлюза, оптимизируя вычислительные ресурсы и адаптируясь к сложности задач. Они демонстрируют значительные преимущества в скорости предварительного обучения, но сталкиваются с проблемами в тонкой настройке и требуют значительной памяти для вывода.

Модели MoE известны своей превосходной скоростью предварительного обучения, с инновациями, такими как DeepSpeed-MoE, оптимизирующими вывод для достижения лучшей задержки и эффективности затрат. Недавние достижения эффективно решили проблему коммуникации “все-все”, повышая эффективность обучения и вывода.

Создание строительных блоков для искусственного интеллекта общего назначения

ИИ общего назначения представляет собой гипотетическую возможность ИИ, соответствующую или превышающую человеческий интеллект во всех областях. Хотя современный ИИ превосходит в узких задачах, ИИ общего назначения остается далеким и спорным, учитывая его потенциальные риски.

Однако, постепенные достижения в таких областях, как обучение с переносом, многозадачное обучение, разговорные возможности и абстракция, приближают к амбициозной цели ИИ общего назначения. Спекулятивный проект OpenAI’s Q* направлен на интеграцию обучения с подкреплением в модели языка как еще один шаг вперед.

Этические границы и риски манипулирования моделями ИИ

Jailbreaks позволяют атакующим обойти этические границы, установленные во время процесса тонкой настройки ИИ. Это приводит к генерации вредоносного контента, такого как дезинформация, ненавистная речь, фишинговые письма и вредоносный код, представляя риски для отдельных лиц, организаций и общества в целом. Например, взломанная модель могла бы производить контент, который пропагандирует разделительные нарративы или поддерживает киберпреступную деятельность. (Узнать больше)

Хотя еще не было зарегистрировано никаких кибератак с использованием jailbreak, несколько концепций jailbreak доступны в Интернете и продаются на темной сети. Эти инструменты предоставляют подсказки, предназначенные для манипулирования моделями ИИ, такими как ChatGPT, потенциально позволяя хакерам раскрыть конфиденциальную информацию через корпоративные чат-боты. Распространение этих инструментов на платформах, таких как киберпреступные форумы, подчеркивает срочность решения этой угрозы. (Прочитать больше)

Смягчение рисков jailbreak

Для противодействия этим угрозам необходим многогранный подход:

  1. Устойчивая тонкая настройка: Включение разнообразных данных в процесс тонкой настройки улучшает устойчивость модели к манипуляциям.
  2. Обучение с противоречивыми примерами: Обучение с противоречивыми примерами повышает способность модели распознавать и сопротивляться манипулированным входным данным.
  3. Регулярная оценка: Постоянный мониторинг выводов помогает обнаружить отклонения от этических руководств.
  4. Надзор человека: Вовлечение человеческих рецензентов добавляет дополнительный уровень безопасности.

Угрозы, усиленные ИИ: эксплуатация галлюцинаций

Галлюцинация ИИ, когда модели генерируют выводы, не основанные на их обучающих данных, может быть использована как оружие. Например, атакующие манипулировали ChatGPT, чтобы рекомендовать несуществующие пакеты, что привело к распространению вредоносного ПО. Это подчеркивает необходимость постоянной бдительности и сильных контрмер против такой эксплуатации. (Изучить дальше)

Хотя этика преследования ИИ общего назначения остается спорной, его стремление продолжает влиять на направления исследований генеративного ИИ – будь то текущие модели похожи на ступеньки или обходные пути на пути к человеческому уровню ИИ.

Я провел последние пять лет, погружаясь в увлекательный мир машинного обучения и глубокого обучения. Моя страсть и экспертиза привели меня к участию в более чем 50 различных проектах программной инженерии, с особым акцентом на ИИ/МО. Мое непрекращающееся любопытство также привело меня к обработке естественного языка, области, которую я с нетерпением жду возможности изучить дальше.