Модели и платформы ИИ

Джемма: Google представляет передовые возможности ИИ через открытый исходный код

mm
Добавьте Unite.AI в избранные источники в Google

Область искусственного интеллекта (ИИ) пережила огромный прогресс в последние годы, в основном благодаря достижениям в области глубокого обучения и обработки естественного языка (NLP). На переднем крае этих достижений находятся большие языковые модели (LLM) – системы ИИ, обученные на огромных объемах текстовых данных, которые могут генерировать текст, похожий на человеческий, и участвовать в разговорных задачах.

Модели LLM, такие как PaLM от Google (GOOGL ), Claude от Anthropic и Gopher от DeepMind, продемонстрировали замечательные возможности, от программирования до рассуждений на основе общих знаний. Однако большинство этих моделей не были открыто выпущены, что ограничивает их доступ для исследований, разработки и полезных применений.

Это изменилось с недавним открытым исходным кодом Джеммы – семейства LLM от Google’s DeepMind, основанного на их мощных проприетарных моделях Gemini. В этом блог-посте мы погрузимся в Джемму, анализируя ее архитектуру, процесс обучения, производительность и ответственный выпуск.

Обзор Джеммы

В феврале 2023 года DeepMind открыл исходный код двух размеров моделей Джеммы – версию с 2 миллиардами параметров, оптимизированную для развертывания на устройстве, и более крупную версию с 7 миллиардами параметров, предназначенную для использования на GPU/TPU.

Джемма использует аналогичную архитектуру трансформера и методологию обучения, как и ведущие модели Gemini от DeepMind. Она была обучена на до 6 триллионов токенов текстовых данных из веб-документов, математических текстов и исходного кода.

DeepMind выпустил как сырые предварительно обученные контрольные точки Джеммы, так и версии, дообученные с помощью обучения с учителем и обратной связи человека для улучшения возможностей в таких областях, как диалог, выполнение инструкций и программирование.

Начало работы с Джеммой

Открытый выпуск Джеммы делает ее передовые возможности ИИ доступными для разработчиков, исследователей и энтузиастов. Вот быстрое руководство, чтобы начать работать с Джеммой:

Платформо-независимое развертывание

Одной из ключевых сильных сторон Джеммы является ее гибкость – вы можете запускать ее на CPU, GPU или TPU. Для CPU используйте TensorFlow Lite или HuggingFace Transformers. Для ускоренной производительности на GPU/TPU используйте TensorFlow. Облачные сервисы, такие как Google Cloud’s Vertex AI, также обеспечивают бесшовное масштабирование.

Доступ к предварительно обученным моделям

Джемма поставляется в разных предварительно обученных вариантах, в зависимости от ваших потребностей. Модели 2B и 7B предлагают сильные генеративные возможности прямо из коробки. Для настраиваемого дообучения модели 2B-FT и 7B-FT являются идеальными отправными точками.

Создание интересных приложений

Вы можете создать широкий спектр приложений с помощью Джеммы, таких как генерация историй, перевод языка, ответы на вопросы и производство творческого контента. Ключом является использование сильных сторон Джеммы через дообучение на ваших собственных наборах данных.

Архитектура

Джемма использует архитектуру декодера-только трансформера, основанную на достижениях, таких как многозапросное внимание и роторные позиционные вложения:

  • Трансформеры: представленные в 2017 году, архитектура трансформера, основанная исключительно на механизмах внимания, стала повсеместной в NLP. Джемма наследует способность трансформера моделировать длинные зависимости в тексте.
  • Декодер-only: Джемма использует только стек декодера трансформера, в отличие от моделей энкодер-декодер, таких как BART или T5. Это обеспечивает сильные генеративные возможности для задач, таких как генерация текста.
  • Многозапросное внимание: Джемма использует многозапросное внимание в своей более крупной модели, позволяя каждой головке внимания обрабатывать несколько запросов параллельно для более быстрого вывода.
  • Роторные позиционные вложения: Джемма представляет информацию о позиции с помощью роторных вложений вместо абсолютных кодировок позиции. Этот метод уменьшает размер модели, сохраняя при этом информацию о позиции.

Использование методов, таких как многозапросное внимание и роторные позиционные вложения, позволяет моделям Джеммы достичь оптимального баланса между производительностью, скоростью вывода и размером модели.

Данные и процесс обучения

Джемма была обучена на до 6 триллионов токенов текстовых данных, в основном на английском языке. Это включало веб-документы, математические тексты и исходный код. DeepMind инвестировал значительные усилия в фильтрацию данных, удаляя токсичный, вредный или предвзятый текст с помощью классификаторов и эвристик.

Обучение проводилось на инфраструктуре TPUv5 от Google, с использованием до 4096 TPU для обучения модели Джеммы-7B. Эффективные методы параллелизации модели и данных позволили обучать массивные модели с помощью стандартного оборудования.

Было использовано пошаговое обучение, непрерывно корректируя распределение данных, чтобы сосредоточиться на высококачественном, релевантном тексте. Финальные этапы дообучения использовали смесь человеческих и синтетических примеров для улучшения возможностей в таких областях, как диалог, выполнение инструкций и программирование.

Производительность модели

DeepMind тщательно оценил модели Джеммы на широком наборе из более чем 25 тестов, охватывающих вопросы и ответы, рассуждения, математику, программирование, общие знания и диалоговые возможности.

Джемма достигает результатов на уровне состояния искусства по сравнению с аналогичными по размеру открытыми моделями на большинстве тестов. Некоторые из них:

  • Математика: Джемма отличается на математических тестах, таких как GSM8K и MATH, превосходя модели, такие как Codex и Claude от Anthropic, более чем на 10 пунктов.
  • Программирование: Джемма соответствует или превышает производительность Codex на программных тестах, таких как MBPP, несмотря на то, что не была специально обучена на коде.
  • Диалог: Джемма демонстрирует сильные разговорные способности с 51,7% победной ставкой над Mistral-7B от Anthropic на тестах предпочтения человека.
  • Рассуждения: На задачах, требующих вывода, таких как ARC и Winogrande, Джемма превосходит другие модели размером 7B на 5-10 пунктов.

Универсальность Джеммы в различных дисциплинах демонстрирует ее сильные общие интеллектуальные возможности. Хотя остаются пробелы до человеческого уровня производительности, Джемма представляет собой шаг вперед в области открытого ИИ.

Безопасность и ответственность

Выпуск открытых весов крупных моделей создает проблемы вокруг намеренного неправильного использования и врожденных предубеждений модели. DeepMind предпринял шаги для смягчения рисков:

  • Фильтрация данных: потенциально токсичный, незаконный или предвзятый текст был удален из обучающих данных с помощью классификаторов и эвристик.
  • Оценки: Джемма была протестирована на более чем 30 тестах, отобранных для оценки безопасности, справедливости и надежности. Она соответствует или превышает другие модели.
  • Дообучение: дообучение модели было сосредоточено на улучшении возможностей безопасности, таких как фильтрация информации и адекватное поведение отказа.
  • Условия использования: условия использования запрещают оскорбительное, незаконное или неэтичное использование моделей Джеммы. Однако обеспечение соблюдения остается сложной задачей.
  • Карты модели: карты, описывающие возможности модели, ограничения и предубеждения, были выпущены для содействия прозрачности.

Хотя существуют риски, связанные с открытым исходным кодом, DeepMind определил, что выпуск Джеммы обеспечивает чистую социальную пользу на основе ее профиля безопасности и возможности стимулирования исследований. Однако бдительное наблюдение за потенциальными вредами будет иметь решающее значение.

Содействие следующей волне инноваций в ИИ

Выпуск Джеммы в качестве открытой модели семейства может разблокировать прогресс во всей сообществе ИИ:

  • Доступность: Джемма снижает барьеры для организаций, чтобы строить с помощью передовых возможностей NLP, которые ранее сталкивались с высокими затратами на вычисления и данные для обучения своих собственных моделей LLM.
  • Новые применения: выпуская предварительно обученные и дообученные контрольные точки, DeepMind обеспечивает более легкое развитие полезных приложений в таких областях, как образование, наука и доступность.
  • Настройка: разработчики могут настроить Джемму для отраслевых или доменных приложений посредством дальнейшего обучения на собственных данных.
  • Исследования: открытые модели, такие как Джемма, способствуют большей прозрачности и аудиту текущих систем NLP, освещая будущие направления исследований.
  • Инновации: наличие сильных базовых моделей, таких как Джемма, ускорит прогресс в таких областях, как смягчение предубеждений, фактичность и безопасность ИИ.

Предоставляя возможности Джеммы всем через открытый исходный код, DeepMind надеется стимулировать ответственное развитие ИИ для социального блага.

Дорога впереди

С каждым шагом в ИИ мы приближаемся к моделям, которые соперничают или превосходят человеческий интеллект во всех областях. Системы, такие как Джемма, подчеркивают, как быстрые достижения в самообучаемых моделях открывают все более и более сложные когнитивные возможности.

Однако остается работа по улучшению надежности, интерпретируемости и контролируемости ИИ – областях, где человеческий интеллект все еще доминирует. Области, такие как математика, подчеркивают эти постоянные пробелы, с Джеммой, набирающей 64% на MMLU по сравнению с оценочными 89% человеческой производительности.

Закрытие этих пробелов, обеспечивая при этом безопасность и этику все более способных систем ИИ, будет центральными задачами в ближайшие годы. Находжение правильного баланса между открытостью и осторожностью будет иметь решающее значение, поскольку DeepMind стремится демократизировать доступ к преимуществам ИИ, управляя при этом возникающими рисками.

Инициативы по содействию безопасности ИИ, такие как ANC от Dario Amodei, команда Ethics & Society от DeepMind и Constitutional AI от Anthropic, сигнализируют о растущем признании необходимости нюансов. Значительный прогресс будет требовать открытого, основанного на доказательствах диалога между исследователями, разработчиками, политиками и общественностью.

Если ориентироваться ответственно, Джемма представляет не вершину ИИ, а базовый лагерь для следующего поколения исследователей ИИ, следующих по стопам DeepMind к справедливому, полезному искусственному общему интеллекту.

Вывод

Выпуск моделей Джеммы от DeepMind знаменует новую эру для открытого ИИ – ту, которая выходит за рамки узких тестов в общие интеллектуальные возможности. Тщательно протестированная на безопасность и широко доступная, Джемма устанавливает новый стандарт для ответственного открытого исходного кода в ИИ.

Стимулируемый конкурентным духом, смягченным кооперативными ценностями, обмен прорывами, такими как Джемма, повышает все лодки в экосистеме ИИ. Всему сообществу теперь доступно универсальное семейство моделей LLM для стимулирования или поддержки их инициатив.

Хотя остаются риски, техническая и этическая тщательность DeepMind обеспечивает уверенность в том, что преимущества Джеммы перевешивают ее потенциальные вреды. По мере того, как возможности ИИ становятся все более и более сложными, поддержание этого нюанса между открытостью и осторожностью будет иметь решающее значение.

Джемма приближает нас к ИИ, который приносит пользу всем людям. Но многие грандиозные проблемы все еще ждут на пути к благотворительному искусственному общему интеллекту. Если исследователи ИИ, разработчики и общество в целом смогут поддерживать совместный прогресс, Джемма может однажды быть рассмотрена как исторический базовый лагерь, а не как окончательная вершина.

Я провел последние пять лет, погружаясь в увлекательный мир машинного обучения и глубокого обучения. Моя страсть и экспертиза привели меня к участию в более чем 50 различных проектах программной инженерии, с особым акцентом на ИИ/МО. Мое непрекращающееся любопытство также привело меня к обработке естественного языка, области, которую я с нетерпением жду возможности изучить дальше.