Модели и платформы ИИ
Джемма: Google представляет передовые возможности ИИ через открытый исходный код
Область искусственного интеллекта (ИИ) пережила огромный прогресс в последние годы, в основном благодаря достижениям в области глубокого обучения и обработки естественного языка (NLP). На переднем крае этих достижений находятся большие языковые модели (LLM) – системы ИИ, обученные на огромных объемах текстовых данных, которые могут генерировать текст, похожий на человеческий, и участвовать в разговорных задачах.
Модели LLM, такие как PaLM от Google (GOOGL ), Claude от Anthropic и Gopher от DeepMind, продемонстрировали замечательные возможности, от программирования до рассуждений на основе общих знаний. Однако большинство этих моделей не были открыто выпущены, что ограничивает их доступ для исследований, разработки и полезных применений.
Это изменилось с недавним открытым исходным кодом Джеммы – семейства LLM от Google’s DeepMind, основанного на их мощных проприетарных моделях Gemini. В этом блог-посте мы погрузимся в Джемму, анализируя ее архитектуру, процесс обучения, производительность и ответственный выпуск.
Обзор Джеммы
В феврале 2023 года DeepMind открыл исходный код двух размеров моделей Джеммы – версию с 2 миллиардами параметров, оптимизированную для развертывания на устройстве, и более крупную версию с 7 миллиардами параметров, предназначенную для использования на GPU/TPU.
Джемма использует аналогичную архитектуру трансформера и методологию обучения, как и ведущие модели Gemini от DeepMind. Она была обучена на до 6 триллионов токенов текстовых данных из веб-документов, математических текстов и исходного кода.
DeepMind выпустил как сырые предварительно обученные контрольные точки Джеммы, так и версии, дообученные с помощью обучения с учителем и обратной связи человека для улучшения возможностей в таких областях, как диалог, выполнение инструкций и программирование.
Начало работы с Джеммой
Открытый выпуск Джеммы делает ее передовые возможности ИИ доступными для разработчиков, исследователей и энтузиастов. Вот быстрое руководство, чтобы начать работать с Джеммой:
Платформо-независимое развертывание
Одной из ключевых сильных сторон Джеммы является ее гибкость – вы можете запускать ее на CPU, GPU или TPU. Для CPU используйте TensorFlow Lite или HuggingFace Transformers. Для ускоренной производительности на GPU/TPU используйте TensorFlow. Облачные сервисы, такие как Google Cloud’s Vertex AI, также обеспечивают бесшовное масштабирование.
Доступ к предварительно обученным моделям
Джемма поставляется в разных предварительно обученных вариантах, в зависимости от ваших потребностей. Модели 2B и 7B предлагают сильные генеративные возможности прямо из коробки. Для настраиваемого дообучения модели 2B-FT и 7B-FT являются идеальными отправными точками.
Создание интересных приложений
Вы можете создать широкий спектр приложений с помощью Джеммы, таких как генерация историй, перевод языка, ответы на вопросы и производство творческого контента. Ключом является использование сильных сторон Джеммы через дообучение на ваших собственных наборах данных.
Архитектура
Джемма использует архитектуру декодера-только трансформера, основанную на достижениях, таких как многозапросное внимание и роторные позиционные вложения:
- Трансформеры: представленные в 2017 году, архитектура трансформера, основанная исключительно на механизмах внимания, стала повсеместной в NLP. Джемма наследует способность трансформера моделировать длинные зависимости в тексте.
- Декодер-only: Джемма использует только стек декодера трансформера, в отличие от моделей энкодер-декодер, таких как BART или T5. Это обеспечивает сильные генеративные возможности для задач, таких как генерация текста.
- Многозапросное внимание: Джемма использует многозапросное внимание в своей более крупной модели, позволяя каждой головке внимания обрабатывать несколько запросов параллельно для более быстрого вывода.
- Роторные позиционные вложения: Джемма представляет информацию о позиции с помощью роторных вложений вместо абсолютных кодировок позиции. Этот метод уменьшает размер модели, сохраняя при этом информацию о позиции.
Использование методов, таких как многозапросное внимание и роторные позиционные вложения, позволяет моделям Джеммы достичь оптимального баланса между производительностью, скоростью вывода и размером модели.
Данные и процесс обучения
Джемма была обучена на до 6 триллионов токенов текстовых данных, в основном на английском языке. Это включало веб-документы, математические тексты и исходный код. DeepMind инвестировал значительные усилия в фильтрацию данных, удаляя токсичный, вредный или предвзятый текст с помощью классификаторов и эвристик.
Обучение проводилось на инфраструктуре TPUv5 от Google, с использованием до 4096 TPU для обучения модели Джеммы-7B. Эффективные методы параллелизации модели и данных позволили обучать массивные модели с помощью стандартного оборудования.
Было использовано пошаговое обучение, непрерывно корректируя распределение данных, чтобы сосредоточиться на высококачественном, релевантном тексте. Финальные этапы дообучения использовали смесь человеческих и синтетических примеров для улучшения возможностей в таких областях, как диалог, выполнение инструкций и программирование.
Производительность модели
DeepMind тщательно оценил модели Джеммы на широком наборе из более чем 25 тестов, охватывающих вопросы и ответы, рассуждения, математику, программирование, общие знания и диалоговые возможности.
Джемма достигает результатов на уровне состояния искусства по сравнению с аналогичными по размеру открытыми моделями на большинстве тестов. Некоторые из них:
- Математика: Джемма отличается на математических тестах, таких как GSM8K и MATH, превосходя модели, такие как Codex и Claude от Anthropic, более чем на 10 пунктов.
- Программирование: Джемма соответствует или превышает производительность Codex на программных тестах, таких как MBPP, несмотря на то, что не была специально обучена на коде.
- Диалог: Джемма демонстрирует сильные разговорные способности с 51,7% победной ставкой над Mistral-7B от Anthropic на тестах предпочтения человека.
- Рассуждения: На задачах, требующих вывода, таких как ARC и Winogrande, Джемма превосходит другие модели размером 7B на 5-10 пунктов.
Универсальность Джеммы в различных дисциплинах демонстрирует ее сильные общие интеллектуальные возможности. Хотя остаются пробелы до человеческого уровня производительности, Джемма представляет собой шаг вперед в области открытого ИИ.
Безопасность и ответственность
Выпуск открытых весов крупных моделей создает проблемы вокруг намеренного неправильного использования и врожденных предубеждений модели. DeepMind предпринял шаги для смягчения рисков:
- Фильтрация данных: потенциально токсичный, незаконный или предвзятый текст был удален из обучающих данных с помощью классификаторов и эвристик.
- Оценки: Джемма была протестирована на более чем 30 тестах, отобранных для оценки безопасности, справедливости и надежности. Она соответствует или превышает другие модели.
- Дообучение: дообучение модели было сосредоточено на улучшении возможностей безопасности, таких как фильтрация информации и адекватное поведение отказа.
- Условия использования: условия использования запрещают оскорбительное, незаконное или неэтичное использование моделей Джеммы. Однако обеспечение соблюдения остается сложной задачей.
- Карты модели: карты, описывающие возможности модели, ограничения и предубеждения, были выпущены для содействия прозрачности.
Хотя существуют риски, связанные с открытым исходным кодом, DeepMind определил, что выпуск Джеммы обеспечивает чистую социальную пользу на основе ее профиля безопасности и возможности стимулирования исследований. Однако бдительное наблюдение за потенциальными вредами будет иметь решающее значение.
Содействие следующей волне инноваций в ИИ
Выпуск Джеммы в качестве открытой модели семейства может разблокировать прогресс во всей сообществе ИИ:
- Доступность: Джемма снижает барьеры для организаций, чтобы строить с помощью передовых возможностей NLP, которые ранее сталкивались с высокими затратами на вычисления и данные для обучения своих собственных моделей LLM.
- Новые применения: выпуская предварительно обученные и дообученные контрольные точки, DeepMind обеспечивает более легкое развитие полезных приложений в таких областях, как образование, наука и доступность.
- Настройка: разработчики могут настроить Джемму для отраслевых или доменных приложений посредством дальнейшего обучения на собственных данных.
- Исследования: открытые модели, такие как Джемма, способствуют большей прозрачности и аудиту текущих систем NLP, освещая будущие направления исследований.
- Инновации: наличие сильных базовых моделей, таких как Джемма, ускорит прогресс в таких областях, как смягчение предубеждений, фактичность и безопасность ИИ.
Предоставляя возможности Джеммы всем через открытый исходный код, DeepMind надеется стимулировать ответственное развитие ИИ для социального блага.
Дорога впереди
С каждым шагом в ИИ мы приближаемся к моделям, которые соперничают или превосходят человеческий интеллект во всех областях. Системы, такие как Джемма, подчеркивают, как быстрые достижения в самообучаемых моделях открывают все более и более сложные когнитивные возможности.
Однако остается работа по улучшению надежности, интерпретируемости и контролируемости ИИ – областях, где человеческий интеллект все еще доминирует. Области, такие как математика, подчеркивают эти постоянные пробелы, с Джеммой, набирающей 64% на MMLU по сравнению с оценочными 89% человеческой производительности.
Закрытие этих пробелов, обеспечивая при этом безопасность и этику все более способных систем ИИ, будет центральными задачами в ближайшие годы. Находжение правильного баланса между открытостью и осторожностью будет иметь решающее значение, поскольку DeepMind стремится демократизировать доступ к преимуществам ИИ, управляя при этом возникающими рисками.
Инициативы по содействию безопасности ИИ, такие как ANC от Dario Amodei, команда Ethics & Society от DeepMind и Constitutional AI от Anthropic, сигнализируют о растущем признании необходимости нюансов. Значительный прогресс будет требовать открытого, основанного на доказательствах диалога между исследователями, разработчиками, политиками и общественностью.
Если ориентироваться ответственно, Джемма представляет не вершину ИИ, а базовый лагерь для следующего поколения исследователей ИИ, следующих по стопам DeepMind к справедливому, полезному искусственному общему интеллекту.
Вывод
Выпуск моделей Джеммы от DeepMind знаменует новую эру для открытого ИИ – ту, которая выходит за рамки узких тестов в общие интеллектуальные возможности. Тщательно протестированная на безопасность и широко доступная, Джемма устанавливает новый стандарт для ответственного открытого исходного кода в ИИ.
Стимулируемый конкурентным духом, смягченным кооперативными ценностями, обмен прорывами, такими как Джемма, повышает все лодки в экосистеме ИИ. Всему сообществу теперь доступно универсальное семейство моделей LLM для стимулирования или поддержки их инициатив.
Хотя остаются риски, техническая и этическая тщательность DeepMind обеспечивает уверенность в том, что преимущества Джеммы перевешивают ее потенциальные вреды. По мере того, как возможности ИИ становятся все более и более сложными, поддержание этого нюанса между открытостью и осторожностью будет иметь решающее значение.
Джемма приближает нас к ИИ, который приносит пользу всем людям. Но многие грандиозные проблемы все еще ждут на пути к благотворительному искусственному общему интеллекту. Если исследователи ИИ, разработчики и общество в целом смогут поддерживать совместный прогресс, Джемма может однажды быть рассмотрена как исторический базовый лагерь, а не как окончательная вершина.












