Модели и платформы ИИ
Можно ли построить крупные языковые модели, такие как ChatGPT, за половину стоимости?
Крупные языковые модели (LLM) như GPT-3 и ChatGPT революционизировали искусственный интеллект, предлагая возможности понимания естественного языка и генерации контента. Однако их разработка обходится дорого, что ограничивает доступность и дальнейшие исследования. Исследователи оценивают, что обучение GPT-3 стоило OpenAI около $5 миллионов. Тем не менее, Microsoft (MSFT ) признала потенциал и инвестировала $1 миллиард в 2019 году и $10 миллиардов в 2023 году в проект GPT-3 и ChatGPT от OpenAI.
LLM – это модели машинного обучения, обученные на обширных текстовых данных для приложений обработки естественного языка. Они основаны на архитектуре трансформера и используют механизмы внимания для задач обработки естественного языка, таких как вопрос-ответ, машинный перевод, анализ настроений и т. д.
Возникает вопрос: можно ли повысить эффективность этих крупных моделей, одновременно снижая вычислительную стоимость и время обучения?
Были разработаны несколько подходов, таких как прогрессивные нейронные сети, морфизм сети, параллелизм внутри слоя, наследование знаний и т. д., для снижения вычислительной стоимости обучения нейронных сетей. Новый подход LiGO (линейный оператор роста), который мы будем обсуждать, устанавливает новый стандарт. Он снижает вычислительную стоимость обучения LLM на 50%.
Прежде чем обсуждать эту технику, важно рассмотреть факторы, которые способствуют высокой стоимости создания LLM.
Стоимость создания крупных языковых моделей
Три основных расхода на разработку LLM следующие:
1. Вычислительные ресурсы
Создание LLM требует значительных вычислительных ресурсов для обучения на больших наборах данных. Они должны обрабатывать миллиарды параметров и учиться сложным закономерностям из обширных текстовых данных.
Необходимо инвестировать в специализированное оборудование, такое как графические процессоры (GPU) и процессоры тензорногоflows (TPU), для создания и обучения LLM для достижения передового опыта.
Например, GPT-3 был обучен на суперкомпьютере с 10000 корпоративными GPU (H100 и A100) и 285000 ядрами CPU.
2. Потребление энергии
Интенсивные вычислительные ресурсы, необходимые для создания LLM, приводят к значительному потреблению энергии. Например, обучение 175 миллиардов параметров GPT-3 заняло 14,8 дней с использованием 10000 GPU V100, что эквивалентно 3,55 миллионам часов GPU. Такой высокий уровень потребления энергии имеет значительные экологические последствия.
3. Хранение и управление данными
LLM обучаются на больших наборах данных. Например, GPT-3 был обучен на обширном корпусе текстовых данных, включая Common Crawl, WebText2, Books1, Books2 и Википедию, среди других источников. Значительные инвестиции в инфраструктуру необходимы для сбора, курирования и хранения этих наборов данных.
Также требуется облачное хранение для хранения данных и человеческая экспертиза для предварительной обработки данных и контроля версий. Кроме того, обеспечение того, чтобы ваша стратегия данных соответствовала нормативным актам, таким как GDPR, также добавляет к стоимости.
Техника LiGO: снижение стоимости создания крупных языковых моделей вдвое
LiGO (линейный оператор роста) – это новая техника, разработанная исследователями в MIT, для снижения вычислительной стоимости обучения LLM на 50%. Этот метод включает в себя инициализацию весов более крупных моделей из весов более мелких предварительно обученных моделей, что позволяет эффективно масштабировать нейронные сети.

Изображение из статьи: Обучение предварительно обученных моделей для эффективной тренировки трансформеров
Yoon Kim, старший автор статьи, говорит:
«Оценивается, что обучение моделей такого масштаба, как гипотетически запускается ChatGPT, может занять миллионы долларов только за одну тренировочную сессию. Можно ли улучшить эффективность этих методов обучения, чтобы мы могли получить хорошие модели за меньшее время и за меньшие деньги? Мы предлагаем сделать это, используя более мелкие языковые модели, которые были предварительно обучены».
Этот метод сохраняет преимущества более крупных моделей с сниженной вычислительной стоимостью и временем обучения по сравнению с обучением крупной модели с нуля. LiGO использует данный линейный оператор роста, который объединяет операторы глубины и ширины для оптимальной производительности.
В статье использовались различные наборы данных для проведения текстовых экспериментов, включая корпус английской Википедии для обучения моделей BERT и RoBERTa, и набор данных C4 для обучения модели GPT2.
Эксперименты с техникой LiGO включали рост BERT-Small до BERT-Base, BERT-Base до BERT-Large, RoBERTaSmall до RoBERTa-Base, GPT2-Base до GPT2-Medium и CaiT-XS до CaiT-S.
Исследователи сравнили свой подход с несколькими другими базовыми вариантами, включая обучение с нуля, прогрессивное обучение, bert2BERT и KI.
Техника LiGO предложила 44,7% экономии операций с плавающей запятой (FLOPs) и 40,7% экономии времени стендарта по сравнению с обучением модели BERT-Base с нуля, повторно используя модель BERT-Small. Оператор роста LiGO превосходит StackBERT, MSLT, bert2BERT и KI в эффективной тренировке.
Преимущества использования метода оптимизации обучения, такого как LiGO
LiGO – это эффективный метод обучения нейронных сетей, который имеет несколько преимуществ, перечисленных ниже:
1. Быстрое обучение
Как упоминалось ранее, быстрое обучение – это основное преимущество техники LiGO. Она обучает LLM за половину времени, увеличивая производительность и снижая затраты.
2. Эффективность ресурсов
LiGO – это ресурсоэффективный метод, поскольку он минимизирует время стендарта и операции с плавающей запятой, что приводит к более экономичному и экологически чистому подходу к обучению крупных трансформерных моделей.
3. Обобщение
Техника LiGO улучшила производительность как языковых, так и зрительных трансформеров, что указывает на то, что это обобщаемый метод, который можно применять к различным задачам.
Создание коммерческих продуктов ИИ – это только один аспект общих затрат, связанных с системами ИИ. Другой значительный компонент затрат возникает из ежедневных операций. Например, это стоит OpenAI около $700 000 каждый день, чтобы отвечать на запросы с помощью ChatGPT. Исследователи, как ожидается, продолжат исследовать подходы, которые делают LLM экономически эффективными во время обучения и более доступными во время выполнения.
Для получения дополнительной информации об ИИ посетите unite.ai.












