Модели и платформы ИИ

Отражение 70B: LLM с самокорректирующимся когнитивным процессом и ведущими показателями производительности

mm
Добавьте Unite.AI в избранные источники в Google
Reflection 70B, large language models, AI self-correction, Reflection-Tuning, open-source AI, HyperWrite

Отражение 70B – это открытая крупномасштабная языковая модель (LLM), разработанная компанией HyperWrite. Эта новая модель представляет собой подход к когнитивным процессам ИИ, который может изменить то, как мы взаимодействуем с системами ИИ и полагаемся на них в различных областях, от обработки языка до решения сложных проблем.

Благодаря Отражающему настройке, новаторской технике, которая позволяет модели自окорректировать и исправлять свои собственные ошибки в режиме реального времени, Отражение 70B быстро поднялось на вершину, обогнав проприетарные модели, такие как GPT-4 и Claude 3.5 Sonnet, на нескольких эталонных тестах, включая MMLU, MATH и HumanEval.

Отражение 70B построено на основе прочной Llama 3.1-70B архитектуры, но его механизм самоисправления отличает его. Через итеративные циклы отражения, обнаружения ошибок и уточнения вывода модель имитирует человеческий когнитивный процесс беспрецедентным образом, расширяя границы того, что может достичь ИИ. В результате Отражение 70B предлагает не только непревзойденную точность, но и более глубокое понимание своего процесса принятия решений, критически важный фактор для применений, где прозрачность и точность имеют первостепенное значение.

Что такое Отражение 70B

В своей основе Отражение 70B построено на открытой модели Llama 3.1-70B компании Meta. Однако то, что действительно отличает его, – это уникальная способность заниматься процессом, подобным человеческому отражению, – отсюда и его название. Эта способность обусловлена техникой, называемой “Отражающей настройкой“, которая позволяет модели выявлять и исправлять свои собственные ошибки в режиме реального времени, тем самым повышая свою точность и надежность.

Мэтт Шумер, генеральный директор HyperWrite, представил Отражение 70B с смелым заявлением, что это “лучшая открытая модель ИИ в мире.” Но что именно делает эту модель такой особенной, и как она сравнивается с гигантами индустрии, такими как GPT-4 и Claude 3.5 Sonnet? Давайте рассмотрим.

Понимание селективной отражающей настройки: сдвиг парадигмы в обучении ИИ

Селективная отражающая настройка вводит подход к настройке инструкций, где целью является улучшение качества данных инструкций и их совместимости со студенческой моделью, которая подвергается тонкой настройке. Традиционные методы часто фокусируются на улучшении самих данных, но упускают из виду, насколько хорошо улучшенные данные пары соответствуют целям обучения модели. Селективная отражающая настройка мостит этот разрыв, создавая сотрудничество между учителем и студентом, где модель учителя интроспективно рассматривает данные и предоставляет уточненные пары инструкций и ответов, в то время как модель студента оценивает и выбирает только те улучшения, которые лучше всего соответствуют ее потребностям в обучении.

Метод селективной отражающей настройки, демонстрирующий сотрудничество между моделью учителя и моделью студента

Процесс состоит из двух ключевых фаз:

  1. Селективное отражение инструкций: Модель учителя отражает на инструкцию данного образца и генерирует уточненную пару инструкции и ответа. Модель студента оценивает, является ли это новое инструкция полезным на основе метрики, называемой Трудность выполнения инструкции (IFD). Метрика IFD оценивает трудность образца для модели студента, гарантируя, что только данные, которые бросают вызов модели, сохраняются.
  2. Селективное отражение ответов: На этом этапе модель учителя отражает на ответах, сгенерированных на первом этапе. Модель студента оценивает эти ответы с помощью Обратной трудности выполнения инструкции (r-IFD), метрики, которая измеряет, насколько возможно для модели студента вывести инструкцию на основе ответа. Это гарантирует, что ответ не только улучшает рассуждения модели, но и хорошо соответствует существующим знаниям модели.

Применяя как IFD, так и r-IFD, селективная отражающая настройка производит пары данных, которые являются сложными, но осуществимыми, улучшая процесс настройки инструкций без необходимости дополнительных наборов данных. Результатом является более эффективная по выборке и высокопроизводительная LLM, которая превосходит многие более крупные модели.

Архитектура мышления: как Отражение 70B “думает”

Архитектура Отражения 70B поднимает рассуждения ИИ на новый уровень, разделяя процесс мышления на несколько стадий. Каждая стадия позволяет модели улучшаться итеративно через самоотражение, подобно человеческому когнитивному процессу:

  1. Первоначальные данные и ответ: Модель начинает с генерации ответа на данную инструкцию. Этот первоначальный вывод аналогичен стандартным выводам LLM.
  2. Селективное отражение инструкций: После генерации первоначального ответа модель переходит в фазу отражения инструкций. Модель учителя отражает на исходной инструкции и предлагает улучшения. Эти предложения затем оцениваются моделью студента с помощью метрики IFD, чтобы определить, является ли новая пара инструкции и ответа более подходящей для дальнейшей настройки.
  3. Селективное отражение ответов: Следующим шагом является уточнение ответа самого по себе. Здесь модель учителя генерирует новый ответ на основе обновленной инструкции. Модель студента, используя метрику r-IFD, оценивает, помогает ли новый ответ лучше вывести инструкцию.
  4. Окончательная настройка инструкций: Как только лучшая пара инструкции и ответа выбрана, она добавляется в окончательный набор данных, используемый для тонкой настройки модели. Этот многоступенчатый процесс гарантирует, что только наиболее эффективные и согласованные пары инструкций и ответов включаются в данные тонкой настройки.

Этот структурированный процесс отражения позволяет пользователям видеть, как модель проходит через свой процесс мышления, создавая прозрачность и значительно улучшая точность и последовательность в сложных задачах.

Тестирование блеска: Отражение 70B в действии

Использование Отражением 70B селективной отражающей настройки не только предлагает более совершенный процесс обучения, но и достигает ведущих показателей производительности на нескольких эталонных тестах. Благодаря своему механизму самооценки модель превосходит проприетарные модели, которые значительно больше по размеру.

  1. MMLU (Массовое многозадачное понимание языка): Отражение 70B набрало впечатляющие 72,2%, превзойдя другие крупные открытые модели, такие как LLaMA 2.
  2. Математический эталон: В задачах математических рассуждений модель превзошла GPT-4 и Claude 3.5, демонстрируя свою силу в решении сложных проблем.
  3. IFEval и GSM8K: Отражение 70B также преуспело в IFEval, где его согласованность инструкции и ответа оценивалась, и в GSM8K, математическом эталоне решения проблем. Самоотражающая настройка позволила модели справиться с сложными и нюансированными проблемами более эффективно, чем ее более крупные конкуренты.

Используя селективную отражающую настройку, Отражение 70B продемонстрировало, что размер не является единственным фактором для достижения высоких показателей производительности. Способность самокорректировки и отражения на своих выводах привела к более сильным и согласованным рассуждениям, позволяя ей превзойти модели с большим количеством параметров.

График сравнения производительности sRecycled WizardLM 7B с другими моделями, такими как Zephyr 7B Beta, Vicuna 13B v1.3 и LLaMA2 Chat 7B

Сравнение производительности sRecycled WizardLM 7B с другими моделями

Реальные применения: использование потенциала Отражения 70B

Отражение 70B с его коррекцией ошибок в режиме реального времени и прозрачным принятием решений открывает новые возможности в различных областях. Ниже приведены некоторые реальные применения:

Сложное решение проблем

Сила Отражения 70B заключается в решении сложных проблем. Рассмотрим сложный математический запрос:


<p>Пользователь: "Решите уравнение: 2x^2 + 5x - 3 = 0"
Отражение 70B:</p>

<p>&lt;thinking&gt; Применение квадратичной формулы...&lt;/thinking&gt;
&lt;reflection&gt; Коррекция в расчете...&lt;/reflection&gt;
&lt;output&gt; Решения: x = 1/2 и x = -3.&lt;/output&gt;

Перевод языка с культурной чувствительностью

В отличие от типичных моделей перевода, Отражение 70B адаптирует переводы языка к культурным контекстам:

Пользователь: "Переведите 'It's raining cats and dogs' на французский, учитывая культурный контекст."
Отражение 70B:

<p>thinking: Буквальный перевод будет "Il pleut des chats et des chiens"...thinking;
reflection: Культурно подходящий перевод будет "Il pleut des cordes."reflection;
output: Перевод предоставлен.

Улучшение отладки и оптимизации кода

Способность Отражения 70B к коррекции ошибок делает его идеальным для отладки и оптимизации кода:

Пользователь: "Отладите этот код Python..."
Отражение 70B: &lt;thinking&gt; Анализирую шаг за шагом...&lt;/thinking&gt;
&lt;reflection&gt; Определена бесконечная рекурсия.&lt;/reflection&gt;
&lt;output&gt; Исправленная версия кода с правильной рекурсией.&lt;/output&gt;

Расширение конкурентного ландшафта моделей 70B

Хотя Отражение 70B делает волны, оно является частью более широкой экосистемы моделей с 70 миллиардами параметров. Вот как оно сравнивается с другими:

  • Мета Llama 3.1-70B: Прочная базовая модель, известная своими общими применениями.
  • Claude 2 70B (Anthropic): Ориентирована на этический ИИ, умело решает проблемы рассуждения и генерации длинного контента.
  • GPT-3.5 70B (OpenAI): Легкая версия GPT-4, отличается балансом производительности и эффективности.
  • BLOOM 70B: Мультимедийная модель, обученная на естественных и программных языках.
  • Falcon 70B: Отмечена своей эффективностью обучения и вывода.

Эффективное выполнение моделей 70B: последние техники

Эффективное выполнение моделей такого размера – нетривиальная задача. Чтобы максимизировать производительность, вот последние стратегии:

1. Квантование

Уменьшение точности весов модели помогает снизить использование памяти и время вывода. Техники 4-битного квантования с использованием BitsAndBytes позволяют Отражению 70B работать эффективно на меньших GPU.

Пример:

from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-2-70b-hf", load_in_4bit=True)

2. Шардирование модели

Разделение модели на несколько GPU (например, с помощью DeepSpeed Zero) позволяет обрабатывать более крупные модели без превышения памяти GPU.

from xformers.ops import memory_efficient_attention
model.attention = memory_efficient_attention

3. Смешанная точность и эффективное внимание

FlashAttention и xformers снижают нагрузку внимания, улучшая время обработки для крупных входных последовательностей.

from xformers.ops import memory_efficient_attention
model.attention = memory_efficient_attention

4. Отложение на CPU и обрезание

Отложение на CPU и обрезание менее критических весов помогают запускать модели на более скромном оборудовании, сохраняя при этом производительность.

from accelerate import cpu_offload
model = cpu_offload(model)

Взгляд в будущее: будущее с Отражением 405B

Следующим рубежом для HyperWrite является разработка Отражения 405B, модели, которая, как ожидается, превзойдет Отражение 70B по масштабу и производительности. Эта модель направлена на то, чтобы расширить границы открытого ИИ, позиционируя себя для挑жения даже самых передовых проприетарных моделей, таких как GPT-5.

Заключение

Благодаря Отражающей настройке Отражение 70B достигло ведущих показателей производительности на ключевых эталонных тестах, сохраняя при этом уровень прозрачности и точности, редко встречающийся в открытых моделях ИИ. Его способность к самоисправлению дает ему существенное преимущество, особенно в областях, требующих высоких уровней точности, таких как кодирование, перевод языка и решение сложных проблем.

Я провел последние пять лет, погружаясь в увлекательный мир машинного обучения и глубокого обучения. Моя страсть и экспертиза привели меня к участию в более чем 50 различных проектах программной инженерии, с особым акцентом на ИИ/МО. Мое непрекращающееся любопытство также привело меня к обработке естественного языка, области, которую я с нетерпением жду возможности изучить дальше.