Модели и платформы ИИ

Интеллектуальный ИИ Tülu 3 от Allen AI стал неожиданным соперником DeepSeek

mm
Добавьте Unite.AI в избранные источники в Google

Новости продолжают поступать. Модели DeepSeek бросают вызов стандартам, устанавливают новые рекорды и привлекают большое внимание. Но что-то интересное только что произошло в области исследований ИИ, что также заслуживает вашего внимания.

Allen AI тихо выпустила свою новую семью моделей Tülu 3, и их версия с 405 миллиардами параметров не только конкурирует с DeepSeek, но и опережает или равна ей на ключевых тестах.

Давайте поставим это в перспективу.

Модель Tülu 3 с 405 миллиардами параметров конкурирует с лучшими моделями, такими как DeepSeek V3, в различных задачах. Мы наблюдаем сопоставимые или лучшие результаты в таких областях, как математические задачи, задачи программирования и точное выполнение инструкций. И они делают это с полностью открытым подходом.

Они выпустили полный процесс обучения, код и даже свою новую методику обучения с верифицированными вознаграждениями, называемую Reinforcement Learning with Verifiable Rewards (RLVR), которая сделала это возможным.

Такие разработки за последние несколько недель действительно меняют, как происходит разработка лучших ИИ. Когда полностью открытая модель может конкурировать с лучшими закрытыми моделями, это открывает возможности, которые ранее были заперты за закрытыми корпоративными стенами.

Техническая битва

Что сделало Tülu 3 выдающимся? Это заключается в уникальном четырехэтапном процессе обучения, который выходит за рамки традиционных подходов.

Давайте посмотрим, как Allen AI построила эту модель:

Этап 1: Стратегический выбор данных

Команда знала, что качество модели начинается с качества данных. Они объединили устоявшиеся наборы данных, такие как WildChat и Open Assistant, с自动生成ным контентом. Но вот ключевое прозрение: они не просто агрегировали данные, а создали целевые наборы данных для конкретных навыков, таких как математическое рассуждение и программирование.

Этап 2: Построение лучших ответов

На втором этапе Allen AI сосредоточилась на обучении модели конкретным навыкам. Они создали различные наборы данных для обучения – некоторые для математики, другие для программирования и еще больше для общих задач. Тестируя эти комбинации повторно, они могли увидеть точно, где модель преуспела и где ей нужно улучшение. Этот итеративный процесс раскрыл истинный потенциал того, чего может достичь Tülu 3 в каждой области.

Этап 3: Обучение на сравнениях

Вот где Allen AI стала творческой. Они построили систему, которая могла мгновенно сравнить ответы Tülu 3 с ответами других лучших моделей. Но они также решили постоянную проблему в ИИ – тенденцию моделей писать длинные ответы просто ради длины. Их подход, использующий нормализованную по длине прямую оптимизацию предпочтений (DPO), означал, что модель училась ценить качество над количеством. Результат? Ответы, которые одновременно точны и осмысленны.

Когда модели ИИ учатся на предпочтениях (какой ответ лучше, А или Б?), они склонны развивать разочаровывающую предвзятость: они начинают думать, что более длинные ответы всегда лучше. Это как будто они пытаются выиграть, сказав больше, а не сказав вещи хорошо.

Нормализованная по длине DPO исправляет это, регулируя, как модель учится на предпочтениях. Вместо того, чтобы просто смотреть, какой ответ был предпочтителен, она учитывает длину каждого ответа. Подумайте об этом как о судействе ответов по качеству на слово, а не только по общему влиянию.

Почему это важно? Потому что это помогает Tülu 3 учиться быть точной и эффективной. Вместо того, чтобы заполнять ответы лишними словами, чтобы казаться более полными, она учится доставлять ценность в любой длине, которая действительно необходима.

Это может показаться мелкой деталью, но оно имеет решающее значение для построения ИИ, который общается естественно. Лучшие человеческие эксперты знают, когда быть краткими и когда расширяться – и именно это помогает нормализованная по длине DPO учить модель.

Этап 4: Инновация RLVR

Это технический прорыв, который заслуживает внимания. RLVR заменяет субъективные модели вознаграждения конкретной верификацией.

Большинство моделей ИИ учатся через сложную систему моделей вознаграждения – по сути, образованные догадки о том, что делает хороший ответ. Но Allen AI пошла по другому пути с RLVR.

Подумайте о том, как мы обычно обучаем модели ИИ. Нам обычно нужны другие модели ИИ (называемые моделями вознаграждения), чтобы судить, является ли ответ хорошим или нет. Это субъективно, сложно и часто несогласовано. Некоторые ответы могут показаться хорошими, но содержать тонкие ошибки, которые проскользнули.

RLVR переворачивает этот подход с ног на голову. Вместо того, чтобы полагаться на субъективные суждения, она использует конкретные, верифицированные результаты. Когда модель пытается решить математическую задачу, нет серой зоны – ответ либо правильный, либо неправильный. Когда она пишет код, этот код либо работает правильно, либо нет.

Вот где это становится интересным:

  • Модель получает мгновенную, бинарную обратную связь: 10 баллов за правильные ответы, 0 за неправильные
  • Нет места для частичных баллов или размытой оценки
  • Обучение становится сосредоточенным и точным
  • Модель учится отдавать приоритет точности над правдоподобными, но неправильными ответами

Обучение RLVR (Allen AI)

Результаты? Tülu 3 показала значительные улучшения в задачах, где важна точность. Ее производительность в математическом рассуждении (бенчмарк GSM8K) и задачах программирования заметно возросла. Даже ее выполнение инструкций стало более точным, поскольку модель научилась ценить конкретную точность над приблизительными ответами.

Что делает это особенно интересным, так это то, как это меняет игру для открытого ИИ. Предыдущие подходы часто боролись за то, чтобы соответствовать точности закрытых моделей в технических задачах. RLVR показывает, что с правильным подходом к обучению открытые модели могут достичь того же уровня надежности.

Взгляд на цифры

Версия Tülu 3 с 405 миллиардами параметров конкурирует напрямую с лучшими моделями в области. Давайте посмотрим, где она преуспела и что это значит для открытого ИИ.

Математика

Tülu 3 преуспела в сложном математическом рассуждении. На бенчмарках, таких как GSM8K и MATH, она соответствует производительности DeepSeek. Модель справляется с многоступенчатыми задачами и демонстрирует сильные математические рассуждения.

Код

Результаты программирования оказываются столь же впечатляющими. Благодаря обучению RLVR Tülu 3 пишет код, который эффективно решает задачи. Ее сила заключается в понимании инструкций программирования и создании функциональных решений.

Точное выполнение инструкций

Способность модели следовать инструкциям выделяется как ее основная сила. В то время как многие модели приближают или обобщают инструкции, Tülu 3 демонстрирует замечательную точность в выполнении именно того, что запрошено.

Открывая черный ящик разработки ИИ

Allen AI выпустила не только мощную модель, но и весь процесс ее разработки.

Каждый аспект процесса обучения задокументирован и доступен. От четырехэтапного подхода до методов подготовки данных и реализации RLVR – весь процесс лежит открыто для изучения и воспроизведения. Эта прозрачность устанавливает новый стандарт в разработке высокопроизводительного ИИ.

Разработчики получают всесторонние ресурсы:

  • Полные конвейеры обучения
  • Инструменты обработки данных
  • Фреймворки оценки
  • Спецификации реализации

Это позволяет командам:

  • Модифицировать процессы обучения
  • Адаптировать методы для конкретных потребностей
  • Строить на проверенных подходах
  • Создавать специализированные реализации

Этот открытый подход ускоряет инновации в области. Исследователи могут строить на проверенных методах, а разработчики могут сосредоточиться на улучшениях, а не начинать с нуля.

Восхождение открытого совершенства

Успех Tülu 3 – это большой момент для открытой разработки ИИ. Когда открытые модели соответствуют или превосходят частные альтернативы, это фундаментально меняет отрасль. Исследовательские команды по всему миру получают доступ к проверенным методам, ускоряя свою работу и порождая новые инновации. Частные лаборатории ИИ должны адаптироваться – либо увеличивая прозрачность, либо продвигая технические границы еще дальше.

Глядя вперед, прорывы Tülu 3 в верифицированных вознаграждениях и многоступенчатом обучении намекают на то, что предстоит. Команды могут строить на этих основах, потенциально продвигая производительность еще дальше. Код существует, методы задокументированы, и новая волна разработки ИИ началась. Для разработчиков и исследователей возможность экспериментировать и улучшать эти методы знаменует начало захватывающей главы в разработке ИИ.

Часто задаваемые вопросы (FAQ) о Tülu 3

Что такое Tülu 3 и какие ее ключевые особенности?

Tülu 3 – это семья открытых моделей ИИ, разработанных Allen AI, построенная на основе архитектуры Llama 3.1. Она доступна в различных размерах (8B, 70B и 405B параметров). Tülu 3 предназначена для улучшения производительности в различных задачах, включая знания, рассуждение, математику, программирование, выполнение инструкций и безопасность.

Каков процесс обучения Tülu 3 и какие данные используются?

Обучение Tülu 3 включает несколько ключевых этапов. Сначала команда курирует разнообразный набор запросов из как публичных наборов данных, так и синтетических данных, ориентированных на конкретные навыки, обеспечивая очистку данных от бенчмарков. Далее выполняется тонкая настройка (SFT) на смеси инструкций, математических и программных данных. Затем используется прямая оптимизация предпочтений (DPO) с предпочтительными данными, сгенерированными через обратную связь человека и ИИ. Наконец, для задач с измеримой точностью используется обучение с верифицированными вознаграждениями (RLVR). Tülu 3 использует отобранные наборы данных для каждого этапа, включая инструкции, математику и кодовые данные.

Как Tülu 3 подходит к безопасности и какие метрики используются для ее оценки?

Безопасность является ключевым компонентом разработки Tülu 3, решаемым на протяжении всего процесса обучения. Во время SFT используется набор данных, ориентированный на безопасность, который в основном ортогонален другим ориентированным на задачи данным.

Что такое RLVR?

RLVR – это техника, при которой модель обучается оптимизироваться против верифицированного вознаграждения, например, правильности ответа. Это отличается от традиционного RLHF, который использует модель вознаграждения.

Алекс возглавляет новостные операции Unite.AI, основанные на ИИ, сочетая журналистику, исследования и автоматизацию, чтобы обеспечить своевременное и масштабируемое освещение искусственного интеллекта. Его работа способствует эффективному выявлению новых разработок в области искусственного интеллекта, при этом поддерживая редакционные стандарты издания.