Моделі та платформи ШІ

Allen AI’s Tülu 3 Стало Незачуваним Рівалам DeepSeek

mm
Додайте Unite.AI до бажаних джерел у Google

Новини продовжуються. Моделі DeepSeek викликали挑 війни, встановили нові стандарти та зробили багато шуму. Але щось цікаве тільки що відбулося в сфері дослідження штучного інтелекту, яке також заслуговує на вашу увагу.

Allen AI тихо випустила свою нову Tülu 3 сім’ю моделей, і їхня версія з 405B параметрів не тільки конкурує з DeepSeek, але й дорівнює чи навіть перевершує її на ключових бенчмарках.

Давайте поставимо це в перспективу.

Модель Tülu 3 з 405B параметрів конкурує з топовими виконавцями, такими як DeepSeek V3, у різних завданнях. Ми бачимо порівняльну чи вищу продуктивність у сфері математичних проблем, кодових викликів та точного виконання інструкцій. І вони роблять це з повністю відкритим підходом.

Вони випустили повний процес навчання, код та навіть свою нову методу підкріпленого навчання з верифікованими винагородами (RLVR), яка зробила це можливим.

Такі розробки за останні кілька тижнів дійсно змінюють, як відбувається розвиток штучного інтелекту вищого рівня. Коли повністю відкрита модель може дорівнювати чи перевершувати найкращі закриті моделі, це відкриває можливості, які раніше були закриті за приватними корпоративними стінами.

Технічна Битва

Що зробило Tülu 3 видатним? Це пов’язано з унікальним чотириступеневим процесом навчання, який виходить за межі традиційних підходів.

Давайте розглянемо, як Allen AI створила цю модель:

Ступінь 1: Стратегічне Відбір Даних

Команда знала, що якість моделі починається з якості даних. Вони поєднали встановлені набори даних, такі як WildChat та Open Assistant, з 自动生成ним контентом. Але ось ключовий висновок: вони не просто агрегували дані – вони створили цільові набори даних для конкретних навичок, таких як математична логіка та кодування.

Ступінь 2: Будування Кращих Відповідей

На другому етапі Allen AI зосередилася на навчанні моделі конкретним навичкам. Вони створили різні набори навчальних даних – деякі для математики, інші для кодування та ще більше для загальних завдань. Виконуючи ці комбінації повторно, вони могли бачити точно, де модель excelled і де їй потрібно покращення. Цей ітеративний процес розкрив справжній потенціал того, чого могла досягти Tülu 3 у кожній сфері.

Ступінь 3: Навчання з Порівнянь

Це місце, де Allen AI стала творчою. Вони побудували систему, яка могла миттєво порівнювати відповіді Tülu 3 з іншими топовими моделями. Але вони також вирішили постійну проблему в штучному інтелекті – тенденцію моделей писати довгі відповіді просто заради довжини. Їхній підхід, який використовував нормалізовану довжину Прямої Оптимізації Відпочинку (DPO), означав, що модель навчилася цінувати якість над кількістю. Результат? Відповіді, які є як точними, так і цілеспрямованими.

Коли моделі штучного інтелекту вчаться з переваг (яка відповідь краща, А чи Б?), вони схильні розвивати розчаровуючу упередженість: вони починають думати, що довгі відповіді завжди кращі. Це як вони намагаються перемогти, кажучи більше, а не кажучи речі добре.

Нормалізована довжина DPO виправляє це, регулюючи, як модель вчиться з переваг. Замість того, щоб просто дивитися, яка відповідь була перевагою, вона бере до уваги довжину кожної відповіді. Подумайте про це як судження відповідей за їхню якість на слово, а не тільки їх загальний вплив.

Чому це має значення? Тому що це допомагає Tülu 3 навчатися бути точним і ефективним. Замість того, щоб заповнювати відповіді додатковими словами, щоб вони здавалися більш повними, вона вчиться доставляти цінність у будь-якій довжині, яка фактично потрібна.

Це може здатися дрібницею, але воно є важливим для побудови штучного інтелекту, який спілкується природно. Найкращі людські експерти знають, коли бути лаконичними і коли розгортатися – і саме це нормалізована довжина DPO допомагає вчити модель.

Ступінь 4: Інновація RLVR

Це технічний прорив, який заслуговує уваги. RLVR замінює суб’єктивні моделі винагород на конкретну верифікацію.

Більшість моделей штучного інтелекту вчаться через складну систему моделей винагород – по суті освічені здогади про те, що робить хорошу відповідь. Але Allen AI пішла іншим шляхом з RLVR.

Подумайте, як ми зараз тренуємо моделі штучного інтелекту. Зазвичай нам потрібні інші моделі штучного інтелекту (звані моделями винагород) для судження, чи є відповідь хорошою чи ні. Це суб’єктивно, складно та часто нестабільно. Деякі відповіді можуть здаватися хорошими, але містити тонкі помилки, які прослизають крізь.

RLVR перевергає цей підхід з ніг на голову. Замість того, щоб покладатися на суб’єктивні судження, воно використовує конкретні, верифіковані результати. Коли модель намагається вирішити математичну проблему, немає сірого простору – відповідь або правильна, або неправильна. Коли вона пише код, цей код або працює правильно, або ні.

Ось де це стає цікавим:

  • Модель отримує миттєву, бінарну зворотню зв’язок: 10 балів за правильні відповіді, 0 за неправильні
  • Не існує місця для часткової оцінки або розмитої оцінки
  • Навчання стає зосередженим і точним
  • Модель вчиться ставити точність вище за правдоподібні, але неправильні відповіді

RLVR Навчання (Allen AI)

Результати? Tülu 3 показала значні покращення у завданнях, де точність має найбільше значення. Її продуктивність у математичних rozumінні (бенчмарк GSM8K) та кодових викликах значно зросла. Навіть її виконання інструкцій стало більш точним, оскільки модель навчилася цінувати конкретну точність над приблизними відповідями.

Що робить це особливо цікавим, так це те, як це змінює гру для відкритого штучного інтелекту. Попередні підходи часто боролися за те, щоб досягти тієї ж точності, що й закриті моделі у технічних завданнях. RLVR показує, що з правильним підходом до навчання відкриті моделі можуть досягти того ж рівня надійності.

Огляд Цифр

Версія Tülu 3 з 405B параметрів конкурує безпосередньо з топовими моделями в галузі. Давайте розглянемо, де вона excelled і що це означає для відкритого штучного інтелекту.

Математика

Tülu 3 excelled у складному математичному rozumінні. На бенчмарках, таких як GSM8K і MATH, вона дорівнює продуктивності DeepSeek. Модель обробляє багаторівневі проблеми та демонструє сильні математичні rozumіння можливості.

Код

Результати кодування виявилися однаково вражаючими. Завдяки навчанню RLVR Tülu 3 пише код, який ефективно вирішує проблеми. Її сила полягає в розумінні інструкцій з кодування та створенні функціональних рішень.

Точне Виконання Інструкцій

Спроможність моделі виконувати інструкції виділяється як ключова сила. Хоча багато моделей наближаються або узагальнюють інструкції, Tülu 3 демонструє вражаючу точність у виконанні точно того, що запитується.

Відкриття Чорної Скриньки Розробки Штучного Інтелекту

Allen AI випустила не тільки потужну модель, але й повний процес її розробки.

Кожен аспект процесу навчання задокументований і доступний. Від чотириступеневого підходу до методів підготовки даних та реалізації RLVR – весь процес відкритий для вивчення та реплікації. Ця прозорість встановлює новий стандарт у високопродуктивному розвитку штучного інтелекту.

Розробники отримують комплексні ресурси:

  • Повні навчальні потоки
  • Інструменти обробки даних
  • Фреймворки оцінки
  • Специфікації реалізації

Це дозволяє командам:

  • Модифікувати процеси навчання
  • Приспособлювати методи для конкретних потреб
  • Будувати на перевірених підходах
  • Створювати спеціалізовані реалізації

Цей відкритий підхід прискорює інновації у всій галузі. Дослідники можуть будувати на перевірених методах, а розробники можуть зосередитися на покращеннях, а не починати з нуля.

Зростання Відкритого Штучного Інтелекту

Успіх Tülu 3 – це великий момент для відкритого розвитку штучного інтелекту. Коли відкриті моделі дорівнюють або перевершують приватні альтернативи, це фундаментально змінює галузь. Команди досліджень у всьому світі отримують доступ до перевірених методів, прискорюючи свою роботу та породжуючи нові інновації. Приватні лабораторії штучного інтелекту повинні адаптуватися – або збільшуючи прозорість, або розширюючи технічні межі ще далі.

Оглядаючи вперед, прориви Tülu 3 у верифікованих винагородах та багаторівневому навчанні намітують, що буде далі. Команди можуть будувати на цих фундаментах, потенційно підвищуючи продуктивність ще вище. Код існує, методи задокументовані, і нова хвиля розвитку штучного інтелекту розпочалася. Для розробників та дослідників можливість експериментувати та покращувати ці методи означає початок цікавої глави у розвитку штучного інтелекту.

Часто Задавані Питання (FAQ) про Tülu 3

Що таке Tülu 3 і які її ключові особливості?

Tülu 3 – це сім’я відкритих моделей великої мови, розроблених компанією Allen AI, побудованих на основі архітектури Llama 3.1. Вона доступна у різних розмірах (8B, 70B і 405B параметрів). Tülu 3 призначена для покращення продуктивності у різних завданнях, включаючи знання, rozumіння, математику, кодування, виконання інструкцій та безпеку.

Який процес навчання використовується для Tülu 3 і які дані використовуються?

Навчання Tülu 3 включає кілька ключових етапів. Спочатку команда підготувала різноманітний набір запитів з публічних наборів даних та синтетичних даних, орієнтованих на конкретні навички, забезпечуючи, щоб дані були очищені від бенчмарків. Другий етап включає супервізоване тонке налаштування (SFT) на змішаних даних виконання інструкцій, математики та кодування. Далі використовується пряма оптимізація переваг (DPO) з перевагами, згенерованими людьми та моделями великої мови. Нарешті, використовується підкріплене навчання з верифікованими винагородами (RLVR) для завдань з вимірною правильністю. Tülu 3 використовує підібрані набори даних для кожного етапу, включаючи інструкції, математику та кодові дані.

Як Tülu 3 підходить до безпеки та які метрики використовуються для її оцінки?

Безпека є ключовим компонентом розробки Tülu 3, розглянутим на всіх етапах процесу навчання. Під час SFT використовується набір даних, орієнтований на безпеку, який виявився в основному ортогональним до інших завдань.

Що таке RLVR?

RLVR – це техніка, при якій модель тренується для оптимізації з верифікованою винагородою, як наприклад правильність відповіді. Це відрізняється від традиційного підкріпленого навчання з людським зворотним зв’язком (RLHF), яке використовує модель винагороди.

Alex очолює новинні операції Unite.AI, що працюють на базі ШІ, поєднуючи журналістику, дослідження та автоматизацію, щоб підтримувати своєчасне та масштабоване висвітлення штучного інтелекту. Його робота допомагає забезпечити ефективне виявлення нових розробок у сфері ШІ, зберігаючи редакційні стандарти видання.