Моделі та платформи ШІ

Як Phi-4-Reasoning переозначає висновок ШІ, викликуючи міфу “Чим більший, тим краще”

mm
Додайте Unite.AI до бажаних джерел у Google

Недавнє випуск Microsoft (MSFT ) Phi-4-Reasoning викликає один із ключових припущень щодо побудови систем штучного інтелекту, здатних до висновків. З моменту появи ланцюгового висновку в 2022 році дослідники вважали, що просунуті висновки вимагають великих мовних моделей з сотнями мільярдів параметрів. Однак нова 14-мільярдна модель Microsoft, Phi-4-Reasoning, поставила під сумнів це переконання. Використовуючи даніцентричний підхід замість сприйняття обчислювальної потужності, модель досягає результатів, порівнянних з набагато великими системами. Ця проривна технологія показує, що даніцентричний підхід може бути так само ефективним для навчання висновкових моделей, як і для традиційного навчання ШІ. Це відкриває можливість для менших моделей ШІ досягти просунутих висновків, змінивши спосіб навчання висновкових моделей, рухаючись від “чим більший, тим краще” до “кращі дані – краще”.

Традиційний висновковий парадигма

Ланцюговий висновок став стандартом для вирішення складних проблем у штучному інтелекті. Цей метод спрямовує мовні моделі через висновковий процес, розбиваючи складні проблеми на менші, керувані кроки. Він імітує людське мислення, роблячи моделі “думати вголос” природною мовою перед тим, як давати відповідь.

Однак, ця здатність мала важливе обмеження. Дослідники постійно виявили, що ланцюговий висновок працював добре лише тоді, коли мовні моделі були дуже великими. Спроможність висновку здавалася безпосередньо пов’язаною з розміром моделі, причому більші моделі виконували кращу роботу на складних висновкових завданнях. Це призвело до того, що компанії зосередилися на створенні великих висновкових моделей, де компанії зосередилися на перетворенні великих мовних моделей у потужні висновкові двигуни.

Ідея включення висновкових можливостей до моделей ШІ здебільшого виникла з спостереження, що великі мовні моделі можуть виконувати вивчення в контексті. Дослідники виявили, що коли моделі показують приклади того, як вирішувати проблеми крок за кроком, вони вчаться слідувати цьому шаблону для нових проблем. Це призвело до переконання, що більші моделі, навчені на величезних даних, природно розвивають більш просунуті висновки. Сильна зв’язок між розміром моделі та висновковими можливостями стала загальноприйнятою мудрістю. Команди вклали величезні ресурси у масштабування висновкових можливостей за допомогою підкріплювального навчання, вважаючи, що обчислювальна потужність є ключем до просунутих висновків.

Поняття данихцентричного підходу

Поява данихцентричного ШІ викликає менталітет “чим більший, тим краще”. Цей підхід зсуває фокус від архітектури моделі до ретельної інженерії даних, використовуваних для навчання систем ШІ. Замість того, щоб розглядати дані як фіксовані входи, даніцентрична методологія розглядає дані як матеріал, який можна покращити та оптимізувати для підвищення продуктивності ШІ.

Ендрю Нг, лідер у цій галузі, просуває побудову систематичної інженерної практики для покращення якості даних, а не лише коригування коду чи масштабування моделей. Ця філософія визнає, що якість даних та кураторство часто важливіше, ніж розмір моделі. Компанії, які приймають цей підхід, показують, що менші, добре навчені моделі можуть перевершити більші, якщо вони навчені на високоякісних, ретельно підготовлених наборах даних.

Данихцентричний підхід ставить інше питання: “Як ми можемо покращити наші дані?” замість “Як ми можемо зробити модель більша?” Це означає створення кращих навчальних наборів даних, покращення якості даних та розвиток систематичної інженерії даних. У данихцентричному ШІ фокусується на розумінні того, що робить дані ефективними для конкретних завдань, а не просто збираючи більше даних.

Цей підхід показав велику перспективу у навчанні малих, але потужних моделей ШІ за допомогою малих наборів даних та значно менше обчислень. Моделі Phi від Microsoft є хорошим прикладом навчання малих мовних моделей за допомогою данихцентричного підходу. Ці моделі навчені за допомогою curriculum learning, який в основному натхненний тим, як діти вчаться через прогресивно складніші приклади. Спочатку моделі навчені на легких прикладах, які потім поступово замінюються складнішими. Microsoft побудував набір даних з підручників, як пояснюється в їхній роботі “Textbooks Are All You Need.” Це допомогло Phi-3 перевершити моделі, такі як Google’s (GOOGL ) Gemma і GPT 3.5, у завданнях, таких як розуміння мови, загальні знання, математичні завдання шкільного рівня та медичні питання.

Незважаючи на успіх данихцентричного підходу, висновок загалом залишався особливістю великих моделей ШІ. Це тому, що висновок вимагає складних шаблонів та знань, які великомасштабні моделі захоплюють легше. Однак це переконання було недавно викликано розробкою моделі Phi-4-Reasoning.

Проривна стратегія Phi-4-Reasoning

Phi-4-Reasoning показує, як даніцентричний підхід можна використовувати для навчання малих висновкових моделей. Модель була побудована шляхом супервайзного тонкого налаштування базової моделі Phi-4 на ретельно вибраних “навчальних” промптах та висновкових прикладах, згенерованих з OpenAI’s o3-mini. Фокус був на якості та специфіці, а не на розмірі набору даних. Модель навчена за допомогою близько 1,4 мільйона високоякісних промптів замість мільярдів загальних. Дослідники відфільтрували приклади, щоб покрити різні рівні складності та типи висновку, забезпечуючи різноманітність. Ця ретельна кураторство зробило кожен навчальний приклад цілеспрямованим, навчаючи модель конкретним висновковим шаблонам, а не просто збільшуючи обсяг даних.

У супервайзному тонкому налаштуванні модель навчена з повними висновковими демонстраціями, що включають повний процес мислення. Ці крок за кроком висновкові ланцюги допомогли моделі навчитися будувати логічні аргументи та розв’язувати проблеми систематично. Щоб ще більше підвищити висновкові можливості моделі, її подальше уточнення здійснюється за допомогою підкріплювального навчання на близько 6 000 високоякісних математичних завдань з верифікованими рішеннями. Це показує, що навіть мала кількість зосередженого підкріплювального навчання може суттєво покращити висновок, коли його застосовують до ретельно відібраних даних.

Результати, що перевершують очікування

Результати доводять, що цей даніцентричний підхід працює. Phi-4-Reasoning перевершує набагато більші відкриті моделі, такі як DeepSeek-R1-Distill-Llama-70B, і майже дорівнює повній DeepSeek-R1, незважаючи на те, що вона значно менша. На тесті AIME 2025 (кваліфікаційний раунд американської математичної олімпіади) Phi-4-Reasoning перевершує DeepSeek-R1, який має 671 мільярд параметрів.

Ці здобутки виходять за межі математики до наукового розв’язання проблем, програмування, алгоритмів, планування та просторових завдань. Покращення від ретельної кураторства даних добре переносяться на загальні бенчмарки, що свідчить про те, що цей метод будує фундаментальні висновкові навички, а не завдання-специфічні трюки.

Phi-4-Reasoning викликає ідею про те, що просунуті висновки потребують масивної обчислювальної потужності. Модель з 14 мільярдами параметрів може дорівнювати результатам моделей, які у десятки разів більші, якщо вона навчена на ретельно відібраних даних. Ця ефективність має важливі наслідки для розгортання висновкових моделей ШІ, де ресурси обмежені.

Наслідки для розвитку ШІ

Успіх Phi-4-Reasoning сигналізує про зміну того, як висновкові моделі ШІ повинні бути побудовані. Замість того, щоб зосереджуватися в основному на збільшенні розміру моделі, команди можуть досягти кращих результатів, інвестуючи у якість даних та кураторство. Це робить просунуті висновки більш доступними для організацій без величезних обчислювальних бюджетів.

Данихцентричний метод також відкриває нові напрямки досліджень. Майбутня робота може зосередитися на пошуку кращих навчальних промптів, створенні багатших висновкових демонстрацій та розумінні того, які дані найкраще допомагають висновку. Ці напрямки можуть бути більш продуктивними, ніж просто будівництво більших моделей.

Ширше, це може допомогти демократизувати ШІ. Якщо менші моделі, навчені на відібраних даних, можуть дорівнювати великим моделям, просунуті ШІ стають доступними для більшої кількості розробників та організацій. Це також може прискорити прийняття та інновації ШІ в областях, де дуже великі моделі не є практичними.

Майбутнє висновкових моделей

Phi-4-Reasoning встановлює новий стандарт для розвитку висновкових моделей. Майбутні системи ШІ, ймовірно, будуть балансувати ретельне кураторство даних з архітектурними поліпшеннями. Цей підхід визнає, що як якість даних, так і проектування моделі мають значення, але покращення даних може дати швидші, більш економічні здобутки.

Це також дозволяє створювати спеціалізовані висновкові моделі, навчені на домен-специфічних даних. Замість загальних гігантів команди можуть будувати зосереджені моделі, що excelling у конкретних галузях за допомогою цілеспрямованого кураторства даних. Це створить більш ефективні ШІ для конкретних застосунків.

Як ШІ розвивається, уроки з Phi-4-Reasoning будуть впливати не лише на навчання висновкових моделей, але й на розвиток ШІ в цілому. Успіх кураторства даних, що перевершує обмеження розміру, свідчить про те, що майбутній прогрес лежить у поєднанні інновацій моделей з розумною інженерією даних, а не лише будівництвом більших архітектур.

Резюме

Microsoft Phi-4-Reasoning змінює загальне переконання, що просунуті висновки ШІ потребують дуже великих моделей. Замість того, щоб сприймати розмір, ця модель використовує даніцентричний підхід з високоякісними та ретельно вибраними навчальними даними. Phi-4-Reasoning має лише 14 мільярдів параметрів, але виконує так само добре, як і набагато великі моделі на складних висновкових завданнях. Це показує, що фокусування на кращих даних важливіше, ніж просто збільшення розміру моделі.

Цей новий спосіб навчання робить просунуті висновкові ШІ більш ефективними та доступними для організацій, які не мають великих обчислювальних ресурсів. Успіх Phi-4-Reasoning вказує на новий напрямок у розвитку ШІ. Він зосереджується на покращенні якості даних, розумному навчанні та ретельному інженерному забезпеченні, а не лише на збільшенні розміру моделі.

Цей підхід може допомогти ШІ розвиватися швидше, зменшити витрати та дозволити більшій кількості людей та компаній використовувати потужні інструменти ШІ. У майбутньому ШІ, ймовірно, буде розвиватися шляхом поєднання кращих моделей з кращими даними, роблячи просунуті ШІ корисними у багатьох спеціалізованих областях.

Доктор Техсін Зія є доцентом COMSATS University Islamabad, який має ступінь PhD з штучного інтелекту у Віденському технічному університеті, Австрія. Спеціалізується на штучному інтелекті, машинному навчанні, науці про дані та комп'ютерному баченні, він зробив значний внесок з публікаціями в авторитетних наукових журналах. Доктор Техсін також очолював різні промислові проекти як головний дослідник і служив консультантом з штучного інтелекту.