Моделі та платформи ШІ

Всередині Microsoft Phi-3 Mini: Легкий модуль штучного інтелекту, який перевершує свої можливості

mm
Додайте Unite.AI до бажаних джерел у Google

Microsoft (MSFT ) недавно представила свій останній легкий мовний модуль під назвою Phi-3 Mini, який запускає тріо компактних моделей штучного інтелекту, призначених для надання передових можливостей при мінімальному розмірі, що дозволяє їм працювати ефективно на пристроях з обмеженими обчислювальними ресурсами. При розмірі лише 3,8 мільярдів параметрів Phi-3 Mini є лише частиною розміру гігантів штучного інтелекту, таких як GPT-4, проте він обіцяє дорівнювати їхнім можливостям у багатьох ключових областях.

Розробка Phi-3 Mini представляє собою значний етап у напрямку демократизації передових можливостей штучного інтелекту, роблячи їх доступними на ширшому спектрі апаратного забезпечення. Його малий розмір дозволяє йому бути розгорнутим локально на смартфонах, планшетах та інших пристроях краю, подолавши затримку та проблеми конфіденційності, пов’язані з хмарними моделями. Це відкриває нові можливості для інтелектуальних досвідів на пристроях у різних галузях, від віртуальних помічників та розмовного штучного інтелекту до помічників програмування та завдань зі समझу мови.

4-бітова квантизація phi-3-mini, що працює на iPhone
4-бітова квантизація phi-3-mini, що працює на iPhone

Під капотом: Архітектура та навчання

У своїй основі Phi-3 Mini є моделлю декодера трансформера, побудованою на подібній архітектурі, як і відкрита модель Llama-2. Вона має 32 шари, 3072 приховані розміри та 32 голови уваги, з довжиною контексту за замовчуванням 4 000 токенів. Microsoft також представила довгу версію контексту під назвою Phi-3 Mini-128K, яка розширює довжину контексту до 128 000 токенів за допомогою технік, таких як LongRope.

Що відрізняє Phi-3 Mini, однак, це його методологія навчання. Замість того, щоб покладатися виключно на силу величезних наборів даних та обчислювальної потужності, Microsoft зосередилася на створенні високоякісного, щільного навчального набору даних. Ці дані складаються з сильно фільтрованих веб-даних, а також синтетичних даних, згенерованих більшістю моделей мови.

Процес навчання відбувається у два етапи. На першому етапі модель піддається впливу різноманітних веб-джерел, спрямованих на навчання її загальним знанням та розумінням мови. Другий етап поєднує ще більш сильно фільтровані веб-дані з синтетickými даними, призначеними для надання логічних навичок розуміння та експертизи в окремих галузях.

Microsoft називає цей підхід “оптимальним режимом даних”, який відрізняється від традиційного “оптимального режиму обчислень” або “перенавчування” багатьох великих мовних моделей. Метою є підлаштування навчальних даних до масштабу моделі, забезпечуючи правильний рівень знань та можливостей розуміння, залишаючи при цьому достатню ємність для інших можливостей.

Якість нових моделей Phi-3, виміряна за допомогою бенчмарку Massive Multitask Language Understanding (MMLU)
Якість нових моделей Phi-3, виміряна за допомогою бенчмарку Massive Multitask Language Understanding (MMLU)

Цей підхід, орієнтований на дані, дав свої плоди, оскільки Phi-3 Mini демонструє вражаючі результати на широкому спектрі академічних бенчмарків, часто дорівнюючи або перевершуючи набагато більші моделі. Наприклад, він набирає 69% на бенчмарку MMLU для багатовекторного навчання та розуміння, і 8,38 на бенчмарку MT-bench для математичних розрахунків – результати, які відповідають моделям типу Mixtral 8x7B і GPT-3.5.

Безпека та надійність

Поряд з вражаючими можливостями Microsoft поставила сильний акцент на безпеці та надійності під час розробки Phi-3 Mini. Модель пройшла суворий післянавчальний процес, що включає наглядальне тонке налаштування (SFT) та пряму оптимізацію переваг (DPO).

Стадія SFT використовує сильно відфільтровані дані з різних галузей, включаючи математику, програмування, розуміння, розмови, ідентичність моделі та безпеку. Це допомагає зміцнити можливості моделі в цих областях, надаючи їй сильне відчуття ідентичності та етичного поведінки.

Стадія DPO, з іншого боку, зосереджена на відхиленні моделі від нежаданих поведінок за допомогою відхилених відповідей як негативних прикладів. Цей процес охоплює дані у форматі чату, завдання з розуміння та зусилля щодо відповідальності штучного інтелекту (RAI), забезпечуючи, щоб Phi-3 Mini відповідав принципам етичного та довірчого штучного інтелекту Microsoft.

Щоб ще більше підвищити свій профіль безпеки, Phi-3 Mini був підданий широкому червоному тестуванню та автоматизованому тестуванню по десяткам категорій шкоди RAI. Незалежна червона команда в Microsoft ітеративно вивчала модель, визначаючи області для покращення, які потім були вирішені за допомогою додаткових відфільтрованих наборів даних та повторного навчання.

Цей багаторічний підхід суттєво зменшив кількість шкідливих відповідей, фактичних неточностей та упереджень, як це демонструється внутрішніми бенчмарками RAI Microsoft. Наприклад, модель демонструє низький рівень дефектів для шкідливого контенту (0,75%) та підсумовування (10%), а також низький рівень необґрунтованості (0,603), вказуючи на те, що її відповіді твердо засновані на заданому контексті.

Застосування та випадки використання

З вражаючими можливостями та надійними заходами безпеки Phi-3 Mini підходить для широкого спектра застосувань, особливо в середовищах з обмеженими ресурсами та обмеженнями затримки.

Одним з найперспективніших напрямків є розгортання інтелектуальних віртуальних помічників та розмовного штучного інтелекту безпосередньо на мобільних пристроях. Виконуючи роботу локально, ці помічники можуть забезпечувати миттєві відповіді без потреби у мережевому з’єднанні, а також забезпечувати, що конфіденційні дані залишаються на пристрої, вирішуючи проблеми конфіденційності.

Модель Phi-3 Mini з сильними можливостями розуміння також робить її цінним активом для допомоги у програмуванні та математичному вирішенні проблем. Розробники та студенти можуть користатися локальними можливостями завершення коду, виявлення помилок та пояснень, спрощуючи процеси розробки та навчання.

Поза цими застосуваннями відкритість моделі відкриває можливості в таких областях, як розуміння мови, підсумовування тексту та відповіді на запитання. Її малий розмір та ефективність роблять її привабливим вибором для впровадження можливостей штучного інтелекту у широкий спектр пристроїв та систем, від розумних домашніх пристроїв до промислових автоматизованих систем.

Передбачення майбутнього: Phi-3 Small та Phi-3 Medium

Хоча Phi-3 Mini є видатним досягненням сам по собі, Microsoft має ще більші плани щодо сім’ї моделей Phi-3. Компанія вже представила дві більші моделі, Phi-3 Small (7 мільярдів параметрів) та Phi-3 Medium (14 мільярдів параметрів), які, як очікується, будуть розширювати межі можливостей компактних мовних моделей.

Phi-3 Small, наприклад, використовує більш просунуту токенізацію (tiktoken) та механізм групової уваги, а також новий шар блоків блокспарс-уваги, щоб оптимізувати свій пам’ятний слід, зберігаючи при цьому довгий контекст. Він також включає додаткові 10% багатомовних даних, підвищуючи свої можливості у розумінні та генерації мови на кількох мовах.

Phi-3 Medium, з іншого боку, представляє собою суттєвий крок вперед у масштабі, з 40 шарами, 40 головами уваги та розміром вкладення 5 120. Хоча Microsoft зазначає, що деякі бенчмарки можуть потребувати подальшого доопрацювання суміші навчальних даних для повного використання цієї збільшеної ємності, початкові результати обнадійливі, з суттєвими покращеннями над Phi-3 Small у завданнях, таких як MMLU, TriviaQA та HumanEval.

Обмеження та майбутні напрямки

Незважаючи на свої вражаючі можливості, Phi-3 Mini, як і всі мовні моделі, не позбавлена обмежень. Одним з найвражаючих слабкостей є його відносно обмежена здатність зберігати фактичні знання, як це видно з його нижчої продуктивності на бенчмарках, таких як TriviaQA.

Однак, Microsoft вважає, що це обмеження можна пом’якшити шляхом доповнення моделі можливостями пошуку, дозволяючи їй отримувати та розуміти відповідну інформацію за потреби. Цей підхід демонструється у Hugging Face Chat-UI, де Phi-3 Mini може використовувати пошук для покращення своїх відповідей.

Іншою областю для покращення є багатомовні можливості моделі. Хоча Phi-3 Small зробив перші кроки шляхом включення додаткових багатомовних даних, подальша робота потрібна для повного розблокування потенціалу цих компактних моделей для міжмовних застосувань.

Оглядаючи майбутнє, Microsoft зобов’язується продовжувати розвиток сім’ї моделей Phi, вирішуючи їх обмеження та розширюючи їх можливості. Це може включати подальше доопрацювання навчальних даних та методології, а також дослідження нових архітектур та технік, спеціально розроблених для компактних високопродуктивних мовних моделей.

Висновок

Microsoft Phi-3 Mini представляє собою суттєвий крок вперед у демократизації передових можливостей штучного інтелекту. Надання передових можливостей у компактному, ресурсо-ефективному пакеті відкриває нові можливості для інтелектуальних досвідів на пристроях у широкому спектрі застосувань.

Інноваційний підхід моделі до навчання, який підкреслює високоякісні, щільні дані над силою обчислень, став справжнім проривом, дозволяючи Phi-3 Mini перевершувати свої можливості. У поєднанні з її надійними заходами безпеки та тривалим розвитком сім’ї моделей Phi-3 готова відіграти важливу роль у формуванні майбутнього інтелектуальних систем, роблячи штучний інтелект більш доступним, ефективним та довірчим, ніж будь-коли раніше.

Як галузь технологій продовжує розширювати межі того, що можливо з штучним інтелектом, зобов’язання Microsoft щодо легких, високопродуктивних моделей, таких як Phi-3 Mini, представляє собою свіжий відхід від традиційної мудрості “більше – краще”. Демонструючи, що розмір не є всім, Phi-3 Mini має потенціал для натхнення нової хвилі інновацій, зосереджених на максимізації цінності та впливу штучного інтелекту через розумну кураторію даних, вдумливе проектування моделей та відповідальну практику розробки.

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.