Моделі та платформи ШІ

Зростання малих моделей розуміння: чи можуть компактні моделі штучного інтелекту дорівнювати можливостям GPT?

mm
Додайте Unite.AI до бажаних джерел у Google

За останні роки галузь штучного інтелекту була захоплена успіхом великих мовних моделей (LLM). Спочатку розроблені для обробки природної мови, ці моделі еволюціонували у потужні інструменти розуміння, здатні вирішувати складні задачі з людським мисленням. Однак, незважаючи на їх виняткові можливості розуміння, LLM мають суттєві недоліки, включаючи високі обчислювальні витрати та повільну швидкість розгортання, що робить їх непрактичними для використання в реальному світі в умовах обмежених ресурсів, таких як мобільні пристрої або=edge-обчислення. Це призвело до зростання інтересу до розробки менших, більш ефективних моделей, які можуть пропонувати подібні можливості розуміння, мінімізуючи витрати та вимоги до ресурсів. Ця стаття досліджує зростання цих малих моделей розуміння, їх потенціал, виклики та наслідки для майбутнього штучного інтелекту.

Зміна перспективи

Для більшої частини недавньої історії галузі штучного інтелекту слідувала принципу “законів масштабування”, який припускає, що продуктивність моделі покращується передбачувано при збільшенні даних, обчислювальної потужності та розміру моделі. Хоча цей підхід дав потужні моделі, він також призвів до суттєвих компромісів, включаючи високі витрати на інфраструктуру, вплив на довкілля та проблеми затримки. Не всі застосування потребують повної потужності великих моделей з сотнями мільярдів параметрів. У багатьох практичних випадках – таких як асистенти на пристроях, охорона здоров’я та освіта – менші моделі можуть досягати подібних результатів, якщо вони можуть розуміти ефективно.

Розуміння розуміння в штучному інтелекті

Розуміння в штучному інтелекті відноситься до здатності моделі слідувати логічним ланцюгам, розуміти причину та наслідок, виводити наслідки, планувати кроки в процесі та визначати протиріччя. Для мовних моделей це часто означає не тільки отримання інформації, але й маніпулювання та виведення інформації через структурований, крок за кроком підхід. Цей рівень розуміння зазвичай досягається шляхом налаштування LLM для виконання багатокрокового розуміння перед тим, як надати відповідь. Хоча цей метод ефективний, він вимагає суттєвих обчислювальних ресурсів і може бути повільним та дорогим у розгортанні, що викликає занепокоєння щодо їх доступності та впливу на довкілля.

Розуміння малих моделей розуміння

Малі моделі розуміння спрямовані на повторення можливостей великих моделей, але з більшою ефективністю щодо обчислювальної потужності, використання пам’яті та затримки. Ці моделі часто використовують техніку, звану дистиляцією знань, де менша модель ( “учень”) вчиться у більшої, попередньо натренованої моделі (“вчитель”). Процес дистиляції включає навчання меншої моделі на даних, згенерованих більшим моделем, з метою передачі здатності розуміння. Модель учня потім налаштовується для покращення її продуктивності. У деяких випадках включається підкріплення навчання з спеціалізованими домен-специфічними функціями винагороди для подальшого покращення здатності моделі виконувати завдання-специфічне розуміння.

Зростання та вдосконалення малих моделей розуміння

Помітним етапом у розвитку малих моделей розуміння стало випуск DeepSeek-R1. Незважаючи на те, що вона була натренована на відносно скромному кластері старих GPU, DeepSeek-R1 досягла продуктивності, порівнянної з більшістю моделей, таких як OpenAI’s o1 на бенчмарках, таких як MMLU та GSM-8K. Це досягнення призвело до переоцінки традиційного підходу масштабування, який припускав, що більші моделі є суттєво кращими.

Успіх DeepSeek-R1 можна пояснити її інноваційним процесом навчання, який поєднував великомасштабне підкріплення навчання без використання нагляду налаштування на ранніх етапах. Ця інновація призвела до створення DeepSeek-R1-Zero, моделі, яка продемонструвала вражаючі можливості розуміння, порівнянні з великими моделями розуміння. Далі вдосконалення, такі як використання даних холодного старту, покращили когерентність моделі та виконання завдань, особливо в таких областях, як математика та код.

Крім того, техніки дистиляції виявилися важливими для розробки менших, більш ефективних моделей з більших. Наприклад, DeepSeek випустила дистильовані версії своїх моделей, розміром від 1,5 мільярда до 70 мільярдів параметрів. Використовуючи ці моделі, дослідники натренували порівняно меншу модель DeepSeek-R1-Distill-Qwen-32B, яка перевершила OpenAI’s o1-mini на різних бенчмарках. Ці моделі тепер можуть бути розгорнуті на стандартному обладнанні, що робить їх більш життєздатним варіантом для широкого спектра застосунків.

Чи можуть малі моделі дорівнювати можливостям GPT?

Для оцінки того, чи можуть малі моделі розуміння (SRM) дорівнювати можливостям великих моделей (LRM), таких як GPT, необхідно оцінити їх продуктивність на стандартних бенчмарках. Наприклад, модель DeepSeek-R1 отримала близько 0,844 на тесті MMLU, порівняному з більшістю моделей, таких як o1. На наборі даних GSM-8K, який фокусується на математичних завданнях для учнів початкової школи, дистильована модель DeepSeek-R1 демонструвала топ-тієрову продуктивність, перевершивши як o1, так і o1-mini.

У завданнях кодування, таких як ті, що на LiveCodeBench та CodeForces, дистильовані моделі DeepSeek-R1 виконали подібно до o1-mini та GPT-4o, демонструючи сильні можливості розуміння в програмуванні. Однак більші моделі все ще мають перевагу у завданнях, які вимагають ширшого розуміння мови або обробки довгих контекстних вікон, оскільки менші моделі tendють бути більш завдання-специфічними.

Незважаючи на свої сильні сторони, малі моделі можуть боротися з розширеними завданнями розуміння або коли вони стикаються з неконтрольованими даними. Наприклад, у симуляціях шахових ігор LLM DeepSeek-R1 зробила більше помилок, ніж більші моделі, що свідчить про обмеження її здатності підтримувати увагу та точність протягом тривалого часу.

Компроміси та практичні наслідки

Компроміси між розміром моделі та продуктивністю є критичними при порівнянні SRM з GPT-рівневими LRM. Менші моделі вимагають менше пам’яті та обчислювальної потужності, що робить їх ідеальними для пристроїв на краю, мобільних застосунків або ситуацій, коли необхідне автономне висновування. Ця ефективність призводить до нижчих операційних витрат, з моделями, такими як DeepSeek-R1, які можуть бути на 96% дешевшими у використанні, ніж більші моделі, такі як o1.

Однак, ці вигоди в ефективності супроводжуються деякими компромісами. Менші моделі зазвичай налаштовуються для конкретних завдань, що обмежує їх універсальність порівняно з більшістю моделей. Наприклад, хоча DeepSeek-R1 excels у математиці та кодуванні, вона відстає у багатомодальних можливостях, таких як інтерпретація зображень, які більші моделі, такі як GPT-4o, можуть обробляти.

Незважаючи на ці обмеження, практичні застосування малих моделей розуміння є величезними. У сфері охорони здоров’я вони можуть забезпечувати діагностичні інструменти, які аналізують медичні дані на стандартних серверах лікарень. У освіті вони можуть бути використані для розробки персоналізованих систем навчання, які надають крок за кроком зворотній зв’язок учням. У наукових дослідженнях вони можуть допомогти з аналізом даних та тестуванням гіпотез у таких областях, як математика та фізика. Відкрита сутність моделей, таких як DeepSeek-R1, також сприяє співробітництву та демократизації доступу до штучного інтелекту, дозволяючи меншим організаціям користуватися передовими технологіями.

Основне

Еволюція мовних моделей у менші моделі розуміння є суттєвим кроком вперед у галузі штучного інтелекту. Хоча ці моделі ще не повністю дорівнюють широким можливостям великих мовних моделей, вони пропонують ключеві переваги в ефективності, вартості та доступності. Збалансувавши можливості розуміння та ефективність ресурсів, менші моделі готуються до відігравання суттєвої ролі у різних застосунках, роблячи штучний інтелект більш практичним та сталим для використання у реальному світі.

Доктор Техсін Зія є доцентом COMSATS University Islamabad, який має ступінь PhD з штучного інтелекту у Віденському технічному університеті, Австрія. Спеціалізується на штучному інтелекті, машинному навчанні, науці про дані та комп'ютерному баченні, він зробив значний внесок з публікаціями в авторитетних наукових журналах. Доктор Техсін також очолював різні промислові проекти як головний дослідник і служив консультантом з штучного інтелекту.