Моделі та платформи ШІ

Чому модель штучної інтелектуальної мови Orca-2 від Microsoft позначає суттєвий крок у напрямку сталого штучного інтелекту?

mm
Додайте Unite.AI до бажаних джерел у Google

Незважаючи на помітний прогрес, досягнутий штучним інтелектом за останні десять років, який включає перемогу над людськими чемпіонами у стратегічних іграх, таких як Шахи та Ґо, та передбачення тривимірної структури білків, широке впровадження більшості мовних моделей (LLM) означає зміну парадигми. Ці моделі, які готуються перетворити взаємодію людини та комп’ютера, стали незамінними в різних галузях, включаючи освіту, сервісну підтримку клієнтів, пошук інформації, розробку програмного забезпечення, ЗМІ та охорону здоров’я. Хоча ці технологічні кроки розблоковують наукові прориви та сприяють промисловому зростанню, існує суттєва негативна сторона для планети.

Процес навчання та використання LLM витрачає величезну кількість енергії, що призводить до суттєвого екологічного впливу, який позначається підвищенням рівня вуглекислого газу та викидів парникових газів. Нещодавнє дослідження Коледжу інформаційних та комп’ютерних наук Університету Массачусетса в Амгерсті показало, що навчання LLM може викинути понад 626 000 фунтів вуглекислого газу, що приблизно еквівалентно викидам п’яти автомобілів за все їхнє життя. Стартап Hugging Face виявив, що навчання великої мовної моделі BLOOM, запущеної на початку року, призвело до 25 метричних тонн викидів вуглекислого газу. Аналогічно, модель штучного інтелекту Facebook Meena накопичує викиди вуглекислого газу, порівнянні з екологічним впливом водіння автомобіля понад 240 000 миль під час процесу навчання.

Незважаючи на навчання LLM, попит на хмарні обчислення, який є важливим для LLM, зараз спричиняє більше викидів, ніж вся авіаційна промисловість. Один центр обробки даних може споживати стільки ж енергії, скільки 50 000 будинків. Інше дослідження підкреслює, що навчання однієї великої мовної моделі може викинути стільки ж CO2, скільки п’ять автомобілів, які використовують енергію протягом усього свого життя. Прогнози свідчать, що викиди штучного інтелекту зростуть на 300% до 2025 року, підкреслюючи необхідність балансування прогресу штучного інтелекту з екологічною відповідальністю та спонукаючи ініціативи зробити штучний інтелект більш екологічно чистим. Щоб вирішити проблему негативного екологічного впливу прогресу штучного інтелекту, сталевий штучний інтелект виникає як важлива галузь дослідження.

Сталевий штучний інтелект

Сталевий штучний інтелект представляє зміну парадигми у розробці та впровадженні систем штучного інтелекту, зосереджуючись на мінімізації екологічного впливу, етичних розглядах та довгострокових соціальних вигодах. Цей підхід спрямований на створення інтелектуальних систем, які є енергоефективними, екологічно відповідальними та узгодженими з людськими цінностями. Сталевий штучний інтелект зосереджується на використанні чистої енергії для комп’ютерів, розумних алгоритмів, які використовують менше енергії, та дотримання етичних керівних принципів для забезпечення справедливих та прозорих рішень. Важливо відзначити, що існує різниця між штучним інтелектом для сталості та сталевим штучним інтелектом; перший може включати використання штучного інтелекту для оптимізації існуючих процесів без обов’язкового розгляду їхніх екологічних або соціальних наслідків, тоді як другий активно інтегрує принципи сталості на кожному етапі розвитку штучного інтелекту, від проєктування до впровадження, для створення позитивного та тривалого впливу на планету та суспільство.

Від LLM до малих мовних моделей (SLM)

У пошуках сталевого штучного інтелекту Microsoft (MSFT ) працює над розробкою малих мовних моделей (SLM), щоб узгодити їхні можливості з великими мовними моделями (LLM). У цьому зусиллі вони недавно представили Orca-2, розроблений для розуміння, як GPT-4. На відміну від свого попередника Orca-1, який має 13 мільярдів параметрів, Orca-2 містить 7 мільярдів параметрів, використовуючи два ключові техніки.

  1. Інструктивне налаштування: Orca-2 покращується шляхом навчання на прикладах, підвищуючи якість вмісту, нульові можливості та розумові навички у різних завданнях.
  2. Налаштування пояснень: Розпізнавши обмеження інструктивного налаштування, Orca-2 вводить налаштування пояснень. Це включає створення детальних пояснень для моделей учителів, збагачення сигналів розуміння та покращення загального розуміння.

Orca-2 використовує ці техніки для досягнення високоефективного розуміння, порівнянного з тим, чого досягають LLM з багатьма більшими параметрами. Основна ідея полягає в тому, щоб дозволити моделі визначити найкращий спосіб вирішення проблеми, незалежно від того, чи це швидка відповідь, чи ретельне продумування крок за кроком. Microsoft називає це “Остережним розумінням”.

Для навчання Orca-2 Microsoft створює новий набір навчальних даних, використовуючи анотації FLAN, Orca-1 та набір даних Orca-2. Вони починають з простих питань, додають деякі складні, а потім використовують дані від моделей розмов для того, щоб зробити його ще розумнішим.

Orca-2 проходить ретельну оцінку, яка охоплює розуміння, завершення тексту, основу, істину та безпеку. Результати показують потенціал покращення розуміння SLM через спеціалізоване навчання на синтетичних даних. Незважаючи на деякі обмеження, моделі Orca-2 показують перспективи для майбутніх поліпшень у розумінні, контролі та безпеці, доводячи ефективність застосування синтетичних даних стратегічно при уточненні моделі після навчання.

Значення Orca-2 для сталевого штучного інтелекту

Orca-2 представляє суттєвий крок у напрямку сталевого штучного інтелекту, викликуючи поширений погляд на те, що тільки великі моделі, з їхнім суттєвим енергоспоживанням, можуть справді просунути можливості штучного інтелекту. Ця мала мовна модель представляє альтернативний погляд, sugerуючи, що досягнення досконалості у мовних моделях не обов’язково вимагає величезних наборів даних та обширних обчислювальних потужностей. Натомість це підкреслює важливість розумного проєктування та ефективної інтеграції.

Цей прорив відкриває нові можливості, пропонуючи зміну фокусу – від простого збільшення штучного інтелекту до концентрації на тому, як ми його проєктуємо. Це позначає суттєвий крок у тому, щоб зробити просунутий штучний інтелект більш доступним для ширшої аудиторії, забезпечуючи, щоб інновації були інклюзивними та досягали ширшого кола людей та організацій.

Orca-2 має потенціал суттєво вплинути на розвиток майбутніх мовних моделей. Чи то поліпшення завдань, пов’язаних з обробкою природної мови, чи надання можливості більш складним застосуванням штучного інтелекту в різних галузях, ці менші моделі готуються принести суттєві позитивні зміни. Крім того, вони діють як піонери у сприянні більш сталевим практикам штучного інтелекту, узгоджуючи технологічний прогрес з зобов’язанням щодо екологічної відповідальності.

Основне

Модель штучного інтелекту Orca-2 від Microsoft представляє суттєвий крок у напрямку сталевого штучного інтелекту, викликуючи погляд на те, що тільки великі моделі можуть просунути штучний інтелект. Приоритизуючи розумне проєктування над розміром, Orca-2 відкриває нові можливості, пропонуючи більш інклюзивний та екологічно відповідальний підхід до розвитку просунутого штучного інтелекту. Ця зміна позначає суттєвий крок у напрямку нової парадигми у проєктуванні інтелектуальних систем.

Доктор Техсін Зія є доцентом COMSATS University Islamabad, який має ступінь PhD з штучного інтелекту у Віденському технічному університеті, Австрія. Спеціалізується на штучному інтелекті, машинному навчанні, науці про дані та комп'ютерному баченні, він зробив значний внесок з публікаціями в авторитетних наукових журналах. Доктор Техсін також очолював різні промислові проекти як головний дослідник і служив консультантом з штучного інтелекту.