Промпт-інжиніринг

За межами ланцюга думок: Як оптимізація уподобань думок просунула ЛЛМ

mm
Додайте Unite.AI до бажаних джерел у Google

Нова революційна техніка, розроблена командою дослідників з Meta, UC Berkeley та NYU, обіцяє покращити роботу систем штучного інтелекту при виконанні загальних завдань. Відома як “Оптимізація уподобань думок” (ОУД), цей метод спрямований на те, щоб зробити великі мовні моделі (ЛЛМ) більш роздумливими та обдуманими у своїх відповідях.

Колаборативна робота над ОУД об’єднує експертизу провідних інститутів у сфері досліджень штучного інтелекту.

Механіка оптимізації уподобань думок

У своїй основі ОУД працює шляхом заохочення моделей штучного інтелекту генерувати “думкові кроки” перед тим, як надати остаточну відповідь. Цей процес імітує людські когнітивні процеси, коли ми часто думаємо над проблемою чи запитом, перш ніж артикулювати свою відповідь.

Техніка включає кілька ключових кроків:

  1. Модель запрошується генерувати думкові кроки перед тим, як відповісти на запит.
  2. Створюються кілька виходів, кожен зі своїми думковими кроками та остаточною відповіддю.
  3. Модель-оцінювач оцінює лише остаточні відповіді, а не самі думкові кроки.
  4. Модель потім тренується через оптимізацію уподобань на основі цих оцінок.

Цей підхід суттєво відрізняється від попередніх технік, таких як ланцюг думок (CoT). Хоча CoT здебільшого використовувався для математичних та логічних завдань, ОУД призначений для більш широкого застосування у різних типах запитів та інструкцій. Крім того, ОУД не вимагає явного нагляду за процесом думок, дозволяючи моделі розвивати свої власні ефективні стратегії мислення.

Інша ключова відмінність полягає в тому, що ОУД подолав виклик обмежених тренувальних даних, які містять людські процеси думок. Зосереджуючи оцінку на остаточному виході, а не на проміжних кроках, ОУД дозволяє більш гнучкі та різноманітні шаблони мислення.

Експериментальна установка та результати

Для перевірки ефективності ОУД дослідники провели експерименти, використовуючи два провідні бенчмарки у сфері мовних моделей штучного інтелекту: AlpacaEval та Arena-Hard. Ці бенчмарки призначені для оцінки загальних інструкцій, які слідувати моделям штучного інтелекту у широкому спектрі завдань.

Експерименти використовували Llama-3-8B-Instruct як базову модель, з різними суддівськими моделями, використаними для оцінки. Ця установка дозволила дослідникам порівняти продуктивність ОУД з базовими моделями та оцінити його вплив на різні типи завдань.

Результати цих експериментів були перспективними, показуючи покращення у кількох категоріях:

  1. Розуміння та розв’язування проблем: Як очікувалося, ОУД показав здобутки у завданнях, які вимагають логічного мислення та аналізу. 
  2. Загальні знання: Цікаво, що техніка також покращила продуктивність у запитах, пов’язаних із широкими фактичними відомостями. 
  3. Маркетинг: Можливо, несподівано, ОУД продемонстрував покращені можливості у завданнях, пов’язаних із маркетингом та продажами. 
  4. Креативні завдання: Дослідники відзначили потенційні вигоди у таких сферах, як креативне письмо, припускаючи, що “думка” може допомогти у плануванні та структуризації креативних виходів.

Ці покращення не обмежувалися традиційно важкими завданнями, що свідчить про те, що ОУД має потенціал для покращення продуктивності штучного інтелекту у широкому спектрі застосувань. Темпи перемог на бенчмарках AlpacaEval та Arena-Hard показали суттєві покращення порівняно з базовими моделями, причому ОУД досяг конкурентоспроможних результатів навіть у порівнянні з набагато більшішими мовними моделями.

Однак варто відзначити, що поточна реалізація ОУД показала деякі обмеження, особливо у математичних завданнях. Дослідники спостерігали, що продуктивність у математичних завданнях фактично знизилася порівняно з базовою моделлю, що свідчить про те, що подальша доопрацювання можуть бути необхідними для вирішення конкретних доменів.

Вплив на розвиток штучного інтелекту

Успіх ОУД у покращенні продуктивності у різних категоріях відкриває перспективи для застосувань штучного інтелекту. За межами традиційних завдань з розумінням та розв’язуванням проблем ця техніка могла б покращити можливості штучного інтелекту у креативному письмі, перекладі мови та генерації контенту. Дозволяючи штучному інтелекту “думати” через складні процеси перед генерацією виходу, ми могли б побачити більш нюансовані та контекстно-чутливі результати у цих сферах.

У сфері обслуговування клієнтів ОУД міг би привести до більш роздумливих та комплексних відповідей від чат-ботів та віртуальних асистентів, потенційно покращуючи задоволеність клієнтів та знижуючи потребу у втручанні людини. Крім того, у сфері аналізу даних цей підхід міг би дозволити штучному інтелекту розглянути декілька перспектив та потенційних кореляцій перед тим, як зробити висновки з комплексних наборів даних, що призведе до більш проникливих та надійних аналізів.

Незважаючи на перспективні результати, ОУД стикається з декількома викликами у своїй поточній формі. Спостережуване зниження у математичних завданнях свідчить про те, що техніка може не бути універсально корисною у всіх доменах. Це обмеження підкреслює необхідність доопрацювання ОУД для конкретних доменів.

Іншим суттєвим викликом є потенційний зростаючий обчислювальний наклад. Процес генерації та оцінки декількох думкових шляхів міг би потенційно збільшити час обробки та вимоги до ресурсів, що обмежує застосунки ОУД у сценаріях, де швидкі відповіді є критичними.

Крім того, поточне дослідження зосередилося на конкретному розмірі моделі, що піднімає питання про те, як добре ОУД буде масштабуватися для більших чи менших мовних моделей. Є також ризик “передумування” – надмірне “думання” могло б привести до заплутаних чи надто складних відповідей для простих завдань.

Баланс глибини думок з складністю завдання буде ключовою сферою для майбутніх досліджень та розробок.

Майбутні напрями

Одним з ключових напрямів для майбутніх досліджень є розробка методів контролю довжини та глибини процесів думок штучного інтелекту. Це могло б включати динамічну корекцію, що дозволить моделі адаптувати глибину своїх думок на основі складності завдання. Дослідники також могли б дослідити параметри, визначені користувачем, що дозволять користувачам вказувати бажаний рівень думок для різних застосунків.

Оптимізація ефективності буде критичною в цій сфері. Розробка алгоритмів для пошуку оптимальної точки між ретельним розглядом та швидкими часами відповіді могла б суттєво покращити практичну застосовність ОУД у різних доменах та випадках використання.

Якщо моделі штучного інтелекту продовжуватимуть зростати у розмірі та можливостях, дослідження того, як ОУД масштабується з розміром моделі, буде критичним. Майбутні напрямки досліджень можуть включати:

  • Тестування ОУД на сучасних великих мовних моделях для оцінки його впливу на більш просунуті системи штучного інтелекту 
  • Дослідження того, чи більші моделі потребують різних підходів до генерації та оцінки думок 
  • Дослідження потенціалу ОУД для подолання прогалини у продуктивності між меншими та більшістю моделями, потенційно роблячи більш ефективне використання обчислювальних ресурсів

Ці дослідження могли б привести до більш просунутих систем штучного інтелекту, які можуть обробляти все більш складні завдання, зберігаючи при цьому ефективність та точність.

Висновок

Оптимізація уподобань думок представляє суттєвий крок вперед у покращенні можливостей великих мовних моделей. Заохочуючи системи штучного інтелекту “думати, перш ніж говорити”, ОУД продемонстрував покращення у широкому спектрі завдань, потенційно революціонізуючи підхід до розробки штучного інтелекту.

Якщо дослідження в цій сфері продовжуватимуться, ми можемо очікувати подальших доопрацювань техніки, спрямованих на вирішення поточних обмежень та розширення її застосунків. Майбутнє штучного інтелекту може включати системи, які не тільки обробляють інформацію, але й займаються більш людськими когнітивними процесами, що призведе до більш нюансованих, контекстно-чутливих та, врешті-решт, більш корисних штучних інтелектів.

Алекс Макфарленд - журналіст та письменник з питань штучного інтелекту, який досліджує останні розробки в галузі штучного інтелекту. Він співпрацював з численними стартапами та виданнями з штучного інтелекту у світі.