Моделі та платформи ШІ
Reflection 70B: LLM з самокоригуючою когніцією та лідерською продуктивністю

Reflection 70B – це відкритий великомасштабний мовний модель (LLM), розроблений компанією HyperWrite. Ця нова модель вводить підхід до когніції штучного інтелекту, який може змінити спосіб нашого взаємодії з системами штучного інтелекту в багатьох галузях, від обробки мови до складного вирішення проблем.
Відповідно до Reflection-Tuning, революційної техніки, яка дозволяє моделі самооцінювати та виправляти свої помилки в режимі реального часу, Reflection 70B швидко піднявся на вершину, обігнавши пропріетарні моделі, такі як GPT-4 і Claude 3.5 Sonnet, у декількох бенчмарках, включаючи MMLU, MATH і HumanEval.
Reflection 70B побудований на основі потужної архітектури Llama 3.1-70B, але його механізм самоочищення відрізняє його. Через ітеративні цикли рефлексії, виявлення помилок та уточнення виходу модель імітує людську когніцію незрівнянним чином, розширюючи межі того, чого може досягти штучний інтелект. В результаті Reflection 70B пропонує не тільки неперевершену точність, але й глибші знання про свій процес прийняття рішень, критичний функціонал для застосунків, де прозорість і точність мають першорядне значення.
Що таке Reflection 70B
У своїй основі Reflection 70B побудований на основі Meta’s відкритої моделі Llama 3.1-70B. Однак те, що справді відрізняє його, – це унікальна здатність займатися процесом, подібним до людської рефлексії, – звідси й його назва. Ця здатність походить від техніки під назвою “Reflection-Tuning“, яка дозволяє моделі визначати та виправляти свої помилки в режимі реального часу, покращуючи свою точність і надійність.
Matt Shumer, генеральний директор HyperWrite, представив Reflection 70B з твердженням, що це “найпотужніша відкрита модель штучного інтелекту у світі“. Але що саме робить цю модель такою особливою, і як вона порівнюється з гігантами галузі, такими як GPT-4 і Claude 3.5 Sonnet? Давайте дослідимо.
Поняття вибіркової рефлексії-налаштування: парадигматичний зсув у навчанні штучного інтелекту
Вибіркова рефлексія-налаштування вводить підхід до налаштування інструкцій, де метою є покращення якісної інструкційної інформації та її сумісності зі студентською моделлю, яку донастрають. Традиційні методи часто зосереджуються на покращенні даних самих по собі, але не беруть до уваги, наскільки покращені дані відповідають навчальним цілям моделі. Вибіркова рефлексія-налаштування мостить цю прогалину, створюючи співпрацю вчителя та учня, де вчителем модель рефлексує над даними та надає уточнені інструкції-відповіді, а учень модель оцінює та вибирає тільки ті покращення, які найкраще відповідають його навчальним потребам.
Процес складається з двох ключових фаз:
- Вибіркова рефлексія інструкцій: Вчителем модель рефлексує над інструкцією даного зразка та генерує уточнені інструкції-відповіді. Учень модель оцінює, чи це нова інструкція є корисною на основі метрики під назвою Складність виконання інструкцій (IFD). Метрика IFD оцінює складність зразка для учня-моделі, забезпечуючи, щоб тільки дані, які викликують модель належним чином, зберігалися.
- Вибіркова рефлексія відповідей: На цій фазі вчителем модель рефлексує над відповідями, згенерованими на першій фазі. Учень модель оцінює ці відповіді за допомогою Оберненої складності виконання інструкцій (r-IFD), метрики, яка вимірює, наскільки можливо для учня вивести інструкцію на основі відповіді. Це забезпечує, щоб відповідь не тільки покращувала розуміння моделі, але й гармонійно поєднувалася з існуючими знаннями учня.
Застосовуючи як IFD, так і r-IFD, вибіркова рефлексія-налаштування виробляє дані пари, які є складними, але виконуваними, покращуючи процес налаштування інструкцій без потреби додаткових наборів даних. Результатом є більш економічна зразків і високопродуктивна модель LLM, яка перевершує багато більших моделей.
Архітектура мислення: як “думає” Reflection 70B
Архітектура Reflection 70B піднімає рівень штучного інтелекту, розділяючи процес мислення на декілька стадій. Кожна стадія дозволяє моделі покращуватися ітеративно через самоаналіз, подібно до людської когніції:
- Початкові дані та відповідь: Модель починається з генерації відповіді на дану інструкцію. Цей початковий вихід схожий на стандартний вихід LLM.
- Вибіркова рефлексія інструкцій: Після генерації початкової відповіді модель переходить до фази рефлексії інструкцій. Вчителем модель рефлексує над оригінальною інструкцією та пропонує покращення. Ці пропозиції потім оцінюються учнем-моделлю за допомогою бали IFD, щоб визначити, чи нова інструкція-відповідь пара більш підходить для подальшого налаштування.
- Вибіркова рефлексія відповідей: Після рефлексії над інструкцією модель переходить до уточнення відповіді. Тут вчителем модель генерує нову відповідь на основі оновленої інструкції. Учень модель, використовуючи бали r-IFD, оцінює, чи нова відповідь допомагає у виводі інструкції більш ефективно.
- Остаточне налаштування інструкцій: Як тільки вибрана найкраща інструкція-відповідь пара, вона додається до остаточного набору даних, використовуваного для доналаштування моделі. Цей багатостадійний процес забезпечує, що тільки найбільш ефективні та узгоджені інструкції-відповіді пари включаються до даних доналаштування.
Цей структурований процес рефлексії дозволяє користувачам бачити, як модель проходить свій процес мислення, створюючи прозорість та суттєво покращуючи точність та узгодженість у складних завданнях.
Бенчмаркінг блискавичності: Reflection 70B у дії
Використання Reflection 70B вибіркової рефлексії-налаштування не тільки пропонує більш просунутий процес навчання, але й досягає промислового рівня продуктивності у декількох бенчмарках. Через свій механізм самооцінки модель перевершує пропріетарні моделі, які значно більші за розміром.
- MMLU (Масове багатозадачне розуміння мови): Reflection 70B набрав вражаючі 72.2%, перевершивши інші великі відкриті моделі, такі як LLaMA 2.
- Математичний бенчмарк: У математичних завданнях з rozumіння Reflection 70B перевершив GPT-4 і Claude 3.5, демонструючи свою силу у вирішенні складних завдань.
- IFEval і GSM8K: Reflection 70B також excelled у IFEval, де його узгодженість інструкції-відповіді була оцінена, і у GSM8K, математичному бенчмарку вирішення проблем. Самоаналітичний механізм налаштування дозволив моделі краще справлятися з тонкими та нюансированими завданнями, ніж її більш великі конкуренти.
Використовуючи вибіркову рефлексію-налаштування, Reflection 70B продемонстрував, що розмір не є єдиним фактором досягнення високої продуктивності. Спроможність самокоригування та рефлексії над своїми виходами привела до сильнішого, більш узгодженого rozumіння, дозволяючи їй перевершити моделі з більшими параметрами.
Реальні застосування: використання потенціалу Reflection 70B
Reflection 70B відкриває нові двері в різних галузях завдяки своїй здатності до самоочищення та прозорого прийняття рішень. Нижче наведені деякі приклади реальних застосунків:
Складне вирішення проблем
Сила Reflection 70B лежить у вирішенні складних проблем. Розглянемо складне математичне запитання:
<p>Користувач: "Розв'яжіть рівняння: 2x^2 + 5x - 3 = 0" Reflection 70B:</p> <p><thinking> Застосування квадратичної формули...</thinking> <reflection> Виправлення у розрахунках...</reflection> <output> Рішеннями є x = 1/2 і x = -3.</output>
Переклад мови з культурною чутливістю
На відміну від типових моделей перекладу, Reflection 70B адаптує переклади мови до культурних контекстів:
Користувач: "Перекладіть 'It's raining cats and dogs' французькою, враховуючи культурний контекст." Reflection 70B: <p>thinking: Буквальний переклад буде "Il pleut des chats et des chiens"...thinking; reflection: Культурально прийнятний переклад буде "Il pleut des cordes."reflection; output: Переклад надано.
Покращення налагодження та оптимізації коду
Спроможність Reflection 70B до самоочищення робить його ідеальним для налагодження та оптимізації коду:
Користувач: "Налагодіть цей код Python..." Reflection 70B: <thinking> Аналіз крок за кроком...</thinking> <reflection> Виявлено нескінченну рекурсію.</reflection> <output> Виправлена версія коду з правильною рекурсією.</output>
Розширення конкурентного ландшафту моделей 70B
Хоча Reflection 70B робить значний внесок, він є частиною ширшої екосистеми моделей з 70 мільярдами параметрів. Ось як він порівнюється з іншими:
- Meta’s Llama 3.1-70B: Потужна базова модель, відома своїми загальними застосунками.
- Claude 2 70B (Anthropic): Модель, орієнтована на етичний штучний інтелект, вміла у rozumінні та генерації довгих контентів.
- GPT-3.5 70B (OpenAI): Легша версія GPT-4, що excels у балансі продуктивності та ефективності.
- BLOOM 70B: Багатомовний гігант, навчений на природніх та програмних мовах.
- Falcon 70B: Відзначений своєю ефективністю навчання та висновку.
Ефективне виконання моделей 70B: останні техніки
Ефективне виконання моделей такого розміру – це не проста задача. Для максимізації продуктивності ось останні стратегії:
1. Квантування
Зниження точності моделі допомагає знизити використання пам’яті та час висновку. Техніки 4-бітового квантування за допомогою BitsAndBytes дозволяють Reflection 70B працювати ефективно на менших GPU.
Приклад:
from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-2-70b-hf", load_in_4bit=True)
2. Шардування моделі
Розподіл моделі по декількох GPU (наприклад, за допомогою DeepSpeed Zero) дозволяє обробляти більші моделі без перевищення пам’яті GPU.
from xformers.ops import memory_efficient_attention model.attention = memory_efficient_attention
3. Змішана точність та ефективна увага
FlashAttention та xformers зменшують витрати на увагу, покращуючи час обробки великих вхідних послідовностей.
from xformers.ops import memory_efficient_attention model.attention = memory_efficient_attention
4. Відвантаження на CPU та обрізання
Відвантаження на CPU та обрізання менш критичних ваг дозволяють виконувати моделі на більш скромному обладнанні, зберігаючи продуктивність.
from accelerate import cpu_offload model = cpu_offload(model)
Погляд у майбутнє: майбутнє з Reflection 405B
Наступний рубіж для HyperWrite – розробка Reflection 405B, моделі, яка очікується перевершить Reflection 70B як за масштабом, так і за продуктивністю. Ця модель має на меті розширити межі відкритого штучного інтелекту, поставивши себе у позицію, щоб викликати навіть найбільш просунуті пропріетарні моделі, такі як GPT-5.














