Моделі та платформи ШІ
Qwen2 – Останній мультилінгвальний мовний модель Alibaba, який викликає виклик SOTA, як Llama 3
Після місяців очікування, команда Qwen від Alibaba нарешті представила Qwen2 – наступну еволюцію їхньої потужної серії мовних моделей. Qwen2 представляє значний крок вперед, демонструючи передові досягнення, які потенційно можуть позиціонувати його як найкращу альтернативу моделі Meta Llama 3. У цьому технічному аналізі ми розглянемо ключові особливості, показники продуктивності та інноваційні техніки, які роблять Qwen2 потужним претендентом у сфері великих мовних моделей (LLM).
Масштабування: Представлення лінійки моделей Qwen2
У основі Qwen2 лежить різноманітна лінійка моделей, розроблених для задоволення різних вимог до обчислювальних ресурсів. Серія охоплює п’ять різних розмірів моделей: Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B, Qwen2-57B-A14B і флагманський Qwen2-72B. Цей діапазон варіантів задовольняє широкий спектр користувачів, від тих, хто має скромні апаратні ресурси, до тих, хто має доступ до передових обчислювальних інфраструктур.
Однією з видатних особливостей Qwen2 є його мультилінгвальні можливості. Хоча попередня модель Qwen1.5 excelled у англійській та китайській мовах, Qwen2 був навчений на даних, що охоплюють вражаючі 27 додаткових мов. Ця мультилінгвальна навчальна програма включає мови з різних регіонів, таких як Західна Європа, Східна та Центральна Європа, Близький Схід, Східна Азія та Південна Азія.
Розширюючи свій лінгвістичний репертуар, Qwen2 демонструє виняткову здатність розуміти та генерувати контент у широкому діапазоні мов, роблячи його незамінним інструментом для глобальних застосунків та міжкультурної комунікації.
Вирішення проблеми код-світчінгу: Мультилінгвальний виклик
У мультилінгвальних контекстах явище код-світчінгу – практика чергування між різними мовами в рамках однієї розмови або висловлювання – є поширеним явищем. Qwen2 був ретельно навчений для обробки сценаріїв код-світчінгу, суттєво знижуючи пов’язані з цим проблеми та забезпечуючи плавні переходи між мовами.
Оцінки за допомогою промптів, які зазвичай викликають код-світчінг, підтвердили суттєве покращення Qwen2 у цій галузі, свідчачи про зобов’язання Alibaba щодо надання справжньої мультилінгвальної мовної моделі.
Видатні можливості у сфері кодування та математики
Qwen2 має видатні можливості у сфері кодування та математики, областях, які традиційно становили виклик для мовних моделей. Використовуючи обширні високоякісні набори даних та оптимізовані методи навчання, Qwen2-72B-Instruct, варіант моделі з інструкціями, демонструє видатну продуктивність у вирішенні математичних проблем та завдань кодування у різних мовах програмування.
Розширення контекстного розуміння
Однією з найбільш вражаючих особливостей Qwen2 є його здатність розуміти та обробляти розширені контекстні послідовності. Хоча більшість мовних моделей борються з довгими текстами, Qwen2-7B-Instruct і Qwen2-72B-Instruct були розроблені для обробки контекстів довжиною до 128K токенів.
Ця видатна здатність є революційною для застосунків, які вимагають глибокого розуміння довгих документів, таких як юридичні контракти, дослідницькі статті чи густі технічні матеріали. Qwen2 може забезпечити більш точні та повні відповіді, відкриваючи нові горизонти у сфері обробки природної мови.

Точність моделей Qwen2 у відновленні фактів з документів різної довжини контексту та глибини документів.
Цей графік демонструє здатність моделей Qwen2 відновлювати факти з документів різної довжини контексту та глибини документів.
Архітектурні інновації: Групове звернення до запитів та оптимізовані вкладення
Під капотом Qwen2 включає кілька архітектурних інновацій, які сприяють його винятковій продуктивності. Однією з таких інновацій є采用 групового звернення до запитів (GQA) для всіх розмірів моделей. GQA пропонує швидшу швидкість висновку та знижує використання пам’яті, роблячи Qwen2 більш ефективним та доступним для широкого діапазону апаратних конфігурацій.
Крім того, Alibaba оптимізував вкладення для менших моделей у серії Qwen2. Зв’язуючи вкладення, команда змогла зменшити відбиток пам’яті цих моделей, що дозволяє їх розгортання на менш потужному апаратному забезпеченні при збереженні високої якості продуктивності.
Бенчмаркінг Qwen2: Перевершення моделей SOTA
Qwen2 демонструє вражаючу продуктивність у широкому діапазоні бенчмарків. Порівняльні оцінки показують, що Qwen2-72B, найбільша модель у серії, перевершує провідних конкурентів, таких як Llama-3-70B, у критичних областях, включаючи розуміння природної мови, набуття знань, кодування, математичні навички та мультилінгвальні можливості.
Незважаючи на те, що Qwen2-72B має менше параметрів, ніж його попередник Qwen1.5-110B, він демонструє вищу продуктивність, свідчачи про ефективність ретельно відібраних наборів даних та оптимізованих методів навчання Alibaba.
Безпека та відповідальність: Сумісність з людськими цінностями
Qwen2-72B-Instruct був ретельно оцінений щодо його здатності обробляти потенційно шкідливі запити, пов’язані з незаконною діяльністю, шахрайством, порнографією та порушенням конфіденційності. Результати є обнадійливими: Qwen2-72B-Instruct демонструє продуктивність, порівнювану з високою оцінкою моделі GPT-4, демонструючи значно нижчі рівні шкідливих відповідей порівняно з іншими великими моделями, такими як Mistral-8x22B.
Це досягнення підкреслює зобов’язання Alibaba щодо розробки систем штучного інтелекту, які відповідають людським цінностям, забезпечуючи, що Qwen2 не тільки потужний, але й надійний та відповідальний.
Ліцензування та відкритий вихідний код
У рамках подальшого посилення впливу Qwen2 Alibaba прийняла відкритий підхід до ліцензування. Хоча Qwen2-72B та його інструктовані моделі зберігають оригінальну ліцензію Qianwen, інші моделі – Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B та Qwen2-57B-A14B – були ліцензовані під перmissive ліцензією Apache 2.0.
Ця підвищена відкритість очікується прискорити застосування та комерційне використання моделей Qwen2 у світі, сприяючи співробітництву та інноваціям у глобальному співтоваристві штучного інтелекту.
Використання та реалізація
Використання моделей Qwen2 є простим завдяки їх інтеграції з популярними фреймворками, такими як Hugging Face. Ось приклад використання Qwen2-7B-Chat-beta для висновку:
from transformers import AutoModelForCausalLM, AutoTokenizer
<p>device = "cuda" # пристрій для завантаження моделі</p>
<p>model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen1.5-7B-Chat", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen1.5-7B-Chat")</p>
<p>prompt = "Дайте коротке введення до великих мовних моделей."</p>
<p>messages = [{"role": "user", "content": prompt}]</p>
<p>text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)</p>
<p>model_inputs = tokenizer([text], return_tensors="pt").to(device)</p>
<p>generated_ids = model.generate(model_inputs.input_ids, max_new_tokens=512, do_sample=True)</p>
<p>generated_ids = [output_ids[len(input_ids):] for input_ids, output_ids in zip(model_inputs.input_ids, generated_ids)]</p>
<p>response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
print(response)</p>
Цей фрагмент коду демонструє, як налаштувати та згенерувати текст за допомогою моделі Qwen2-7B-Chat. Інтеграція з Hugging Face робить її доступною та простою для експериментів.
Qwen2 проти Llama 3: Порівняльний аналіз
Хоча Qwen2 та Meta’s Llama 3 є потужними мовними моделями, вони демонструють різні сильні сторони та компроміси.

Графік порівняння продуктивності Qwen2-72B, Llama3-70B, Mixtral-8x22B та Qwen1.5-110B у різних бенчмарках, включаючи MMLU, MMLU-Pro, GPQA та інші.
Ось порівняльний аналіз, який допоможе вам зрозуміти їхні ключові відмінності:
Мультилінгвальні можливості: Qwen2 має явну перевагу у сфері мультилінгвальної підтримки. Його навчання на даних, що охоплюють 27 додаткових мов, крім англійської та китайської, дозволяє Qwen2 видатно виконувати завдання міжкультурної комунікації та мультилінгвальних сценаріїв. Натомість, мультилінгвальні можливості Llama 3 менш виражені, що потенційно обмежує його ефективність у різноманітних лінгвістичних контекстах.
Кодування та математична здатність: Обидві моделі Qwen2 та Llama 3 демонструють вражаючі кодувальні та математичні можливості. Однак Qwen2-72B-Instruct здається мати невелику перевагу, завдячуючи його ретельному навчанню на обширних високоякісних наборах даних у цих областях. Зобов’язання Alibaba щодо покращення можливостей Qwen2 у цих областях може надати йому перевагу для спеціалізованих застосунків, пов’язаних з кодуванням або математичним розв’язуванням проблем.
Довге контекстне розуміння: Моделі Qwen2-7B-Instruct та Qwen2-72B-Instruct можуть обробляти контексти довжиною до 128K токенів. Ця особливість особливо цінна для застосунків, які вимагають глибокого розуміння довгих документів, таких як юридичні контракти, дослідницькі статті чи густі технічні матеріали. Llama 3, хоча й здатний обробляти довгі послідовності, може не відповідати продуктивності Qwen2 у цій конкретній області.
Хоча обидві моделі Qwen2 та Llama 3 демонструють продуктивність на рівні стану мистецтва, різноманітна лінійка моделей Qwen2, що варіюється від 0,5B до 72B параметрів, пропонує більшу гнучкість та масштабованість. Ця гнучкість дозволяє користувачам вибирати розмір моделі, який найкраще відповідає їхнім обчислювальним ресурсам та вимогам продуктивності. Крім того, тривалі зусилля Alibaba щодо масштабування Qwen2 до більших моделей можуть进一步 підвищити його можливості, потенційно перевершуючи Llama 3 у майбутньому.
Розгортання та інтеграція: Спрощення прийняття Qwen2
Для забезпечення широкого прийняття та інтеграції Qwen2 Alibaba прийняла активні кроки для забезпечення безперешкодного розгортання на різних платформах та фреймворках. Команда Qwen тісно співпрацювала з численними сторонніми проектами та організаціями, що дозволило Qwen2 бути використаним у поєднанні з широким діапазоном інструментів та фреймворків.
Настройка та квантовація: Сторонні проекти, такі як Axolotl, Llama-Factory, Firefly, Swift та XTuner, були оптимізовані для підтримки настройки моделей Qwen2, що дозволяє користувачам адаптувати моделі до своїх конкретних завдань та наборів даних. Крім того, інструменти квантовації, такі як AutoGPTQ, AutoAWQ та Neural Compressor, були адаптовані для роботи з Qwen2, що дозволяє ефективне розгортання на пристроях з обмеженими ресурсами.
Розгортання та висновок: Моделі Qwen2 можуть бути розгорнуті та використані за допомогою різноманітних фреймворків, включаючи vLLM, SGL, SkyPilot, TensorRT-LLM, OpenVino та TGI. Ці фреймворки пропонують оптимізовані висновкові трубопроводи, що дозволяє ефективне та масштабне розгортання Qwen2 у виробничих середовищах.
Платформи API та локальне виконання: Для розробників, які бажають інтегрувати Qwen2 у свої застосунки, платформи API, такі як Together, Fireworks та OpenRouter, пропонують зручний доступ до можливостей моделей. Альтернативно, локальне виконання підтримується фреймворками, такими як MLX, Llama.cpp, Ollama та LM Studio, що дозволяє користувачам запускати Qwen2 на своїх локальних машинах, зберігаючи контроль над приватністю та безпекою даних.
Фреймворки агентів та RAG: Підтримка Qwen2 для використання інструментів та агентських можливостей підтримується фреймворками, такими як LlamaIndex, CrewAI та OpenDevin. Ці фреймворки дозволяють створення спеціалізованих агентів штучного інтелекту та інтеграцію Qwen2 у трубопроводи генерації з підтримкою відновлення (RAG), розширюючи діапазон застосунків та випадків використання.
Погляд у майбутнє: Майбутні розробки та можливості
Візія Alibaba для Qwen2 простягається далеко за межі поточної версії. Команда активно тренує більші моделі для дослідження меж масштабування моделей, доповнюючи зусилля з масштабування даних. Крім того, плани передбачають розширення Qwen2 у сфері багатомодальної штучної інтелектуальної обробки, що дозволить інтегрувати можливості розуміння зору та аудіо.
По мірі того, як екосистема відкритого штучного інтелекту продовжує розвиватися, Qwen2 відіграє ключову роль, служачи потужним ресурсом для дослідників, розробників та організацій, які прагнуть просунути стан мистецтва у сфері обробки природної мови та штучного інтелекту.















