Mô hình và nền tảng AI
Qwen2 – Mô hình ngôn ngữ đa ngôn ngữ mới nhất của Alibaba thách thức SOTA như Llama 3
Sau nhiều tháng chờ đợi, đội ngũ Qwen của Alibaba đã cuối cùng ra mắt Qwen2 – sự tiến hóa tiếp theo của dòng mô hình ngôn ngữ mạnh mẽ của họ. Qwen2 đại diện cho một bước nhảy vĩ đại về phía trước, với những tiến bộ hàng đầu về công nghệ có thể đặt nó vào vị trí là sự thay thế tốt nhất cho mô hình Llama 3 nổi tiếng của Meta. Trong bài phân tích kỹ thuật này, chúng tôi sẽ khám phá các tính năng chính, điểm chuẩn hiệu suất và các kỹ thuật đổi mới mà làm cho Qwen2 trở thành một đối thủ mạnh trong lĩnh vực mô hình ngôn ngữ lớn (LLM).
Tăng quy mô: Giới thiệu dòng mô hình Qwen2
Ở cốt lõi của Qwen2 là một loạt các mô hình đa dạng được thiết kế để đáp ứng các nhu cầu tính toán khác nhau. Dòng sản phẩm bao gồm năm mô hình kích thước khác nhau: Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B, Qwen2-57B-A14B và mô hình hàng đầu Qwen2-72B. Phạm vi lựa chọn này phù hợp với một loạt các người dùng, từ những người có tài nguyên phần cứng khiêm tốn đến những người có quyền truy cập vào cơ sở hạ tầng tính toán tiên tiến.
Một trong những tính năng nổi bật của Qwen2 là khả năng đa ngôn ngữ. Trong khi mô hình Qwen1.5 trước đó chỉ xuất sắc trong tiếng Anh và tiếng Trung, Qwen2 đã được đào tạo trên dữ liệu bao gồm 27 ngôn ngữ bổ sung. Chương trình đào tạo đa ngôn ngữ này bao gồm các ngôn ngữ từ các khu vực đa dạng như Tây Âu, Đông và Trung Âu, Trung Đông, Đông Á và Nam Á.
Bằng cách mở rộng kho từ vựng ngôn ngữ của mình, Qwen2 thể hiện khả năng hiểu và tạo nội dung vượt trội trên nhiều ngôn ngữ, khiến nó trở thành một công cụ vô giá cho các ứng dụng toàn cầu và giao tiếp xuyên văn hóa.
Địa chỉ chuyển mã: Một thách thức đa ngôn ngữ
Trong các ngữ cảnh đa ngôn ngữ, hiện tượng chuyển mã – việc thay đổi giữa các ngôn ngữ khác nhau trong một cuộc trò chuyện hoặc phát biểu đơn lẻ – là một hiện tượng phổ biến. Qwen2 đã được đào tạo cẩn thận để xử lý các kịch bản chuyển mã, giảm đáng kể các vấn đề liên quan và đảm bảo chuyển đổi mượt mà giữa các ngôn ngữ.
Các đánh giá sử dụng các lời nhắc thường gây ra chuyển mã đã xác nhận sự cải tiến đáng kể của Qwen2 trong lĩnh vực này, là minh chứng cho cam kết của Alibaba trong việc cung cấp một mô hình ngôn ngữ đa ngôn ngữ thực sự.
Xuất sắc trong mã hóa và toán học
Qwen2 có khả năng đáng chú ý trong các lĩnh vực mã hóa và toán học, những lĩnh vực đã từng là thách thức cho các mô hình ngôn ngữ. Bằng cách tận dụng các tập dữ liệu chất lượng cao và các phương pháp đào tạo được tối ưu hóa, Qwen2-72B-Instruct, biến thể được điều chỉnh của mô hình hàng đầu, thể hiện hiệu suất vượt trội trong việc giải quyết các vấn đề toán học và mã hóa trên nhiều ngôn ngữ lập trình.
Mở rộng sự hiểu biết ngữ cảnh
Một trong những tính năng ấn tượng nhất của Qwen2 là khả năng hiểu và xử lý các chuỗi ngữ cảnh mở rộng. Trong khi hầu hết các mô hình ngôn ngữ gặp khó khăn với văn bản dài, Qwen2-7B-Instruct và Qwen2-72B-Instruct đã được thiết kế để xử lý độ dài ngữ cảnh lên đến 128K token.
Khả năng này là một yếu tố thay đổi trò chơi cho các ứng dụng đòi hỏi sự hiểu biết sâu sắc về các tài liệu dài, chẳng hạn như hợp đồng pháp lý, bài báo nghiên cứu hoặc tài liệu kỹ thuật dày đặc. Bằng cách xử lý hiệu quả các ngữ cảnh mở rộng, Qwen2 có thể cung cấp các phản hồi chính xác và toàn diện hơn, mở ra những chân trời mới trong xử lý ngôn ngữ tự nhiên.

Độ chính xác của các mô hình Qwen2 trong việc thu hồi sự kiện từ các tài liệu trên các độ dài ngữ cảnh và độ sâu tài liệu khác nhau.
Biểu đồ này hiển thị khả năng của các mô hình Qwen2 trong việc thu hồi sự kiện từ các tài liệu có độ dài ngữ cảnh và độ sâu khác nhau.
Đổi mới kiến trúc: Chú ý truy vấn nhóm và nhúng tối ưu hóa
Dưới mui xe, Qwen2 kết hợp một số đổi mới kiến trúc đóng góp cho hiệu suất vượt trội của nó. Một trong những đổi mới như vậy là việc áp dụng Chú ý truy vấn nhóm (GQA) trên tất cả các kích thước mô hình. GQA cung cấp tốc độ suy luận nhanh hơn và sử dụng bộ nhớ giảm, khiến Qwen2 trở nên hiệu quả và dễ tiếp cận hơn với nhiều cấu hình phần cứng.
Ngoài ra, Alibaba đã tối ưu hóa các nhúng cho các mô hình nhỏ hơn trong dòng Qwen2. Bằng cách gắn kết các nhúng, nhóm đã quản lý để giảm dấu chân bộ nhớ của các mô hình này, cho phép chúng được triển khai trên phần cứng ít mạnh mẽ hơn trong khi vẫn duy trì hiệu suất chất lượng cao.
Đánh giá Qwen2: Vượt trội so với các mô hình hiện tại
Qwen2 có hiệu suất đáng chú ý trên nhiều điểm chuẩn đa dạng. Các đánh giá so sánh cho thấy Qwen2-72B, mô hình lớn nhất trong dòng, vượt trội so với các đối thủ hàng đầu như Llama-3-70B trong các lĩnh vực quan trọng, bao gồm hiểu ngôn ngữ tự nhiên, thu thập kiến thức, thành thạo mã hóa, kỹ năng toán học và khả năng đa ngôn ngữ.
Mặc dù có ít tham số hơn so với người tiền nhiệm Qwen1.5-110B, Qwen2-72B vẫn thể hiện hiệu suất vượt trội, là minh chứng cho hiệu quả của các tập dữ liệu được quản lý cẩn thận và các phương pháp đào tạo được tối ưu hóa của Alibaba.
An toàn và trách nhiệm: Đồng bộ với giá trị con người
Qwen2-72B-Instruct đã được đánh giá nghiêm ngặt về khả năng xử lý các truy vấn có thể gây hại liên quan đến hoạt động bất hợp pháp, gian lận, khiêu dâm và vi phạm quyền riêng tư. Kết quả rất đáng khích lệ: Qwen2-72B-Instruct hoạt động tương đương với mô hình GPT-4 được đánh giá cao về mặt an toàn, thể hiện tỷ lệ phản hồi có hại thấp hơn so với các mô hình lớn khác như Mistral-8x22B.
Điều này nhấn mạnh cam kết của Alibaba trong việc phát triển các hệ thống AI phù hợp với giá trị con người, đảm bảo rằng Qwen2 không chỉ mạnh mẽ mà còn đáng tin cậy và có trách nhiệm.
Giấy phép và cam kết mã nguồn mở
Trong một động thái nhằm tăng cường tác động của Qwen2, Alibaba đã áp dụng một cách tiếp cận mã nguồn mở cho việc cấp phép. Trong khi Qwen2-72B và các mô hình được điều chỉnh theo hướng dẫn giữ lại giấy phép Qianwen ban đầu, các mô hình còn lại – Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B và Qwen2-57B-A14B – đã được cấp phép theo giấy phép Apache 2.0 permissive.
Sự cởi mở này được kỳ vọng sẽ tăng tốc việc áp dụng và sử dụng thương mại các mô hình Qwen2 trên toàn thế giới, thúc đẩy sự hợp tác và đổi mới trong cộng đồng AI toàn cầu.
Sử dụng và triển khai
Sử dụng các mô hình Qwen2 là một quá trình đơn giản nhờ vào sự tích hợp với các khuôn khổ phổ biến như Hugging Face. Dưới đây là một ví dụ về việc sử dụng Qwen2-7B-Chat-beta cho suy luận:
from transformers import AutoModelForCausalLM, AutoTokenizer
<p>device = "cuda" # thiết bị để tải mô hình</p>
<p>model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen1.5-7B-Chat", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen1.5-7B-Chat")</p>
<p>prompt = "Cho tôi một giới thiệu ngắn về các mô hình ngôn ngữ lớn."</p>
<p>messages = [{"role": "user", "content": prompt}]</p>
<p>text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)</p>
<p>model_inputs = tokenizer([text], return_tensors="pt").to(device)</p>
<p>generated_ids = model.generate(model_inputs.input_ids, max_new_tokens=512, do_sample=True)</p>
<p>generated_ids = [output_ids[len(input_ids):] for input_ids, output_ids in zip(model_inputs.input_ids, generated_ids)]</p>
<p>response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
print(response)</p>
Mã đoạn này thể hiện cách thiết lập và tạo văn bản bằng mô hình Qwen2-7B-Chat. Sự tích hợp với Hugging Face làm cho nó trở nên dễ tiếp cận và dễ dàng để thử nghiệm.
Qwen2 so với Llama 3: Phân tích so sánh
Mặc dù Qwen2 và Llama 3 của Meta đều là những mô hình ngôn ngữ mạnh mẽ, chúng thể hiện các điểm mạnh và sự đánh đổi khác nhau.

Biểu đồ so sánh hiệu suất của Qwen2-72B, Llama3-70B, Mixtral-8x22B và Qwen1.5-110B trên nhiều điểm chuẩn bao gồm MMLU, MMLU-Pro, GPQA và các điểm chuẩn khác.
Dưới đây là phân tích so sánh để giúp bạn hiểu rõ về các điểm khác biệt chính:
Khả năng đa ngôn ngữ: Qwen2 có lợi thế rõ ràng về hỗ trợ đa ngôn ngữ. Việc đào tạo trên dữ liệu bao gồm 27 ngôn ngữ bổ sung, ngoài tiếng Anh và tiếng Trung, cho phép Qwen2 vượt trội trong giao tiếp xuyên văn hóa và các kịch bản đa ngôn ngữ. Ngược lại, khả năng đa ngôn ngữ của Llama 3 ít nổi bật hơn, có thể hạn chế hiệu quả của nó trong các ngữ cảnh ngôn ngữ đa dạng.
Thành thạo mã hóa và toán học: Cả Qwen2 và Llama 3 đều thể hiện khả năng mã hóa và toán học ấn tượng. Tuy nhiên, Qwen2-72B-Instruct dường như có một lợi thế nhỏ, nhờ vào việc đào tạo trên các tập dữ liệu chất lượng cao và được tối ưu hóa trong các lĩnh vực này. Sự tập trung của Alibaba vào việc nâng cao khả năng của Qwen2 trong các lĩnh vực này có thể mang lại cho nó một lợi thế cho các ứng dụng chuyên biệt liên quan đến mã hóa hoặc giải toán.
Hiểu biết ngữ cảnh dài: Qwen2-7B-Instruct và Qwen2-72B-Instruct có khả năng xử lý độ dài ngữ cảnh lên đến 128K token. Tính năng này đặc biệt có giá trị cho các ứng dụng đòi hỏi sự hiểu biết sâu sắc về các tài liệu dài, chẳng hạn như hợp đồng pháp lý, bài báo nghiên cứu hoặc tài liệu kỹ thuật dày đặc. Llama 3, mặc dù có khả năng xử lý các chuỗi dài, có thể không匹 Qwen2 trong lĩnh vực này.
Mặc dù cả Qwen2 và Llama 3 đều thể hiện hiệu suất hàng đầu, Qwen2 có dòng mô hình đa dạng, từ 0,5B đến 72B tham số, cung cấp sự linh hoạt và khả năng mở rộng lớn hơn. Sự đa dạng này cho phép người dùng chọn mô hình phù hợp nhất với tài nguyên tính toán và yêu cầu hiệu suất của họ. Ngoài ra, nỗ lực không ngừng của Alibaba để mở rộng Qwen2 lên các mô hình lớn hơn có thể tăng cường khả năng của nó, có thể vượt qua Llama 3 trong tương lai.
Triển khai và tích hợp: Tối ưu hóa việc áp dụng Qwen2
Để thúc đẩy việc áp dụng và tích hợp Qwen2 rộng rãi, Alibaba đã thực hiện các bước chủ động để đảm bảo việc triển khai dễ dàng trên nhiều nền tảng và khuôn khổ. Đội ngũ Qwen đã hợp tác chặt chẽ với nhiều dự án và tổ chức của bên thứ ba, cho phép Qwen2 được tận dụng cùng với nhiều công cụ và khuôn khổ khác nhau.
Tối ưu hóa và lượng tử hóa: Các dự án của bên thứ ba như Axolotl, Llama-Factory, Firefly, Swift và XTuner đã được tối ưu hóa để hỗ trợ việc tinh chỉnh mô hình Qwen2, cho phép người dùng điều chỉnh mô hình cho các nhiệm vụ và tập dữ liệu cụ thể của họ. Ngoài ra, các công cụ lượng tử hóa như AutoGPTQ, AutoAWQ và Neural Compressor đã được điều chỉnh để làm việc với Qwen2, giúp dễ dàng triển khai trên các thiết bị có tài nguyên hạn chế.
Triển khai và suy luận: Các mô hình Qwen2 có thể được triển khai và cung cấp bằng nhiều khuôn khổ, bao gồm vLLM, SGL, SkyPilot, TensorRT-LLM, OpenVino và TGI. Các khuôn khổ này cung cấp các đường ống suy luận được tối ưu hóa, cho phép triển khai hiệu quả và có thể mở rộng Qwen2 trong các môi trường sản xuất.
Nền tảng API và thực thi cục bộ: Đối với các nhà phát triển muốn tích hợp Qwen2 vào ứng dụng của họ, các nền tảng API như Together, Fireworks và OpenRouter cung cấp quyền truy cập thuận tiện vào các khả năng của mô hình. Ngoài ra, thực thi cục bộ được hỗ trợ thông qua các khuôn khổ như MLX, Llama.cpp, Ollama và LM Studio, cho phép người dùng chạy Qwen2 trên máy cục bộ của họ trong khi vẫn kiểm soát quyền riêng tư và bảo mật dữ liệu.
Khung công cụ và khung RAG: Hỗ trợ của Qwen2 cho việc sử dụng công cụ và khả năng của tác nhân được tăng cường bởi các khuôn khổ như LlamaIndex, CrewAI và OpenDevin. Các khuôn khổ này cho phép tạo ra các tác nhân AI chuyên dụng và tích hợp Qwen2 vào các đường ống tạo sinh tăng cường, mở rộng phạm vi ứng dụng và trường hợp sử dụng.
Nhìn về tương lai: Phát triển và cơ hội trong tương lai
Tầm nhìn của Alibaba cho Qwen2 mở rộng xa hơn việc phát hành hiện tại. Đội ngũ đang tích cực đào tạo các mô hình lớn hơn để khám phá các giới hạn của việc mở rộng mô hình, cùng với các nỗ lực mở rộng dữ liệu. Hơn nữa, các kế hoạch đang được tiến hành để mở rộng Qwen2 vào lĩnh vực trí tuệ đa phương tiện, cho phép tích hợp các khả năng hiểu biết về thị giác và âm thanh.
Khi hệ sinh thái mã nguồn mở AI tiếp tục phát triển, Qwen2 sẽ đóng vai trò quan trọng, phục vụ như một nguồn lực mạnh mẽ cho các nhà nghiên cứu, nhà phát triển và tổ chức tìm cách thúc đẩy trạng thái hiện tại của xử lý ngôn ngữ tự nhiên và trí tuệ nhân tạo.















