Model dan platform AI
Qwen2 – Model Bahasa Multilingual Terbaru Alibaba yang Menantang SOTA seperti Llama 3
Setelah berbulan-bulan antisipasi, Tim Qwen Alibaba akhirnya memperkenalkan Qwen2 – evolusi berikutnya dari seri model bahasa yang kuat. Qwen2 mewakili lompatan besar ke depan, dengan kemajuan mutakhir yang dapat memposisikannya sebagai alternatif terbaik untuk model Llama 3 yang dirilis Meta. Dalam penyelaman teknis ini, kita akan menjelajahi fitur kunci, benchmark kinerja, dan teknik inovatif yang membuat Qwen2 menjadi pesaing yang tangguh di dunia model bahasa besar (LLM).
Meningkatkan Kapasitas: Memperkenalkan Jajaran Model Qwen2
Di inti Qwen2 terdapat jajaran model yang beragam, dirancang untuk memenuhi berbagai kebutuhan komputasi. Seri ini mencakup lima ukuran model yang berbeda: Qwen2-0,5B, Qwen2-1,5B, Qwen2-7B, Qwen2-57B-A14B, dan model andalan Qwen2-72B. Rentang pilihan ini memenuhi spektrum pengguna yang luas, dari mereka yang memiliki sumber daya perangkat keras yang sederhana hingga mereka yang memiliki akses ke infrastruktur komputasi mutakhir.
Salah satu fitur unggulan Qwen2 adalah kemampuan multilingualnya. Sementara model Qwen1.5 sebelumnya unggul dalam bahasa Inggris dan Cina, Qwen2 telah dilatih pada data yang mencakup 27 bahasa tambahan. Regimen pelatihan multilingual ini mencakup bahasa dari wilayah yang beragam seperti Eropa Barat, Eropa Timur dan Tengah, Timur Tengah, Asia Timur, dan Asia Selatan.
Dengan memperluas repertoar linguistiknya, Qwen2 menunjukkan kemampuan luar biasa untuk memahami dan menghasilkan konten dalam berbagai bahasa, membuatnya menjadi alat yang sangat berharga untuk aplikasi global dan komunikasi antar budaya.
Mengatasi Code-Switching: Tantangan Multilingual
Dalam konteks multilingual, fenomena code-switching – praktik berganti-ganti antara bahasa yang berbeda dalam satu percakapan atau kalimat – adalah hal yang umum. Qwen2 telah dilatih secara hati-hati untuk menangani skenario code-switching, mengurangi masalah terkait dan memastikan transisi yang lancar antara bahasa.
Evaluasi menggunakan prompt yang biasanya memicu code-switching telah mengkonfirmasi perbaikan signifikan Qwen2 dalam domain ini, sebagai bukti komitmen Alibaba untuk menghadirkan model bahasa yang benar-benar multilingual.
Unggul dalam Pemrograman dan Matematika
Qwen2 memiliki kemampuan luar biasa dalam domain pemrograman dan matematika, area yang telah lama menjadi tantangan bagi model bahasa. Dengan memanfaatkan dataset berkualitas tinggi yang luas dan metode pelatihan yang dioptimalkan, Qwen2-72B-Instruct, varian yang dioptimalkan untuk instruksi, menunjukkan kinerja yang luar biasa dalam menyelesaikan masalah matematika dan tugas pemrograman dalam berbagai bahasa pemrograman.
Mengembangkan Pemahaman Konteks
Salah satu fitur paling mengesankan dari Qwen2 adalah kemampuannya untuk memahami dan memproses urutan konteks yang diperpanjang. Sementara model bahasa lainnya berjuang dengan teks panjang, Qwen2-7B-Instruct dan Qwen2-72B-Instruct telah dirancang untuk menangani panjang konteks hingga 128K token.
Kemampuan ini adalah permainan yang berubah untuk aplikasi yang memerlukan pemahaman mendalam tentang dokumen panjang, seperti kontrak hukum, makalah penelitian, atau manual teknis yang padat. Dengan memproses konteks yang diperpanjang, Qwen2 dapat memberikan respons yang lebih akurat dan komprehensif, membuka peluang baru dalam pemrosesan bahasa alami.

Akurasi model Qwen2 dalam mengambil fakta dari dokumen dengan berbagai panjang konteks dan kedalaman dokumen.
Grafik ini menunjukkan kemampuan model Qwen2 untuk mengambil fakta dari dokumen dengan berbagai panjang konteks dan kedalaman.
Inovasi Arsitektur: Perhatian Grup Query dan Embedding yang Dioptimalkan
Di bawah tenda, Qwen2 mengintegrasikan beberapa inovasi arsitektur yang berkontribusi pada kinerjanya yang luar biasa. Salah satu inovasi tersebut adalah adopsi Perhatian Grup Query (GQA) di semua ukuran model. GQA menawarkan kecepatan inferensi yang lebih cepat dan penggunaan memori yang lebih rendah, membuat Qwen2 lebih efisien dan dapat diakses oleh berbagai konfigurasi perangkat keras.
Selain itu, Alibaba telah mengoptimalkan embedding untuk model yang lebih kecil dalam seri Qwen2. Dengan mengikat embedding, tim telah berhasil mengurangi jejak memori model ini, memungkinkan mereka untuk diterapkan pada perangkat keras yang kurang kuat sambil mempertahankan kinerja yang tinggi.
Benchmaking Qwen2: Mengungguli Model State-of-the-Art
Qwen2 memiliki kinerja yang luar biasa di berbagai benchmark. Evaluasi komparatif mengungkapkan bahwa Qwen2-72B, model terbesar dalam seri ini, mengungguli pesaing terdepan seperti Llama-3-70B dalam area kritis, termasuk pemahaman bahasa alami, akuisisi pengetahuan, kemampuan pemrograman, keterampilan matematika, dan kemampuan multilingual.
Meskipun memiliki lebih sedikit parameter daripada pendahulunya, Qwen1.5-110B, Qwen2-72B menunjukkan kinerja yang lebih baik, sebagai bukti efektivitas dataset yang hati-hati dan metode pelatihan yang dioptimalkan oleh Alibaba.
Keamanan dan Tanggung Jawab: Selaras dengan Nilai Manusia
Qwen2-72B-Instruct telah dievaluasi secara ketat untuk kemampuannya menangani pertanyaan yang berpotensi berbahaya terkait dengan kegiatan ilegal, penipuan, pornografi, dan pelanggaran privasi. Hasilnya sangat menggembirakan: Qwen2-72B-Instruct menunjukkan kinerja yang setara dengan model GPT-4 yang sangat dihargai dalam hal keamanan, menunjukkan proporsi respons yang berbahaya yang jauh lebih rendah dibandingkan dengan model besar lainnya seperti Mistral-8x22B.
Pencapaian ini menekankan komitmen Alibaba untuk mengembangkan sistem AI yang selaras dengan nilai manusia, memastikan bahwa Qwen2 tidak hanya kuat tetapi juga dapat dipercaya dan bertanggung jawab.
Lisensi dan Komitmen Open-Source
Dalam upaya untuk meningkatkan dampak Qwen2, Alibaba telah mengadopsi pendekatan open-source untuk lisensi. Sementara Qwen2-72B dan model instruksi-tunednya mempertahankan lisensi Qianwen asli, model lainnya – Qwen2-0,5B, Qwen2-1,5B, Qwen2-7B, dan Qwen2-57B-A14B – telah dilisensikan di bawah lisensi Apache 2.0 yang lebih terbuka.
Keterbukaan yang ditingkatkan ini diharapkan dapat mempercepat penerapan dan penggunaan komersial model Qwen2 di seluruh dunia, memfasilitasi kolaborasi dan inovasi dalam komunitas AI global.
Penggunaan dan Implementasi
Menggunakan model Qwen2 cukup sederhana, berkat integrasinya dengan kerangka kerja populer seperti Hugging Face. Berikut adalah contoh menggunakan Qwen2-7B-Chat-beta untuk inferensi:
from transformers import AutoModelForCausalLM, AutoTokenizer
<p>device = "cuda" # perangkat untuk memuat model</p>
<p>model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen1.5-7B-Chat", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen1.5-7B-Chat")</p>
<p>prompt = "Berikan saya pengantar singkat tentang model bahasa besar."</p>
<p>messages = [{"role": "user", "content": prompt}]</p>
<p>text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)</p>
<p>model_inputs = tokenizer([text], return_tensors="pt").to(device)</p>
<p>generated_ids = model.generate(model_inputs.input_ids, max_new_tokens=512, do_sample=True)</p>
<p>generated_ids = [output_ids[len(input_ids):] for input_ids, output_ids in zip(model_inputs.input_ids, generated_ids)]</p>
<p>response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
print(response)</p>
Potongan kode ini menunjukkan cara mengatur dan menghasilkan teks menggunakan model Qwen2-7B-Chat. Integrasi dengan Hugging Face membuatnya mudah diakses dan dieksperimenkan.
Qwen2 vs. Llama 3: Analisis Komparatif
Sementara Qwen2 dan Llama 3 Meta keduanya merupakan model bahasa yang tangguh, mereka menunjukkan kekuatan dan trade-off yang berbeda.

Grafik perbandingan kinerja Qwen2-72B, Llama3-70B, Mixtral-8x22B, dan Qwen1.5-110B di berbagai benchmark termasuk MMLU, MMLU-Pro, GPQA, dan lain-lain.
Berikut adalah analisis komparatif untuk membantu Anda memahami perbedaan kunci antara keduanya:
Kemampuan Multilingual: Qwen2 memiliki keunggulan yang jelas dalam hal dukungan multilingual. Pelatihan pada data yang mencakup 27 bahasa tambahan, di luar bahasa Inggris dan Cina, memungkinkan Qwen2 untuk unggul dalam komunikasi antar budaya dan skenario multilingual. Di sisi lain, kemampuan multilingual Llama 3 kurang menonjol, yang dapat membatasi efektivitasnya dalam konteks linguistik yang beragam.
Kemampuan Pemrograman dan Matematika: Keduanya, Qwen2 dan Llama 3, menunjukkan kemampuan pemrograman dan matematika yang mengesankan. Namun, Qwen2-72B-Instruct tampaknya memiliki keunggulan tipis, berkat pelatihan yang ketat pada dataset yang luas dan berkualitas tinggi dalam domain ini. Fokus Alibaba untuk meningkatkan kemampuan Qwen2 dalam area ini dapat memberinya keunggulan dalam aplikasi khusus yang melibatkan pemrograman atau pemecahan masalah matematika.
Pemahaman Konteks Panjang: Qwen2-7B-Instruct dan Qwen2-72B-Instruct menawarkan kemampuan mengesankan untuk menangani panjang konteks hingga 128K token. Fitur ini sangat berharga untuk aplikasi yang memerlukan pemahaman mendalam tentang dokumen panjang, seperti kontrak hukum, makalah penelitian, atau manual teknis yang padat. Llama 3, meskipun mampu memproses urutan panjang, mungkin tidak menyaingi kinerja Qwen2 dalam area ini.
Sementara keduanya menunjukkan kinerja state-of-the-art, jajaran model Qwen2 yang beragam, mulai dari 0,5B hingga 72B parameter, menawarkan fleksibilitas dan skalabilitas yang lebih besar. Fleksibilitas ini memungkinkan pengguna untuk memilih ukuran model yang paling sesuai dengan sumber daya komputasi dan kebutuhan kinerja mereka. Selain itu, upaya Alibaba untuk meningkatkan Qwen2 ke model yang lebih besar dapat lebih meningkatkan kemampuannya, potensial mengungguli Llama 3 di masa depan.
Penggunaan dan Integrasi: Memudahkan Adopsi Qwen2
Untuk memfasilitasi adopsi dan integrasi Qwen2 yang luas, Alibaba telah mengambil langkah-langkah proaktif untuk memastikan penerapan yang mulus di berbagai platform dan kerangka kerja. Tim Qwen telah bekerja sama erat dengan berbagai proyek dan organisasi pihak ketiga, memungkinkan Qwen2 untuk digunakan bersama dengan berbagai alat dan kerangka kerja.
Penyetelan Halus dan Kuantisasi: Proyek pihak ketiga seperti Axolotl, Llama-Factory, Firefly, Swift, dan XTuner telah dioptimalkan untuk mendukung penyetelan halus model Qwen2, memungkinkan pengguna untuk menyesuaikan model dengan tugas dan dataset spesifik mereka. Selain itu, alat kuantisasi seperti AutoGPTQ, AutoAWQ, dan Neural Compressor telah disesuaikan untuk bekerja dengan Qwen2, memfasilitasi penerapan yang efisien pada perangkat dengan keterbatasan sumber daya.
Penggunaan dan Inferensi: Model Qwen2 dapat diterapkan dan disajikan menggunakan berbagai kerangka kerja, termasuk vLLM, SGL, SkyPilot, TensorRT-LLM, OpenVino, dan TGI. Kerangka kerja ini menawarkan pipa inferensi yang dioptimalkan, memungkinkan penerapan Qwen2 yang efisien dan skalabel dalam lingkungan produksi.
Platform API dan Eksekusi Lokal: Bagi pengembang yang ingin mengintegrasikan Qwen2 ke dalam aplikasi mereka, platform API seperti Together, Fireworks, dan OpenRouter menyediakan akses yang mudah ke kemampuan model. Alternatifnya, eksekusi lokal didukung oleh kerangka kerja seperti MLX, Llama.cpp, Ollama, dan LM Studio, memungkinkan pengguna untuk menjalankan Qwen2 di mesin lokal mereka sambil mempertahankan kontrol atas privasi dan keamanan data.
Kerangka Kerja Agen dan RAG: Dukungan Qwen2 untuk penggunaan alat dan kemampuan agen diperkuat oleh kerangka kerja seperti LlamaIndex, CrewAI, dan OpenDevin. Kerangka kerja ini memungkinkan pembuatan agen AI khusus dan integrasi Qwen2 ke dalam pipa retrieval-augmented generation (RAG), memperluas jangkauan aplikasi dan kasus penggunaan.
Menghadap ke Masa Depan: Pengembangan dan Peluang Masa Depan
Visi Alibaba untuk Qwen2 meluas jauh melampaui rilis saat ini. Tim Qwen secara aktif melatih model yang lebih besar untuk menjelajahi batas skala model, dilengkapi dengan upaya penskalaan data yang berkelanjutan. Selain itu, rencana sedang dilakukan untuk memperluas Qwen2 ke dalam ranah AI multimodal, memungkinkan integrasi kemampuan pemahaman visi dan audio.
Seiring ekosistem AI open-source terus berkembang, Qwen2 akan memainkan peran penting, berfungsi sebagai sumber daya yang kuat bagi peneliti, pengembang, dan organisasi yang berusaha untuk memajukan keadaan seni dalam pemrosesan bahasa alami dan kecerdasan buatan.















