AI-modellen en platforms

Qwen2 – Alibaba’s Latest Multilingual Language Model Challenges SOTA like Llama 3

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
evolution from Qwen1.5 to Qwen2

Na maanden van verwachting heeft Alibaba’s Qwen-team eindelijk Qwen2 onthuld – de volgende evolutie van hun krachtige reeks taalmodellen. Qwen2 vertegenwoordigt een significante stap voorwaarts, met baanbrekende vooruitgang die het potentieel heeft om het tot de beste alternatief te maken voor Meta’s gevierde Llama 3-model. In deze technische diepe duik, zullen we de belangrijkste functies, prestatiebenchmarks en innovatieve technieken verkennen die Qwen2 een formidabele tegenstander maken in het domein van grote taalmodellen (LLM’s).

Scaling Up: Introducing the Qwen2 Model Lineup

Aan de kern van Qwen2 ligt een diverse reeks modellen die zijn ontworpen om aan verschillende computervragen te voldoen. De serie omvat vijf verschillende modelgroottes: Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B, Qwen2-57B-A14B en het vlaggenschip Qwen2-72B. Deze reeks opties is bedoeld voor een breed spectrum van gebruikers, van die met bescheiden hardwarebronnen tot die met toegang tot state-of-the-art computermiddelen.

Een van de opvallende functies van Qwen2 is zijn multilinguale mogelijkheden. Terwijl het voorgaande Qwen1.5-model uitblonk in het Engels en Chinees, is Qwen2 getraind op gegevens die 27 extra talen omvatten. Deze multilinguale trainingsregime omvat talen uit diverse regio’s, zoals West-Europa, Oost- en Centraal-Europa, het Midden-Oosten, Oost-Azië en Zuid-Azië.

Tabel met talen die worden ondersteund door Qwen2-modellen, ingedeeld naar regio's

Talen die worden ondersteund door Qwen2-modellen, ingedeeld naar geografische regio’s

Door zijn linguïstische repertoire uit te breiden, toont Qwen2 een uitzonderlijke capaciteit om inhoud te begrijpen en te genereren in een breed scala aan talen, waardoor het een onmisbaar instrument is voor mondiale toepassingen en cross-culturele communicatie.

Specificaties van Qwen2-modellen, inclusief parameters, GQA, tie-embedding en contextlengte

Specificaties van Qwen2-modellen, inclusief parameters, GQA, en contextlengte.

Addressing Code-Switching: A Multilingual Challenge

In multilinguale contexten is het fenomeen van code-switching – de praktijk van het afwisselen tussen verschillende talen binnen een enkel gesprek of uiting – een veelvoorkomend verschijnsel. Qwen2 is zorgvuldig getraind om code-switching-scenario’s aan te pakken, waardoor de daarmee samenhangende problemen aanzienlijk worden verminderd en een soepele overgang tussen talen wordt gewaarborgd.

Evaluaties met prompts die typisch code-switching induceren, hebben de aanzienlijke verbetering van Qwen2 in dit domein bevestigd, hetgeen een getuigenis is van Alibaba’s toewijding om een echt multilinguaal taalmodel te leveren.

Excelling in Coding and Mathematics

Qwen2 heeft opmerkelijke capaciteiten in de domeinen van codering en wiskunde, gebieden die traditioneel uitdagingen hebben gevormd voor taalmodellen. Door het gebruik van uitgebreide, hoogwaardige datasets en geoptimaliseerde trainingsmethoden, toont Qwen2-72B-Instruct, de instructie-gefinetune variant van het vlaggenschipmodel, uitstekende prestaties bij het oplossen van wiskundige problemen en coderingstaken in verschillende programmeertalen.

Extending Context Comprehension

Een van de meest indrukwekkende functies van Qwen2 is zijn vermogen om uitgebreide contextsequenties te begrijpen en te verwerken. Terwijl de meeste taalmodellen worstelen met lange vormen van tekst, zijn Qwen2-7B-Instruct en Qwen2-72B-Instruct modellen ontworpen om contextlengtes van maximaal 128K tokens aan te kunnen.

Deze opmerkelijke capaciteit is een game-changer voor toepassingen die een diepgaand begrip van lange documenten vereisen, zoals juridische contracten, onderzoeksrapporten of dichte technische handleidingen. Door effectief uitgebreide contexten te verwerken, kan Qwen2 meer accurate en uitgebreide antwoorden geven, waardoor nieuwe frontiers in natuurlijke taalverwerking worden ontsloten.

Grafiek die de feitophaalaccuratie van Qwen2-modellen toont over verschillende contextlengtes en documentdieptes

Accuratie van Qwen2-modellen bij het ophalen van feiten uit documenten over verschillende contextlengtes en documentdieptes.

Deze grafiek toont de capaciteit van Qwen2-modellen om feiten op te halen uit documenten van verschillende contextlengtes en dieptes.

Architectural Innovations: Group Query Attention and Optimized Embeddings

Onder de motorkap omvat Qwen2 verschillende architectonische innovaties die bijdragen aan zijn uitzonderlijke prestaties. Een van deze innovaties is de adoptie van Group Query Attention (GQA) in alle modelgroottes. GQA biedt snellere inferentiesnelheden en verlaagt het geheugengebruik, waardoor Qwen2 efficiënter en toegankelijker wordt voor een bredere reeks hardwareconfiguraties.

Bovendien heeft Alibaba de embeddings voor kleinere modellen in de Qwen2-reeks geoptimaliseerd. Door de embeddings te koppelen, is het team erin geslaagd het geheugengebruik van deze modellen te verminderen, waardoor ze kunnen worden ingezet op minder krachtige hardware zonder afbreuk te doen aan de prestaties.

Benchmarking Qwen2: Outperforming State-of-the-Art Models

Qwen2 heeft een opmerkelijke prestatie over een breed scala aan benchmarks. Vergelijkende evaluaties onthullen dat Qwen2-72B, het grootste model in de reeks, toonaangevende concurrenten zoals Llama-3-70B overtreft in kritieke gebieden, waaronder natuurlijke taalbegrip, kennisverwerving, coderingsvaardigheid, wiskundige vaardigheden en multilinguale capaciteiten.

Grafieken die Qwen2-72B-Instruct en Llama3-70B-Instruct vergelijken in codering en wiskunde

Qwen2-72B-Instruct versus Llama3-70B-Instruct in codering en wiskunde

Ondanks het feit dat het minder parameters heeft dan zijn voorganger, Qwen1.5-110B, toont Qwen2-72B een superieure prestatie, hetgeen een getuigenis is van de effectiviteit van Alibaba’s zorgvuldig gecureerde datasets en geoptimaliseerde trainingsmethoden.

Safety and Responsibility: Aligning with Human Values

Qwen2-72B-Instruct is grondig geëvalueerd voor zijn vermogen om mogelijk schadelijke queries te hanteren die verband houden met illegale activiteiten, fraude, pornografie en schendingen van de privacy. De resultaten zijn bemoedigend: Qwen2-72B-Instruct presteert vergelijkbaar met het hoog gewaardeerde GPT-4-model op het gebied van veiligheid, met aanzienlijk lagere percentages schadelijke antwoorden in vergelijking met andere grote modellen zoals Mistral-8x22B.

Deze prestatie onderstreept Alibaba’s toewijding om AI-systemen te ontwikkelen die in overeenstemming zijn met menselijke waarden, waardoor Qwen2 niet alleen krachtig maar ook betrouwbaar en verantwoordelijk is.

Licensing and Open-Source Commitment

In een stap die de impact van Qwen2 verder versterkt, heeft Alibaba een open-source benadering van licenties aangenomen. Terwijl Qwen2-72B en zijn instructie-gefinetune modellen de oorspronkelijke Qianwen-licentie behouden, zijn de overige modellen – Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B en Qwen2-57B-A14B – gelicenceerd onder de permissive Apache 2.0-licentie.

Deze verhoogde openheid zal naar verwachting de toepassing en commerciële gebruiken van Qwen2-modellen wereldwijd versnellen, waardoor samenwerking en innovatie binnen de mondiale AI-gemeenschap worden bevorderd.

Usage and Implementation

Het gebruik van Qwen2-modellen is eenvoudig dankzij hun integratie met populaire frameworks zoals Hugging Face. Hier is een voorbeeld van het gebruik van Qwen2-7B-Chat-beta voor inferentie:

from transformers import AutoModelForCausalLM, AutoTokenizer

device = "cuda" # het apparaat waarop het model moet worden geladen

model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen1.5-7B-Chat", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen1.5-7B-Chat")

prompt = "Geef me een korte inleiding tot grote taalmodellen."

messages = [{"role": "user", "content": prompt}]

text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)

model_inputs = tokenizer([text], return_tensors="pt").to(device)

generated_ids = model.generate(model_inputs.input_ids, max_new_tokens=512, do_sample=True)

generated_ids = [output_ids[len(input_ids):] for input_ids, output_ids in zip(model_inputs.input_ids, generated_ids)]

response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
print(response)

Deze codefragment toont hoe u Qwen2-7B-Chat kunt instellen en tekst kunt genereren met het Qwen2-7B-Chat-model. De integratie met Hugging Face maakt het toegankelijk en gemakkelijk om te experimenteren.

Qwen2 vs. Llama 3: A Comparative Analysis

Terwijl Qwen2 en Meta’s Llama 3 beide formidabele taalmodellen zijn, vertonen ze verschillende sterke en zwakke punten.

Prestatievergelijking van Qwen2-72B, Llama3-70B, Mixtral-8x22B en Qwen1.5-110B over meerdere benchmarks

Een vergelijkende prestatiegrafiek van Qwen2-72B, Llama3-70B, Mixtral-8x22B en Qwen1.5-110B over verschillende benchmarks, waaronder MMLU, MMLU-Pro, GPQA en anderen.

Hier is een vergelijkende analyse om u te helpen de belangrijkste verschillen te begrijpen:

Multilinguale capaciteiten: Qwen2 heeft een duidelijk voordeel op het gebied van multilinguale ondersteuning. Zijn training op gegevens die 27 extra talen omvatten, naast het Engels en Chinees, stelt Qwen2 in staat om uit te blinken in cross-culturele communicatie en multilinguale scenario’s. In tegenstelling tot Llama 3’s multilinguale capaciteiten zijn minder uitgesproken, wat zijn effectiviteit in diverse linguïstische contexten kan beperken.

Coderings- en wiskundevaardigheid: Zowel Qwen2 als Llama 3 tonen indrukwekkende coderings- en wiskundecapaciteiten. Qwen2-72B-Instruct lijkt echter een lichte voorsprong te hebben, dankzij zijn grondige training op uitgebreide, hoogwaardige datasets in deze domeinen. Alibaba’s focus op het verbeteren van Qwen2’s capaciteiten in deze gebieden kan hem een voordeel geven voor gespecialiseerde toepassingen die codering of wiskundige probleemoplossing betreffen.

Lang contextbegrip: Qwen2-7B-Instruct en Qwen2-72B-Instruct modellen beschikken over een indrukwekkend vermogen om contextlengtes van maximaal 128K tokens te verwerken. Deze functie is bijzonder waardevol voor toepassingen die een diepgaand begrip van lange documenten vereisen, zoals juridische contracten, onderzoeksrapporten of dichte technische handleidingen. Llama 3, hoewel in staat om lange sequenties te verwerken, kan Qwen2’s prestaties in dit specifieke gebied niet evenaren.

Terwijl zowel Qwen2 als Llama 3 state-of-the-art prestaties vertonen, biedt Qwen2’s diverse modelreeks, variërend van 0,5B tot 72B parameters, grotere flexibiliteit en schaalbaarheid. Deze flexibiliteit stelt gebruikers in staat om de modelgrootte te kiezen die het beste past bij hun computermiddelen en prestatievereisten. Bovendien kan Alibaba’s voortdurende inspanningen om Qwen2 te schalen naar grotere modellen zijn capaciteiten verder verbeteren, waardoor het Llama 3 in de toekomst kan inhalen.

Deployment and Integration: Streamlining Qwen2 Adoption

Om de bredere adoptie en integratie van Qwen2 te vergemakkelijken, heeft Alibaba proactieve stappen ondernomen om een naadloze implementatie over verschillende platforms en frameworks te waarborgen. Het Qwen-team heeft nauw samengewerkt met diverse derdepartijprojecten en organisaties, waardoor Qwen2 kan worden gebruikt in combinatie met een breed scala aan tools en frameworks.

Fine-tuning en quantisatie: Derdepartijprojecten zoals Axolotl, Llama-Factory, Firefly, Swift en XTuner zijn geoptimaliseerd om fine-tuning van Qwen2-modellen te ondersteunen, waardoor gebruikers de modellen kunnen aanpassen aan hun specifieke taken en datasets. Bovendien zijn quantisatiehulpmiddelen zoals AutoGPTQ, AutoAWQ en Neural Compressor aangepast om met Qwen2 te werken, waardoor een efficiënte implementatie op apparaten met beperkte middelen mogelijk wordt.

Implementatie en inferentie: Qwen2-modellen kunnen worden geïmplementeerd en geserveerd met behulp van een verscheidenheid aan frameworks, waaronder vLLM, SGL, SkyPilot, TensorRT-LLM, OpenVino en TGI. Deze frameworks bieden geoptimaliseerde inferentiepijplijnen, waardoor een efficiënte en schaalbare implementatie van Qwen2 in productieomgevingen mogelijk wordt.

API-platforms en lokale uitvoering: Voor ontwikkelaars die Qwen2 in hun toepassingen willen integreren, bieden API-platforms zoals Together, Fireworks en OpenRouter een gemakkelijke toegang tot de capaciteiten van de modellen. Als alternatief wordt lokale uitvoering ondersteund via frameworks zoals MLX, Llama.cpp, Ollama en LM Studio, waardoor gebruikers Qwen2 kunnen uitvoeren op hun lokale machines terwijl ze de controle over gegevensprivacy en -beveiliging behouden.

Agent- en RAG-frameworks: Qwen2’s ondersteuning voor toolgebruik en agentcapaciteiten wordt versterkt door frameworks zoals LlamaIndex, CrewAI en OpenDevin. Deze frameworks maken het mogelijk om gespecialiseerde AI-agents te creëren en Qwen2 te integreren in retrieval-augmented generation (RAG)-pijplijnen, waardoor het bereik van toepassingen en gebruikscases wordt uitgebreid.

Looking Ahead: Future Developments and Opportunities

Alibaba’s visie voor Qwen2 gaat verder dan de huidige release. Het team is actief bezig met het trainen van grotere modellen om de grenzen van modelscaling te verkennen, aangevuld door voortdurende inspanningen om de datasets te schalen. Bovendien zijn er plannen om Qwen2 uit te breiden naar het domein van multimodale AI, waardoor de integratie van visie- en audiobegrip mogelijk wordt.

Terwijl de open-source AI-ecosysteem blijft groeien, zal Qwen2 een cruciale rol spelen als een krachtig hulpmiddel voor onderzoekers, ontwikkelaars en organisaties die de staat van de techniek in natuurlijke taalverwerking en kunstmatige intelligentie willen verbeteren.

Ik heb de afgelopen vijf jaar doorgebracht met het onderdompelen van mezelf in de fascinerende wereld van Machine Learning en Deep Learning. Mijn passie en expertise hebben me geleid om bij te dragen aan meer dan 50 diverse software-engineeringprojecten, met een bijzondere focus op AI/ML. Mijn voortdurende nieuwsgierigheid heeft me ook aangetrokken tot Natural Language Processing, een vakgebied dat ik graag verder wil verkennen.