AI-modeller og platforme
Qwen2 – Alibabas Seneste Multisproglige Sprogmodel Udfordrer SOTA som Llama 3
Efter måneder med forventning har Alibabas Qwen-team endelig afsløret Qwen2 – den næste udvikling i deres kraftfulde sprogmodelserie. Qwen2 repræsenterer et betydeligt spring fremad, med avancerede funktioner, der potentielt kan positionere det som det bedste alternativ til Metas fejrede Llama 3-model. I denne tekniske dykning vil vi udforske de vigtigste funktioner, præstationsbenchmarks og innovative teknikker, der gør Qwen2 til en formidabel konkurrent i verden af store sprogmodeller (LLM’er).
Skalering Op: Introduktion til Qwen2-Modelserien
I hjertet af Qwen2 ligger en divers modelserie, der er tilpasset til at møde varierende computermæssige krav. Serien omfatter fem forskellige modeller: Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B, Qwen2-57B-A14B og flagskibet Qwen2-72B. Dette udvalg af muligheder tilbyder en bred vifte af brugere, fra dem med beskedne hardwareressourcer til dem med adgang til avanceret computermæssig infrastruktur.
En af Qwen2’s fremragende funktioner er dens multilinguale evner. Mens den forrige Qwen1.5-model udmærkede sig i engelsk og kinesisk, er Qwen2 blevet trænet på data, der spænder over 27 yderligere sprog. Dette multilinguale træningsprogram omfatter sprog fra forskellige regioner, såsom Vesteuropa, Øst- og Centraleuropa, Mellemøsten, Østasien og Sydasien.
Ved at udvide sin lingvistiske repertoire demonstrerer Qwen2 en exceptionel evne til at forstå og generere indhold på tværs af en bred vifte af sprog, hvilket gør det til et uvurderligt værktøj for globale anvendelser og tværkulturel kommunikation.
Løsning af Kode-Skift: En Multilingval Udfordring
I multilingvale kontekster er fænomenet kode-skift – praksis med at skifte mellem forskellige sprog inden for en enkelt samtale eller udtalelse – en almindelig forekomst. Qwen2 er blevet omhyggeligt trænet til at håndtere kode-skift-scenarier, hvilket betydeligt reducerer tilhørende problemer og sikrer glatte overgange mellem sprog.
Evalueringer ved hjælp af prompts, der typisk inducerer kode-skift, har bekræftet Qwen2’s betydelige forbedring i dette domæne, et vidnesbyrd om Alibabas engagement i at levere et sandt multilingvalt sprogmodel.
Udmærkelse i Kodning og Matematik
Qwen2 har bemærkelsesværdige evner i områderne kodning og matematik, områder, der traditionelt har udgjort udfordringer for sprogmodeller. Ved at udnytte omfattende højkvalitetsdatasetter og optimerede træningsmetoder udmærker Qwen2-72B-Instruct, den instruktions-tuned variant af flagskibet, sig med en fremragende præstation i løsning af matematiske problemer og kodningsopgaver på tværs af forskellige programmeringssprog.
Udvidelse af Kontekstforståelse
En af de mest imponerende funktioner i Qwen2 er dens evne til at forstå og behandle udvidede kontekstsekvenser. Mens de fleste sprogmodeller kæmper med langformstekst, er Qwen2-7B-Instruct og Qwen2-72B-Instruct-modellerne blevet konstrueret til at håndtere kontekstlængder på op til 128K token.
Denne bemærkelsesværdige funktion er en game-changer for anvendelser, der kræver en dyb forståelse af længere dokumenter, såsom juridiske kontrakter, forskningspapirer eller tætte tekniske manualer. Ved at effektivt behandle udvidede kontekster kan Qwen2 give mere præcise og omfattende svar, hvilket åbner nye grænser for naturlig sprogbehandling.

Faktaretrievals-nøjagtigheden for Qwen2-modeller på tværs af forskellige kontekstlængder og dokumentdybder.
Dette diagram viser Qwen2-modellernes evne til at hente fakta fra dokumenter af forskellige kontekstlængder og dybder.
Arkitektoniske Innovationer: Gruppe-forespørgsels-opmærksomhed og Optimerede Indlejninger
Under panseret inkorporerer Qwen2 flere arkitektoniske innovationer, der bidrager til dens exceptionelle præstation. En af disse innovationer er adoptionen af Gruppe-forespørgsels-opmærksomhed (GQA) på tværs af alle modeller. GQA tilbyder hurtigere inferenshastigheder og reduceret hukommelsesbrug, hvilket gør Qwen2 mere effektiv og tilgængelig for en bred vifte af hardware-konfigurationer.
Derudover har Alibaba optimeret indlejringerne for mindre modeller i Qwen2-serien. Ved at binde indlejringerne har teamet reduceret hukommelsesaftrykket af disse modeller, hvilket muliggør deres udrulning på mindre kraftfuld hardware, samtidig med at de opretholder en høj kvalitet.
Benchmarking Qwen2: Overgående State-of-the-Art-Modeller
Qwen2 har en bemærkelsesværdig præstation på tværs af en bred vifte af benchmarks. Sammenlignende evalueringer viser, at Qwen2-72B, den største model i serien, overgår førende konkurrenter som Llama-3-70B i kritiske områder, herunder naturlig sprogforståelse, viden tilegnelse, kodningsdygtighed, matematiske færdigheder og multilinguale evner.
Trods havde færre parametre end sin forgænger, Qwen1.5-110B, viser Qwen2-72B en overlegen præstation, et vidnesbyrd om Alibabas omhyggeligt kuraterede datasetter og optimerede træningsmetoder.
Sikkerhed og Ansvar: Alignering med Menneskelige Værdier
Qwen2-72B-Instruct er blevet grundigt evalueret for sin evne til at håndtere potentielt skadelige forespørgsler relateret til ulovlige aktiviteter, svindel, pornografi og privatlivskrænkelser. Resultaterne er opmuntrende: Qwen2-72B-Instruct opfører sig sammenligneligt med den højt respekterede GPT-4-model i forhold til sikkerhed, og viser betydeligt færre skadelige svar sammenlignet med andre store modeller som Mistral-8x22B.
Dette fremhæver Alibabas engagement i at udvikle AI-systemer, der er i overensstemmelse med menneskelige værdier, hvilket sikrer, at Qwen2 ikke kun er kraftfuld, men også troværdig og ansvarlig.
Licens og Åben Kildekods-Engagement
I et skridt, der yderligere forstærker Qwen2’s impact, har Alibaba valgt en åben kildekods-licens. Mens Qwen2-72B og dens instruktions-tuned modeller stadig har den oprindelige Qianwen-licens, er de resterende modeller – Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B og Qwen2-57B-A14B – blevet licenseret under den permissive Apache 2.0-licens.
Denne forbedrede åbenhed forventes at accelerere anvendelsen og kommercielle brug af Qwen2-modeller på verdensplan, og vil fremme samarbejde og innovation inden for den globale AI-fællesskab.
Brug og Implementering
Brug af Qwen2-modeller er direkte, takket være deres integration med populære frameworks som Hugging Face. Her er et eksempel på, hvordan man bruger Qwen2-7B-Chat-beta til inferens:
from transformers import AutoModelForCausalLM, AutoTokenizer
<p>device = "cuda" # enheden til at indlæse modellen på</p>
<p>model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen1.5-7B-Chat", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen1.5-7B-Chat")</p>
<p>prompt = "Giv mig en kort introduktion til store sprogmodeller."</p>
<p>messages = [{"role": "user", "content": prompt}]</p>
<p>text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)</p>
<p>model_inputs = tokenizer([text], return_tensors="pt").to(device)</p>
<p>generated_ids = model.generate(model_inputs.input_ids, max_new_tokens=512, do_sample=True)</p>
<p>generated_ids = [output_ids[len(input_ids):] for input_ids, output_ids in zip(model_inputs.input_ids, generated_ids)]</p>
<p>response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
print(response)</p>
Dette kodeeksempel demonstrerer, hvordan man kan opsætte og generere tekst ved hjælp af Qwen2-7B-Chat-modellen. Integrationen med Hugging Face gør det tilgængeligt og let at eksperimentere med.
Qwen2 vs. Llama 3: En Sammenlignende Analyse
Selv om Qwen2 og Meta’s Llama 3 begge er kraftfulde sprogmodeller, viser de forskellige styrker og kompromiser.

En sammenlignende præstationsdiagram for Qwen2-72B, Llama3-70B, Mixtral-8x22B og Qwen1.5-110B på tværs af flere benchmarks, herunder MMLU, MMLU-Pro, GPQA og andre.
Her er en sammenlignende analyse for at hjælpe dig med at forstå deres nøgleforskelle:
Multilinguale Evner: Qwen2 har en klar fordel, når det kommer til multilinguale understøttelse. Dets træning på data, der spænder over 27 yderligere sprog, ud over engelsk og kinesisk, giver Qwen2 mulighed for at udmærke sig i tværkulturel kommunikation og multilinguale scenarier. I modsætning hertil er Llama 3’s multilinguale evner mindre prononcerede, hvilket potentielt kan begrænse dets effektivitet i diverse lingvistiske kontekster.
Kodning og Matematikdygtighed: Begge Qwen2 og Llama 3 viser imponerende kodnings- og matematiske evner. Qwen2-72B-Instruct synes dog at have en lille fordel, takket være sin omhyggelige træning på omfattende, højkvalitetsdatasetter i disse områder. Alibabas fokus på at forbedre Qwen2’s evner i disse områder kan give det en fordel i specialiserede anvendelser, der involverer kodning eller matematiske problemløsninger.
Lang Kontekstforståelse: Qwen2-7B-Instruct og Qwen2-72B-Instruct-modellerne kan håndtere kontekstlængder på op til 128K token. Denne funktion er særligt værdifuld for anvendelser, der kræver en dyb forståelse af længere dokumenter, såsom juridiske kontrakter, forskningspapirer eller tætte tekniske manualer. Llama 3 kan måske ikke matche Qwen2’s præstation i dette specifikke område.
Selv om både Qwen2 og Llama 3 viser state-of-the-art-præstation, tilbyder Qwen2’s diverse modelserie, der spænder fra 0,5B til 72B parametre, en større fleksibilitet og skalerbarhed. Denne fleksibilitet giver brugerne mulighed for at vælge den modelstørrelse, der bedst passer deres computermæssige ressourcer og præstationskrav. Derudover kan Alibabas fortsatte bestræbelser på at skale Qwen2 op til større modeller potentielt udvide dets evner og overgå Llama 3 i fremtiden.
Udrulning og Integration: Forenkling af Qwen2-Adoption
For at lette en bred udrulning og integration af Qwen2 har Alibaba taget proaktive skridt til at sikre en problemfri udrulning på tværs af forskellige platforme og frameworks. Qwen-teamet har samarbejdet tæt med flere tredjepartsprojekter og organisationer, hvilket giver Qwen2 mulighed for at blive anvendt i kombination med en bred vifte af værktøjer og frameworks.
Fine-tuning og Kvantificering: Tredjepartsprojekter som Axolotl, Llama-Factory, Firefly, Swift og XTuner er blevet optimeret til at understøtte fine-tuning af Qwen2-modeller, hvilket giver brugerne mulighed for at tilpasse modellerne til deres specifikke opgaver og datasetter. Derudover er kvantificeringsværktøjer som AutoGPTQ, AutoAWQ og Neural Compressor blevet tilpasset til at fungere med Qwen2, hvilket muliggør en effektiv udrulning på ressource-begrænsede enheder.
Udrulning og Inferens: Qwen2-modeller kan udrulles og servieres ved hjælp af en række frameworks, herunder vLLM, SGL, SkyPilot, TensorRT-LLM, OpenVino og TGI. Disse frameworks tilbyder optimerede inferens-rørledninger, hvilket giver mulighed for en effektiv og skalerbar udrulning af Qwen2 i produktionsmiljøer.
API-Platforme og Lokal Udførelse: For udviklere, der søger at integrere Qwen2 i deres anvendelser, tilbyder API-platforme som Together, Fireworks og OpenRouter en nem adgang til modellens funktioner. Alternativt understøttes lokal udførelse gennem frameworks som MLX, Llama.cpp, Ollama og LM Studio, hvilket giver brugerne mulighed for at køre Qwen2 på deres lokale maskiner, samtidig med at de opretholder kontrol over data-integritet og sikkerhed.
Agent og RAG-Frameworks: Qwen2’s understøttelse af værktøjsanvendelse og agent-funktioner er forstærket gennem frameworks som LlamaIndex, CrewAI og OpenDevin. Disse frameworks giver mulighed for at skabe specialiserede AI-agenter og integrere Qwen2 i retrieval-augmented generation (RAG)-rørledninger, hvilket udvider anvendelsesområdet og brugsscenarier.
Udsigt Fremad: Fremtidige Udviklinger og Muligheder
Alibabas vision for Qwen2 strækker sig langt ud over den nuværende udgivelse. Teamet er aktivt i gang med at træne større modeller for at udforske grænserne for model-skalerbarhed, suppleret med fortsatte data-skaleringsbestræbelser. Derudover er der planer om at udvide Qwen2 ind i området for multimodal AI, hvilket giver mulighed for at integrere syns- og lydforståelsesfunktioner.
Da den åbne kildekods-AI-økosystem fortsætter med at blomstre, vil Qwen2 spille en afgørende rolle som en kraftfuld ressource for forskere, udviklere og organisationer, der søger at fremme tilstanden for naturlig sprogbehandling og kunstig intelligens.















