AI-modellen en platforms
Jamba: AI21 Labs’ Nieuwe Hybride Transformer-Mamba Taalmodel
Taalmodellen hebben een snelle vooruitgang geboekt, met Transformer-architecturen die de leiding nemen in natuurlijke taalverwerking. Echter, naarmate modellen schaalbaar worden, zijn de uitdagingen van het omgaan met lange contexten, geheugenefficiëntie en doorvoer capaciteit meer uitgesproken geworden.
AI21 Labs heeft een nieuwe oplossing geïntroduceerd met Jamba, een state-of-the-art groot taalmodel (LLM) dat de sterke punten van zowel Transformer- als Mamba-architecturen combineert in een hybride framework. Dit artikel gaat in op Jamba’s architectuur, prestaties en potentiële toepassingen.
Overzicht van Jamba
Jamba is een hybride groot taalmodel ontwikkeld door AI21 Labs, dat een combinatie van Transformer-lagen en Mamba-lagen gebruikt, geïntegreerd met een Mixture-of-Experts (MoE)-module. Deze architectuur stelt Jamba in staat om geheugengebruik, doorvoer en prestaties in evenwicht te brengen, waardoor het een krachtig instrument is voor een breed scala aan NLP-taken. Het model is ontworpen om binnen een enkele 80GB GPU te passen, waardoor het een hoge doorvoer en een kleine geheugenvoetafdruk biedt, terwijl het state-of-the-art-prestaties op verschillende benchmarks behaalt.
De Architectuur van Jamba
Jamba’s architectuur is de hoeksteen van zijn mogelijkheden. Het is gebouwd op een novum hybride ontwerp dat Transformer-lagen afwisselt met Mamba-lagen, met MoE-modules om de capaciteit van het model te vergroten zonder de rekenkundige eisen aanzienlijk te verhogen.
1. Transformer-Lagen
De Transformer-architectuur is het standaardmodel voor moderne LLM’s vanwege zijn vermogen om parallelle verwerking efficiënt te verwerken en lange-afstandsafhankelijkheden in tekst te detecteren. Echter, de prestaties zijn vaak beperkt door hoge geheugen- en rekenkundige eisen, vooral bij het verwerken van lange contexten. Jamba lost deze beperkingen op door Mamba-lagen te integreren, die we hieronder zullen bespreken.
2. Mamba-Lagen
Mamba is een recent state-space-model (SSM) ontworpen om lange-afstandsrelaties in sequenties efficiënter te verwerken dan traditionele RNN’s of zelfs Transformers. Mamba-lagen zijn bijzonder effectief in het verminderen van de geheugenvoetafdruk die geassocieerd is met het opslaan van sleutel-waarde (KV)-caches in Transformers. Door Mamba-lagen af te wisselen met Transformer-lagen, vermindert Jamba het totale geheugengebruik, terwijl het hoge prestaties behoudt, vooral bij taken die lange contexten vereisen.
3. Mixture-of-Experts (MoE)-Modules
De MoE-module in Jamba introduceert een flexibele benadering voor het schalen van de modelcapaciteit. MoE stelt het model in staat om het aantal beschikbare parameters te vergroten zonder de actieve parameters tijdens inferentie evenredig te verhogen. In Jamba wordt MoE toegepast op sommige van de MLP-lagen, met de router-mechanisme die de top-experts selecteert om te activeren voor elk token. Deze selectieve activering stelt Jamba in staat om hoge efficiëntie te behouden bij het omgaan met complexe taken.
De onderstaande afbeelding demonstreert de functionaliteit van een inductie-header in een hybride Attention-Mamba-model, een belangrijk kenmerk van Jamba. In dit voorbeeld is de aandacht-header verantwoordelijk voor het voorspellen van labels zoals “Positief” of “Negatief” in reactie op sentiment-analysetaken. De gemarkeerde woorden laten zien hoe de aandacht van het model sterk gefocust is op label-tokens van de few-shot-voorbeelden, vooral op het kritieke moment voordat het laatste label wordt voorspeld. Deze aandachtsmechanisme speelt een cruciale rol in het vermogen van het model om in-context te leren, waarbij het model het juiste label moet afleiden op basis van de gegeven context en few-shot-voorbeelden.
De prestatieverbeteringen die worden geboden door het integreren van Mixture-of-Experts (MoE) met de Attention-Mamba-hybride-architectuur worden benadrukt in Tabel. Door MoE te gebruiken, vergroot Jamba zijn capaciteit zonder de rekenkundige kosten evenredig te verhogen. Dit is vooral duidelijk in de aanzienlijke verbetering van de prestaties op verschillende benchmarks, zoals HellaSwag, WinoGrande en Natural Questions (NQ). Het model met MoE behaalt niet alleen een hogere nauwkeurigheid (bijv. 66,0% op WinoGrande in vergelijking met 62,5% zonder MoE), maar toont ook verbeterde log-waarschijnlijkheden in verschillende domeinen (bijv. -0,534 op C4).
Sleutelarchitectonische Kenmerken
- Laagcompositie: Jamba’s architectuur bestaat uit blokken die Mamba– en Transformer-lagen combineren in een specifieke verhouding (bijv. 1:7, wat betekent één Transformer-laag voor elke zeven Mamba-lagen). Deze verhouding is afgestemd op optimale prestaties en efficiëntie.
- MoE-integratie: De MoE-lagen worden elke paar lagen toegepast, met 16 experts beschikbaar en de top-2 experts geactiveerd per token. Deze configuratie stelt Jamba in staat om effectief te schalen, terwijl het de compromissen tussen geheugengebruik en rekenkundige efficiëntie beheert.
- Normalisatie en stabiliteit: Om stabiliteit tijdens de training te garanderen, wordt in Jamba RMSNorm in de Mamba-lagen geïntegreerd, wat helpt om problemen zoals grote activatiesprongen die kunnen optreden bij schaalbaarheid te mitigeren.
Jamba’s Prestaties en Benchmarking
Jamba is grondig getest tegen een breed scala aan benchmarks, waarbij het concurrerende prestaties over de gehele linie heeft getoond. De volgende secties benadrukken enkele van de belangrijkste benchmarks waarop Jamba heeft uitgeblonken, waarbij het zijn sterke punten in zowel algemene NLP-taken als lange-contextscenario’s laat zien.
1. Algemene NLP-Benchmarks
Jamba is geëvalueerd op verschillende academische benchmarks, waaronder:
- HellaSwag (10-shot): Een taak voor gezond verstand waarbij Jamba een prestatiescore van 87,1% behaalde, waarmee het veel concurrerende modellen overtrof.
- WinoGrande (5-shot): Een andere redenetaak waarbij Jamba een score van 82,5% behaalde, waarmee het zijn vermogen om complexe linguïstische redeneringen te behandelen, aantoonde.
- ARC-Challenge (25-shot): Jamba toonde sterke prestaties met een score van 64,4%, wat zijn vermogen om moeilijke multiple-choice-vragen te beheren, weerspiegelt.
In aggregatiebenchmarks zoals MMLU (5-shot) behaalde Jamba een score van 67,4%, wat zijn robuustheid over diverse taken aantoont.
2. Lange-Contextevaluaties
Een van Jamba’s opvallende kenmerken is zijn vermogen om extreem lange contexten te behandelen. Het model ondersteunt een contextlengte van maximaal 256K tokens, de langste onder openbaar beschikbare modellen. Deze mogelijkheid is getest met de Needle-in-a-Haystack-benchmark, waarbij Jamba uitzonderlijke ophalingnauwkeurigheid over verschillende contextlengtes heeft getoond, inclusief maximaal 256K tokens.
3. Doorvoer en Efficiëntie
Jamba’s hybride architectuur verbetert de doorvoer aanzienlijk, vooral bij lange sequenties.

In tests waarin de doorvoer (tokens per seconde) over verschillende modellen werd vergeleken, bleek Jamba consistent beter te presteren dan zijn concurrenten, vooral in scenario’s met grote batchgroottes en lange contexten. Bijvoorbeeld, met een context van 128K tokens, behaalde Jamba 3x de doorvoer van Mixtral, een vergelijkbaar model.

Jamba Gebruiken: Python
Voor ontwikkelaars en onderzoekers die Jamba willen uitproberen, heeft AI21 Labs het model beschikbaar gesteld op platforms zoals Hugging Face, waardoor het toegankelijk is voor een breed scala aan toepassingen. Het volgende codevoorbeeld laat zien hoe u Jamba kunt laden en tekst kunt genereren:
<p>from transformers import AutoModelForCausalLM, AutoTokenizer</p> <p>model = AutoModelForCausalLM.from_pretrained("ai21labs/Jamba-v0.1") tokenizer = AutoTokenizer.from_pretrained("ai21labs/Jamba-v0.1")</p> <p>input_ids = tokenizer("In de recente Super Bowl LVIII,", return_tensors='pt').to(model.device)["input_ids"]</p> <p>outputs = model.generate(input_ids, max_new_tokens=216)</p> print(tokenizer.batch_decode(outputs))
Dit eenvoudige script laadt het Jamba-model en de tokenizer, genereert tekst op basis van een gegeven invoerprompt en print de gegenereerde output.
Fine-Tunen van Jamba
Jamba is ontworpen als een basismodel, wat betekent dat het kan worden fijngesteld voor specifieke taken of toepassingen. Fijngesteld stelt gebruikers in staat om het model aan te passen aan niche-domeinen, waardoor de prestaties op gespecialiseerde taken worden verbeterd. Het volgende voorbeeld laat zien hoe u Jamba kunt fijngesteld met de PEFT-bibliotheek:
import torch from datasets import load_dataset from trl import SFTTrainer, SFTConfig from peft import LoraConfig from transformers import AutoTokenizer, AutoModelForCausalLM, TrainingArguments <p>tokenizer = AutoTokenizer.from_pretrained("ai21labs/Jamba-v0.1") model = AutoModelForCausalLM.from_pretrained( "ai21labs/Jamba-v0.1", device_map='auto', torch_dtype=torch.bfloat16)</p> <p>lora_config = LoraConfig(r=8, target_modules=[ "embed_tokens","x_proj", "in_proj", "out_proj", # mamba "gate_proj", "up_proj", "down_proj", # mlp "q_proj", "k_proj", "v_proj" # attention], task_type="CAUSAL_LM", bias="none")</p> <p>dataset = load_dataset("Abirate/english_quotes", split="train") training_args = SFTConfig(output_dir="./results", num_train_epochs=2, per_device_train_batch_size=4, logging_dir='./logs', logging_steps=10, learning_rate=1e-5, dataset_text_field="quote") trainer = SFTTrainer(model=model, tokenizer=tokenizer, args=training_args, peft_config=lora_config, train_dataset=dataset, ) trainer.train()
Dit codevoorbeeld fijngesteld Jamba op een dataset van Engelse citaten, waarbij de parameters van het model worden aangepast om beter te passen bij de specifieke taak van tekstgeneratie in een gespecialiseerd domein.
Inzet en Integratie
AI21 Labs heeft de Jamba-familie breed toegankelijk gemaakt via verschillende platforms en inzetopties:
- Cloud-platforms:
- Beschikbaar op belangrijke cloudproviders, waaronder Google Cloud Vertex AI, Microsoft Azure en NVIDIA NIM (NVDA ).
- Komt binnenkort beschikbaar op Amazon Bedrock, Databricks Marketplace en Snowflake Cortex.
- AI-ontwikkelingsframeworks:
- Integratie met populaire frameworks zoals LangChain en LlamaIndex (aanstaand).
- AI21 Studio:
- Directe toegang via AI21’s eigen ontwikkelingsplatform.
- Hugging Face:
- Modellen beschikbaar voor download en experimenten.
- On-premises-inzet:
- Opties voor privé, on-site-inzet voor organisaties met specifieke beveiligings- of nalevingsbehoeften.
- Aangepaste oplossingen:
- AI21 biedt aangepaste modelaanpassing en fijngestelde diensten voor enterprise-klanten.
Ontwikkelaarsvriendelijke Functies
Jamba-modellen komen met verschillende ingebouwde mogelijkheden die ze bijzonder aantrekkelijk maken voor ontwikkelaars:
- Functieaanroep: Integreer gemakkelijk externe tools en API’s in uw AI-workflows.
- Gestructureerde JSON-uitvoer: Genereer schone, parseerbare gegeestructuren rechtstreeks vanuit natuurlijke taalinput.
- Documentobjectdigestie: Verwerk en begrijp complexe documentstructuren efficiënt.
- RAG-optimalisaties: Ingebouwde functies om retrieval-augmenteerde generatiepijplijnen te verbeteren.
Deze functies, in combinatie met het model’s lange contextvenster en efficiënte verwerking, maken Jamba een veelzijdig instrument voor een breed scala aan ontwikkelingsscenario’s.
Ethische Overwegingen en Verantwoordelijke AI
Terwijl de mogelijkheden van Jamba indrukwekkend zijn, is het essentieel om zijn gebruik te benaderen met een verantwoordelijke AI-houding. AI21 Labs benadrukt verschillende belangrijke punten:
- Basismodelnatur: Jamba 1.5-modellen zijn voorgetrainde basismodellen zonder specifieke afstemming of instructieafstemming.
- Geen ingebouwde waarborgen: De modellen hebben geen inherente moderatiemechanismen.
- Verantwoorde inzet: Aanvullende aanpassing en waarborgen moeten worden geïmplementeerd voordat Jamba in productieomgevingen of bij eindgebruikers wordt gebruikt.
- Gegevensbescherming: Bij het gebruik van cloudgebaseerde inzet moet u zich bewust zijn van gegevensbehandeling en nalevingsvereisten.
- Bevooroordeeldheidsbewustzijn: Net als alle grote taalmodellen, kan Jamba bevooroordeeldheden weerspiegelen die aanwezig zijn in zijn trainingsgegevens. Gebruikers moeten zich hiervan bewust zijn en passende mitigaties implementeren.
Door deze factoren in acht te nemen, kunnen ontwikkelaars en organisaties Jamba’s mogelijkheden verantwoordelijk en ethisch gebruiken.
Een Nieuw Hoofdstuk in AI-Ontwikkeling?
De introductie van de Jamba-familie door AI21 Labs markeert een belangrijke mijlpaal in de evolutie van grote taalmodellen. Door de krachten van transformers en state space-modellen te combineren, de integratie van mixture of experts-technieken en de grenzen van contextlengte en verwerkingssnelheid te verleggen, opent Jamba nieuwe mogelijkheden voor AI-toepassingen in verschillende industrieën.
Terwijl de AI-gemeenschap Jamba’s innovatieve architectuur verder verkent en bouwt, kunnen we verwachten dat er verdere vooruitgang wordt geboekt in model-efficiëntie, lange-contextbegrip en praktische AI-inzet. De Jamba-familie vertegenwoordigt niet alleen een reeks modellen, maar ook een potentiële verschuiving in de manier waarop we de ontwerp- en implementatie van grote-schaal AI-systemen benaderen.














