Modely a platformy AI
Stav multilingválních LLM: Pohyb beyond English
Podle výzkumu společnosti Microsoft (MSFT ) má kolem 88 % světových jazyků, kterými hovoří 1,2 miliardy lidí, omezený přístup k velkým jazykovým modelům (LLM). To je způsobeno tím, že většina LLM je zaměřena na angličtinu, tj. jsou většinou vyvíjeny s anglickými daty a pro anglicky mluvící osoby. Tato dominance angličtiny také přetrvává ve vývoji LLM a vedla k digitální jazykové propasti, která může vyloučit většinu lidí z výhod LLM. Aby se tento problém vyřešil, je potřeba LLM, který se může učit v různých jazycích a provádět úkoly v různých jazycích. Vstupují multilingvní LLM!
Co jsou Multilingvní LLM?
Multilingvní LLM může rozumět a generovat text v několika jazycích. Jsou školeny na datech, které obsahují různé jazyky, a mohou provádět různé úkoly v více než jednom jazyce na základě podnětu uživatele.
Multilingvní LLM mají obrovské aplikace, zahrnující překlad literatury do místních dialektů, reálnou komunikaci v několika jazycích, tvorbu obsahu v několika jazycích atd. Pomohou všem získat přístup k informacím a komunikovat snadno, bez ohledu na jazyk.
Kromě toho multilingvní LLM řeší výzvy, jako je nedostatek kulturních nuancí a kontextu, omezení školicích dat a potenciální ztráta znalostí během překladu.
Jak fungují Multilingvní LLM?
Stavba multilingvního LLM zahrnuje pečlivé přípravu vyvážené sbírky textu v různých jazycích a výběr vhodné architektury a školicí techniky pro školení modelu, upřednostňující model Transformer, který je ideální pro multilingvní učení.

Zdroj: Obrázky od autora
Jedna technika spočívá ve sdílení vnoření, které zachycuje sémantický význam slov v různých jazycích. To umožňuje LLM naučit se podobnosti a rozdíly každého jazyka, aby mohl lépe rozumět různým jazykům.
Tato znalost také umožňuje LLM přizpůsobit se různým lingvistickým úkonům, jako je překlad jazyků, psaní v různých stylech atd. Další technika, která se používá, je přenos učení mezi jazyky, kde je model předškoleno na velkém korpusu multilingválních dat před tím, než je jemně upraveno pro konkrétní úkoly.
Tento dvoufázový proces zajišťuje, že model má silný základ v multilingválním jazykovém pochopení, což jej činí přizpůsobitelným pro různé downstream aplikace.
Příklady Multilingválních Velkých Jazykových Modelů

Zdroj: Ruder.io
Několik pozoruhodných příkladů multilingválních LLM se objevilo, každý z nich uspokojující specifické lingvistické potřeby a kulturní kontexty. Podívejme se na některé z nich:
1. BLOOM
BLOOM je otevřený multilingvní LLM, který upřednostňuje rozmanité jazyky a přístupnost. S 176 miliardami parametrů může BLOOM zpracovat úkoly v 46 přirozených a 13 programovacích jazycích, což z něj činí jeden z největších a nejrozmanitějších LLM.
Otevřená povaha BLOOM umožňuje výzkumníkům, vývojářům a jazykovým komunitám využít jeho schopností a přispět k jeho zlepšení.
2. YAYI 2
YAYI 2 je otevřený LLM, který je speciálně navržen pro asijské jazyky, s ohledem na složitosti a kulturní nuance regionu. Byl předškoleno od začátku na multilingválním korpusu více než 16 asijských jazyků, obsahujícím 2,65 bilionu filtrovaných tokenů.
To umožňuje modelu dosáhnout lepších výsledků, splňujících specifické požadavky jazyků a kultur v Asii.
3. PolyLM
PolyLM je otevřený „polyglot“ LLM, který se zaměřuje na řešení problémů s nízkozdrojovými jazyky nabízením adaptabilních schopností. Byl školen na datové sadě o velikosti asi 640 miliard tokenů a je k dispozici ve dvou velikostech modelu: 1,7 miliardy a 13 miliard. PolyLM zná více než 16 různých jazyků.
Povoluje modelům školeným na jazycích s vysokými zdroji, aby se jemně upravily pro nízkozdrojové jazyky s omezenými daty. Tato flexibilita činí LLM více užitečnými v různých jazykových situacích a úkolech.
4. XGLM
XGLM, který má 7,5 miliardy parametrů, je multilingvní LLM, který byl školen na korpusu pokrývajícím rozmanitou sadu více než 20 jazyků pomocí techniky few-shot learning. Je součástí rodiny velkých multilingválních LLM, které byly školeny na masivním datasetu textu a kódu.
Cílem je pokrýt co nejvíce jazyků, a proto se zaměřuje na inkluzivitu a lingvistickou rozmanitost. XGLM demonstruje potenciál pro stavbu modelů, které uspokojují potřeby různých jazykových komunit.
5. mT5
mT5 (hromadně multilingvní Text-to-Text Transfer Transformer) byl vyvinut společností Google (GOOGL ) AI. Školen na common crawl dataset, mT5 je špičkový multilingvní LLM, který může zpracovat 101 jazyků, od široce používaných, jako je španělština a čínština, až po méně zdrojové jazyky, jako je baskičtina a kečuánština.
Také vyniká v multilingválních úkolech, jako je překlad, souhrn, zodpovězení otázek atd.
Je možné vytvořit univerzální LLM?
Koncept jazykově neutrálního LLM, který může rozumět a generovat jazyk bez偏見 vůči jakémukoli konkrétnímu jazyku, je fascinující.
Zatímco vývoj skutečně univerzálního LLM je stále daleko, současné multilingvní LLM prokázaly významný úspěch. Jakmile budou plně vyvinuty, mohou uspokojit potřeby jazyků, které jsou nedostatečně zastoupeny, a různých komunit.
Například výzkum ukazuje, že většina multilingválních LLM může usnadnit zero-shot cross-lingual transfer z jazyka s bohatými zdroji do jazyka s omezenými zdroji bez úkolově specifických trénovacích dat.
Kromě toho modely, jako je YAYI a BLOOM, které se zaměřují na specifické jazyky a komunity, prokázaly potenciál jazykově orientovaného přístupu při pohánění pokroku a inkluzivity.
Abyste postavili univerzální LLM nebo vylepšili současné multilingvní LLM, musíte udělat následující:
- Crowdsource rodilé mluvčí pro komunitní zapojení a kuraci jazykových dat.
- Podpořte komunitní úsilí týkající se otevřených příspěvků a financování multilingválního výzkumu a rozvoje.
Výzvy Multilingválních LLM
Zatímco koncept univerzálních multilingválních LLM slibuje mnoho, také čelí několika výzvám, které je třeba řešit, než budeme moci těžit z jejich výhod:
1. Množství dat
Multilingvní modely vyžadují větší slovník pro reprezentaci tokenů v mnoha jazycích než monolingvní modely, ale mnoho jazyků postrádá velké datové sady. To činí obtížným efektivní školení těchto modelů.
2. Kvalita dat
Zajištění přesnosti a kulturní vhodnosti výstupů multilingválních LLM v různých jazycích je významnou starostí. Modely musí být školeny a jemně upraveny s pečlivou pozorností k lingvistickým a kulturním nuancím, aby se zabránilo zkreslení a nepřesnostem.
3. Omezení zdrojů
Školení a spuštění multilingválních modelů vyžaduje podstatné výpočetní zdroje, jako jsou výkonné GPU (například NVIDIA A100 GPU). Vysoká cena představuje výzvu, zejména pro jazyky s nízkými zdroji a komunity s omezeným přístupem k výpočetnímu infrastrukturu.
4. Architektura modelu
Adaptace architektury modelu pro přizpůsobení se rozmanitým lingvistickým strukturám a složitostem je pokračující výzvou. Modely musí být schopny zpracovat jazyky s rozdílnými slovosledy, morfologickými variacemi a systémy psaní, zatímco zachovávají vysoký výkon a efektivitu.
5. Komplexity hodnocení
Hodnocení výkonu multilingválních LLM beyond anglických benchmarků je kritické pro měření jejich skutečné efektivity. To vyžaduje zohlednění kulturních nuancí, lingvistických zvláštností a doménově specifických požadavků.
Multilingvní LLM mají potenciál prolomit jazykové bariéry, posílit jazyky s nízkými zdroji a usnadnit efektivní komunikaci v různých komunitách.
Nepropásněte nejnovější zprávy a analýzy v oblasti AI a ML – navštivte unite.ai dnes.












