Modely a platformy AI

MOSEL: Rozvoj sběru řečových dat pro všechny evropské jazyky

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Vývoj jazykových modelů AI byl dosud převážně ovlivněn angličtinou, což vedlo k podreprezentaci mnoha evropských jazyků. To vytvořilo významnou nerovnováhu v tom, jak AI technologie rozumí a reagují na různé jazyky a kultury. MOSEL si klade za cíl změnit tento trend vytvořením komplexní, otevřené kolekce řečových dat pro 24 oficiálních jazyků Evropské unie. Poskytováním rozmanitých jazykových dat MOSEL usiluje o to, aby AI modely byly více inkluzivní a reprezentativní pro bohatou jazykovou krajinu Evropy.

Jazyková rozmanitost je zásadní pro zajištění inkluzivity ve vývoji AI. Převážná závislost na anglicky orientovaných modelech může vést k technologiím, které jsou méně efektivní nebo dokonce nepřístupné pro mluvčí jiných jazyků. Multijazyčné sady dat pomáhají vytvářet AI systémy, které slouží všem, bez ohledu na jazyk, kterým mluví. Přijetí jazykové rozmanitosti zlepšuje přístupnost technologií a zajišťuje spravedlivé zastoupení různých kultur a komunit. Propagací jazykové inkluzivity může AI skutečně odrážet rozmanité potřeby a hlasy svých uživatelů.

Přehled MOSEL

MOSEL, nebo Masivní otevřená řečová data pro evropské jazyky, je průkopnický projekt, který si klade za cíl vytvořit rozsáhlou, otevřenou kolekci řečových dat pokrývajících všechny 24 oficiální jazyky Evropské unie. Vyvinutý mezinárodním týmem výzkumníků, MOSEL integruje data z 18 různých projektů, jako jsou CommonVoice, LibriSpeech a VoxPopuli. Tato kolekce zahrnuje jak přepisované řečové záznamy, tak nelabelované audio data, nabízející významný zdroj pro rozvoj multijazyčného AI.

Jedním z klíčových příspěvků MOSEL je zahrnutí jak přepisovaných, tak nelabelovaných dat. Přepisovaná data poskytují spolehlivý základ pro školení AI modelů, zatímco nelabelovaná audio data lze použít pro další výzkum a experimenty, zejména pro jazyky s omezenými zdroji. Kombinace těchto sad dat vytváří jedinečnou příležitost pro vývoj jazykových modelů, které jsou více inkluzivní a schopné porozumět rozmanité jazykové krajině Evropy.

Překlenutí mezery v datech pro podreprezentované jazyky

Rozdělení řečových dat napříč evropskými jazyky je velmi nerovnoměrné, s angličtinou dominující většinu dostupných sad dat. Tato nerovnováha představuje významné výzvy pro vývoj AI modelů, které mohou porozumět a přesně reagovat na méně reprezentované jazyky. Mnoho oficiálních jazyků EU, jako je maltština nebo irština, má velmi omezená data, což brání schopnosti AI technologií efektivně sloužit těmto jazykovým komunitám.

MOSEL si klade za cíl překlenout tuto mezeru v datech využitím OpenAI’s Whisper modelu k automatickému přepisu 441 000 hodin dříve nelabelovaných audio dat. Tento přístup významně rozšířil dostupnost trénovacích materiálů, zejména pro jazyky, které postrádaly rozsáhlá ručně přepisovaná data. Ačkoli automatický přepis není dokonalý, poskytuje cenný výchozí bod pro další vývoj, umožňující budování více inkluzivních jazykových modelů.

Nicméně, výzvy jsou zvláště zřetelné pro určité jazyky. Například model Whisper měl potíže s maltštinou, dosahující chybovosti slov přes 80 procent. Takové vysoké chybové sazby zdůrazňují potřebu další práce, včetně zlepšení přepisovacích modelů a sběru více kvalitních, ručně přepisovaných dat. Tým MOSEL se zavázal pokračovat v těchto úsilích, zajišťujíc, aby i jazyky s omezenými zdroji mohli těžit z pokroků v AI technologiích.

Role otevřeného přístupu při pohánění inovací AI

Otevřená dostupnost MOSEL je klíčovým faktorem při pohánění inovací v evropském AI výzkumu. Poskytováním řečových dat zdarma MOSEL umožňuje výzkumníkům a vývojářům pracovat s rozsáhlými, kvalitními daty, která byla dříve nedostupná nebo omezená. Tato dostupnost podporuje spolupráci a experimenty, vytvářející komunitně orientovaný přístup k rozvoji AI technologií pro všechny evropské jazyky.
Výzkumníci a vývojáři mohou využít data MOSEL k trénování, testování a vylepšování AI jazykových modelů, zejména pro jazyky, které byly podreprezentovány v AI krajíně. Otevřená povaha těchto dat také umožňuje menším organizacím a akademickým institucím účastnit se pokročilého AI výzkumu, rozbitím bariér, které často favorizují velké technologické společnosti s exkluzivními zdroji.

Budoucí směry a cesta vpřed

Pohledem do budoucna, tým MOSEL plánuje pokračovat v rozšiřování datové sady, zejména pro podreprezentované jazyky. Shromažďováním více dat a zlepšováním přesnosti automatických přepisů MOSEL usiluje o vytvoření více vyváženého a inkluzivního zdroje pro AI vývoj. Tyto úsilí jsou zásadní pro zajištění, aby všechny evropské jazyky, bez ohledu na počet mluvčích, měly místo v rozvíjející se AI krajíně.

Úspěch MOSEL by mohl také inspirovat podobné iniciativy globálně, propagující jazykovou rozmanitost v AI za hranicemi Evropy. Stanovením precedensu pro otevřený přístup a spolupráci, MOSEL vytváří cestu pro budoucí projekty, které priorizují inkluzivitu a reprezentaci v AI, přispívající nakonec k více spravedlivé technologické budoucnosti.

Alex McFarland je AI novinář a spisovatel, který zkoumá nejnovější vývoj v oblasti umělé inteligence. Spolupracoval s mnoha AI startupy a publikacemi po celém světě.