AI-modeller og platforme
MOSEL: Fremmer taledataindsamling for alle europæiske sprog

Udviklingen af AI-sprogmodeller har i høj grad været domineret af engelsk, hvilket har medført, at mange europæiske sprog er underrepræsenterede. Dette har skabt en betydelig ubalance i, hvordan AI-teknologier forstår og reagerer på forskellige sprog og kulturer. MOSEL søger at ændre på denne situation ved at opbygge en omfattende, open-source-samling af taledata for de 24 officielle sprog i Den Europæiske Union. Ved at tilbyde diverse sprogdata søger MOSEL at sikre, at AI-modeller er mere inklusive og repræsentative for Europas rigelige sproglandskab.
Sprogdiversitet er afgørende for at sikre inklusivitet i AI-udvikling. At afhænge for meget af engelsk-centrerede modeller kan resultere i teknologier, der er mindre effektive eller endda utilgængelige for talere af andre sprog. Multisprogede datasæt hjælper med at skabe AI-systemer, der kan betjene alle, uanset det sprog, de taler. At omfavne sprogdiversitet forbedrer teknologiens tilgængelighed og sikrer en retfærdig repræsentation af forskellige kulturer og samfund. Ved at fremme sprogmæssig inklusivitet kan AI virkelig reflektere de forskellige behov og stemmer fra brugerne.
Overblik over MOSEL
MOSEL, eller Massive Open-source Speech data for European Languages, er et banebrydende projekt, der søger at opbygge en omfattende, open-source-samling af taledata, der dækker alle 24 officielle sprog i Den Europæiske Union. Udviklet af et internationalt hold af forskere, integrerer MOSEL data fra 18 forskellige projekter, såsom CommonVoice, LibriSpeech og VoxPopuli. Denne samling inkluderer både transkriberede taleoptagelser og ulabellede lydfiler, hvilket tilbyder en betydelig ressource for at fremme multilingual AI-udvikling.
En af de vigtigste bidrag fra MOSEL er inklusionen af både transkriberede og ulabellede data. De transkriberede data giver en pålidelig grundlag for at træne AI-modeller, mens de ulabellede lydfiler kan bruges til yderligere forskning og eksperimenter, især for ressourcesvage sprog. Kombinationen af disse datasæt skaber en unik mulighed for at udvikle sprogmodeller, der er mere inklusive og kan forstå det diverse sproglandskab i Europa.

At brokke datagabet for underrepræsenterede sprog
Fordelingen af taledata over europæiske sprog er meget urent, med engelsk som dominerer størstedelen af de tilgængelige datasæt. Denne ubalance præsenterer betydelige udfordringer for at udvikle AI-modeller, der kan forstå og nøjagtigt reagere på mindre repræsenterede sprog. Mange af de officielle EU-sprog, såsom maltesisk eller irsk, har meget begrænsede data, hvilket hindrer AI-teknologiens evne til effektivt at betjene disse sprogkommuner.
MOSEL søger at brokke dette datagab ved at udnytte OpenAI’s Whisper-model til automatisk at transkribere 441.000 timers tidligere ulabellede lydfiler. Dette tilgang har betydeligt udvidet tilgængeligheden af træningsmateriale, især for sprog, der manglede omfattende manuelt transkriberede data. Selvom automatisk transkription ikke er perfekt, giver det en værdifuld startpunkt for yderligere udvikling, hvilket muliggør mere inklusive sprogmodeller.
Men udfordringerne er særligt tydelige for visse sprog. For eksempel havde Whisper-modellen svært ved at håndtere maltesisk, med en ordfejlrate på over 80 procent. Sådanne høje fejlratere understreger behovet for yderligere arbejde, herunder forbedring af transkriptionsmodeller og indsamling af mere højkvalitets-, manuelt transkriberede data. MOSEL-holdet er dedikeret til at fortsætte disse bestræbelser, hvilket sikrer, at selv ressourcesvage sprog kan drage fordel af fremskridt i AI-teknologi.
Rollen for open adgang i at drive AI-innovation
MOSEL’s open-source-tilgængelighed er en afgørende faktor i at drive innovation i europæisk AI-forskning. Ved at gøre taledataene frit tilgængelige, giver MOSEL forskere og udviklere mulighed for at arbejde med omfattende, højkvalitets-datasæt, der tidligere var utilgængelige eller begrænsede. Denne tilgængelighed opmuntrer til samarbejde og eksperimenter, hvilket fremmer en fællesskabsdrevet tilgang til at fremme AI-teknologier for alle europæiske sprog.
Forskere og udviklere kan udnytte MOSEL’s data til at træne, teste og forfine AI-sprogmodeller, især for sprog, der har været underrepræsenterede i AI-landskabet. Den åbne natur af disse data giver også mindre organisationer og akademiske institutioner mulighed for at deltage i fremme af AI-forskning, hvilket bryder barrierer, der ofte favoriserer store teknologivirksomheder med eksklusive ressourcer.
Fremtidige retninger og vejen fremad
Settende fremad planlægger MOSEL-holdet at fortsætte med at udvide datasættet, især for underrepræsenterede sprog. Ved at indsamle mere data og forbedre nøjagtigheden af automatiske transkriptioner, søger MOSEL at skabe en mere balanceret og inklusiv ressource for AI-udvikling. Disse bestræbelser er afgørende for at sikre, at alle europæiske sprog, uanset antallet af talere, har en plads i det udviklende AI-landskab.
MOSEL’s succes kunne også inspirere til lignende initiativer globalt, hvilket fremmer sprogdiversitet i AI ud over Europa. Ved at sætte et precedent for open adgang og fællesskabsdrevet udvikling, baner MOSEL vejen for fremtidige projekter, der prioriterer inklusivitet og repræsentation i AI, hvilket bidrager til en mere retfærdig teknologisk fremtid.












