AI-modeller og plattformer

MOSEL: Fremmer taledatainnsamling for alle europeiske språk

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Utviklingen av AI-språkmodeller har i stor grad vært dominert av engelsk, og har ført til at mange europeiske språk er underrepresentert. Dette har skapt en betydelig ubalanse i hvordan AI-teknologier forstår og responderer på forskjellige språk og kulturer. MOSEL har som mål å endre denne trenden ved å lage en omfattende, åpen kildekode-samling av taledata for de 24 offisielle språkene i Den europeiske union. Ved å tilby diverse språkdata, søker MOSEL å sikre at AI-modellene er mer inklusive og representative for Europas rike språklandskap.

Språklig mangfold er avgjørende for å sikre inklusivitet i AI-utvikling. Å være for avhengig av engelsk-sentriske modeller kan føre til teknologier som er mindre effektive eller til og med utilgjengelige for talere av andre språk. Flerspråklige datasett hjelper med å skape AI-systemer som tjener alle, uavhengig av språket de snakker. Å fremme språklig mangfold forbedrer teknologitilgjengelighet og sikrer rettferdig representasjon av forskjellige kulturer og samfunn. Ved å fremme språklig inklusivitet, kan AI virkelig reflektere de mangfoldige behovene og stemmene til brukerne.

Oversikt over MOSEL

MOSEL, eller Massive Open-source Speech data for European Languages, er et banebrytende prosjekt som har som mål å bygge en omfattende, åpen kildekode-samling av taledata som dekker alle 24 offisielle språkene i Den europeiske union. Utviklet av et internasjonalt team av forskere, integrerer MOSEL data fra 18 forskjellige prosjekter, som CommonVoice, LibriSpeech og VoxPopuli. Denne samlingen inkluderer både transkriberte taleopptak og ulabelt lyddata, og tilbyr en betydelig ressurs for å fremme flerspråklig AI-utvikling.

En av de viktigste bidragene til MOSEL er inklusjonen av både transkribert og ulabelt data. De transkriberte dataene gir en pålitelig basis for trening av AI-modeller, mens de ulabelte lyddataene kan brukes til videre forskning og eksperimentering, spesielt for språk med begrensede ressurser. Kombinasjonen av disse datasettene skaper en unik mulighet til å utvikle språkmodeller som er mer inklusive og i stand til å forstå det mangfoldige språklandskapet i Europa.

Brygging av datagapet for underrepresenterte språk

Fordelingen av taledata over europeiske språk er svært ujevn, med engelsk som dominerer majoriteten av tilgjengelige datasett. Denne ubalansen presenterer betydelige utfordringer for utvikling av AI-modeller som kan forstå og nøyaktig respondere på mindre representerte språk. Mange av de offisielle EU-språkene, som maltesisk eller irsk, har svært begrensede data, noe som hindrer evnen til AI-teknologier til å effektivt tjene disse språklig samfunnene.

MOSEL har som mål å brygge dette datagapet ved å bruke OpenAI’s Whisper-modell til å automatisk transkribere 441 000 timer med tidligere ulabelt lyddata. Dette tilnærmingen har betydelig utvidet tilgjengeligheten av treningsmateriale, spesielt for språk som manglet omfattende manuelt transkriberte data. Selv om automatisk transkripsjon ikke er perfekt, gir den en verdifull utgangspunkt for videre utvikling, og tillater mer inklusive språkmodeller å bli bygget.

Men, utfordringene er spesielt tydelige for visse språk. For eksempel, hadde Whisper-modellen problemer med maltesisk, og oppnådde en ordfeilrate på over 80 prosent. Slike høye feilrater understreker behovet for ytterligere arbeid, inkludert forbedring av transkripsjonsmodeller og innsamling av mer høykvalitets, manuelt transkribert data. MOSEL-teamet er dedikert til å fortsette disse innsatsene, og sikre at selv språk med begrensede ressurser kan dra nytte av fremgangen i AI-teknologi.

Rollen til åpen tilgang i å drive AI-innovasjon

MOSELs åpen kildekode-tilgjengelighet er en nøkelfaktor i å drive innovasjon i europeisk AI-forskning. Ved å gjøre taledataene fritt tilgjengelige, gir MOSEL forskere og utviklere mulighet til å arbeide med omfattende, høykvalitets datasett som tidligere var utilgjengelige eller begrensede. Denne tilgjengeligheten oppmuntrer til samarbeid og eksperimentering, og fremmer en fellesskapsdrevet tilnærming til å fremme AI-teknologier for alle europeiske språk.

Forskere og utviklere kan bruke MOSELs data til å trene, teste og forbedre AI-språkmodeller, spesielt for språk som har vært underrepresentert i AI-landskapet. Den åpne naturen til denne dataen tillater også mindre organisasjoner og akademiske institusjoner å delta i banebrytende AI-forskning, og bryter ned barrierer som ofte favoriserer store teknologiselskaper med eksklusive ressurser.

Framtidige retninger og veien fremover

Ser man fremover, planlegger MOSEL-teamet å fortsette å utvide datasettene, spesielt for underrepresenterte språk. Ved å samle inn mer data og forbedre nøyaktigheten av automatiske transkripsjoner, søker MOSEL å skape en mer balansert og inklusiv ressurs for AI-utvikling. Disse innsatsene er avgjørende for å sikre at alle europeiske språk, uavhengig av antall talere, har en plass i det utviklende AI-landskapet.

Suksessen til MOSEL kunne også inspirere lignende initiativer globalt, og fremme språklig mangfold i AI utenfor Europa. Ved å sette et precedens for åpen tilgang og samarbeidende utvikling, åpner MOSEL veien for fremtidige prosjekter som prioriterer inklusivitet og representasjon i AI, og bidrar til en mer rettferdig teknologisk fremtid.

Alex McFarland er en AI-journalist og forfatter som utforsker de nyeste utviklingene innen kunstig intelligens. Han har samarbeidet med tallrike AI-startups og publikasjoner verden over.