AI-modeller och plattformar

MOSEL: Utveckling av taldatainsamling för alla europeiska språk

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Utvecklingen av AI-språkmodeller har till stor del dominerats av engelska, vilket har lett till att många europeiska språk är underrepresenterade. Detta har skapat en betydande obalans i hur AI-teknologier förstår och svarar på olika språk och kulturer. MOSEL syftar till att ändra på denna berättelse genom att skapa en omfattande, öppen källsamling av taldata för de 24 officiella språken i Europeiska unionen. Genom att tillhandahålla diversifierad språkdata syftar MOSEL till att säkerställa att AI-modeller är mer inkluderande och representativa för Europas rika språkliga landskap.

Språklig mångfald är avgörande för att säkerställa inkludering i AI-utveckling. Att förlita sig för mycket på engelskspråkiga modeller kan leda till teknologier som är mindre effektiva eller till och med otillgängliga för talare av andra språk. Multispråkiga dataset hjälper till att skapa AI-system som tjänar alla, oavsett det språk de talar. Att främja språklig mångfald förbättrar teknologitillgänglighet och säkerställer rättvis representation av olika kulturer och samhällen. Genom att främja språklig inkludering kan AI verkligen spegla de olika behoven och rösterna hos dess användare.

Översikt av MOSEL

MOSEL, eller Massiv öppen källsamling av taldata för europeiska språk, är ett banbrytande projekt som syftar till att bygga en omfattande, öppen källsamling av taldata som täcker alla 24 officiella språk i Europeiska unionen. Utvecklat av ett internationellt team av forskare integrerar MOSEL data från 18 olika projekt, såsom CommonVoice, LibriSpeech och VoxPopuli. Denna samling innehåller både transkriberade talinspelningar och oetiketterad ljuddata, vilket erbjuder en betydande resurs för att främja multilingual AI-utveckling.

En av de viktigaste bidragen från MOSEL är inklusionen av både transkriberad och oetiketterad data. Den transkriberade datan ger en tillförlitlig grund för att träna AI-modeller, medan den oetiketterade ljuddatan kan användas för ytterligare forskning och experiment, särskilt för språk med begränsade resurser. Kombinationen av dessa dataset skapar en unik möjlighet att utveckla språkmodeller som är mer inkluderande och kan förstå det diversifierade språkliga landskapet i Europa.

Att överbrygga dataglappet för underrepresenterade språk

Fördelningen av taldata över europeiska språk är mycket ojämn, med engelska som dominerar majoriteten av tillgängliga dataset. Denna obalans presenterar betydande utmaningar för att utveckla AI-modeller som kan förstå och svara korrekt på mindre representerade språk. Många av de officiella EU-språken, såsom maltesiska eller irländska, har mycket begränsad data, vilket hindrar AI-teknologiers förmåga att effektivt tjäna dessa språkliga samhällen.

MOSEL syftar till att överbrygga detta dataglapp genom att använda OpenAI:s Whisper-modell för att automatiskt transkribera 441 000 timmar av tidigare oetiketterad ljuddata. Detta tillvägagångssätt har betydligt utökat tillgängligheten av träningsmaterial, särskilt för språk som saknade omfattande manuellt transkriberad data. Även om automatisk transkription inte är perfekt, ger den en värdefull utgångspunkt för ytterligare utveckling, vilket möjliggör att mer inkluderande språkmodeller kan byggas.

Men utmaningarna är särskilt tydliga för vissa språk. Till exempel hade Whisper-modellen svårt med maltesiska, med en ordfelprocent på över 80 procent. Sådana höga felprocent sätter ljuset på behovet av ytterligare arbete, inklusive förbättring av transkriptionsmodeller och insamling av mer högkvalitativ, manuellt transkriberad data. MOSEL-teamet är engagerat i att fortsätta dessa ansträngningar, för att säkerställa att även språk med begränsade resurser kan dra nytta av framstegen inom AI-teknologi.

Den roll som öppen tillgång spelar i att driva AI-innovation

MOSEL:s öppna tillgänglighet är en avgörande faktor för att driva innovation inom europeisk AI-forskning. Genom att göra taldata fritt tillgängliga, ger MOSEL forskare och utvecklare möjlighet att arbeta med omfattande, högkvalitativa dataset som tidigare var otillgängliga eller begränsade. Denna tillgänglighet uppmuntrar samarbete och experiment, och främjar en community-driven approach för att främja AI-teknologier för alla europeiska språk.

Forskare och utvecklare kan utnyttja MOSEL:s data för att träna, testa och förfinna AI-språkmodeller, särskilt för språk som har varit underrepresenterade inom AI-landskapet. Den öppna naturen hos denna data möjliggör också att mindre organisationer och akademiska institutioner kan delta i banbrytande AI-forskning, och bryter ner barriärer som ofta gynnar stora techföretag med exklusiva resurser.

Framtida riktningar och vägen framåt

Blickar man framåt planerar MOSEL-teamet att fortsätta expandera dataset, särskilt för underrepresenterade språk. Genom att samla in mer data och förbättra noggrannheten i automatiska transkriptioner, syftar MOSEL till att skapa en mer balanserad och inkluderande resurs för AI-utveckling. Dessa ansträngningar är avgörande för att säkerställa att alla europeiska språk, oavsett antalet talare, har en plats i det utvecklande AI-landskapet.

MOSEL:s framgång kan också inspirera liknande initiativ globalt, och främja språklig mångfald inom AI bortom Europa. Genom att sätta ett prejudikat för öppen tillgång och samarbetsutveckling, banar MOSEL väg för framtida projekt som prioriterar inkludering och representation inom AI, och bidrar på så sätt till en mer jämlik teknologisk framtid.

Alex McFarland är en AI-journalist och författare som utforskar de senaste utvecklingarna inom artificiell intelligens. Han har samarbetat med många AI-startups och publikationer över hela världen.