Modelli e piattaforme di IA

Facebook Crea un Modello di Traduzione Automatica in Grado di Tradurre Direttamente tra 100 Lingue Diverse

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Facebook (META ) ha recentemente sviluppato un nuovo modello di traduzione automatica che può tradurre testi tra qualsiasi coppia di lingue di un set di 100 lingue. Mentre esistono altri sistemi di traduzione automatica, la maggior parte degli altri sistemi di traduzione AI opera traducendo prima il testo in inglese e poi convertendo il testo da lì. Come riportato da Engadget, il traduttore AI di Facebook opera senza utilizzare la lingua inglese come intermediario e riesce a raggiungere un’accuratezza di circa il 90%.

I dati di allenamento per il modello AI di Facebook sono stati composti da circa 7,5 miliardi di coppie di frasi, distribuite in 100 lingue diverse. I dati sono stati raccolti dal web utilizzando una serie di web crawler e le lingue presenti nei dati raccolti sono state identificate utilizzando un modello di linguaggio chiamato FastText. Una volta raccolti i dati, sono stati eseguiti attraverso uno strumento chiamato LASER 2.0 per estrarre il significato dei diversi campioni di frasi e abbinare le frasi in lingue diverse in base al loro significato. LASER 2.0 è stato sviluppato da Facebook e utilizza algoritmi di apprendimento non supervisionato per creare embedding. Gli embedding delle frasi contengono informazioni sui rapporti tra le diverse frasi in base a caratteristiche come la frequenza di utilizzo e la vicinanza delle frasi. LASER 2.0 è quindi in grado di creare coppie di frasi che hanno significati molto simili.

I dati di allenamento non sono stati abbinati solo in base ai significati delle frasi. Le lingue stesse sono state raggruppate insieme. L’obiettivo era quello di progettare un sistema che non richiedesse l’uso dell’inglese come medium tra due lingue, con Angela Fan di Facebook, che ha guidato il progetto, che ha notato che molte regioni del mondo parlano due lingue che non sono l’inglese. Gli ingegneri di Facebook hanno eseguito l’allenamento concentrandosi sull’abbinamento di lingue che vengono comunemente tradotte l’una nell’altra. Sono stati creati quattordici gruppi linguistici diversi, in base a variabili come cultura, somiglianze linguistiche e geografia. Ad esempio, uno dei gruppi linguistici creati dai ricercatori contiene le lingue più comuni in India, che includono le lingue urdu, tamil, hindi e bengalese. Ciò è stato fatto in modo che le lingue comunemente accoppiate ricevessero traduzioni di alta qualità.

Il metodo di allenamento basato sui gruppi linguistici ha portato a risultati interessanti. È stato trovato che il modello di traduzione risultante aveva una maggiore accuratezza rispetto ai modelli esistenti per alcune coppie di lingue. Ad esempio, quando si traduce dall’inglese al bielorusso, l’AI è in grado di applicare certi modelli che ha imparato quando traduce il russo perché il bielorusso ha somiglianze linguistiche con il russo. Allo stesso modo, gli sforzi di traduzione tra lo spagnolo e il portoghese sono migliorati poiché lo spagnolo è la seconda lingua più parlata e c’era un volume sostanziale di dati di allenamento per il compito.

Ci sono circa sessanta lingue che il sistema di traduzione non copre ancora, e l’accuratezza del modello sulle lingue senza molti dati di allenamento deve essere migliorata prima che sia pronto per l’uso. Molte lingue del Sud-Est asiatico e dell’Africa mancano del volume di dati necessario per addestrare un modello affidabile. Il team di ricerca dovrà determinare un modo per compensare questa mancanza di dati. Il team di ricerca deve anche determinare come controllare eventuali modelli razzisti, sessisti o profani che il modello potrebbe aver appreso. Sebbene il team di ricerca abbia utilizzato un filtro di profanità, il filtro funziona principalmente sui dati in inglese.

Il sistema di traduzione automatica non è stato ancora utilizzato sulla piattaforma di social media di Facebook. Il modello attuale è solo per scopi di ricerca. Tuttavia, Facebook sta preparando modelli simili per gestire i circa 20 miliardi di richieste di traduzione che il sito riceve ogni giorno.

Blogger e programmatore con specializzazioni in Machine Learning e Deep Learning argomenti. Daniel spera di aiutare gli altri a utilizzare il potere dell'AI per il bene sociale.