KI-Modelle und Plattformen

Facebook entwickelt ein maschinelles Übersetzungsmodell, das direkt zwischen 100 verschiedenen Sprachen übersetzen kann

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Facebook (META ) hat kürzlich ein neues maschinelles Übersetzungsmodell entwickelt, das Texte zwischen jedem beliebigen Sprachenpaar aus einer Menge von 100 Sprachen übersetzen kann. Während andere maschinelle ÜbersetzungsSysteme existieren, operieren die meisten anderen KI-ÜbersetzungsSysteme, indem sie den Text zunächst ins Englische übersetzen und dann den Text von dort aus umwandeln. Wie Engadget berichtete, operiert Facebooks KI-Übersetzer ohne die englische Sprache als Vermittler und soll etwa 90% Genauigkeit erreichen.

Facebooks Trainingsdaten für das KI-Modell bestanden aus etwa 7,5 Milliarden Satzpaaren, die auf 100 verschiedene Sprachen verteilt waren. Die Daten wurden aus dem Internet mithilfe einer Reihe von Web-Crawlern gesammelt, und die in den gesammelten Daten vorhandenen Sprachen wurden mithilfe eines Sprachmodells namens FastText identifiziert. Sobald die Daten gesammelt waren, wurden sie durch ein Tool namens LASER 2.0 geleitet, um die Bedeutung der verschiedenen Satzbeispiele zu extrahieren und Sätze in verschiedenen Sprachen basierend auf ihrer Bedeutung zusammenzufügen. LASER 2.0 wurde von Facebook entwickelt und verwendet unsupervidierte Lernalgorithmen, um Einbettungen zu erstellen. Die Satzeinbettungen enthalten Informationen über die Beziehungen zwischen verschiedenen Sätzen basierend auf Merkmalen wie Häufigkeit der Verwendung und Nähe der Sätze zueinander. LASER 2.0 kann dann Paare von Sätzen erstellen, die sehr ähnliche Bedeutungen haben.

Die Trainingsdaten wurden nicht nur basierend auf Satzbedeutungen gepaart. Die Sprachen selbst wurden in Gruppen unterteilt. Das Ziel war es, ein System zu entwerfen, das nicht das Englische als Medium zwischen zwei Sprachen erfordert, wobei Facebooks Angela Fan, die das Projekt leitete, bemerkte, dass viele Regionen auf der ganzen Welt zwei Sprachen sprechen, die nicht Englisch sind. Die Facebook-Ingenieure führten die Ausbildung durch, indem sie sich auf die Paarung von Sprachen konzentrierten, die häufig übersetzt werden. Vierzehn verschiedene Sprachgruppen wurden erstellt, basierend auf Variablen wie Kultur, sprachliche Ähnlichkeiten und Geographie. Als Beispiel enthielt eine der von den Forschern erstellten sprachlichen Gruppen die häufigsten Sprachen in Indien, darunter Urdu, Tamil, Hindi und Bengali. Dies wurde getan, um sicherzustellen, dass häufig gepaarte Sprachen hochwertige Übersetzungen erhalten.

Die sprachgruppenorientierte Trainingsmethode führte zu einigen interessanten Ergebnissen. Es wurde festgestellt, dass das resultierende Übersetzungsmodell eine höhere Genauigkeit als aktuell existierende Modelle für bestimmte Sprachenpaare aufwies. Beispielsweise konnte das KI-System, wenn es zwischen Englisch und Weißrussisch übersetzte, bestimmte Muster anwenden, die es beim Übersetzen aus dem Russischen gelernt hatte, da Weißrussisch sprachliche Ähnlichkeiten mit Russisch aufweist. Ebenso verbesserten sich die Übersetzungsversuche zwischen Spanisch und Portugiesisch, da Spanisch die zweitmeistgesprochene Sprache ist und es eine erhebliche Menge an Trainingsdaten für diese Aufgabe gab.

Es gibt etwa sechzig Sprachen, die das ÜbersetzungsSystem noch nicht abdeckt, und die Genauigkeit des Modells für Sprachen mit wenig Trainingsdaten muss verbessert werden, bevor es einsatzbereit ist. Viele Sprachen in Südostasien und Afrika haben nicht die notwendige Datenmenge, um ein zuverlässiges Modell zu trainieren. Das Forschungsteam muss eine Möglichkeit finden, diese Datenlücke zu kompensieren. Das Forschungsteam muss auch bestimmen, wie es vermeiden kann, dass das Modell rassistische, sexistische oder andere anstößige Muster gelernt hat. Obwohl das Forschungsteam einen Obszönitätsfilter verwendet, funktioniert dieser hauptsächlich auf den englischen Daten.

Das maschinelle ÜbersetzungsSystem wurde noch nicht auf Facebooks sozialem Medien-Plattform eingesetzt. Das aktuelle Modell ist nur für Forschungszwecke bestimmt. Facebook bereitet jedoch ähnliche Modelle vor, um etwa 20 Milliarden Übersetzungsanfragen pro Tag auf der Plattform zu bearbeiten.

Blogger und Programmierer mit Spezialisierungen in Machine Learning und Deep Learning Themen. Daniel hofft, anderen zu helfen, die Macht von KI für das soziale Wohl zu nutzen.