Myslitelé

Vliv transformátorů: Bylo strojové překladu úplně vyřešeno?

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Společnost Google nedávno oznámila vydání 110 nových jazyků na Google Translate jako součást iniciativy 1000 jazyků spuštěné v roce 2022. V roce 2022 přidala na začátku 24 jazyků. S posledními 110 jazyky je jich nyní 243. Tento rychlý růst byl možný díky technologii Zero-Shot Machine Translation, kde se modely strojového překladu učí překládat do jiného jazyka bez předchozích příkladů. Ale v budoucnu uvidíme, zda tento pokrok může být konečným řešením problému strojového překladu, a zatím můžeme prozkoumat, jak k tomu může dojít. Ale nejdříve jeho příběh.

Jak to bylo dříve?

Statistický strojový překlad (SMT)

Tato metoda byla původně používána službou Google Translate. Závisela na statistických modelech. Tyto modely analyzovaly velké paralelní sbírky, kolekce zarovnaných překladů vět, aby určily nejpravděpodobnější překlady. Nejprve systém přeložil text do angličtiny jako mezistupeň, než jej převedl do cílového jazyka, a musel křížově ověřit fráze s rozsáhlými datovými sadami z překladů Organizace spojených národů a Evropského parlamentu. Liší se od tradičních přístupů, které vyžadovaly kompilaci vyčerpávajících gramatických pravidel. A statistický přístup umožnil, aby se systém učil a přizpůsoboval datům bez závislosti na statických lingvistických rámcích, které by se mohly rychle stát zcela zbytečnými.

Existují však i některé nevýhody této metody. Nejprve služba Google Translate používala překlad založený na frázích, kde systém rozdělil věty na fráze a přeložil je jednotlivě. To byla zlepšení oproti překladům slovo za slovem, ale stále mělo omezení, jako jsou nevhodné frázování a chyby kontextu. Jednoduše ne zcela rozuměl nuancím, jako my. Kromě toho SMT silně závisí na existenci paralelních sbírek, a jakýkoli relativně vzácný jazyk by byl obtížně přeložitelný, protože by neměl dostatek paralelních dat.

Neuronový strojový překlad (NMT)

V roce 2016 společnost Google přešla na neuronový strojový překlad. Ten používá hluboké učící modely k překladu celých vět najednou, poskytující tak více plynulé a přesné překlady. NMT funguje podobně jako sofistikovaný multilingvální asistent ve vašem počítači. Používá architekturu sekvenční-sekvenční (seq2seq) k zpracování věty v jednom jazyce, aby pochopil její význam. Poté generuje odpovídající větu v jiném jazyce. Tato metoda používá obrovské datové sady pro učení, na rozdíl od statistického strojového překladu, který se spoléhá na statistické modely, které analyzují velké paralelní sbírky, aby určily nejpravděpodobnější překlady. Na rozdíl od SMT, který se zaměřoval na překlad založený na frázích a vyžadoval大量 ručního úsilí pro vývoj a údržbu lingvistických pravidel a slovníků, NMT umožňuje lépe zachytit nuanci jazyka, protože může zpracovat celé sekvence slov. Takže zlepšil kvalitu překladu napříč různými jazykovými páry, často dosahující úrovně plynulosti a přesnosti srovnatelné s lidskými překladateli.

Zavádění transformátorů

V roce 2017 vydala společnost Google Research článek s názvem “Pozornost je vše, co potřebujete,” který představil transformátory světu a označil zásadní posun od RNN v architektuře neuronových sítí.

Transformátory se spoléhají pouze na mechanismus pozornosti, – samo-pozornost, která umožňuje modelům neuronového strojového překladu selektivně zaměřit se na nejkritičtější části vstupních sekvencí. Na rozdíl od RNN, které zpracovávají slova v sekvenci uvnitř vět, samo-pozornost vyhodnocuje každý token napříč celým textem, určuje, které další jsou pro pochopení kontextu důležité. Toto simultánní výpočet všech slov umožňuje transformátorům efektivně zachytit jak krátké, tak dlouhé závislosti bez závislosti na rekurentních spojeních nebo konvolučních filtrech.

Tím, že se zbavují rekurence, transformátory nabízejí několik klíčových výhod:

  • Paralelizovatelnost: Mechanismy pozornosti mohou být vypočteny paralelně napříč různými segmenty sekvence, což urychluje trénování na moderním hardwaru, jako jsou GPU.
  • Účinnost trénování: Také vyžadují podstatně méně času na trénování ve srovnání s tradičními modely založenými na RNN nebo CNN, poskytují lepší výkon v úkolech, jako je strojový překlad.

Zero-Shot Machine Translation a PaLM 2

V roce 2022 společnost Google vydala podporu pro 24 nových jazyků pomocí Zero-Shot Machine Translation, což představuje významný milník ve strojovém překladu. Také oznámila iniciativu 1 000 jazyků, zaměřenou na podporu 1 000 nejčastěji mluvených jazyků světa. Nyní spustila dalších 110 jazyků. Zero-Shot Machine Translation umožňuje překlad bez paralelních dat mezi zdrojovým a cílovým jazykem, eliminuje potřebu vytvářet trénovací data pro každý jazykový pár — proces, který byl dříve nákladný a časově náročný, a pro některé jazykové páry také nemožný.

Tento pokrok byl možný díky architektuře a mechanismu samo-pozornosti transformátorů. Schopnost modelu transformátoru učit se kontextové vztahy napříč jazyky, v kombinaci se škálovatelností pro zpracování více jazyků současně, umožnila vývoj efektivnějších a účinnějších multilingválních překladových systémů. Nicméně, modely Zero-Shot obecně vykazují nižší kvalitu než ty, které byly trénovány na paralelních datech.

Poté, navazující na pokrok transformátorů, společnost Google představila PaLM 2 v roce 2023, což umožnilo vydání 110 nových jazyků v roce 2024. PaLM 2 významně vylepšil schopnost služby Translate učit se úzce související jazyky, jako je Awadhi a Marwadi (souvisí s hindštinou) a francouzské kreolštiny, jako Seychellois a Mauritian Creole. Vylepšení v PaLM 2, jako je optimalizace výpočtu, vylepšené datové sady a rafinovaná konstrukce — umožnily efektivnější učení jazyků a podporovaly pokračující úsilí společnosti Google o zlepšení a rozšíření jazykové podpory a zachycení rozmanitých lingvistických nuancí.

Můžeme tvrdit, že problém strojového překladu byl zcela vyřešen transformátory?

Evoluce, o které mluvíme, trvala 18 let od přijetí SMT společností Google až po recentních 110 dalších jazyků pomocí Zero-Shot Machine Translation. To představuje obrovský skok, který může potenciálně snížit potřebu rozsáhlého sběru paralelních sbírek — historicky a velmi časově náročného úkolu, který průmysl sledoval po více než dvě desetiletí. Ale tvrzení, že strojový překlad je kompletně vyřešen, by bylo předčasné, zohledňující jak technické, tak etické úvahy.

Aktuální modely stále bojují s kontextem a koherencí a dělají jemné chyby, které mohou změnit význam textu. Tyto problémy jsou velmi přítomny v delších, složitějších větách, kde je nutné zachovat logický tok a porozumět nuancím pro dosažení výsledků. Kromě toho kulturní nuance a idomatické výrazy se často ztrácejí nebo ztrácí význam, způsobujíce překlady, které mohou být gramaticky správné, ale nemají zamýšlený dopad nebo zní nepřirozeně.

Data pro předtrénování: PaLM 2 a podobné modely jsou předtrénovány na rozmanitém multilingválním textovém korpusu, překonávajícím svého předchůdce PaLM. Toto vylepšení vybavuje PaLM 2, aby vynikl v multilingválních úkolech, zdůrazňujících pokračující důležitost tradičních datových sad pro zlepšení kvality překladu.

Doménově specifické nebo vzácné jazyky: V specializovaných oblastech, jako jsou právní, lékařské nebo technické, paralelní sbírky zajišťují, že modely narazí na specifické terminologie a jazykové nuance. Pokročilé modely mohou mít potíže s doménově specifickou terminologií nebo se vyvíjejícími jazykovými trendy, což představuje výzvy pro Zero-Shot Machine Translation. Kromě toho jsou jazyky s nízkými zdroji stále špatně překládány, protože nemají dostatek dat pro trénování přesných modelů.

Testování: Paralelní sbírky zůstávají nezbytné pro hodnocení a testování výkonu překladových modelů, zejména pro jazyky, které postrádají dostatek paralelních dat. Automatizované metriky, jako BLEU, BLERT a METEOR, mají omezení při hodnocení nuance v kvalitě překladu kromě gramatiky. Ale pak jsme my, lidé, omezeni našimi předpojatostmi. Kromě toho není mnoho kvalifikovaných hodnotitelů, a najít ideálního bilingvního hodnotitele pro každou jazykovou пару, aby chytil jemné chyby.

Zdrojová intenzita: Zdrojově náročná povaha trénování a nasazování LLM zůstává bariérou, omezující přístup pro některé aplikace nebo organizace.

Kulturní uchování. Etická dimenze je hluboká. Jak popisuje Isaac Caswell, výzkumný pracovník Google Translate, Zero-Shot Machine Translation: “Můžete si to představit jako polyglota, který zná mnoho jazyků. Ale pak také vidí text v 1 000 dalších jazycích, který není přeložen. Můžete si představit, že jste velký polyglot, a pak začnete číst romány v jiném jazyce, můžete začít skládat, co by to mohlo znamenat na základě vašeho znalosti jazyka obecně.” Ale je důležité zohlednit dlouhodobý dopad na menší jazyky, které postrádají paralelní sbírky, potenciálně ovlivňující kulturní uchování, když se závislost přesouvá od jazyků samotných.

Irina Barskaya, PhD, je uznávaný odborník na data s více než desetiletou zkušeností, která zahrnuje jak produktovou analytiku, tak analytiku pro pokročilé technologie. Vedla vytvoření a analytiku pro Yasminu, první plně funkční lokalizovanou AI-založenou hlasovou asistentku pro Saúdskou Arábii, která zajišťuje komplexní lokalizaci dat a označování pro moderní standardní arabštinu a saúdskoarabské dialekty. V současné době Irina vede kvalitativní analytiku ve společnosti Yandex, kde pohání pokroky v AI technologiích.