AI 모델 및 플랫폼
페이스북, 100개 언어 직접 번역할 수 있는 기계 번역 모델 개발
페이스북은 최근에 새로운 기계 번역 모델을 개발하여 100개의 언어 중 任意의 언어 쌍으로 텍스트를 번역할 수 있습니다. 다른 기계 번역 시스템은 대부분 영어를 중간 언어로 사용하여 번역하지만, 페이스북의 AI 번역기는 영어를 중간 언어로 사용하지 않고 직접 번역할 수 있으며, 약 90%의 정확도를 달성할 수 있다고 합니다. Engadget에 따르면, 페이스북의 AI 번역기는 영어를 중간 언어로 사용하지 않고 직접 번역할 수 있으며, 약 90%의 정확도를 달성할 수 있다고 합니다.
페이스북의 AI 모델을 위한 훈련 데이터는 약 7.5억 개의 문장 쌍으로 구성되어 있으며, 100개의 언어로 분산되어 있습니다. 데이터는 웹 크롤러를 사용하여 웹에서 수집되었으며, 수집된 데이터의 언어는 FastText라는 언어 모델을 사용하여 식별되었습니다. 데이터가 수집되면, LASER 2.0라는 도구를 사용하여 문장 샘플의 의미를 추출하고, 의미에 따라 다른 언어의 문장을 매칭시킬 수 있습니다. LASER 2.0는 페이스북에서 개발되었으며, 비지도 학습 알고리즘을 사용하여 임베딩을 생성합니다. 문장 임베딩에는 문장 간의 관계 정보가 포함되어 있으며, 빈도, 근접성 등과 같은 특징에 따라 생성됩니다. LASER 2.0는 의미가 매우 유사한 문장 쌍을 생성할 수 있습니다.
훈련 데이터는 문장 의미에 따라 매칭되지 않았습니다. 언어 자체가 그룹화되었습니다. 목표는 영어를 중간 언어로 사용하지 않는 시스템을 설계하는 것이었습니다. 페이스북의 앵글라 판(Angela Fan) 리더는 많은 지역에서 영어가 아닌 두 언어를 사용한다고 언급했습니다. 페이스북 엔지니어들은 언어를 그룹화하여 훈련을 수행했습니다. 14개의 언어 그룹이 생성되었으며, 문화, 언어적 유사성, 지리 등과 같은 변수에 따라 생성되었습니다. 예를 들어, 연구자들이 생성한 언어 그룹 중 하나에는 인도에서 가장 일반적으로 사용되는 언어인 우르두어, 타밀어, 힌디어, 벵골어가 포함되었습니다. 이렇게 하면 일반적으로 번역되는 언어 쌍이 높은 품질의 번역을 받을 수 있습니다.
언어 그룹에 초점을 둔 훈련 방법은 몇 가지 интерес로운 결과를 가져왔습니다. 결과로 생성된 번역 모델은 특정 언어 쌍에 대한 기존 모델보다 더 높은 정확도를 달성했습니다. 예를 들어, 영어와 벨라루스어를 번역할 때, AI는 러시아어와의 언어적 유사성으로 인해 러시아어를 번역할 때 학습한 패턴을 적용할 수 있었습니다. 마찬가지로, 스페인어와 포르투갈어의 번역도 개선되었습니다. 스페인어는 두 번째로 많이 사용되는 언어이며, 이 작업을 위한大量의 훈련 데이터가 있었습니다.
번역 시스템은 아직 약 60개의 언어를 다루지 못합니다. 또한, 많은 훈련 데이터가 없는 언어의 경우 모델의 정확도를 개선해야 합니다. 동남아시아와 아프리카의 많은 언어는 신뢰할 수 있는 모델을 훈련하기 위한 데이터가 부족합니다. 연구 팀은 이 데이터 부족을 보완하는 방법을 결정해야 합니다. 또한, 모델이 학습한 인종차별적, 성차별적, 또는 다른 비방적인 패턴을 제어하는 방법을 결정해야 합니다. 연구 팀은 이미 영어 데이터에 대한 비방 필터를 사용하고 있지만, 이 필터는 주로 영어 데이터에서 작동합니다.
기계 번역 시스템은 아직 페이스북의 소셜 미디어 플랫폼에서 사용되지 않고 있습니다. 현재 모델은 연구 목적으로만 사용됩니다. 그러나 페이스북은 유사한 모델을 설계하여 매일 약 20억 개의 번역 요청을 처리할 수 있도록 준비하고 있습니다.












