Anderson의 관점
독일어 기계 번역 모델의 높은 탄소 발자국

기계 번역 모델에 의해 생성되는 탄소 발자국의 연구는 독일어가 가장 탄소 집약적인 언어일 수 있음을 나타내고 있다. 새로운 보고서는 더 탄소 효율적인 AI 훈련 방법에 대한 추가적인 연구를 개방하는 것을 목표로 하고 있다. 이는 기계 학습 시스템이 전기를 소비하는 정도에 대한 인식이 증가하는 contexto에서 이루어졌다.
사전 간행물은 탄소 배출량을 줄여라: 기계 번역에서 탄소 배출량 벤치마크라는 제목을 가지고 있으며, 인도의 Manipal Institute of Technology 연구자들이 작성하였다.
저자들은 다양한 언어 간 번역 모델의 훈련 시간과 탄소 배출량 값을 계산하고, 세 가지 가장 탄소 집약적인 언어 쌍과 세 가지 가장 탄소 효율적인 모델 사이에 ‘주목할만한 불일치’를 발견하였다.

10개 에포크 동안 훈련에 RELEASE된 평균 탄소 배출량. 왼쪽은 ConvSeq(아래 참조)를 사용한 결과이고, 오른쪽은 Transformers를 사용한 결과이다. 출처: https://arxiv.org/pdf/2109.12584.pdf
연구에 따르면 가장 ‘생태적인’ 언어 쌍은 영어>프랑스어, 프랑스어>영어, 그리고 독일어>영어이며, 독일어가 가장 높은 탄소 소비를 보이는 언어 쌍인 프랑스어>독일어, 영어>독일어, 독일어>프랑스어에 포함되어 있다.
복리
연구 결과는 어휘 다양성이 ‘적절한 성능 수준에 도달하기 위한 훈련 시간에 직접적으로 비례한다’는 것을示しており, 독일어가 세 가지 테스트 언어 중에서最高의 어휘 다양성 점수를 가지고 있다고 나타내고 있다. 이는 타입-토큰 비율(TTR)로 측정되며, 이는 텍스트 길이에 기반한 어휘 크기 측정이다.
독일어를 처리하는 모델의 요구 사항은 실험에 사용된 소스 데이터에 반영되지 않는다. 실제로, 소스 데이터에서 생성된 독일어 토큰은 영어(320108)보다 적은 299445개의 파생 토큰을 가지고 있으며, 프랑스어(335917)보다도 훨씬 적다.

자연어 처리(NLP) 관점에서 독일어 복합 단어를 구성 요소 단어로 분해하는 것이 도전이다. NLP 시스템은 종종 이러한 분해를 수행해야 하며, 이는 영어와 같은 낮은 TTR 점수를 가진 언어에서 발견되는 문법적 힌트나 맥락적 힌트가 없다. 이러한 과정은 복합 분할 또는 분해라고 한다.
독일어는 세계에서 가장 긴 단어를 가지고 있으며, 2013년에는 65자로 구성된 이전 기록을 깨던 단어가 공식적으로 인정되지 않게 되었다. 이 단어는 소의 육류 라벨링 감시 업무 위탁 법률을 의미하며, 이 글에서 한 줄을 차지할 정도로 길다:
Rindfleischetikettierungsueberwachungsaufgabenuebertragungsgesetz
이 단어는 2013년 유럽 규제 변경으로 인해 더 이상 사용되지 않게 되었다. 다른 유명한 단어로는 ‘다뉴브 강汽船 회사 선장의 미망인’이 있다:
Donaudampfschifffahrtsgesellschaftskapitaenswitwe
일반적으로 독일어의 구문 구조는 많은 서구 언어에서 사용되는 단어 순서 가정과 다르다. 인기 있는 Berlin 기반 spaCY NLP 프레임워크는 2016년에 자체 네이티브 언어 모델을採用하였다.

영어와 독일어 문장에서 투사적 매핑이 독일어의 어휘 요소 간의 복잡한 상관관계를示している 것. 출처: https://explosion.ai/blog/german-model
데이터 및 테스트
연구자들은 소스 데이터로 Multi30k 데이터셋을 사용하였다. 이 데이터셋에는 프랑스어, 독일어, 영어를 포함한 30,000개의 샘플이 있다.
연구자들이 사용한 첫 번째 모델은 Facebook AI의 2017년 Convolutional Sequence to Sequence(ConvSeq)이다. 이는 재귀 단위를 갖지 않고 대신 필터를 사용하여 텍스트에서 특징을 추출하는 신경망이다. 이는 모든 연산을 효율적으로 병렬로 수행할 수 있게 한다.
두 번째 모델은 Google의 영향력 있는 Transformers 아키텍처이다. 이는 2017년에 발표되었다. Transformers는 선형 레이어, 주의 메커니즘, 및 정규화 루틴을 사용한다. 원래 모델은 탄소 비효율성으로 인해 비판을 받았으며, 이후 개선이 이루어졌다고 주장하고 있다.
이 실험은 Google Colab에서 수행되었으며, Tesla (TSLA ) K80 GPU를 사용하였다. 언어는 BLEU(이중 언어 평가도구) 점수 매트릭과 CodeCarbon 머신 러닝 배출량 계산기를 사용하여 비교하였다. 데이터는 10개 에포크 동안 훈련되었다.
결과
연구자들은 독일어 관련 언어 쌍의 훈련 시간이 더 길어지면서 탄소 소비가 증가하는 것을 발견하였다. 다른 언어 쌍, 예를 들어 영어>프랑스어와 프랑스어>영어는 더 높은 탄소 소비를 보였지만, 훈련 시간이 더 짧고 더 쉽게 해결되었다. 이러한 소비는 연구자들이 ‘상대적으로 중요하지 않다’라고 간주하였다.

인코더/디코더 배출량에 따른 언어 쌍 분석.
연구자들은 다음과 같이 결론을 내렸다:
‘우리의 결과는 어떤 언어 쌍이 다른 언어 쌍보다 더 탄소 집약적임을明示적으로示している 것이며, 이는 다양한 아키텍처에서도 동일한 경향을 보인다.’
그들은 다음과 같이 계속한다:
‘그러나 어떤 언어 쌍이 다른 언어 쌍보다 더 탄소 집약적인지에 대한 이유는 여전히 명확하지 않으며, 이러한 탄소 집약적인 언어 쌍에 더 적합한 아키텍처가 있는지, 그리고 왜 그런지에 대한 연구가 필요하다.’
이 연구는 탄소 소비의 불일치 이유가 완전히 명확하지 않으며, 비 라틴계 언어와 함께 이 연구를 진행할 계획이라고 강조한다.
오전 1시 20분 GMT+2 – 텍스트 오류 수정.












