Góc nhìn Anderson
Tác động môi trường cao của mô hình dịch thuật tự động tiếng Đức

Nghiên cứu mới về tác động môi trường của mô hình dịch thuật máy tính cho thấy tiếng Đức có thể là ngôn ngữ phổ biến nhất để đào tạo, mặc dù lý do không hoàn toàn rõ ràng. Báo cáo mới này nhằm mục đích mở ra các hướng nghiên cứu mới về phương pháp đào tạo trí tuệ nhân tạo hiệu quả hơn về mặt carbon, trong bối cảnh nhận thức ngày càng tăng về mức độ tiêu thụ điện năng của các hệ thống học máy.
Bản thảo của báo cáo có tiêu đề Curb Your Carbon Emissions: Benchmarking Carbon Emissions in Machine Translation, và đến từ các nhà nghiên cứu tại Viện Công nghệ Manipal của Ấn Độ.
Các tác giả đã thử nghiệm thời gian đào tạo và tính toán giá trị phát thải carbon cho các mô hình dịch thuật ngôn ngữ khác nhau, và phát hiện ra ‘sự chênh lệch đáng kể’ giữa thời gian dịch và ba mô hình ngôn ngữ tiết kiệm carbon nhất.

Trung bình phát thải carbon trong 10 kỷ của đào tạo. Bên trái, kết quả sử dụng ConvSeq (xem dưới), bên phải, Transformers. Nguồn: https://arxiv.org/pdf/2109.12584.pdf
Báo cáo cho thấy rằng các ngôn ngữ ‘sinh thái’ nhất để đào tạo là tiếng Anh > tiếng Pháp, tiếng Pháp > tiếng Anh và, một cách nghịch lý, tiếng Đức sang tiếng Anh, trong khi tiếng Đức có mặt trong tất cả các ngôn ngữ có tiêu thụ cao nhất: tiếng Pháp > tiếng Đức, tiếng Anh > tiếng Đức và tiếng Đức > tiếng Pháp.
Lãi kép
Kết quả cho thấy rằng sự đa dạng từ vựng ‘đIRECTLY tỷ lệ với thời gian đào tạo để đạt được mức hiệu suất đủ’, và lưu ý rằng tiếng Đức có điểm số đa dạng từ vựng cao nhất trong số ba ngôn ngữ được thử nghiệm, như ước tính bởi Tỷ lệ Token-Type (TTR) – một thước đo kích thước từ vựng dựa trên độ dài văn bản.
Các yêu cầu gia tăng khi xử lý tiếng Đức trong các mô hình dịch thuật không được phản ánh trong dữ liệu nguồn được sử dụng cho thí nghiệm. Trên thực tế, các token ngôn ngữ tiếng Đức được tạo ra từ dữ liệu nguồn có ít token hơn (299445) so với tiếng Anh (320108), và ít hơn nhiều so với tiếng Pháp (335917).

Thử thách, từ góc độ Xử lý Ngôn ngữ Tự nhiên (NLP), là phân chia các từ phức hợp tiếng Đức thành các từ thành phần. Các hệ thống NLP thường phải thực hiện việc này cho tiếng Đức mà không có bất kỳ dấu hiệu ngữ pháp hoặc gợi ý ngữ cảnh nào có thể được tìm thấy trong các ngôn ngữ có điểm TTR thấp hơn, chẳng hạn như tiếng Anh. Quá trình này được gọi là phân chia phức hợp hoặc phân tích.
Tiếng Đức có một số từ riêng lẻ dài nhất trên thế giới, mặc dù vào năm 2013 nó mất công nhận chính thức của từ 65 ký tự trước đây, đủ dài để yêu cầu một dòng riêng trong bài viết này:
Rindfleischetikettierungsueberwachungsaufgabenuebertragungsgesetz
Từ này đề cập đến một luật ủy quyền giám sát dán nhãn thịt bò, nhưng đã bị mất do sự thay đổi trong quy định của châu Âu vào năm đó, nhường chỗ cho các từ phổ biến khác, chẳng hạn như ‘góa phụ của một công ty tàu hơi nước trên sông Danube’ (49 ký tự):
Donaudampfschifffahrtsgesellschaftskapitaenswitwe
Nói chung, cấu trúc ngữ pháp của tiếng Đức đòi hỏi phải rời khỏi các giả định về thứ tự từ trong các thực hành NLP ở nhiều ngôn ngữ phương Tây, với khuôn khổ NLP phổ biến (có trụ sở tại Berlin) spaCY áp dụng ngôn ngữ bản địa vào năm 2016.

Các ánh xạ dự án trong một cụm từ tiếng Anh và tiếng Đức thể hiện mối quan hệ phức tạp giữa các yếu tố từ vựng trong tiếng Đức. Nguồn: https://explosion.ai/blog/german-model
Dữ liệu và Kiểm tra
Để có dữ liệu nguồn, các nhà nghiên cứu đã sử dụng Bộ dữ liệu Multi30k, chứa 30.000 mẫu trên các ngôn ngữ tiếng Pháp, tiếng Đức và tiếng Anh.
Mô hình đầu tiên được các nhà nghiên cứu sử dụng là Convolutional Sequence to Sequence (ConvSeq) của Facebook AI năm 2017, một mạng nơ-ron có các lớp tích chập nhưng thiếu các đơn vị lặp lại, và thay vào đó sử dụng các bộ lọc để suy ra các tính năng từ văn bản. Điều này cho phép tất cả các hoạt động diễn ra song song một cách hiệu quả về mặt tính toán.
Phương pháp thứ hai sử dụng kiến trúc Transformers có ảnh hưởng của Google, cũng từ năm 2017. Transformers sử dụng các lớp tuyến tính, cơ chế chú ý và các quy trình chuẩn hóa. Mô hình ban đầu đã được phê bình vì không hiệu quả về carbon, với các tuyên bố về sự cải thiện sau đó bị tranh cãi.
Các thí nghiệm được thực hiện trên Google Colab, đồng đều trên một GPU Tesla K80 (TSLA ). Các ngôn ngữ được so sánh bằng cách sử dụng chỉ số BLEU (Bilingual Evaluation Understudy) và CodeCarbon Máy tính Emissions Calculator. Dữ liệu được đào tạo trong 10 kỷ.
Kết quả
Các nhà nghiên cứu phát hiện ra rằng đó là thời gian đào tạo kéo dài cho các ngôn ngữ liên quan đến tiếng Đức đã làm cho sự cân bằng nghiêng về tiêu thụ carbon cao hơn. Mặc dù một số ngôn ngữ khác, chẳng hạn như tiếng Anh > tiếng Pháp và tiếng Pháp > tiếng Anh có tiêu thụ carbon cao hơn, chúng được đào tạo nhanh hơn và giải quyết dễ dàng hơn, với những cú sốc tiêu thụ này được các nhà nghiên cứu mô tả là ‘tương đối không đáng kể’ so với tiêu thụ của các ngôn ngữ bao gồm tiếng Đức.

Phân tích các ngôn ngữ theo phát thải bộ giải mã / bộ mã hóa.
Các nhà nghiên cứu kết luận:
‘Kết quả của chúng tôi cung cấp chỉ dẫn rõ ràng rằng một số ngôn ngữ có cường độ carbon cao hơn để đào tạo so với những ngôn ngữ khác, một xu hướng này vẫn tiếp tục qua các kiến trúc khác nhau.’
Họ tiếp tục:
‘Tuy nhiên, vẫn còn những câu hỏi chưa được trả lời về lý do tại sao lại có sự khác biệt rõ ràng như vậy trong việc đào tạo các mô hình cho một ngôn ngữ cụ thể so với ngôn ngữ khác, và liệu các kiến trúc khác có phù hợp hơn cho các ngôn ngữ cường độ carbon cao này, và lý do tại sao điều này lại đúng nếu có.’
Báo cáo nhấn mạnh rằng lý do cho sự chênh lệch tiêu thụ carbon trên các mô hình đào tạo không hoàn toàn rõ ràng. Họ dự kiến sẽ phát triển hướng nghiên cứu này với các ngôn ngữ không dựa trên Latin.
1.20pm GMT+2 – Lỗi văn bản đã được sửa.












