思想领袖
生成式人工智能并非濒危语言的死刑
根据联合国教科文组织的说法,到2100年,多达一半的语言可能会灭绝。很多人认为,生成式人工智能正在加速这一过程。
语言多样性的衰退并不是从人工智能或互联网开始的。但是,人工智能确实有可能加速土著语言和低资源语言的衰落。
世界上7000多种语言中,绝大多数没有足够的资源来训练人工智能模型,而且很多语言缺乏书面形式。这意味着,只有少数几种主要语言占据了人类人工智能训练数据的主导地位,而大多数语言可能会被人工智能革命所抛弃,甚至可能完全消失。
简单的原因是,大多数可用的人工智能训练数据都是英文。英文是大型语言模型(LLM)的主要驱动力,讲较少见语言的人们发现自己在人工智能技术中代表性不足。
考虑以下来自世界经济论坛的统计数据:这些统计数据:
- 两个第三的网站都是英文的。
- 人工智能学习的大部分数据都是从网络上爬取的。
- 不到20%的人口会说英文。
随着人工智能越来越深入地融入我们的日常生活,我们都应该思考语言公平的问题。人工智能具有前所未有的解决问题的潜力,其承诺不应该仅限于英语使用者。人工智能正在为发达国家的人们创造便利和工具,增强他们的个人和职业生活。
低资源语言的使用者习惯于在技术中找到代表性不足——从找不到母语网站到语音助手不支持他们的方言。低资源语言中可用的文本数据质量较差(翻译准确性值得怀疑),且范围狭窄。
社会如何确保低资源语言不会被人工智能所抛弃?我们如何确保语言不会成为人工智能承诺的障碍?
为了实现语言包容性,一些主要的科技公司已经启动了训练大型多语言语言模型(MLM)的计划。例如,微软翻译已经承诺支持“每种语言,到处”。Meta也做出了“没有语言被抛在后面”的承诺。这些都是值得称赞的,但它们是否现实?
语音技术的进步
人工智能模型主要是在文本数据上训练的,这自然偏向于拥有更多文本内容的语言。语言多样性将会通过不依赖文本的系统得到更好的支持。人类的交互曾经完全基于语音,许多文化仍然保持这种口头传统。为了更好地服务全球受众,人工智能行业必须从文本数据转向语音数据。
语音技术的研究正在取得巨大的进步,但它仍然落后于基于文本的技术。语音处理的研究正在进展,但直接的语音到语音技术还远未成熟。事实上,行业通常会谨慎行事,只有当技术发展到一定水平时才会采取行动。
TransPerfect刚刚发布的GlobalLink Live解释平台使用了更成熟的语音技术——自动语音识别(ASR)和文本转语音(TTS)——因为直接的语音到语音系统还不够成熟。话虽如此,我们的研究团队正在为完全的语音到语音管道准备就绪的那一天做准备。
语音到语音翻译模型在保护口语语言方面具有巨大的潜力。2022年,Meta宣布了第一个人工智能驱动的语音到语音翻译系统,用于闽南语,一种主要在华人社区中使用的口语语言,约有4600万人使用。它是Meta的通用语音翻译器项目的一部分,该项目正在开发新的人工智能模型,希望能够实现多种语言之间的实时语音到语音翻译。Meta选择开源其闽南语翻译模型、评估数据集和研究论文,以便他人可以复制和在其基础上进行建设。
少即是多
我们作为全球社区缺乏某些语言的资源,并不意味着这些语言的灭绝。这就是多语言模型的优势所在,即语言之间可以相互学习。所有语言都遵循一定的模式。由于语言之间的知识转移,训练数据的需求减少了。
假设你有一个模型正在学习90种语言,你想添加伊努特语(一种美洲原住民语言)。由于知识转移,你需要的伊努特语数据将会减少。我们正在寻找方法来实现“少即是多”。需要用来微调引擎的数据量更少了。
我对未来更加包容的人工智能持乐观态度。我不认为我们注定要看到大量语言消失,也不认为人工智能将永远属于英语世界。我们已经看到更多关于语言公平性的关注。从更多样化的数据收集到构建更多语言特定的模型,我们正在取得进展。
(MSFT )考虑一下方语,一种在贝宁和邻近的非洲国家有约400万人使用的语言。不久前,一个流行的人工智能模型将方语描述为虚构语言。计算机科学家博纳旺蒂·多塞(Bonaventure Dosseau),他的母亲说方语,已经习惯了这种排斥。多塞,法语为母语,长大时没有翻译程序来帮助他与母亲交流。如今,多塞可以通过他精心构建的方语-法语翻译器与母亲交流。如今,还有一个方语维基百科。
为了利用技术保护语言,土耳其艺术家雷菲克·阿纳多尔(Refik Anadol)已经启动了为土著人民创建开源人工智能工具的工作。在世界经济峰会上,他问道:“我们如何在地球上创造一个不了解人类全部的AI?”
我们不能,也不会。












