AI 在使用日语推理时更不可能发动核打击
作者 Martin Anderson 一项新研究表明,某些 AI 模型在使用日语而非英语进行推理时,极大地降低了推荐核打击的意愿,这揭示了 AI ‘思考’所使用的语言可以深刻影响其道德判断——显然是由于固有的文化嵌入。 来自法国的新研究表明,日本对广岛和长崎的集体记忆可能深深嵌入日语之中,以至于某些 AI 模型在使用日语进行推理时,极大降低了推荐发动核打击的可能性,而在英语中则相反——尽管与这些事件相关的关键词在模型的推理记录中完全缺失:在对一系列领先的大型语言模型(LLM)进行的模拟核危机中,仅仅更改模型内部推理使用的语言(即国家语言),往往会加强对道德代价、平民生命以及核战争人类后果等因素的关注。这并不一定仅针对特定用例或日语本身;相反,它可能强化了这样一种观点:文化规范在语言模型中以深层概念和超语言的方式被编码;这些规范可能在关键决策过程中起到约束作用——而不一定符合 AI 技术或框架创建者的预期方向。作者指出:‘驱动此效应的并非输入语言,而是模型被要求进行推理的语言。当使用日语推理时,模型会自发生成道德词汇(“道德代价”、“数百万生命”),这些在提示中完全不存在。’‘另外五个模型未显示语言效应,但它们几乎在所有条件下都会发起核打击,无论使用何种语言。’本研究测试的模型包括 Claude Sonnet 4.6, Claude Opus 4.6, Claude Haiku 4.5, Gemini Flash 3, Gemini Pro 3.1, GPT-5.2, Mistral...