LLM安全过滤器在非英语环境下失效:模型如何在其他语言中强化刻板印象

9 九月 20264 视图

研究人员发现大型语言模型在安全性方面存在严重的跨语言偏差:其对齐主要针对英语进行优化,因此在其他语言中,模型更容易绕过限制并复现有害偏见。新的基准测试INCLUDE在十种模型和六种印度语言上进行了测试,结果显示偏见水平因语言和模型类型的不同而显著差异。

LLM安全过滤器在非英语环境下失效:模型如何在其他语言中强化刻板印象

以英语为中心的“安全训练”——问题的根源

现代大型语言模型能够自信地使用数十种语言进行交流,但其安全方面的训练却主要基于英语。在模型获得限制——针对有害内容、毒性言论、危险建议——的对齐阶段,几乎完全依赖于英语数据和英语测试。“红队”测试集、标注员指令、标准拒答示例——这些都首先与英语相关。

研究员Namya Bhatnagar在论文《Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs》(arXiv:2608.18131,计算机科学 > 人工智能部分)中系统性地描述了这一问题。该论文于2026年7月26日提交,并已申报至IEEE SLT 2026——口语技术会议。文中记录了一种应被称为安全错觉的现象:当对话者使用英语时,模型看起来受到可靠保护,而一旦超出该语言范围,这种保护便不复存在。

这种差距可以解释:模型通过其训练所用的示例来识别表述的有害性。带有相同意图的孟加拉语、泰米尔语或马拉地语短语可能根本不会进入过滤器的关注范围——数据中不存在这样的“有害”示例。结果,刻板印象式的回答得以通过,而对应的英语表述在入口处就会被拦截。

语音:故障立即可见

这种差距在语音界面中表现得最为危险。对话式助手没有长时间核查的余地:必须即时响应,而用户的语音是鲜活的,带有语调、缩略语和语言混合。在这种情况下,以英语为中心的过滤器无法处理非英语输入,系统可能会给出强化社会刻板印象——基于种姓、地区、宗教或职业归属——的回答。

据作者评估,对于部署在印度语言多样性人口中的语音技术而言,这是一种严重的失效模式。用户会立即以口头形式收到有害回答,且无法复核或质疑。而恰恰是非英语社区成为主要受影响区域:模型在英语中不会放行的偏见性言论,在地区语言中却毫无防护地输出。这已不是未来系统世代的假设性风险,而是当下就已存在的显著缺陷。

INCLUDE:衡量偏见的印度视角

要评估问题的严重程度,仅靠陈述是不够的——需要一个测量工具。作者提出了INCLUDE(Indian Cultural Lens for Understanding and Detecting Embedded Biases):一个多语言评估基准,旨在量化评估印度语境中的社会文化偏见。

该基准基于2604条提示语,涵盖六种语言:

  • 英语;
  • 印地语;
  • 孟加拉语;
  • 马拉地语;
  • 泰米尔语;
  • 印地英语——印地语和英语的混合语,许多印度人日常使用。

关键思想不是逐字翻译英语测试,而是透过印度文化现实来寻找偏见。研究团队使用该数据集测试了十种模型——包括开源和闭源——共收集了14,988项偏见指标。这一规模足以揭示系统性规律,而非孤立的“失误”。

最出人意料的测量结果

统计分析得出了两个关键发现,每一项都值得特别关注。

**在开源模型中,孟加拉语表现最差。**该语言的平均偏见水平在开源模型中最高。这是一个尤其令人不安的信号:开源LLM经常被微调和本地部署,因此它们恰恰是在印度和孟加拉国最大的语言之一上“偏离”最严重的。

**英语出现了令人意外的反转。**在开源模型中,英语的平均偏见水平最低,而在闭源模型中却恰恰相反,是最高的。常见的“专有模型比开源模型更安全”的认知在此并不成立:在英语上,闭源LLM意外地逊于开源模型。换言之,偏见的语言分布很大程度上取决于你面对的是哪一类模型。

结论:安全无法逐字翻译

该研究的主要启示是,文化偏见无法通过通用的英语过滤器来捕获。简单地将英语规则翻译成其他语言并不能解决问题:刻板印象根植于本地语境,模型必须学会在偏见产生的语言和文化中识别它们。

行业应重新审视对齐实践本身:将非英语场景纳入训练,吸引目标语言社区的标注员参与,并定期使用INCLUDE等多语言基准测试模型。否则就会出现悖论:模型掌握的语言越多,其保护未能覆盖的受众就越广。

如果安全仍然以英语为中心,“对齐错觉”将在每一代新的LLM中重现。最脆弱的环节仍将是使用广泛非英语语言的语音系统——而为此付出代价的将是真实存在的用户。

常问问题

LLM安全过滤器在非英语环境下失效:模型如何在其他语言中强化刻板印象