方言:能听懂,但不会说
现代大语言模型在处理方言英语方面表现不俗——它们能够理解用地区变体提出的问题或指令。但一旦要求模型用同样的风格回答,它几乎总会切换回标准英语,且大多偏向美式规范。这就出现了一个有趣的断层:模型能听懂方言,能很好地解读它,却用“书面语”作答。在研究文献中,这种现象被称为 robustness-generation gap——即对非标准输入的稳健性与在自身生成中复现它的能力之间的脱节。
正是这一断层,促使 DiaLLM 论文的作者们展开了研究,该论文近期发表在 arXiv 上(编号 2607.07669)。他们提出的问题是:能否教会开源语言模型不仅理解方言,还能主动使用方言说话——如果可以,哪种训练方法效果最佳。
DiaLLM 提出了什么
研究人员并没有针对某一种方言对模型进行微调。相反,他们选取了三个开源 LLM 家族,并在国际英语语料库(International Corpus of English)上继续预训练。该语料库包含多种国家和区域变体的文本——从澳大利亚英语到印度英语。
随后,训练分为两个方向:隐式范式,即模型自行从示例中习得方言特征;以及显式范式,即明确训练模型选择方言表达。每个方向又分别与三种对齐策略之一相结合。最终形成了一种实验矩阵,可以分别评估每个训练阶段的贡献。
据作者称,这是针对澳大利亚英语、印度英语和北英格兰英语变体,首次对这些组件进行受控比较。此前,没有人曾在统一的实验基础上检验过这些方法。

实验显示了什么
主要结论是:理解方言的能力与生成方言的能力确实没有直接关联。二者并不互为因果:模型可能出色地处理方言结构,却仍然固执地用标准语言作答。
另一个发现也很有趣。模型在自动基准测试上的表现,主要取决于继续预训练和 监督微调(SFT)。对齐对测试指标的影响几乎可以忽略不计。但这并不意味着对齐无用:它显著改变了回答风格,只是标准基准测试对这类变化不敏感。也就是说,如果仅凭数字评估模型,可能会错误地认为所有方法效果等同。
为什么方言生成是一项难题
作者单独比较了针对特定语言变体的显式适应,与不绑定方言的更广泛对齐。显式方法确实产出了能被自动分类器和人类都明确识别为方言的文本。这类回答相比广泛对齐获得了更高的评分。
但这里出现了一个意想不到的细节。最激进地优化“方言奖励”的方法——即最积极地鼓励模型使用方言表达——最终却不受人类评估者的青睐。算法中内置的形式化标准,与人类对高质量方言口语的认知并不一致。额外的语言学分析证实:形式化优化与真实质量之间存在差距,在三个模型家族中的两个身上尤为明显。

因此,三种对齐策略中没有任何一种展现出绝对优势。并不存在“在方言上微调模型,就能得到一个说方言的助手”这样简单的配方。要弥合这一差距,需要更精细的奖励设计——不能简化为对偏离标准语言的一刀切惩罚——以及更高质量的方言训练资源。
结论与展望
DiaLLM 工作的价值在于,它系统性地剖析了不同训练阶段如何影响方言生成。对实践者而言,这意味着:如果你希望助手用澳大利亚英语或印度英语交流,仅靠继续预训练是不够的。还需要精心设计的对齐,而其效果不仅要用自动基准测试来验证,还应邀请母语使用者参与评估。
好消息是:作者计划公开代码、检查点以及带有人类偏好的数据集。这将使其他团队能够继续实验,尝试更复杂的强化学习方法。
而目前,主要结论听起来几乎有些矛盾:大语言模型在理解方言方面越来越强,但用方言说话的能力仍是一个悬而未决的难题,单靠增加训练数据量无法解决。



