为什么模型会自信地胡说八道
现代大型语言模型在回答各种问题上的能力令人印象深刻。但在这种自信背后,往往隐藏着一个严重的缺陷:模型可能会基于虚构的事实,给出一个漂亮且连贯的回答。其中一个关键原因就是所谓的知识错位:在预训练阶段,模型吸收了海量数据,而在针对特定任务进行微调时,又被“灌输”了新的指令。结果,模型并不总能分清自己真正知道的内容在哪里结束,而未知领域又从哪里开始。
来自 Joosung Lee 团队及其同事的研究人员提出了一种方法,帮助模型在答案确实超出其能力范围时,诚实地说出“我不知道”。该研究已被 EMNLP 2026 Findings 接收,并发布在 arXiv 上。

在具体示例层面评估知识
主要难点在于理解模型是否知道某个具体问题的答案,而不是对某个“主题”的整体了解。模型可能在一个领域非常擅长,而在相邻领域却完全不熟悉。因此,作者建议针对每个单独的请求来评估知识。
为此,他们使用了多样本推理:用同一个问题多次询问模型,然后分析其回答的稳定性和一致性。如果回答以高置信度重现且彼此一致——那么模型很可能确实“知道”这个主题。如果回答杂乱无章地变化,或者模型给出不同版本——这就是缺乏知识的信号。
这种方法比模型在单次生成中的常规置信度提供了更可靠、更细粒度的指标。它成为后续训练的基础。
考虑模型已知内容的微调
所获得的知识指标并非用作外部评估,而是作为微调的控制信号。其理念是,模型需要在不同示例上进行差异化学习:
- 如果模型知道答案——则增强训练信号,以巩固正确行为,避免丢失已有技能。
- 如果模型不知道答案——则对信号进行不同缩放,并额外鼓励模型给出明确的“我不知道”回答,而不是生成随机或看似合理的文本。

这种方法有助于避免以下情况:在新数据上进行微调会“抹去”模型的知识边界,迫使它对所有问题都作答,包括它并不擅长的领域。相反,模型会学会识别超出其能力范围的请求,并诚实地告知用户。
如何衡量模型变得更诚实了
仅仅减少幻觉数量是不够的——重要的是模型不要开始大规模拒绝回答它实际上知道的问题。因此,研究人员提出了专门的不确定性评估指标。这些指标不仅评估在“知识库内”问题上的准确性,还评估模型区分已知示例与未知示例的能力。
实验的关键结果表明:所提出的方法能让模型在知识不足时明确表达不确定性,同时不损失其能够回答的问题上的准确性。精确区分已知与未知能稳定地提升最终性能——也就是说,模型会变得更加严谨和可靠。
总结
会说“我不知道”并非弱点,而是安全应用 LLM 的必要组成部分。知识加权微调方法提醒我们:要对抗幻觉,不一定需要“死记硬背”更多事实。只需教会模型诚实地评估自身边界,并且不越界即可。这种方法使模型在真实场景中更有用,因为在那些场景里,得到一个诚实的拒绝,远比得到一段自信的虚假信息要好。



