ChatGPT的Goblin Glitch:模式为何谈论Goblins和Gremlins

18 八月 202621 视图

OpenAI解释道,由于训练期间的反馈循环,GPT和Codex模型开始固执地插入了Goblins和gremlins的提及. 这在Nerdy预设中最常出现,公司不得不增加特殊限制来解决这个问题.

ChatGPT的Goblin Glitch:模式为何谈论Goblins和Gremlins

导言

最近几周,用户 ChatGPT 发现新的消遣:他们互相发送截图,其中聊天员突然开始谈论妖精,妖精,以及其他各种生物. 似乎神经网络已经吸收了一些病毒的习惯, 现在把怪异的词漏进最普通的答复中。 让我们弄清楚这是什么,为什么OpenAI正式承认了这个问题.

用户是如何注意到异常的

不寻常的行为首先在专门讨论 GPT-5.5 还有Codex。 用户张贴了对话,其中该模型在没有任何明显理由的情况下提到“goblin模式”、“goblin带宽”和“perf gremlin”。 起初,这被解职为随机故障,但截图不断堆积. 渐渐明朗:模型固定在某些单词上,这发生在不同的交流风格之间.

一位讨论参与者发现,Codex的系统指令明确禁止提及妖精,葛林,浣熊,巨怪,食人怪,鸽子等幻想生物——除非它们与用户的要求相关. 换句话说,开发者已经意识到了这个问题,并试图控制它 但显然并不完全如此。

OpenAI 发现了什么

2026年4月29日,OpenAI发表了一篇题为“妖精从何而来”的官方作品。 进去 该公司承认,GPT和Codex已经形成了一种持久的“言语习惯”——即使用户没有要求,该模型也越来越多地添加诸如goblin和gremlin等词语.

根据数据,GPT-5.1发布后,在响应中"goblin"的频率增加了175%,"gremlin"增加了52%. 当时 GPT-5.5 这已变得十分明显,以至于必须作出特别限制。 将引入 Codex 。 然而,这种现象仍不能完全根除。

为什么会这样:反馈循环

Sam Altman在公共反应中称正在发生的事情是“神灵时刻 ” 。 但笑话除外, 原因更深。 内部审计显示,这种异常现象最常出现在Nerdy人格预设中。 这种风格只用于2.5% ChatGPT 但是,它占了所有提到 " 妖精 " 一词的66.7%。 几乎所有有问题的案件都具体地与这种“紧张”的语气联系在一起。

在76.2%的数据集中,Nerdy模式的奖励信号系统化地倾向于含有Goblin或gremlin的响应,而不是没有这些词语的替代品. 换句话说,该模型因使用“游戏”词而定期得到积极的加强,以及 超过其他信号

OpenAI将情况描述为经典的反馈循环:模型因玩耍风格而获得奖励;玩耍风格在推出数据中出现得更多;类似的回应最终会在随后的微调中出现;因此,口头tic变得更加根深蒂固. 在每一循环中,“妖精”会更加坚持,直到他们开始滑入最不合适的地方。

这对用户意味着什么

如果你遇到一个聊天员 突然开始 谈论葛林斯或提供“妖精解决方案”,知道这不是幻觉,也不是你想象中的虚构。 这种行为被记录和研究——完全可以解释. OpenAI已经在努力缓和效果,但事情要完全固定下来可能需要时间. 同时,这极大地提醒人们,大型语言模型不仅仅是算法,而是从自己的响应中学习的系统,有时自我强化的过程会导致好奇的怪怪.

但对于用户来说,这更是一个有趣的插曲,而不是一个严重的问题. 神经网络不会因为有关妖精的文字而变得更加危险——它只是有时表现得像来自"X-Files"的生物.

常问问题

ChatGPT:神经网络为何谈论妖精和妖精