校准与再训练的权衡:如何让已遗忘的保持遗忘
研究人员发现,标准的大语言模型去学习(unlearning)方法在针对少量已遗忘示例进行微调时很容易失效。他们提出的“边际校准”(Margin Calibration)技术引入了一种非饱和的边际惩罚,显著降低了此类攻击在多种模型和数据集上的成功率。

12 材料
研究人员发现,标准的大语言模型去学习(unlearning)方法在针对少量已遗忘示例进行微调时很容易失效。他们提出的“边际校准”(Margin Calibration)技术引入了一种非饱和的边际惩罚,显著降低了此类攻击在多种模型和数据集上的成功率。

新研究表明,存在偏见的LLM评判者会在不经意间破坏失败技能的淘汰机制:当虚假成功比例超过0.45时,系统将停止清理技能库,而这一现象在聚合指标中不可见。作者提出了一种低成本的缺陷注入审计方法,以便在部署前对评判者进行检验。

多位网络安全专家反映,他们在“网络可信访问”计划中失去了对Daybreak Blue级别的访问权限。OpenAI承认问题出在自身,并请求重新进行验证。

语言模型成功的关键不仅在于复用token,还在于压缩机制的设计。对于音乐而言,预先固定关系(例如通过五度圈)反而会降低预测效果——更重要的是保留模型上下文并正确设定时间。

我们解析在PC上安装Stable Diffusion最可靠的方法:官方安装器ComfyUI Desktop、通用的Pinokio以及适用于现代模型的Forge Neo。我们解释需要什么样的GPU、为什么Automatic1111不再是首选,以及生成第一张图片需要多长时间。

作者表明,普通的对抗性提示调整会迫使模型依赖伪稳定特征,并在新类别上丧失准确性。新的ADAPT方法通过诱饵提示解决了这一问题,将有用特征与可泛化的捷径分离。

新研究表明,即便是具有文本记忆的、前景看好的AI代理,在任务顺序改变时也会严重退化,且其评估结果存在噪声。作者呼吁采用更严格的测试协议,并对关于性能提升的结论保持谨慎。

InnerExpert的新方法利用MoE模型中专家路由和分歧的特点,按token识别虚构片段。该方法无需人工标注即可训练,在五个数据集上,单次前向传播在答案级别达到最高0.91的准确率,在token级别达到0.76。

作者测试了六种语言模型在航班、公寓和酒店相关问题上的表现,发现关于支付意愿的数值答案系统性地相互矛盾。因此,这些评估无法用单一的效用函数来描述——这意味着在决策时依赖这些评估存在风险。
