事件专题 ·官方一手

LSC-DPO:动态控制学习信号的偏好优化新方法

论文提出 LSC-DPO,从损失函数几何视角分析 DPO,将 sigmoid 因子视为刻画目标局部敏感度的学习信号。该方法动态调节学习信号使其保持在目标区间,并给出对数空间下的稳定追踪条件。在 AlpacaEval 2、MT-Bench 和 Anthropic-HH 三个基准上,LSC-DPO 的成绩稳定优于 DPO 及其他强偏好优化基线。作者还发现不同系数初始化会导致瞬态学习信号轨迹不同,据此推导出信号预算补偿规则,显著降低了不同初始化之间的性能波动。

当前结论

训练偏好模型的老问题:DPO 训到后面梯度就没劲了。这篇把 sigmoid 因子当成可调信号来动态控制,三个基准上都比 DPO 强,搞对齐训练的可以看看实现思路。

7 个信源38° AI 热度最后更新 2026/10/6 01:32:40

证据链

7 个信源
相关来源 3Artificial Analysis
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。