事件专题 ·单一信源

PACT 论文:对齐 critic 与策略,提升 LLM 强化学习训练效果

论文提出 Completeness、Prefix Consistency、Neutrality 三个正则条件,证明它们唯一确定 token 级 credit 分配。基于这一理论,作者指出 On-Policy Distillation 的教师模型相当于隐式 critic,RLOO 信号在期望意义上与 token 级 credit 一致。由此提出 PACT 训练方法,采用 Actor-then-Critic 更新顺序并对 critic 训练施加重要性采样校正。在四个数学推理基准上平均准确率 72.87%,比 GRPO 和 PPO 分别高 8.80 和 13.16 个百分点,SWE-bench Verified 通过率 67.4%。

当前结论

一篇把 LLM 强化学习里 credit assignment 讲清楚的论文,PACT 训练后在数学推理上比 GRPO 高 8.8 个点,搞 RL 后训练的值得看看推导。

2 个信源58° AI 热度最后更新 2026/9/22 12:58:28

证据链

2 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。