主要来源AK
查看原文事件专题 ·单一信源
onPanda:用 token 级修正高效标注 LLM 与 Agent 的 on-policy 对齐数据
onPanda 是一篇关于对齐数据标注方法的研究,核心是通过 token 级修正(Token-Level Correction)来标注 on-policy 数据。方法面向 LLM 和 Agent 两类场景,替代了传统对完整生成结果做标注的方式。论文已发布在 Hugging Face Papers 上,编号 2609.24。
当前结论
一篇教你怎么标注 on-policy 对齐数据的论文,思路是在 token 层面做修正,LLM 和 Agent 都适用,做对齐训练的可以看看。
2 个信源58° AI 热度最后更新 2026/9/22 19:04:43
证据链
2 个信源相关来源 1arXiv cs.LG
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。