事件专题 ·单一信源

onPanda:token 级纠正标注对齐数据,中位标注时间省 52%

论文提出交互式标注工具 onPanda,用 token 级纠正来标注 LLM 对齐数据和智能体轨迹:标注员定位首个不当 token,可从候选 token 中选替换项或自由改写。系统随即截断其后内容并从修正前缀继续生成,循环执行定位-纠正-续写直到产出满意回复。小规模对照实验显示,onPanda 相比人工后期编辑将中位标注时间减少 52%。由于最终回复的绝大多数 token 由模型自身生成,产出数据基本保留模型采样分布,适合构建 on-policy SFT 与偏好数据;纠正记录还带精确位置、天然构成正负样本对,可作细粒度监督。团队同时发布用 onPanda 标注的 Panda-CVL 数据集和一个 token 级纠正基准。

当前结论

标注对齐数据不用整段重写,定位到第一个错 token 改掉让模型接着生成,实验里中位时间省 52%,还附了 Panda-CVL 数据集。

2 个信源29° AI 热度最后更新 2026/9/21 17:56:53

证据链

2 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。