事件专题 ·多源确认

论文提出按失败构成判断该改 harness 还是训练权重

一篇 arXiv 论文研究了长程 LLM agent 的两条改进路径:演化外部 harness 或训练模型权重。作者用首次触发的信号给失败轨迹打标签,区分过程失败(阻塞调用、循环、步数耗尽)与内容失败(交付结果质量差),前者由 harness 修复,后者留给权重训练。在 DeepPlanning 上,自演化 harness 将 Qwen3.5-4B 的 held-out 分数从 0.16 提到 0.30,Qwen3.5-9B 从 0.32 提到 0.44。用演化轨迹训练的 LoRA 适配器在原 harness 下为两个模型规模各加 0.13,4B 叠加后 held-out 分数翻倍以上,9B 上适配器单独即追平完整演化线,内容失败从四分之一降到二十分之一。该流程在 WebArena-Lite 的 117 个未见任务上额外提升 0.09。

当前结论

论文教你看 agent 失败原因来决定改运行时框架还是微调模型,Qwen3.5 上从 0.16 拉到 0.30,做 agent 的都该看看这套诊断方法。

3 个信源41° AI 热度最后更新 2026/10/8 10:33:29

证据链

3 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。