09:27官方一手arXiv: OpenAI@Zehao Wang, Yisen Xu, Chenglin Li, Chao Peng, Bram Adams, Ahmed E. Hassan, Tse-Hsun, Chen精选论文提出 Ledger,一个确定性运行时层,将编码智能体的交互历史蒸馏为显式执行状态。它在模型行动前通过 inform 路径注入状态视图,在命令执行前通过 govern 路径复用有效结果并标记冗余操作。在 SWE-bench Verified 的 500 个实例上,Ledger 将 GPT-5 mini 的 Pass@1 从 56.2% 提升至 64.2%,将 MiniMax M2.5 从 75.8% 提升至 81.0%。成本分别降低 28.9% 和 31.8%;附加到 OpenAI Codex 后 Pass@1 提升 3.4 个百分点,成本降低 24.4%。消融实验显示 govern 贡献主要正确率提升,inform 贡献主要效率提升,两者结合效果最佳。论文LedgerSWE-benchGPT-5 mini10 个信源在谈事件专题推荐理由:arXiv 新论文做了个 Ledger 层,给编码智能体记账执行状态。GPT-5 mini 在 SWE-bench 从 56.2% 提到 64.2%,成本降 28.9%。原文稍后读已读值得跟进有用关注 Ledger
07:46Fireworks AI@FireworksAI_HQ精选Fireworks AI 与 NotteCore 合作,在多个前沿模型上运行了 720 个浏览器代理任务。结果显示,某个基线模型在约 1/5 的调用中产生格式错误输出,导致多步工作流中频繁重试。而 Kimi K2.5、GLM-5 和 MiniMax M2.5 在 Fireworks 上运行时,重试率近乎为零,且随着任务步骤增加,延迟保持稳定。这一差异在生产级代理系统中直接体现为成本、延迟和可靠性的分化。完整报告已发布。AI产品浏览器代理模型对比重试率3 个信源在谈事件专题推荐理由:做浏览器自动化或代理系统的团队,这个对比直接告诉你模型选择如何影响生产环境的成本和稳定性——Kimi/GLM/MiniMax 的低重试率值得关注。原文稍后读已读值得跟进有用关注 浏览器代理