主要来源arXiv: DeepSeek
查看原文事件专题 ·官方一手
SelfSearch:无奖励搜索提升智能体自我改进
研究人员提出SelfSearch方法,让智能体利用历史自我改进记录进行优化,无需下游奖励信号。在六种模型-基准测试中,该方法使种群平均成功率提升,单个智能体在Terminal-Bench 2.1上提高11.2个百分点。在SWE-bench Multilingual上,成功率提升5.0个百分点,同时降低38.5%执行成本。仅需4.03美元搜索成本,DeepSeek V4 Flash就能解决82.0%的Terminal-Bench 2.1任务。
当前结论
SelfSearch让智能体用历史经验自我改进,省钱又高效,Terminal-Bench上提升11.2%,SWE-bench降成本38.5%。
2 个信源58° AI 热度最后更新 2026/9/29 16:36:24
证据链
2 个信源相关来源 1ARC Prize
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。