9月2日
10:49
10:49官方账号arXiv cs.AI@Kshitij Tayal, Arun Sharma, Genta Indra Winata, Anirban Das, Sambit Sahu
精选73°
自然语言正成为提升语言智能体的主要反馈渠道,能传达意图、偏好和因果结构。该研究提出语言强化学习(VRL)范式,围绕反馈生效时机和修改内容形成三大支柱:语言作为基础信号定义任务目标和奖励结构;语言作为反思性反馈指导测试时推理;语言作为学习信号通过训练调整模型参数。
推荐理由:这篇论文首次系统梳理了语言强化学习,将现有研究分为三大类,帮助理解语言如何重塑智能体开发。
8月6日
09:32
09:32官方账号arXiv cs.AI@Bo Wang, Yuqian Yao, Enxi Wang, Luozhijie Jin, Yang Liu, Yiran Suo, Yuxuan Cai, Enyu Zhou, Yufei Gao, Honglin Guo, Tianyu Huai, Li Ji, Zhikai Lei, Bufan Li, Lizhi Lin, Jinxiu Liu, Jie Yang, Jiazheng Zhou, Maosen Zhou, Pengfang Qian, Shichun Liu, Guanshan Liu, Hao Zheng, Yunhao Yu, Hang Yan, Jihua Kang, Xinchi Chen, Xipeng Qiu
ContextWeave 是一项评估语言智能体长期记忆的新基准,基于14名参与者的多月经脱敏工作流,构建了1005个可执行任务,其中568个为核心评测任务。固定模型下,最强记忆配置将 Workspace Score 从68.08提升至78.20,Preference Score 从41.50提升至70.60。固定记忆组件时,召回记忆改善了全部5个测试基础模型的结果。分析还发现,可操作且经验丰富的记忆比紧凑摘要更能支持工作流延续,但也更容易受误导性召回影响。
推荐理由:搞 agent 记忆的人该看看:ContextWeave 拿真实办公流做了1005个任务,能看出召回记忆到底帮不帮得上忙。