10:33elvis@omarsar0精选73°研究人员测试了图记忆与平面检索在长期智能体中的表现差异。在LongMemEval基准测试中,图记忆获得0.42的token F1分数,而平面向量基线为0.47。500个问题的配对bootstrap测试显示差距为-0.050(95% CI -0.085至-0.016)。图记忆在需要回忆特定先前助手回答的问题上表现较差,正确率从0.911降至0.607。论文LongMemEval图记忆平面检索1 个信源在谈事件专题推荐理由:这篇论文实测了图记忆vs平面检索在长期智能体中的真实表现,数据详实,结论明确。原文稍后读已读值得跟进有用关注 LongMemEval
11:04elvis@omarsar0精选Recuris将智能体记忆分为工作记忆和经验记忆,通过锚定当前任务状态进行技能选择,提高长期智能体效果。在四个长期基准测试和十个模型中,成功提升35对模型中的任务成功率。在tau-bench上,GPT-5.6 Sol提升17.8分,Claude Opus 5提升15.6分,Opus 5达到87.9%。长期任务成功率提高,常见失败减少80%以上。技巧Recuris长期智能体技能库维护1 个信源在谈事件专题推荐理由:Recuris分享了提升长期智能体效果的方法,对比GPT-5.6 Sol和Claude Opus 5,效果显著,值得一看。原文稍后读已读值得跟进有用关注 Recuris