09:39
09:39
官方账号arXiv cs.AI@Xixuan Hao, Zeyu Zhang, Zehao Lin, Yihang Sun, Ziliang Guo, Xichong Zhang, Yuxuan Liang, Feiyu Xiong, Zhiyu Li MemOps基准将对话记忆重新定义为生命周期操作序列,包括记住、遗忘、更新、反思及其组合。它通过可控生成流水线在长任务对话中嵌入操作,产生六类操作级探针,并在相邻证据与长上下文两种设置下评估。实验对比了长上下文、检索、参数化和托管记忆系统,发现会话级检索优于回合级检索,而长上下文模型在重构有序记忆状态轨迹上表现明显较弱。该基准揭示出仅靠最终答案准确度无法暴露的多种失败模式,推动记忆评估向可解释的操作级诊断转变。
推荐理由:想测AI的记忆系统到底靠不靠谱?这个新基准MemOps把记忆拆成6种操作来测,比只看最终答案准多了,搞记忆研究的必读。
09:28
09:28
官方账号arXiv cs.AI@Eranga Bandara, Ross Gore, Asanga Gunaratna, Ravi Mukkamala, Nihal Siriwardanagea, Gihan Siriwardanagea, Sachini Rajapakse, Isurunima Kularathna, Pramoda Karunarathna, Chalani Rajapakse, Sachin Shetty, Christopher K. Rhea, Ng Wee Keong, Kasun De Zoysa, Amin Hass, Shaifali Kaushik, Wathsala Herath, Preston Samuel, Anita H. Clayton, Atmaram Yarlagadd 该论文分析了人类与AI助手、编码协作或图像生成等交互中的迭代循环,指出每次请求-反馈-再调整过程会高频触发条件反射,强化不耐烦、完美主义等消极神经通路。作者提出,通过在三层观察(预认知感受、调节间隙、后反应)和两种模式(用户引导与代理辅助)中打断反应链条,可以利用长期抑制替代长时程增强来弱化不良回路。论文以生成式图像提示为例,说明同一挫败会话在观察与否时行为相似但神经效果相反。
推荐理由:这篇论文把日常AI交互解读成神经训练,教你用观察来打断反应回路,实操感强,图像提示例子很直观。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。