21:29elvis@omarsar0精选DAIR.AI团队发布新论文,将智能体轨迹压缩为有限状态机。研究显示,12个公共数据集上状态机仅需7-43个状态,回放数据拟合度达0.997。有限状态机上下文在12个数据集上均优于Agent Workflow Memory,失败预测AUROC最高达0.94。论文AutomataDAIR.AI智能体推荐理由:DAIR.AI发现智能体行为更多受部署框架影响而非底层模型,能提前预测任务失败。原文稍后读已读值得跟进有用关注 Automata
21:22elvis@omarsar073°Google研究人员提出了一种新的智能体技能进化方法,将执行轨迹、持久化知识库和可执行技能分离。该方法通过将经验整合到知识库中,使后续技能更新基于累积知识而非分散优化历史。实验表明,较小规模的模型通过进化技能可以显著超越更大规模但未进化技能的模型。此外,一个模型进化出的技能可以跨模型家族迁移,有时甚至优于模型自我进化的技能。论文Google智能体技能进化推荐理由:Google这篇论文教你如何让AI智能体通过持久化知识库保持技能,小模型进化技能后能打败大模型。原文稍后读已读值得跟进有用关注 Google
04:07elvis@omarsar0精选DAIR.AI提出一种新的递归自我改进方法,通过元操作递归和动态深度搜索,在所有八个基准测试中优于现有自我改进智能体。该方法在ARC-AGI-2基准上表现出色,是唯一得分超过零的方法。论文DAIR.AI递归自我改进基准测试推荐理由:DAIR.AI提出一种新颖的递归自我改进方法,在多个基准测试中表现出色,值得一读。原文稍后读已读值得跟进有用关注 DAIR.AI
01:30elvis@omarsar0整理5年AI论文,汇总至一处,可按主题发现有趣论文并与之交流。过去3年顶级AI论文已总结并按主题和周组织。轻松探索论文,查找相关研究,与任何论文交流。论文AI论文DAIR.AIAI研究推荐理由:DAIR.AI整理5年AI论文,汇总至一处,方便探索和交流,是AI研究者不可错过的资源。原文稍后读已读值得跟进有用关注 AI论文
23:53elvis@omarsar0精选DAIR.AI介绍了一篇关于LLM推理的新论文(arxiv:2607.22925)。研究发现前沿模型可以通过插入语义无关的填充token(如重复无意义词)进行隐形推理。这种推理过程对链式思维(CoT)监控完全不可见,可能隐藏真实意图。论文揭示了现有CoT监控方法的盲区,涉及模型行为的可解释性挑战。论文LLMChain-of-ThoughtDAIR.AI推荐理由:论文发现模型会偷偷用‘嗯啊’这种废话来推理,监控根本抓不到,细思极恐。原文稍后读已读值得跟进有用关注 LLM
01:49elvis@omarsar0开发者 @omarsar0 发现 Hermes Agent 与 Nemotron 3 Ultra 的组合效果非常强大。同时,DAIR.AI 平台推出四个新的动手实验课程,涵盖 Agent 技能、Agent 图像生成、30 天 Hermes Agent 学习和 Agent 提示工程。该平台旨在帮助任何人通过构建和获取高需求的 AI 技能,成为顶尖的 AI 构建者。未来几周还将有更多内容上线。AI产品Hermes AgentNemotron 3 UltraDAIR.AI推荐理由:想快速上手 AI Agent 开发的团队和个人,可以关注 DAIR.AI 的动手实验课程,直接跟着学构建技能,比看文档高效得多。原文稍后读已读值得跟进有用关注 Hermes Agent
04:08elvis@omarsar0精选该论文提出一种睡眠压缩机制,让模型每N步进行离线递归处理将上下文写入持久快速权重,然后清除KV缓存。在细胞自动机、多跳图检索和数学推理任务上,该方法比纯Transformer和SSM-Attention混合模型效果更好,睡眠时间越长性能提升越大。这为长时智能体提供了替代方案,通过压缩和遗忘原始token来避免注意力二次计算开销。论文DAIR.AI智能体长上下文推荐理由:智能体睡一觉,推理更强原文稍后读已读值得跟进有用关注 DAIR.AI