05:03官方一手Hugging Face: Blog(博客/媒体)IBM Research 发布博客探讨智能体在长任务中的记忆压缩问题。文章介绍了基于 Hidden Markov Model (HMM) 的 ALTK 方法。该方法通过演化模型状态来减少对上下文窗口的占用。这种技术旨在解决长程推理任务中的记忆管理挑战。论文IBM ResearchALTKHMM推荐理由:IBM 发了新博客,讲怎么用 HMM 压缩 Agent 记忆,省显存。原文稍后读已读值得跟进有用关注 IBM Research
01:56AK@_akhaliq精选一篇名为《Toward Skill-Native LLMs》的论文提出技能熵(Skill Entropy)概念。技能熵被用于长程推理的基准测试。它还被用作训练目标,推动技能原生模型的发展。论文预印本已发布在Hugging Face,编号2608.05。论文Hugging FaceSkill Entropy长程推理推荐理由:新论文提出技能熵,用来评测和训练长程推理。想搞清AI是不是真会推理的可以读。原文稍后读已读值得跟进有用关注 Hugging Face
11:34官方账号arXiv cs.LG@Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora论文提出Skill Entropy,用于度量模型在同一推理链中切换不同技能(如先做数学推导再规划日程)的难度。基于558个技能和9个可验证领域构建了Skill^2-Bench基准,任务按技能熵分为三个难度等级。在8个前沿模型和4个开源模型上的测试显示,技能熵越高的任务准确率越低,存在明显的技能切换差距。将Skill Entropy作为训练信号,Skill-Entropy RL在Qwen3-4B-Instruct上将Skill^2-Bench得分从34.4%提升到68.4%,在Qwen3-1.7B上从14.6%提升到40.1%。该训练流程还能直接应用到OpenR1-Math等现有数据上。论文Skill EntropySkill^2-BenchQwen3推荐理由:Skill Entropy能测出模型切换推理技能的短板,还能当训练信号:Qwen3小模型得分从34%飙到68%,也能用在OpenR1-Math数据上。原文稍后读已读值得跟进有用关注 Skill Entropy