01:56AK@_akhaliq精选一篇名为《Toward Skill-Native LLMs》的论文提出技能熵(Skill Entropy)概念。技能熵被用于长程推理的基准测试。它还被用作训练目标,推动技能原生模型的发展。论文预印本已发布在Hugging Face,编号2608.05。论文Hugging FaceSkill Entropy长程推理推荐理由:新论文提出技能熵,用来评测和训练长程推理。想搞清AI是不是真会推理的可以读。原文稍后读已读值得跟进有用关注 Hugging Face
11:34官方账号arXiv cs.LG@Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora论文提出Skill Entropy,用于度量模型在同一推理链中切换不同技能(如先做数学推导再规划日程)的难度。基于558个技能和9个可验证领域构建了Skill^2-Bench基准,任务按技能熵分为三个难度等级。在8个前沿模型和4个开源模型上的测试显示,技能熵越高的任务准确率越低,存在明显的技能切换差距。将Skill Entropy作为训练信号,Skill-Entropy RL在Qwen3-4B-Instruct上将Skill^2-Bench得分从34.4%提升到68.4%,在Qwen3-1.7B上从14.6%提升到40.1%。该训练流程还能直接应用到OpenR1-Math等现有数据上。论文Skill EntropySkill^2-BenchQwen3推荐理由:Skill Entropy能测出模型切换推理技能的短板,还能当训练信号:Qwen3小模型得分从34%飙到68%,也能用在OpenR1-Math数据上。原文稍后读已读值得跟进有用关注 Skill Entropy