10:42官方一手arXiv: DeepSeek@Tailin ZhouHierarchical Self-Improvement (HSI) 框架提出让单个冻结的LLM在三个层级上运作:任务harness执行任务、evolver重写harness、meta-evolver重写evolver策略。在BALROG基准上以DeepSeek-V4-Flash-Preview为骨干,HSI在中等难度任务上比初始harness提升显著:BabyAI +39.3、Crafter +33.0、TextWorld +25.0、MiniHack +15.0(均为原始% Progress)。在BabaIsAI子套件上表现出强泛化,BreakStop最佳测试0.98、GoTo达1.00(来自20%未见分割)。当任务超出骨干能力(如NLE)时,harness进化无改善,揭示了反馈保真度和骨干能力两个边界。论文HSIDeepSeek-V4-Flash-PreviewBALROG推荐理由:想用冻结模型提升agent性能?HSI让模型自己改写执行脚手架,在BabyAI等任务上涨了39个点,代码已开源,值得一看。原文稍后读已读值得跟进有用关注 HSI
09:18官方账号arXiv cs.AI@Nathan Young论文提出分层Solomonoff归纳(HSI),将de Finetti定理应用于Solomonoff归纳(SolInd),构造覆盖所有Solomonoff先验的超先验,以支持对给定数据集的外推。作者扩展了Wood等人的证明,表明通用半测度混合的混合仍等价于SolInd,即HSI=SolInd。他们还证明,HSI在任意分布上的超额误差受该分布在超先验中复杂度的限制,类比于SolInd的预测误差受Kolmogorov复杂度限制。随着数据集增长,HSI的平均超额误差收敛到0,实现极限最优预测。论文Solomonoff InductionHSIKolmogorov复杂度推荐理由:这篇把Solomonoff归纳改成能基于数据集预测,证明与原版等价且误差有界,做理论的人可以看。原文稍后读已读值得跟进有用关注 Solomonoff Induction