11:13官方账号arXiv cs.AI@Jiacheng Miao, Jin Mu, Guanhua Chen, James ZouFisher-R1是一个面向可靠假设检验的开源LLM代理,基于强化学习训练。研究团队构建了P-Bench基准,包含425个覆盖经济学、生物学和医学的假设检验任务。Fisher-R1-14B在P-Bench上平均相对成功率比DeepSeek-V4-Pro高21%,在最具挑战性的任务上高出26%。该模型还超过了GPT-5.4等强基线,表明带验证性统计奖励的强化学习能提升推理可靠性。论文Fisher-R1P-Bench假设检验3 个信源在谈事件专题推荐理由:开源模型Fisher-R1专治假设检验,比GPT-5.4和DeepSeek-V4-Pro都强,最难任务能提26%,搞数据分析的可以看看。原文稍后读已读值得跟进有用关注 Fisher-R1
10:05官方账号arXiv cs.LG@Zonghuan Xu这篇论文研究模型评估中测试选择策略:固定全部测试还是根据已有回答动态选择后续测试。作者在有限结果空间 |X|=N 的条件查询模型下证明,两类分布可区分当且仅当它们的成对条件概率存在正分离;若分离为零,任意有限查询预算下最坏误差恰为 1/2。对任意 T 次自适应策略和 ρ∈(0,1),他们构造了一个非自适应随机程序,只需预先选择 O(N^2(T+log(1/ρ))) 对查询,模拟记录与自适应记录的总变差距离不超过 ρ。匹配下界给出常数自适应查询复杂度与 Ω_ε(N^2) 非自适应复杂度,因此最坏情况自适应优势为 Θ_ε(N^2)。结论是交互最多带来二次方查询减少,而非指数级优势。论文假设检验条件查询自适应查询推荐理由:如果你搞模型评估设计,这篇理论文章用严格上下界讲清楚了交互测试比固定测试省多少查询:最多二次方,不是指数级。原文稍后读已读值得跟进有用关注 假设检验