10:44官方账号arXiv cs.LG@Yuanqiang Yu, Yanzhao Zheng, Zhentao Zhang, Tianze Xu, Chao Ma, Jihuai Zhu, Jiashun Liu, Xinle Deng, Baohua Dong, Hangcheng Zhu, Ruohui Huang精选73°研究人员提出PAC方法,结合优势衍生的可学习性和近期奖励增益两个信号,用于大语言模型的多任务强化学习。在多级推理和多领域推理两种设置下,PAC仅需更少的采样步骤就能达到相当的验证分数,并最终超越随机采样和基于优势的课程基线。该方法通过贝叶斯汤普森采样控制器在GRPO训练过程中分配任务资源。论文PACLLM强化学习推荐理由:PAC方法解决了LLM多任务RL中任务分配问题,结合优势信号和实际奖励增益,提升训练效率。原文稍后读已读值得跟进有用关注 PAC
11:34官方账号arXiv cs.AI@Mahdi Nazeri, Anne-Kathrin Schmuck, Sadegh Soudjani, Alessandro Abate本研究提出一种新框架,使用Clopper-Pearson置信区间为LLM生成的有害输出概率计算PAC下界。该算法通过分析潜在空间特征优先探索自回归生成树中更可能产生有害输出的分支。该方法能高效计算极小有害概率(如低于10^-6)下的严格下界。实验在多个SOTA LLM上验证了有效性,所得下界经形式证明小于真实有害概率。论文Clopper-PearsonPACAI安全推荐理由:这篇论文教你用统计方法严格证明LLM有多安全,不是估算,而是可证明的下界。原文稍后读已读值得跟进有用关注 Clopper-Pearson