全部动态

AI 相关资讯全量信息流 · 4198 条
8月28日
论文精选73°19:25
进化策略提升LLM推理覆盖范围

这篇论文对比了ES和GRPO两种训练方法,发现ES能带来更广泛的推理覆盖,还提出了结合两者优势的GRPO-ES顺序训练策略。

官方账号arXiv cs.LG@Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang原文
论文官方一手精选73°18:04
并行分布式推理语言模型性能基础

这篇论文帮你搞懂RL-for-LLM的并行训练策略,让DeepSeek-R1、o3这些推理模型训练不再那么烧钱。

官方一手arXiv: DeepSeek@Maciej Besta, Leonard Schmidt, Lara Nonino, Robert Gerstenberger, Pierre Pang, Patrik Okanovic, Ales Kubicek, Tiancheng Chen, Baraq Lipshitz, Torsten Hoefler原文
论文18:00
无监督学习脓毒症严重程度评分研究

这项研究用新方法替代了过时的脓毒症评分,能更准确预测患者预后。

官方账号arXiv cs.AI@Kevin Zhu, Ryan Zhang, Baraa Abed, Tilendra Choudhary, Malvern Madondo, Mehak Arora, Yixuan Yang, Alasdair Gent, Aditya Nagori, Omer T. Inan, Krista L. Haines, Patrick Georgoff, Suresh M. Agarwal, Vijay Krishnamoorthy, Tetsu Ohnuma, Mihai V. Podgoreanu, Michael R. Pinsky, Gilles Clermont, Craig M. Coopersmith, Craig S. Jabaley, Rishikesan Kamaleswaran原文
论文精选73°17:22
PAWBench评估视频生成模型概率对齐能力

PAWBench首次系统评估视频生成模型作为世界模型的概率对齐能力,揭示了当前模型与理想状态间的差距。

官方账号arXiv cs.AI@Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jingbo Xing, Xi Chen原文

仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档