全部动态
AI 相关资讯全量信息流 · 4198 条
8月28日
进化策略提升LLM推理覆盖范围
官方账号arXiv cs.LG@Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang原文
这篇论文对比了ES和GRPO两种训练方法,发现ES能带来更广泛的推理覆盖,还提出了结合两者优势的GRPO-ES顺序训练策略。
MetaNet:任务条件专家动态分配
官方一手arXiv: DeepSeek@Rongfeng Wang, Shichao Weng, Zhiqiang Wang, Xinyu Liu, Yang Yi, Peilong Zhou, Hongwei Tang2 个信源在谈原文
MetaNet让MoE模型根据任务难度动态分配专家,大幅减少计算量同时保持准确率。
论文18:58
LLMs4OL 2026挑战:本体学习检索增强与词汇过滤团队用Qwen2.5模型解决本体学习任务,通过词汇过滤提高准确性,但无法提取非分类关系。
GRAIN框架通过不变性奖励强化学习提升图推理
官方账号arXiv cs.AI@Zike Yuan, Han Zhang, Jianzhi Yan, Le Liu, Cai Ke, Huozhi Zhou, Jian Xie, Jiran Yin, Yukun Cao, Yue Yu, Hui Wang, Ming Liu, Bing Qin原文
MIT团队推出GRAIN框架,用单智能体解决图推理中的标识符和任务表述变化问题,比多智能体方案更快更准。
SWE-Prime:更少轨迹,更好性能
官方账号arXiv cs.AI@Dewu Zheng, Ruizhe Ye, Yanlin Wang, Yang Ye, Hongyu Zhang, Ensheng Shi, Xilin Liu, Yuchi Ma, Jianxing Yu, Zibin Zheng原文
SWE-Prime用10%数据训练就能超越全数据效果,解决了软件工程领域模型训练数据质量低的问题。
MCR-Bench:首个多轮代码审查基准测试
官方账号arXiv cs.AI@Dewu Zheng, Yanlin Wang, Xiwen Wang, Kefeng Duan, Hongyu Zhang, Xilin Liu, Yuchi Ma, Zibin Zheng原文
MCR-Bench揭示了当前LLM在真实代码审查中的不足,特别是跨轮次时间对齐和长程记忆问题。
并行分布式推理语言模型性能基础
官方一手arXiv: DeepSeek@Maciej Besta, Leonard Schmidt, Lara Nonino, Robert Gerstenberger, Pierre Pang, Patrik Okanovic, Ales Kubicek, Tiancheng Chen, Baraq Lipshitz, Torsten Hoefler原文
这篇论文帮你搞懂RL-for-LLM的并行训练策略,让DeepSeek-R1、o3这些推理模型训练不再那么烧钱。
论文18:00
无监督学习脓毒症严重程度评分研究这项研究用新方法替代了过时的脓毒症评分,能更准确预测患者预后。
LeVJEPA:高效可扩展的视频预训练方法
官方账号arXiv cs.AI@Lukas Kuhn, Lucas Maes, Giuseppe Serra, Quentin Le Lidec, Yann LeCun, Randall Balestriero, Florian Buettner原文
LeVJEPA用简单架构实现视频预训练,大幅降低计算量,在图像和运动任务上都表现出色。
论文17:57
Stageboost:基于反事实估计的信号推荐模型eBay新模型让商品详情页更智能,高价值商品转化率提升0.58%,电商推荐系统值得参考。
TransMeme多智能体框架实现跨文化模因再创作
官方账号arXiv cs.AI@Jingyi Zheng, Yule Liu, Zifan Peng, Tianyi Hu, Yuemeng Zhao, Xinhu Zheng, Xinlei He原文
TransMeme框架解决了跨文化模因再创作的三大挑战,在中文-英文双向转换任务中表现优异。
VPP:提升长上下文LLM推理效率的虚拟流水线并行
官方一手arXiv: DeepSeek@Yan Shi, Xiaochao Wang, Jingchun Gao, Jintao Luo, Xinyi Zhou, Feng Liu, Kui Luo, Xushi Li, Xinjie Guo, Liangjun Feng原文
VPP解决了长上下文LLM推理中流水线气泡问题,在保持短序列性能的同时显著提升长序列吞吐。
PAWBench评估视频生成模型概率对齐能力
官方账号arXiv cs.AI@Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jingbo Xing, Xi Chen原文
PAWBench首次系统评估视频生成模型作为世界模型的概率对齐能力,揭示了当前模型与理想状态间的差距。
研究评估人类与大语言模型的心智化能力
官方一手arXiv: DeepSeek@Aamir Sohail, Xintong Zhong, Arkady Konovalov, Patricia L. Lockwood, Lei Zhang原文
这篇论文用经济游戏测试了四大模型家族的心智化能力,发现GPT-5能灵活调整推理深度,表现超过人类。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档