论文

arXiv 与期刊里的 AI 论文,每篇附中文摘要与推荐理由 · 5284 篇
9月23日
Trains but Doesn't Learn:面向 LLM 智能体交付能力的 Post-Training 基准

这篇论文造了个很较真的基准:不看智能体能不能把指标刷上去,只看它交付的模型到底行不行,连"训练了但没学到东西"这种静默失败都能抓住,四个前沿模型全被拉出来和人类工程师对比。

arXiv: DeepSeek@Weihang Ding, Junfei Zhan原文
9月22日