9月1日
11:24
11:24官方账号arXiv cs.AI@Gopi Krishnan Rajbahadur, Amir M. Ebrahimi, Boyuan Chen, Ahmed E. Hassan
本文提出工业后训练是棕地维护模式,团队需在固定计算和混合预算下改进已部署模型。研究揭示了三大挑战:零和混合设计、产量作为关键指标以及不确定性下的端到端集成。案例显示,提高教师蒸馏转化率使接受监督增加2.84倍,CodeForces pass@1提升2.59点,LiveCodeBench v6 pass@1提升6.11点。
推荐理由:工业LLM维护团队必读,教你如何在有限资源下提升模型性能,数据工程比一次性配方更重要。
7月24日
11:39
11:39官方账号arXiv cs.LG@Rajiv Shailesh Chitale, Rahul Madhavan, Taneesh Gupta, Deepanway Ghosal, Aravindan Raghuveer
TTEL是一种利用固定或环境反馈进行token级错误定位的推理时算法。它通过比较条件概率隔离出错步骤,截断并重新生成,复用有效前缀。在Qwen3-8B上,TTEL在LiveCodeBench达到pass@64为71.0%,生成token仅约360.4k,远少于独立采样的735.0k。在AIME-2025和HMMT-2025数学基准上,TTEL也优于其他测试时基线。
推荐理由:TTEL能定位推理错误,只重算出错部分,省近一半计算量。Qwen3-8B在编程测试上成绩亮眼,值得关注。
6月19日
11:31
11:31官方账号arXiv cs.AI@Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev
LiveCodeBench (LCB) 是广泛采用的代码生成基准,但仅限Python。新基准Multi-LCB将LCB任务转化为12种编程语言,包括Python、C++、Java等,保持原始污染控制和评估协议。研究者在Multi-LCB上评估了24个LLM,发现模型存在Python过拟合、语言特定污染和跨语言性能差异。Multi-LCB为多语言代码评估提供了严格的新基准,直接暴露了当前LLM在Python之外的短板。
推荐理由:想测AI写代码的真本事?别只看Python了。Multi-LCB覆盖12种语言,一测就知道模型是不是只会Python,结果可能让你意外。