9月3日
10:00
10:00官方账号arXiv cs.AI@Etcharla Revanth Rao, Priyanshu Karmakar, Shubhojit Mallick, Manish Gupta, Shreya Ghosh, Abhik Jana
精选73°
UTP-Bench是一个大规模旅行规划基准,整合了印度504个城市的真实旅行数据,包含景点、餐厅、住宿和多种交通网络。该基准引入了实证延迟分布和人群密度模式,用于评估旅行计划在随机条件下的表现。研究团队提出了三个评估指标:缓冲充分度评分(BAS)、人群感知时间评分(CATS)和交通延迟吸收评分(TDAS)。
推荐理由:UTP-Bench用真实数据测试GPT-5等模型,发现它们在时间缓冲、延迟感知和人群敏感规划方面与人类计划差距明显。
9月2日
09:32
09:32官方一手arXiv: DeepSeek@Mohammad Hossein Shalchian, Mostafa Amiri, Amir Mahdi Sadeghzadeh
研究人员使用DeepSeek-V3-0324、GPT-OSS-120B和Qwen3-235B-A22B-Instruct-2507三种LLM为波斯语聊天数据生成标注,训练了四个MatinaRoberta-based NER模型。OSS_ZeroShot标注产生的模型在宏平均F1和标签覆盖率召回率(LCR)上表现最佳,能在单块RTX 3090上约2分钟内完成4万条消息的匿名化处理。
推荐理由:波斯语数据匿名化新方案,用LLM标注训练轻量NER模型,消费级GPU上2分钟处理4万消息。
8月31日
09:30
09:30官方一手arXiv: DeepSeek@Siyuan Gan, Yuhan Li, Xiran Wang, Linjian Meng, Boyan Wang, Zhen Zhao, Jing Huo, Yang Gao
精选73°
研究人员提出RA-OPD方法解决教师模型误导问题。该方法在Qwen3和DeepSeek-R1模型家族上测试。RA-OPD过滤掉与结果奖励不一致的轨迹。在七个数学基准和三个代码基准上表现优于标准OPD。
推荐理由:论文提出RA-OPD解决教师模型误导问题,在数学和代码基准上显著提升性能。
09:05
09:05官方账号arXiv cs.LG@Zewen Ding, Zezhong Wu, Zhou Tao, Shida Wang, Shizhuo Hou, YongXiang Hua, Haoyu Cao, Linli Xu
73°
VISTA方法在AIME24、AIME25和HMMT25基准测试中,使用Qwen3模型在1.7B、4B和8B规模下均取得最高Avg@12成绩。该方法通过结果验证的rollout来调整教师模型分布,仅针对top-k位置进行KL散度优化。VISTA在保持标准OPSD学生更新的同时,实现了对OPSD方法0.6、0.7和2.1个百分点的性能提升。
推荐理由:VISTA方法改进了OPSD蒸馏技术,通过验证器指导教师自适应,在数学推理任务上显著提升性能。
8月20日
10:18
10:18官方账号arXiv cs.AI@Ramneet Kaur, Pradyumna Chari, Ramesh Raskar, Jugad Singh, Sumit Kumar Jha, Anirban Roy
Qwen3-0.6B模型在多代理拍卖场景中,通过新框架监测潜在隐蔽协作;该框架对同质化代理的检测准确率达0.993,异质化组合达0.854;测试显示对小范围竞拍者监测负载小,全白盒干预能恢复出价分布并降低合谋行为47.3个百分点。
推荐理由:Qwen3推出了VLA框架,用来监测多代理潜在通信,在小范围拍卖里表现好,你可以去了解下。
8月15日
19:32
8月11日
8月6日
7月29日
12:01
12:01官方账号arXiv cs.AI@Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni, Hongxing Li, Yiwen Qiu, Weiming Lu, Yongliang Shen
提出Relay-OPD方法,解决同策略蒸馏(OPD)中的前缀失败问题:当学生模型进入错误推理方向后,后续生成偏离正确路径。该方法利用教师-学生在失败前缀上的延续不对称性作为无标签触发信号,让教师短暂接管生成然后交回学生训练。使用Qwen3-4B-Instruct-2507作为教师,Qwen3-0.6B/1.7B-Non-Thinking作为学生,在8个数学推理基准上,Relay-OPD在全部基准中取得最佳或次佳结果,1.7B模型平均超越标准OPD 5.73%,超越最强基线FastOPD 1.49%,且训练轨迹长度减少超过50%。
推荐理由:这篇论文提出了一个很聪明的改进:当学生模型推理跑偏时,让老师模型短暂接管一段,再交回学生继续训练。在Qwen3小模型上效果明显,数学推理准确率提升,训练还更快。
7月28日
7月24日
11:39
11:39官方账号arXiv cs.LG@Rajiv Shailesh Chitale, Rahul Madhavan, Taneesh Gupta, Deepanway Ghosal, Aravindan Raghuveer
TTEL是一种利用固定或环境反馈进行token级错误定位的推理时算法。它通过比较条件概率隔离出错步骤,截断并重新生成,复用有效前缀。在Qwen3-8B上,TTEL在LiveCodeBench达到pass@64为71.0%,生成token仅约360.4k,远少于独立采样的735.0k。在AIME-2025和HMMT-2025数学基准上,TTEL也优于其他测试时基线。
推荐理由:TTEL能定位推理错误,只重算出错部分,省近一半计算量。Qwen3-8B在编程测试上成绩亮眼,值得关注。
7月22日
12:09
12:09官方账号arXiv cs.LG@Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David González-Martínez, Xiaoxia Wu, Yuandong Tian, Shiwei Liu, David Z. Pan, Zhangyang "Atlas" Wang
ISO是一种专门为可验证奖励强化学习(RLVR)设计的优化框架。它通过保持基模型的权重谱不变,仅优化输入输出奇异帧来实现模型适配。离线版本ISO-Merger无需数据或梯度就能合并多个专家模型,在无数据合并方法中性能最强。在线版本ISO-Optimizer在Qwen3-8B-Base上,仅用100步就达到AdamW需270步的准确率(0.495),210步后进一步提升至0.509。实验覆盖1.5B到8B参数的推理与代码任务。
推荐理由:如果厌倦了RLVR微调慢慢跑,试试ISO:只用1/3的训练步数就能达到同等效果,Qwen3-8B上实测有效,代码开源。
7月19日
7月17日
7月16日
7月15日
7月9日
7月7日
17:00
17:00@koltregaskes@koltregaskes
精选
分析显示,前沿模型发布到可本地运行的类似开源模型平均滞后25个月。例如GPT-3到Llama 2 70B约37个月,GPT-4到Gemma 3/Qwen3约2年,Claude 3.5 Sonnet到Gemma 4 31B约21个月。趋势预示当前前沿能力可能在两年后出现在笔记本电脑级模型中。该图表预测Fable/Mythos级模型约2028年中出现。
事件专题

推荐理由:想了解前沿模型多久能变成你能在笔记本上跑的开源版?这篇用GPT-4、Claude 3.5等具体案例算出了平均25个月的滞后,还画了未来预测图。
11:41
11:41官方账号arXiv cs.AI@Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou
RLVR通过可验证奖励提升推理能力,但每次训练强模型需要大量采样,成本高昂。Direct-OPD方案在小模型上执行RL,将其策略偏移作为隐式奖励传递给强模型。对比后RL教师与前RL参考的对数比率,为学生模型提供密集监督。实验显示,Direct-OPD将Qwen3-1.7B在AIME 2024上的准确率从48.3%提升至62.4%,仅需8块A100 GPU训练4小时。该方法优于step-matched直接RL,并支持多策略偏移的级联组合。
推荐理由:用弱模型训练强模型,Qwen3-1.7B在AIME 2024从48.3%飙到62.4%,只花4小时8卡A100。比直接RL还省,值得试试。
7月3日
11:54
11:54官方账号arXiv cs.AI@Wentao Zhang, Liliana Hotsko, Woojeong Kim, Pengyu Nie, Stuart Shieber, Yuntian Deng
精选
PAW(Program-as-Weights)提出一种模糊函数编程范式,将自然语言规范编译为紧凑的本地可执行神经构件。一个4B编译器在FuzzyBench(1000万示例)上训练,为冻结的0.6B Qwen3解释器生成参数高效适配器。该解释器执行PAW程序,性能匹配直接提示Qwen3-32B,但推理内存仅为其1/50,在MacBook M3上达30 tokens/s。PAW将基础模型从逐输入求解器转变为可复用小工具构建器。
推荐理由:PAW让模糊函数(如日志告警、修复JSON)不再依赖大模型API。用4B编译器一次编译,0.6B小模型就能跑出32B的效果,还省内存和算力。