论文
arXiv 与期刊里的 AI 论文,每篇附中文摘要与推荐理由 · 2438 篇
9月23日
Growing Harness:把重复控制逻辑从模型上下文挪进代码
这篇论文教你让 harness 自己从失败里长出控制代码,省掉七到九成 LLM 调用,4B 小模型也能跑 WebArena,做 agent 工程的值得细看。
随机对照实验:Figma Make 让设计任务提速约 20%
这篇对照实验实测了 Figma Make 到底省不省时间:50 个设计师加 50 个产品经理做同样任务,用的人快 20%,产品经理提升最明显。
MAVP 框架用地图锚定提升移动操作机器人任务成功率
机器人移动操作总因底盘跑偏而失败?这篇论文让策略直接预测地图坐标系下的底盘目标位姿再用定位反馈去跟踪,6 个真实任务成功率全赢速度控制,做具身智能的可以看看。
GitScholar 数据集:用 GitHub 活跃度预测 AI 论文影响力
华为团队把 44 万个 GitHub 仓库和 55 万篇 arXiv 论文连起来,发现星标等信号能提前判断哪篇论文会火,精度提升 12%,数据集免费下载。
PACT 论文:对齐 critic 与策略,提升 LLM 强化学习训练效果
一篇把 LLM 强化学习里 credit assignment 讲清楚的论文,PACT 训练后在数学推理上比 GRPO 高 8.8 个点,搞 RL 后训练的值得看看推导。
CompKV:补偿感知的稀疏注意力框架,长上下文推理最高提速 6.85 倍
一篇新论文 CompKV,重新设计了稀疏注意力里的 token 选择逻辑,长上下文推理自注意力最高快 6.85 倍,做推理优化的可以看看。
FIRE 运行时策略让 Agent 重复成功率最高提升 9.2 个百分点
一篇很实用的论文:不改模型、不改提示词,只在运行时注入失败 informed 的策略指令,GPT-5.6 跑 Terminal-Bench 的重复成功率就能涨近 10 个点,做 Agent 的可以看看。
EMERGE:首个SE(3)等变图扩散模型实现分辨率无关点云生成
一个做 3D 点云生成的新扩散架构 EMERGE,用图神经网络替代常规网格化管线,一次训练就能在任意分辨率零样本出结果,做 3D 生成的话可以看看这篇。
9月22日
Google Research提出RRSI:给智能体harness递归自我改进加正则化
Google开源了RRSI:给自动进化智能体harness的方法加正则化,分布外基准还能涨4.7分,还省30%的token。