做仓库级代码生成的可以看看这篇:FeatLens 用功能索引建图再检索,比全仓库图方法省六成节点、四成多 token,检索还不用调 LLM。
论文
这篇论文教你让 harness 自己从失败里长出控制代码,省掉七到九成 LLM 调用,4B 小模型也能跑 WebArena,做 agent 工程的值得细看。
这篇对照实验实测了 Figma Make 到底省不省时间:50 个设计师加 50 个产品经理做同样任务,用的人快 20%,产品经理提升最明显。
这篇讲了怎么把智能体跑长任务的 token 开销砍一半,方法只有一条:压缩只删不改,还开源了能在 Claude Code 里直接用的实现。
一篇很实在的论文:作者发现长文档检索差的真正元凶是近处无关文字抢注意力,给出 LYRA 方法外加 ProxBench 基准,做了 RAG 的话值得看他们的实验数据。
量化到 2-bit 后模型做数学题会发疯循环?这篇论文用 on-policy 蒸馏把 MATH-500 保留率从 35% 拉到 70%,做端侧部署的可以看看。
标注预算不够又想评估策略?这篇 arXiv 论文告诉你怎么分配人工标注最省钱,RMSE 能降一半以上。
研究 grokking 为什么突然泛化的论文,理论算出 grokking 时间由学习率乘 weight decay 决定,还用上千个网络验证了,做可解释性的可以看看。
数据集成领域的新论文,LOKI 能自动从文本里发现不同表之间的行级关联,精度 0.982,比直接调 LLM 便宜 40 倍,做数据湖的可以看看。
一篇挺有意思的论文:同样的模型和提示,BF16 和 FP16 居然输出不一样,作者还给出了低于 4% 延迟开销的修复方法。
机器人移动操作总因底盘跑偏而失败?这篇论文让策略直接预测地图坐标系下的底盘目标位姿再用定位反馈去跟踪,6 个真实任务成功率全赢速度控制,做具身智能的可以看看。
华为团队把 44 万个 GitHub 仓库和 55 万篇 arXiv 论文连起来,发现星标等信号能提前判断哪篇论文会火,精度提升 12%,数据集免费下载。
一篇把 LLM 强化学习里 credit assignment 讲清楚的论文,PACT 训练后在数学推理上比 GRPO 高 8.8 个点,搞 RL 后训练的值得看看推导。
一篇新论文 CompKV,重新设计了稀疏注意力里的 token 选择逻辑,长上下文推理自注意力最高快 6.85 倍,做推理优化的可以看看。
一篇很实用的论文:不改模型、不改提示词,只在运行时注入失败 informed 的策略指令,GPT-5.6 跑 Terminal-Bench 的重复成功率就能涨近 10 个点,做 Agent 的可以看看。
一个做 3D 点云生成的新扩散架构 EMERGE,用图神经网络替代常规网格化管线,一次训练就能在任意分辨率零样本出结果,做 3D 生成的话可以看看这篇。