这篇论文提出了CSFS方法,能在不牺牲预测精度的情况下减少21%的计算成本,适合做风电和太阳能预测的朋友参考。
这篇论文用Terminal-Bench 2.0测试三种Agent优化方法,发现只有RELAI-VCL能持续累积提升,终身平均76.4%远超其他。做智能体持续学习的人必看。
想测试数学推理模型是真会思考还是靠蒙?这个挑战赛提供了新基准和资源,帮你判断模型的鲁棒性。
这篇论文搞了个 AgentHOI,不用训练数据就能做开放世界的人-物交互检测,靠多模态大模型推理,效果还比有监督方法好。
这篇论文讲怎么解决图数据里类别不平衡的问题,NodeImport能动态挑出重要节点,不用重新生成太多假数据,效果还比现有方法好。做图神经网络、节点分类的可以看看方法细节。
这篇论文解决了AI agent过度读取文件的问题,E3方法能自动判断任务简单就少干活,在MSE-Bench上省了85%成本,效果很实在。
这个研究用DiffusionGemma做语音识别,并行解码8步就达到6.6%错误率,只训练了0.16%的参数,挺高效的。
TerraZero 用程序化模拟+零演示强化学习搞定了自动驾驶长尾场景,跑得巨快,还拿了 InterPlan 和 Waymo 的 SOTA,你不想看看怎么做到的?
这篇论文给做游戏AI的同行提供了一个很实用的优化思路:不用固定分配计算资源,而是根据搜索情况动态调整,实测对三个桌游都有明显提升。
这篇论文深挖了一个漏洞:计划评估器可能因为计划含糊就给高分。他们用数学证明并在26条路线上验证了。搞LLM安全或评估的值得一读。
想要自动生成带精确几何图形的数学题?FormalAnalyticGeo 用 CDL 形式语言和 SDF 渲染,造出了 7000+ 带标注的解析几何题目,误差不到 1%。
这篇论文用严格安慰剂对照方法戳穿了代码模型自修复的假设,在0.5-1.5B模型上实测发现错误内容并没带来明显改善,想了解模型能力边界可以看看。
越南语推荐研究缺数据?ViHoRec 提供了 18K 条跨平台高质量交互,还附带了冷启动基准,方便你对比模型在稀疏场景下的表现。
这篇论文提出EcoSpec,在DeepSeek-V3.1等MoE模型上通过成本感知投机解码最高提速1.62倍,值得关注。
这篇论文告诉你:给代码自动取名时,先写摘要再命名比直接硬猜更靠谱。他们用DeepSeek做评估,效果比传统指标好十倍。
想测AI的记忆系统到底靠不靠谱?这个新基准MemOps把记忆拆成6种操作来测,比只看最终答案准多了,搞记忆研究的必读。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。