这篇理论论文把 Dikin walk 采样的混合时间从 $d^{2.5}$ 降到了 $d^{2.25}$,离理论下界 $d^{2}$ 更近了,搞采样理论的同学可以关注。
这篇论文教你用无监督聚类自动分析心脏PET/MRI,在99名患者上准确匹配医生判断,省时省力。
VAIOM 是专门处理金融连续数据的解码器模型,在汇率数据上比 LightGBM 强 0.03 比特以上,创新点是把连续输入和离散输出分开建模,值得做时序预测的人一看。
这篇论文搞了个P-EVAL框架来评估农业AI的安全性,Pezego-HITL架构在加纳测试,延迟降了55%,还挺靠谱的。
这篇论文用STOCKTAKE基准把LLM智能体的‘没看懂’和‘看懂了却没行动’分开了,四个主流模型的表现差距比想象中大。
这个新方法挺聪明,用高维空间特性优化注意力计算,在GLM 5.2上实测提速1.2倍还省内存。
这篇论文提出 Deep Interaction,让你可以直接改推理步骤的错误,不用推倒重来。实验说 STEM 任务上纠错成功率涨 25%,token 还省 40%,挺实用的方法。
这篇论文把RAG和量规评分用在地震教育里,还搭了乐高机器人,让小学生边玩边学安全知识,挺实际的新方法。
这个框架把AI用在职业培训全流程,5个阶段都提速,已经帮人通过NVIDIA认证考试,还有美国会计委员会背书,挺靠谱。
满文OCR因为书写风格多变很难做,这篇论文用了个巧妙的办法:训练几个专家模型再加个路由分类器,哪个风格用哪个专家,精确到0.3%的错误率。挺实用的思路。
这篇论文用两千多个仓库的真实数据告诉你,小项目反而更爱用AI写代码,但整体上大家用得还不多。想了解实际项目怎么管AI贡献的可以看看。
这篇论文提出了CSFS方法,能在不牺牲预测精度的情况下减少21%的计算成本,适合做风电和太阳能预测的朋友参考。
想搞懂Transformer为什么深了还能训练?这篇从秩角度拆解跳接、归一化、双矩阵的设计逻辑,比堆实验更透彻。
这篇重新定义了AI渗透测试,从入侵系统变成操纵行为,提示注入、数据投毒都算,还给了具体测试步骤和案例,搞AI安全可以看看。
这篇论文用Terminal-Bench 2.0测试三种Agent优化方法,发现只有RELAI-VCL能持续累积提升,终身平均76.4%远超其他。做智能体持续学习的人必看。
这篇论文提出了衡量AI智能体忠诚度的新模型DVM-HALL和评分NHAS,专门针对自主商业和DeFi场景,值得研究参考。
这篇论文用原子动作来编舞,比直接生成连续动作更可控,效果也更自然,做AI舞蹈生成可以看看。
HealthClaw能记住你的健康习惯和变化,测试中准确率从0.2%飙到45.7%,还更保护隐私,开源可用。
这篇论文让编译器在AI写Rust代码时实时纠错,而不是写完再报错,对写复杂项目特别有用。
这篇论文用数学证明加更多验证门不如换不同模型或模态,部分相关会让可靠性提升远不如预期。
想测试数学推理模型是真会思考还是靠蒙?这个挑战赛提供了新基准和资源,帮你判断模型的鲁棒性。
这篇论文用图匹配让智能体一次纠正错误,不用反复试错,在ALFWorld和ScienceWorld上效果比现有方法更好。
这篇论文搞了个 AgentHOI,不用训练数据就能做开放世界的人-物交互检测,靠多模态大模型推理,效果还比有监督方法好。
德国公司怎么用AI管人?这篇论文用410份样本告诉你,效率是主因,战略潜力还有待挖掘。
这篇论文讲怎么解决图数据里类别不平衡的问题,NodeImport能动态挑出重要节点,不用重新生成太多假数据,效果还比现有方法好。做图神经网络、节点分类的可以看看方法细节。
这篇论文解决了AI agent过度读取文件的问题,E3方法能自动判断任务简单就少干活,在MSE-Bench上省了85%成本,效果很实在。
手机上跑智能体不用再模拟点击了,PalmClaw直接调用摄像头、传感器等设备功能,速度快94%,值得试试。
这个研究用DiffusionGemma做语音识别,并行解码8步就达到6.6%错误率,只训练了0.16%的参数,挺高效的。
这篇论文用多球碰撞实验揭示了视频扩散模型做因果推理时的短板,增加去噪步数没用,但自回归和加深网络有效。对做视频生成和物理模拟的人很有启发。
TerraZero 用程序化模拟+零演示强化学习搞定了自动驾驶长尾场景,跑得巨快,还拿了 InterPlan 和 Waymo 的 SOTA,你不想看看怎么做到的?
这篇论文澄清了一个常见误解:别拿频谱指标来判断加上下文有没有用。作者给出了新诊断方法,实验做得扎实。
这篇论文用信息论精确测量了水印取样的代价:归属N个用户需要多少个token,提取载荷需要多少,并在GPT-2等模型上验证了理论预测。
处理非高斯多模态观测数据?试试这篇的EnCF方法,比传统卡尔曼滤波灵活。
这篇论文用具体模型和实验告诉你,哪些深度模型在光伏功率预测里更扛NWP天气误差,不是空谈。
这篇论文提出了LatentFlow,一个无需训练就能对随机过程做条件采样的框架,比传统方法快得多,还适用各种过程类型,值得一看。
这篇论文给做游戏AI的同行提供了一个很实用的优化思路:不用固定分配计算资源,而是根据搜索情况动态调整,实测对三个桌游都有明显提升。
这篇论文深挖了一个漏洞:计划评估器可能因为计划含糊就给高分。他们用数学证明并在26条路线上验证了。搞LLM安全或评估的值得一读。
这篇论文用因果干预把LLM的内部报告拆解成抵抗压力和更新证据两个维度,在测试中做到满分,比一般对齐方法更扎实。
想要自动生成带精确几何图形的数学题?FormalAnalyticGeo 用 CDL 形式语言和 SDF 渲染,造出了 7000+ 带标注的解析几何题目,误差不到 1%。
这篇论文用严格安慰剂对照方法戳穿了代码模型自修复的假设,在0.5-1.5B模型上实测发现错误内容并没带来明显改善,想了解模型能力边界可以看看。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。