论文提出了三个新指标,能清楚区分提取式和抽象式摘要,还能帮你发现幻觉问题,比ROUGE更深入。
多跳问答里选答案总是被多条轨迹搞晕?STEC用证据压缩把问题简化为候选级比较,四个基准上全面领先,值得读。
想在心电图分类上搞轻量化部署?LSTrans用知识蒸馏和低秩适配把大模型压缩到可穿戴设备上跑,基准测试上内存和速度都优化了。
论文用实验告诉你,4比特量化的LLM最靠谱,比8比特还稳,想省资源又想要可靠性可以照这个选。
想在不重训模型的情况下让扩散模型生成更多样化的结果?这篇论文给出了一个简单有效的技巧:温度采样配合时间偏移,在DiT、Stable Diffusion上都有效果。
这篇论文提出了一种更聪明的掩码方法,解决了PPO和DPPO在方向判断上的不一致,让LLM强化学习训练更稳定高效。
这篇论文用实验告诉你,深的世界模型在滚动预测时不一定管用——在DeepMind Control的9个任务里,有2个反而是早退浅层更好,而且原因竟然出在训练方式上。搞模型规划的值得看看。
GRADE用17B参数在MMLUPro上以一半计算量超基线4.8分,靠四个门控路由动态调深度,很实用。
这篇论文找到了一个用LLM做观点摘要的新路子,能省下不少token,还能保留不同人的真实观点,比常规摘要方法更靠谱。
这篇论文用图神经网络把RFID信号变成空间地图,能预测物体移动轨迹,比单纯定位更聪明,室内导航和机器人适用。
这篇论文的DSI方法用多检查点集成来稳定尾部风险估计,实验效果比单检查点好不少,搞金融风控的值得一看。
这篇理论论文首次给出了OGD+Projection算法在高维约束优化中违反约束的下界,搞在线凸优化的人可以看看。
这篇论文把OPSD训练时模型思维崩溃的原因和解决方法都讲清楚了,AD-OPSD在数学题上能提4个点,做推理优化的值得看看。
这篇论文把GNN在数据分布变了之后到底准不准、慌不慌讲透了,还给出了一个不用标签的校准方法STAC,做图模型部署的值得一看。
这篇论文提出了WAG方法,能精准定位LLM中那些一旦改动就会崩掉的关键参数,比传统重要性指标更灵敏,还顺手解决了专家分配、遗忘、量化等实际问题。
这篇论文用Claude Code和OpenAI Codex CLI做对比实验发现,多数情况下只让AI用代码执行工具反而更便宜,还不影响成功率。只有Claude在SWE-bench上略贵一点点。想省API成本可以看看。
这篇论文很有意思,告诉你Claude Fable 5在医学难题上不是不会答,而是经常拒绝回答。一旦它愿意回答,准确率反而是最高的。如果你想了解模型的安全边界和真实能力,值得看看。
这篇论文发现了一个反直觉的安全盲区:就算删掉所有危险操作,合成训练数据里藏着的“坏心眼”还是会传递到模型身上。做智能体安全的人必看。
这篇论文把深度高斯过程自然地拓展到有向无环图,理论证明很漂亮,而且在蛋白网络和重离子碰撞模拟上跑赢了现有方法,值得搞因果建模或不确定性量化的朋友细读。
这篇论文系统梳理了LLM在芯片前端设计中的应用,从HDL生成到设计空间探索,还介绍了OpenClaw等代理AI方案,适合关注EDA与AI结合的读者。
用熵约束让机器学习模拟燃烧既准又快,计算省10倍多,还能用旧数据预测新工况。
这篇论文在RTRMC基础上加入图正则化,处理行列关联强的数据时补全更准,做推荐系统或图像修复的值得一看。
这篇论文发现VLM其实知道个数但说不准,用内部探测+自纠正就能白嫖15%精度提升,不调参数,挺实用。
这篇论文发现,把文档当图片直接预训练,比先转成纯文本再训练效果更好,感兴趣的可以看看实验细节。
这篇论文用新数据集CSB系统地测了十年间视觉语言模型的进化,发现最新模型在复杂社交场景上已经跟人类顶级描述差不多准了,只有空间依赖错误还没完全解决。
用LLM代理自动挖IoT漏洞,成功率95%,两分钟一个攻击,省时省力。
想验证AI解释的可信度?ConceptSMILE能审计概念级解释的可靠性,MedSAM和VLM在不同维度各有优劣,论文给出了量化证据。
想用机器验证量子编码定理?Lean-QIT在Lean 4里搭好了整套框架,连HSW定理都形式化了,做量子信息形式化研究的朋友可以复用。
这篇论文把4D雷达和相机融合做到360度检测+占用预测,用状态推理串起两个任务,还搞了个新数据集和评估协议。
他们用GPT-4.1-mini和GPT-4.1做两个不同任务,靠置信度校准和数值推理拿了QANTA 2026最高分0.402,不是靠堆模型而是靠策略。
想提升LLM Agent推理效率?Agora用拍卖机制动态分配任务给专家模型,在五个基准上都比传统路由强,还能平衡成本和效果。
这篇论文给预训练的动作分块变换器加了强化学习后训练,在工业精密操作任务上峰值力降了46倍,适合做实时控制的人看。
这篇论文给了一套为智能体AI系统定风险等级的方法,有十二个打分维度,还专门考虑了编程助手场景,做AI治理的可以看看。
这篇论文把知识图谱和可解释AI怎么配合讲清楚了,还给出了四种具体集成模式,干城市矿产评估的可以看看。
这篇论文用图网络和概念特征来分析八种语言里的习语,发现它们按语义模式聚类而不是语言,还能用LLM自动标注,对做跨语言NLP和理解习语很有用。
这篇论文给投资组合优化问题搞了一套新的进化算法方案,收敛快结果好,做量化研究的可以看看。
这篇论文提出了TCLA方法,不用训练就能让医学VLMs适应新数据,1-shot下效果比现有训练方法还好,很实用。
这篇论文明确提出当前AI在真正开放创新上的两个瓶颈,不是堆能力就能解决的。搞AI研究和产品的人都该看看这个分析。
这篇论文提出了SAGEAgent,它能像医生一样判断该给病人做哪些检查,在几乎不掉准确率的前提下把检查负担砍掉一半多,挺实用的。
这篇论文用实测数据告诉你,在边缘设备上跑视觉大模型,最费电的不是看图片,而是生成文字。想省电?让它少说。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。