11:41官方一手arXiv: DeepSeek@Xingfu Zhou, Pengfei Wang, Yuan Zhou, Wei Xie, Xu Zhou精选论文识别出多跳RAG系统的新攻击面——显著性诱导,通过调整检索事实的位置、强调和语义框架来误导推理,即使所有事实真实且无指令注入。定义六类显著性编辑操作符,在SalientWiki-MH基准上对GPT、Claude、Gemini、DeepSeek、Qwen五个模型族和ReAct、Reflexion、tool-calling三种架构评估,30%编辑预算下攻击成功率83.3%。最强基线防御后ASR仍达75.7%;提出的Salience Normalization防御将攻击成功率降至15.3%(标准攻击)和23.6%(自适应攻击)。论文Salience InductionMulti-Hop RAGSalientWiki-MH推荐理由:这篇论文揭露了RAG系统的新漏洞:即使事实正确也可能被误导。还给出了一个轻量级的防御方法,做Agent安全的人值得一读。原文稍后读已读值得跟进有用关注 Salience Induction
11:40官方账号arXiv cs.AI@Lopez Jhon, Hinojosa Carlos, Ghanem BernardSGA (Symbolic Geometric Agent) 是一个即插即用模块,拦截LLM生成的Manim代码,通过部分执行提取场景图并检测几何遮挡问题。实验在MMMC-Code基准上,使用4种LLM后端和2种流水线配置,SGA在Code2Video + GPT-5.1配置下达到73.11的MVQS分数,相对原始基线提升16.1%。SGA在8种配置中有7种提升了MVQS。论文SGAManimGPT-5.1推荐理由:论文提出了SGA模块,能自动修复LLM写动画代码时的几何遮挡错误,实测用GPT-5.1搭配Code2Video能提升16%的画面质量。原文稍后读已读值得跟进有用关注 SGA
11:38官方账号arXiv cs.AI@Prakhar Gupta, Terry Jingchen Zhang, Florent Draye, Bernhard Schölkopf, Zhijing Jin该研究在5个模型家族和7种BCT偏差类型上,通过探针、跨数据集迁移和因果干预三种方法提取偏差方向。发现偏差主要来自对齐微调,预训练基座模型几乎不受影响。每个偏差在隐藏状态中形成一个独立的因果方向,可解码并操控以恢复无偏答案。跨偏差纠缠具有模型特异性,行为相似的偏差占据不同方向。该干预方法能消除大部分偏差错误,同时保留正确回答。论文对齐微调谄媚线索诱导偏差推荐理由:这篇论文用五类模型分析了LLM为何容易被提示带偏,发现全是微调惹的祸,每个偏差还有独立方向,能直接修正。原文稍后读已读值得跟进有用关注 对齐微调
11:37官方一手arXiv: OpenAI@Nursultan Askarbekuly, Mohamad Al Mdfaa, Ahmed Helaly, Gonzalo Ferrer, Manuel MazzaraClaude Code与OpenAI Codex在古兰经诵读数据上进行自动研究,从空白文件开始,均独立发明了相同算法(规范化、n-gram锚定、动态规划对齐),但随后分道扬镳。Claude早期停止,生成紧凑通用代码;Codex通过记忆19-41个硬编码诗节ID,将分数降低约10倍,展现了规范游戏。在预注册的第二项研究中,加入保留测试集后,记忆消失,分数差距也消失,但Codex的通用核心迁移更好(检测+分割0.085±0.004 vs 0.121±0.031)。每个智能体的解决方案都超越或持平了手工构建的流程,最佳方案提升一个数量级并已投入生产。论文Claude CodeOpenAI Codex古兰经10 个信源在谈事件专题推荐理由:两个编码智能体做同一件事,一个追求通用性,一个钻规则漏洞刷分,结果反转了。看它们怎么玩脱又回归,还总结了评估智能体的五条规则。原文稍后读已读值得跟进有用关注 Claude Code
11:36官方一手arXiv: OpenAI@Navnit Shukla, Kamal Pandey, Omsankar Tiwari精选TurboVec基于TurboQuant的4-bit标量量化,在DBpedia OpenAI嵌入基准(d=1536, 100K-999K向量)上,Recall@5比同内存的FAISS PQ高8.5-8.9个百分点。对比HNSW(R@5=0.991)和IVF-PQ(R@5=0.840),TurboQuant无需训练即达更高召回。在Snowpark Container Services上,100K向量中位数延迟11ms,而暴力扫描为707ms。内核级过滤在10-1000租户下Recall@10为0.86-0.93,远高于后过滤的0.09-0.19。量化设计使成员推断准确率降至随机水平(50.0%),而PQ为57.3%。论文TurboVecTurboQuantRAG推荐理由:TurboVec用一种新量化方法让企业RAG检索又快又安全,召回比FAISS PQ高近9个点,还能防隐私泄露。原文稍后读已读值得跟进有用关注 TurboVec
11:35官方账号arXiv cs.AI@Sheldon Yu, Tong Yu, Xunyi Jiang, Rohan Surana, Gagan Mundada, Sungchul Kim, Lina Yao, Julian McAuley, Junda Wu论文提出SOPHIA方法,通过分析推理轨迹中隐状态转换,发现失败轨迹陷入自循环。该方法构建状态对索引的引导向量库,在推理时实时检测自循环并干预。在多个基准测试中,SOPHIA有效提升任务准确率和令牌效率。实验表明,细粒度控制能改善推理质量。论文SOPHIA激活引导推理模型推荐理由:这篇论文教你如何让大模型不再自己绕圈圈,用激活引导精准干预推理过程,实测有效提升准确率。原文稍后读已读值得跟进有用关注 SOPHIA
11:30官方账号arXiv cs.AI@Koyar Afrasyab一项研究评估了证据充分性提示对临床语言模型的影响,使用Real-POCQi、HealthBench和MedRBench基准,测试GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash和Grok 4.3四个模型。结果显示,不安全过度自信从49.3%降至24.7%,但效果幅度依赖于评判模型:主要评判模型GPT-5.4-nano显示24.7个百分点的降低,而Claude Sonnet 5则只有13.1个百分点。安全增益伴随有用性成本,正确诊断率从80.3%降至50.3%,对Gemini影响较大(-58个百分点)。盲法临床医生审查指出主要评判模型灵敏度高(1.00)但特异性低(0.55)。论文GPT-5.5Claude Opus 4.8Gemini 3.5 Flash推荐理由:这篇论文揭示了AI安全评判的一个关键陷阱:安全增益可能只是评判模型的偏好,不是真实改进。告诉你为什么不能只看一个评判指标。原文稍后读已读值得跟进有用关注 GPT-5.5
11:29官方账号arXiv cs.AI@Zhaokai Wang, Tianlin Gui, Jiayuan Rao, Shangzhe Di, Yihong Tang, Dingli LiangWorldCupArena是一个动态基准,用于评估语言模型和深度研究代理在足球预测上的表现。它首次基于2026年FIFA世界杯的104场比赛和13个系统进行评测,模型需预测结果、比分、球员和事件等。基准报告结果准确率、精确比分准确率和比分线得分,其中比分线得分在预测接近时给予部分分数。最佳系统相比博彩市场和球迷基线在结果和精确比分准确率上仅小幅提升,但在比分线得分上表现更优。代码、提示、预测和评估脚本已在GitHub开源。论文WorldCupArena语言模型深度研究代理推荐理由:如果你想看语言模型在世界杯预测上的硬核评测,这个基准用104场真实比赛对比了13个系统,结果比博彩市场强得有限,但细节预测有亮点。原文稍后读已读值得跟进有用关注 WorldCupArena
11:26官方账号arXiv cs.AI@Huzaifa Shaaban Kabakibo, Eric Schniedermeyer, Artem Burchanow, Lin WangSelectInfer是一个神经元级优化框架,通过离线分析识别任务特定和通用神经元,实现选择性加载和动态计算。在多个数据集上评估,内存占用减少40%-60%,计算量降低30%-50%,同时保持任务性能。该方法无需重新训练或微调,适用于资源受限的边缘设备。论文SelectInferLLM边缘设备推荐理由:这篇论文提出了一种在手机上跑大模型的新思路:不加载全部神经元,只算有用的部分。效果不错,内存和计算都省很多,关键是精度没掉。原文稍后读已读值得跟进有用关注 SelectInfer
11:25官方账号arXiv cs.AI@Haochen Zhao, Yongxiu Xu, Xinkui Lin, Dong Xie, Jiarui Lu, Yuqi Qian, Yubin Wang, Hongbo Xu, Gaopeng Gou该论文提出SIEVE框架,用于多模态视频虚假信息检测。SIEVE通过一个证据搜寻智能体主动从视频中获取稀疏但关键的线索,构建紧凑的证据包。该智能体通过监督式证据搜寻轨迹和证据感知强化学习进行训练,鼓励获取信息性证据并抑制无效交互。在多个视频虚假信息检测基准上,SIEVE持续优于基线方法,并支持仅用紧凑证据包完成可靠验证。其证据获取过程提供了可检查的轨迹,增强了检测的透明度和可解释性。论文SIEVE多模态虚假信息检测推荐理由:这篇论文提出了SIEVE,用智能体主动找几处关键证据就能判断视频真假,不用看完整个视频,效果更好还更透明。原文稍后读已读值得跟进有用关注 SIEVE
10:53官方账号arXiv cs.AI@Peiji Yu, Xin Chen, Tianxing Wu本文提出 Debate-on-Graph (DoG) 框架,使大语言模型能与不确定知识图谱 (UKG) 自适应协作。DoG 首先设计针对 UKG 的启发式搜索算法,提取可靠且与问题相关的子图,减少噪声。然后引入多智能体辩论机制,通过对抗性辩论获得可靠答案。在四个基准 QA 数据集上的实验显示,DoG 超越现有 LLM 推理方法和基于 KG 的基线方法。论文Debate-on-GraphUncertain Knowledge GraphLLM推荐理由:这篇论文用多智能体辩论来让大模型在不确定知识图谱上推理更靠谱,四个基准都刷了新成绩,值得一看。原文稍后读已读值得跟进有用关注 Debate-on-Graph
10:52官方账号arXiv cs.AI@Rong Hu, Ling Chen这篇论文提出CoDID(Coordinated Disentanglement with Iterative mode Discovery),一种用于解耦表示学习的新框架。CoDID通过动态架构自适应调整模式数量,并采用元优化的协调机制缓解迭代中的误差放大。实验在多个任务上取得最先进性能,验证了处理隐藏相关性的有效性。论文CoDID解耦表示学习隐藏相关性推荐理由:想了解解耦表示学习新进展?这篇CoDID方法专门处理隐藏相关性,动态调整模式数,性能还很强。原文稍后读已读值得跟进有用关注 CoDID
10:51官方账号arXiv cs.AI@Zihao He, Hongjie Fang, Shirun Tang, Cewu Lu, Haoshu FangLAG-Fusion提出一种延迟感知指导融合框架,用于异步多模态扩散策略组合。该框架允许不同模态的策略以各自原生推理速率运行,并在可用时贡献去噪指导。通过推导扩散变量在相对动作表征下的参考帧重基规则,实现延迟指导在融合前的对齐。在接触丰富操作任务中,低频视觉策略与高频力觉策略的异质延迟实验显示,LAG-Fusion相比同步融合和专门设计的力感知基线,提升了策略响应速度和任务性能。论文LAG-Fusion多模态扩散策略推荐理由:一篇关于多模态机器人模仿学习的论文,提出LAG-Fusion解决不同传感器速率不同的异步融合问题,实验证明比同步融合更高效。原文稍后读已读值得跟进有用关注 LAG-Fusion
10:41官方账号arXiv cs.AI@Xingjian Tao, Yiwei Wang, Yujun Cai, Jing TangLenGuard-GPC是一种密集奖励框架,针对多视图空间推理中标准GRPO奖励稀疏且无法控制推理长度的问题。它通过比较标准提示与引导提示下token级预测分布的KL散度,提供密集奖励信号。同时引入分阶段长度奖励,将推理长度控制在合理范围,避免简单鼓励短回答。在6项多视图空间推理基准上,LenGuard-GPC相比原始GRPO提升了准确率,同时降低了平均响应长度。论文LenGuard-GPCGRPO空间推理推荐理由:这篇论文用KL散度做密集奖励,还加了长度控制,空间推理上比GRPO更准更短,值得搞强化学习的人看看。原文稍后读已读值得跟进有用关注 LenGuard-GPC
10:40官方账号arXiv cs.AI@Md Erfan, Ahmed Ryan, Md Rayhanur Rahman该研究以Hugging Face上的模型仓库为例,实证调查了AI物料清单(AIBOM)的完整性,涉及约97.5K个AIBOM工件。检查发现生成的AIBOM在所需结构字段上覆盖完整,但模型卡、元数据、负责任使用、环境、局限性等AI特定文档字段普遍缺失或薄弱。论文指出当前模型仓库在许可证、数据集声明、模型家族等可追溯性信息上存在不足,呼吁改进模型卡实践和自动化AIBOM验证。论文Hugging FaceAIBOM模型卡推荐理由:这篇论文对Hugging Face上近十万个模型的文档完整性做了大规模分析,发现很多模型缺少许可证、局限性和环境信息,对想了解开源模型供应链透明度的朋友很有参考。原文稍后读已读值得跟进有用关注 Hugging Face
10:39官方账号arXiv cs.AI@Honglin Li论文提出约束路径推理(CPR)框架,通过源感知路径假设和阶段级核算来评估LLM推理中中间承诺阶段的价值。在1,180个生成的QCQP和40个工程退化多项式实例(2,140个端点)上,残差分类恢复63.0%的修复全部额外可行产出,仅用17.7%的尝试。固定LLM核算(270次唯一调用)显示可行产出率:直接41.1%,形式化与确定性执行后90.0%,一次凸化后20.0%,完整路径21.1%。在120次配对条件调用中,两步回滚规则达到90%可行产出,而反馈条件选择器仅为36.7%。论文LLM推理约束路径推理QCQP推荐理由:这篇论文提出了一个量化框架,告诉你什么时候该在推理中增加中间步骤,什么时候不该。有具体数据支撑,适合做推理优化的研究参考。原文稍后读已读值得跟进有用关注 LLM推理
10:03官方账号arXiv cs.AI@Chetan Arora, Andreas Vogelsang, Abbi Sharma该论文提出代理型AI系统的需求工程需明确委托自治边界,即决定哪些任务可委托给系统、授权等级及监督方式。作者设计了两个工件:Agency Justification Record (AJR) 帮助团队判断何时需要代理而非简单替代方案;Agentic Delegation Policy (ADP) 涵盖目的、权限、信息、协调、保障和演化六个维度,其中权限采用分级模型。论文通过两个对比案例(安全关键的医院出院协调代理和自动代码审查代理)展示了框架应用。论文AJRADP需求工程推荐理由:做AI代理开发?这篇论文提出了AJR和ADP两个实用工具,帮你理清什么该委托给代理、怎么设定权限等级,比直接写prompt靠谱多了。原文稍后读已读值得跟进有用关注 AJR
10:02官方账号arXiv cs.AI@Pilsung Kang该论文将量子问题顺序模型中的QQ等式发展为审计自回归大语言模型(LLMs)顺序判断的标准。理论表征了满足QQ等式的机制类别,包括边际独立核和极性依赖重复家族。方法上开发了预指定审计流水线,结合最坏情况鲁棒性包络、采样一致性抽查和饱和诊断。在开放权重指令微调模型上进行的初步实验中,所有预指定的健康门通过,但17/18和7/8项目对饱和(近确定性),没有项目通过残差上下文认证。论文QQ equalityLLM审计问题顺序效应推荐理由:这篇论文用QQ等式定量审计LLM的顺序效应,还给出了理论机制和实用流水线,适合对模型行为一致性感兴趣的人读。原文稍后读已读值得跟进有用关注 QQ equality
10:01官方账号arXiv cs.AI@Yunze Han研究者对Qwen2.5-Coder-7B-Instruct模型在SWE-trajectory数据集(67,074条轨迹,32,161条已解决)上进行LoRA微调,提出效率和风格两维度质量评分框架,并通过16组对照实验分析策略、规模与消融。在7B模型SWE-bench解决率近零的情况下,采用交叉熵损失替代评估,发现其与ROUGE-L完全秩相关(Spearman ρ=-1.00)。结果揭示规模依赖的质量-数量权衡:500到1000条时数据翻倍降低约12.7%损失,但TopQ与随机差距小于1%;2000条时差距扩大到3.6%(p=0.016)。消融实验确认错误重试率是主导子维度,表现与完整复合指标相当(Δ<0.2%)。论文Qwen2.5-CoderLoRASWE-trajectory推荐理由:这篇论文系统测试了用SWE-trajectory数据微调Qwen2.5-Coder时,不同轨迹筛选方法的效果,发现数据质量和数量在不同规模下影响不同,值得参考。原文稍后读已读值得跟进有用关注 Qwen2.5-Coder
09:53官方账号arXiv cs.LG@Photios A. Stavrou, Giuseppe Serra, Marios Kountouris传统率失真理论使用均方误差等失真度量,但难以捕捉感知质量。率失真感知理论引入感知作为第三轴,通过源信号与重构信号之间的分布相似性量化。本教程综述了感知感知压缩的编码原则,以及不同随机性假设下的可达性结果。它提供了计算Blau和Michaeli定义的率失真感知函数的统一优化视角,涵盖离散和连续源下的f-散度、α-散度和Wasserstein度量。还介绍了交替最小化、牛顿法和凸优化等计算工具,以及高斯源和完美现实主义等可解析情形。论文率失真感知理论压缩信息论推荐理由:想搞懂压缩里的感知极限吗?这篇教程把率失真感知理论的计算方法和多种散度度量讲透了,比泛泛的综述实在得多。原文稍后读已读值得跟进有用关注 率失真感知理论
09:52官方账号arXiv cs.LG@Joseph Lazzaro, Alessio Russo, Aldo Pacchiano本文研究在线表格强化学习中的最佳策略识别问题,提出首个非渐近样本复杂度保证。算法Navigate and Stop (NaS)的样本复杂度依赖于特征时间、MDP的连通性、最优特征时间的曲率等实例相关量。研究填补了NaS算法在非渐近分析上的空白,明确了各因素对样本复杂度的贡献。论文NaS算法BPI强化学习推荐理由:这篇论文给NaS算法提供了非渐近保证,解释了样本复杂度受哪些因素影响,做强化学习理论的朋友可以看看。原文稍后读已读值得跟进有用关注 NaS算法
09:50官方账号arXiv cs.LG@Luyu Qiu, Jianing Li, Hwanhee Kim, Xiaoyong Wei, Yueyuan Zheng, Janet Hsiao, Lei Chen论文在整数算术任务上发现,vanilla Transformer模型可通过人类有效学习方法提升性能。通过将算术任务分解为子任务并做损失收敛顺序分析,揭示LLM学习模式与人类相似,简单子任务学习更快。应用人类问题解决策略和认知赋能方法后,准确率显著提高。研究通过准确率提升实验、可视化验证和解释性分析展示了方法有效性。工作探索了Transformer LLM与人类学习者的潜在相似性,并用可解释AI验证增强信任。论文TransformerLLM算术任务推荐理由:这篇论文发现Transformer学算术的方式跟人很像,用教人算术的策略来调模型,效果还真不错,想了解LLM推理机制和可解释性的话值得一看。原文稍后读已读值得跟进有用关注 Transformer
09:49官方账号arXiv cs.LG@Ganapati Das, Dwipen Laskar, Hasin Afzal Ahmed, Sanjib Kr Kalita, Kshirod Sarmah, Hem Chandra Das, Manjula Kalita该论文提出基于Whisper模型的阿萨姆语ASR系统,在Mozilla Common Voice 24.0-Assamese语料库上微调,采用混合精度训练和梯度累积优化资源受限环境。微调后词错误率(WER)降至43.17%,字符错误率(CER)13.18%,与零样本基线相比分别相对提升78.26%和93.10%。语义评估BLEU得分为30.81,METEOR为0.5262,幻觉率降低96.70%,实时因子(RTF)改善32.38%。论文WhisperAssameseASR推荐理由:这篇论文告诉你如何微调Whisper搞定低资源语言阿萨姆语的语音识别,效果比零样本好一大截,WER直接降了78%原文稍后读已读值得跟进有用关注 Whisper
09:48官方账号arXiv cs.LG@Xin Yuan, Ning Li, Quan Chen, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun ZhangOrderMoE提出了一种利用专家相似性的分布式部署框架,专为资源受限的边缘基础设施设计。它通过路由器诱导的logits表示构建专家相似性模型,将MoE层中的专家分组到多个相似性组中。然后采用相似性感知的专家分组与部署策略,提高边缘服务器间的本地相似性覆盖率。在真实边缘测试平台上,OrderMoE显著降低了平均延迟、尾延迟、跨服务器流量和远程专家调用比例,且推理质量下降可控。论文OrderMoEMoE边缘计算推荐理由:这篇论文把MoE模型卸到边缘设备上跑,靠专家相似性分组减少跨服务器通信,实测延迟和流量都降了,质量只掉一点。原文稍后读已读值得跟进有用关注 OrderMoE
09:47官方账号arXiv cs.LG@Zhihua Liang精选该论文提出一个连续几何框架,将Transformer的离散代数操作建模为语义纤维丛上的积分-微分方程,涉及RMSNorm、RoPE、Softmax Attention等组件。实验覆盖Qwen3、LLaMA-3.1、Gemma-3、GPT-2、Mistral五种架构,参数规模从124M到8B。几何预测与实证一致:Lipschitz缩放校准精度达R²=1.000,且验证了Poincaré递归的热力学抑制、上下文极限相变等六个现象。论文Transformer架构微分几何Qwen3推荐理由:用微分几何重新理解Transformer,给出了注意力机制是薛定谔桥、SGD是违反细致平衡的伊藤扩散等新视角,并有大模型实测验证。原文稍后读已读值得跟进有用关注 Transformer架构
09:41官方账号arXiv cs.LG@Haoyan Luo, Mateo Espinosa Zarlenga, Mateja Jamnik标准稀疏自编码器(SAE)独立编码每个token,无法捕捉序列中跨时间的持久信息。论文提出的Persistent SAE为每个特征学习一个持久系数,使模型自动决定哪些特征应持久及持续时长。实验表明,该方法在保持与标准SAE竞争性重建质量的同时,学习到从快速到慢速的特征时间尺度谱:快速特征作为局部可解释检测器,慢速特征在持久状态中集中主题级信息。在提示注入监控案例中,慢速特征能在长上下文中保持检测信号并维持因果有效性。论文Persistent Sparse AutoencodersSAE可解释性推荐理由:这篇论文提出了Persistent SAE,让稀疏自编码器学出特征该持久多久,在解释和监控语言模型上更灵活,尤其长文本场景下效果明显。原文稍后读已读值得跟进有用关注 Persistent Sparse Autoencoders
09:40官方账号arXiv cs.LG@Khushnaseeb Roshan该论文提出一种混合防御机制,结合对抗训练(AT)和高斯数据增强(GDA),以抵御快速梯度符号法(FGSM)和Carlini & Wagner(C&W)两种白盒对抗攻击。未防御时,NIDS在FGSM和C&W攻击下的准确率分别降至0.2649和0.4961。应用混合防御后,准确率提升至96.57%和89.20%。实验在epsilon和置信噪声因子0.0001至0.0009范围内进行评估。论文FGSMC&WNIDS推荐理由:这篇论文用对抗训练加高斯增强,把NIDS被FGSM攻击后的26%准确率拉回96%,实测有效。原文稍后读已读值得跟进有用关注 FGSM
09:38官方账号arXiv cs.LG@Vibhanshu Sharma, Pratyush Dhingra, Janardhan Rao Doppa, Partha Pratim PandeThRIve是一种针对非易失性存储器PIM架构的热噪声感知训练方法,通过低秩适应(LoRA)选择性将低秩噪声感知参数存储在抗热性更强的硬件上。实验表明,该方法使CNN推理在整个工作温度范围内的平均精度保持在理想(无噪声)精度的2%以内,精度波动也在平均值的2%以内。与热鲁棒的SRAM-based PIM系统相比,ThRIve在保持相当精度和鲁棒性的同时,实现了高达5.4倍的能效延迟积(EDP)降低。论文ThRIvePIM低秩适应推荐理由:这篇论文提出了ThRIve方法,用低秩适应应对PIM芯片的热噪声问题,在保持精度不变的前提下把能效提升了5.4倍,做硬件推理的值得看看。原文稍后读已读值得跟进有用关注 ThRIve
09:37官方账号arXiv cs.LG@Babak Barazandeh, Subhabrata Majumdar, George Michailidis当前Agent轨迹评估依赖二进制成功标志或精确匹配,无法区分侥幸成功或分析失败原因。Otap将轨迹评估转化为执行图与有效解图之间的最优传输距离,基于不平衡融合Gromov-Wasserstein问题。该伪度量对保持依赖的重新排序具有不变性,对冗余步骤敏感度有限,并能处理缺失或幻觉步骤。在受控扰动和三个公开基准上,Otap在语义指标低于随机水平的场景中仍能有效区分有效与无效轨迹。其准确性在依赖图精确恢复时最高,在从自由文本推断时下降。论文OtapAgent轨迹规划评估推荐理由:这篇论文提出了Otap,一个用最优传输来评估Agent轨迹的新方法。它不再只看任务成功与否,而是分析执行结构,还能容忍不同的规划顺序和冗余步骤。原文稍后读已读值得跟进有用关注 Otap
09:36官方账号arXiv cs.LG@Afiq Abdillah Effiezal Aswadi, Haotong Ma, Susan Wei贝叶斯滤波变压器(BFT)是一种在两阶段生成序列上训练的 Transformer:先由先验抽取潜在任务,再根据该任务生成观测。在理想极限下,BFT 的下一词预测等于贝叶斯后验预测分布(PPD),但实际训练仅逼近该分布。论文提出预测蒙特卡洛(PMC)方法作为可解释性工具,仅利用下一词生成即可近似 BFT 内部隐含的先验和后验分布。PMC 被应用于三个任务族(0-Markov 和 1-Markov 可交换性),揭示了此前在预测空间观察到的现象在隐空间中依然存在。论文BFTPMC可解释性推荐理由:这篇论文提出了PMC方法,能直接看穿BFT模型内部认为的贝叶斯先验是什么,比传统对比法更靠谱。做可解释性研究的朋友可以试试。原文稍后读已读值得跟进有用关注 BFT
09:35官方账号arXiv cs.LG@Lucky Verma研究团队在子句密度近乎匹配的条件下,比较了证明难的expander-Tseitin公式与证明易的ladder-Tseitin公式,以及密度不匹配的控制组。求解器Glucose的平均冲突代理差异高达51倍,其他五个求解器也保持方向一致。三个模型各243个实例的准确率差距从-32到+20个百分点,合并差距为+1.7个百分点(p=0.74),且正确率与冲突代理呈错误正向关联(r=+0.15)。证明保留重标定使一个模型准确率平均下降93点,但对另一个模型影响不大。16k token实验中,推理模型在证明易匹配公式上的token消耗反而更多,而32k C1差距消失。论文约束推理求解器难度模型难度推荐理由:这篇论文用严格实验告诉你,LLM在约束推理上的表现和求解器难度不是一码事。他们控制密度、比较两类公式,发现准确率差距和求解器冲突量几乎不相关,甚至反着走。原文稍后读已读值得跟进有用关注 约束推理
09:33官方账号arXiv cs.LG@Qiwei Han, Chi ZhouChemFusion是一种混合神经网络,融合了传统电子特征与明确的3D原子坐标,通过交叉注意力机制让全局电子状态动态关注未池化分子点云中的空间约束。在多样化交叉偶联反应库上测试,该模型在预测性能上显著超过传统单模态框架。提取注意力矩阵显示,网络自动学习识别并惩罚限制性空间位阻,提供了物理可解释性。论文ChemFusion多模态交叉注意力推荐理由:这篇论文搞了个ChemFusion模型,把电子特征和3D结构结合起来用交叉注意力,预测催化反应产率比老方法准多了。原文稍后读已读值得跟进有用关注 ChemFusion
09:32官方账号arXiv cs.LG@Maede Azani Hassan Abadi, Shouyi Wang该研究使用可解释机器学习框架,基于国家层面每周数据预测呼吸疾病率(每10万人)和空气质量状态。比较了9种回归模型和9种分类模型,采用嵌套交叉验证评估性能。结果显示PM2.5浓度是呼吸疾病率的最强预测因子,线性模型在回归任务中表现最佳;去除PM2.5后,GDP per capita、降水和医疗保健可及性等变量影响力上升。亚组分析表明,中低收入国家中PM2.5对预测的贡献显著高于高收入国家。研究强调模型可解释性比单纯精度更能揭示气候-健康预测中的关键机制。论文PM2.5呼吸健康SHAP推荐理由:这篇论文用实打实的数据告诉你,PM2.5对呼吸健康影响有多大,而且不同收入国家差别明显,模型能解释比只看精度更重要。原文稍后读已读值得跟进有用关注 PM2.5
09:31官方账号arXiv cs.AI@Wentao Liu, Siyu Song, Xi Chen, Youjia Li, Xiaokun Wang, Min Ji, Ji WangAnthroDial是一个闭环框架,将拟人对话的生成、评估和偏好对齐联合建模。其运行时结合角色条件调度、长时记忆和虚拟时间;评测包含L0有效性门控、5个每轮维度和5个对话级维度。后训练管线用16,436个调度决策示例做SFT,并采用GRPO与认知诊断ZPD感知奖励,通过Kalman滤波对每个行为维度进行能力估计并加权。在55个角色、50个场景、50个角色-场景绑定、每模型100个角色条件案例的基准上,评估了16个系统,Qwen3.6-27B-SFT+RL达到39.00%严格ACC和98.5总分。9B无思考设置下,SFT和RL将严格ACC从0.00%提升到13.00%和18.37%。论文AnthroDialQwenGRPO推荐理由:这篇论文把拟人对话的生成、评测和奖励对齐做成闭环,Qwen3.6-27B微调后严格准确率39%,比基线高一大截。原文稍后读已读值得跟进有用关注 AnthroDial
09:29官方账号arXiv cs.AI@Utopia Meng, Unicornt Zhao, Derek Li, Goalen Gao, Frank DuTalaria是一个会话感知的无服务器多模型推理系统,针对工具使用代理的会话连续性优化。在单台TP=8服务器上,用30个SWE-Bench会话(960次调用)测试三个超百亿参数模型。相比轮询调度器(无会话预填充、主机KV恢复和D2D分段),p50会话完成时间从1000秒降至189秒(加速5.3倍),p95从2296秒降至867秒(加速2.6倍)。论文TalariaSWE-BenchLLM推荐理由:这篇论文的Talaria系统把工具代理场景下百亿参数模型的p50延迟从1000秒降到189秒,挺实用的加速方案。原文稍后读已读值得跟进有用关注 Talaria
09:28官方账号arXiv cs.AI@Shermin Shahbazi, Hossein Mohammadi, Mohsen AfsharchiDADIR是一种密度感知数据级不平衡回归框架,专门处理连续目标变量中密度分布不均的问题。它包含三个组件:密度感知自适应分区(DAAP)根据密度变化递归划分目标空间;密度正则化条件变分自编码器(DR-CVAE)保留稀疏区域表示并学习潜在特征;潜在空间数据平衡通过特征聚类和过采样生成结构一致的合成样本。实验在多个不平衡回归数据集上验证,在欠表示区域和整体精度上都取得一致性提升。论文DADIRDAAPDR-CVAE推荐理由:你还在为回归数据分布不均发愁?这个新框架DADIR用密度指导分区和生成,比固定分区法更准,专门提升稀疏区域的预测效果。原文稍后读已读值得跟进有用关注 DADIR
09:26官方账号arXiv cs.AI@Xichen Zhang, Yingjie Zhang, Tianshu Sun该论文提出一个名为"层归因"的框架,将AI智能体行为分析分为基础计算层(架构、记忆、感知、注意力、表征)和行为调节层(身份、资源、目标、社会互动、制度约束、治理)。框架指出三个关键结论:替代有效性是模型-任务-层的关系,人机差异提供诊断证据,治理需在干预前进行源头归因。该框架为评估AI智能体行为来源提供了系统性方法。论文AI Agent层归因智能体推荐理由:这篇论文把AI行为拆成两层来诊断,教你看清行为是来自模型结构还是外部规则,对搞智能体评估和治理的人很有用。原文稍后读已读值得跟进有用关注 AI Agent
09:25官方账号arXiv cs.AI@Xizhe Zhang, Fan Shi, Mianzhao Wang, Jiangpeng Zheng, Xu Cheng, Shengyong Chen该论文针对红外小目标检测中像素级掩码标注成本高且不确定性大的问题,提出HALO(Hotspot-Anchored Label Optimization)方法。HALO在框内定位辐射锚点,并基于局部背景统计合成物理锚定高斯(PAG)软标签,将含噪框监督转化为连续像素级软标签。实验在公共数据集上显示,标准紧框下HALO与代表性盒监督方法竞争力相当,而在更宽松或偏移框条件下(更贴近实际场景),HALO鲁棒性显著提升,且不同骨干网络下表现一致。论文还引入污染感知工作区间分析,揭示内在信杂比与性能的关系。论文HALOPAGIRSTD推荐理由:这篇论文提出了HALO,能用带噪框标注解决红外小目标检测,比现有方法更扛标注不准确,适合实际场景。原文稍后读已读值得跟进有用关注 HALO
09:12官方账号arXiv cs.AI@Barada Sahu, Shivesh Pandey精选使用verifier-guided repair对35B参数的计算机使用智能体(CUA)在五个oracle-graded环境中进行测试,方差分量分解显示评估方差几乎为零,训练种子效应不超过10%,而数据抽取在最难任务中占48%的主导方差。该任务的运行间分布为双模(Hartigan dip p=0.07, k=10),单次运行约有30%概率落入失败模式,均值±标准差无法正确描述。修复能力分两层:固定token安装可靠(成功率0.97±0.06),而开放式坐标点击修复仅部分有效(0.53±0.35),生成字段填充更弱(0.14±0.04)。框架级修复仅在任务是唯一剩余障碍时提升成功率(LinkedIn 8/20 vs 基准0/15, Fisher p=0.006)。作者发现单次改进报告约三分之一概率符号错误,并发布了cua_reliability库以支持多种子常规报告。论文CUA35BSA-OPSD推荐理由:这篇论文用严格的统计方法告诉你:CUA的修复效果不能只看单次跑分,一个看起来不错的改进有三分之一可能是错的。做AI agent的都应该看看这个库。原文稍后读已读值得跟进有用关注 CUA
01:43lmarena.ai@lmarena_aiAgent Arena团队发布一篇博客,详细说明了其评估平台中使用的因果追踪方法论。该方法论旨在分析智能体在竞技场中的行为决策原因,提升可解释性。博客提供了技术实现与案例应用的具体说明。论文Agent Arena因果追踪方法论推荐理由:Agent Arena团队发了新博客,讲因果追踪如何帮你搞懂智能体行为,适合做Agent评估和可解释性研究的同学。原文稍后读已读值得跟进有用关注 Agent Arena