9月3日
09:13
09:13官方账号arXiv cs.LG@Mohammad Waquas Usmani, Susmit Shannigrahi, Michael Zink
研究人员评估了选择性坐标加密对机器学习重建攻击的鲁棒性。实验使用PointNet和随机森林模型,在X和2X两种加密粒度下测试。结果显示,完全加密X坐标仍具挑战性,但2X方案会通过相邻坐标泄露足够信息,实现准确重建。
推荐理由:论文揭示了点云加密方案的安全漏洞,2X加密模式下机器学习仍能重建加密数据。
09:12
09:12官方账号arXiv cs.LG@Quan Hao, Mengyue Fan, Zifan Dong, Youru Li, Jianduo Zhao, Lechuan Xu, Hao Zhang, Fei Xia, Jigang Wang, Chong Qiu, Liguo Zhang
精选73°
ProbeMatchDTI是一种新型药物-靶点相互作用预测框架,包含IterProbe和BindingProbe两个组件。该模型在BindingDB和DrugBank基准测试中分别实现了2.0%和0.5%的AUC-ROC提升。研究通过特征级模式分析,展示了其在跨尺度生化模式匹配中的探针驱动行为。该框架已与证据引导的下游药物发现工作流程连接,可用于候选药物优化和验证规划。
推荐理由:ProbeMatchDTI框架能保留弱生化模式,在药物-靶点预测上超越现有方法2个百分点,代码已开源。
09:12
09:12官方账号arXiv cs.LG@Xixiang He, Xingming Li, Baiqi Wu, Qiyao Sun, Xuanyu Ji, Ao Cheng, Qingyong Hu
精选73°
研究人员提出MT-SDPO方法,通过自我锚点、答案验证资格和特权蒸馏三个组件整合多个冻结教师模型。该方法在Qwen3-8B模型上测试,将最弱领域性能提升14.79点,领域差距缩小74.7%。代码已在GitHub开源,地址为https://github.com/hexixiang/MT-SDPO。
推荐理由:MT-SDPO方法让每个样本选择最可靠的教师,而非按领域匹配,大幅提升多领域大模型性能。
09:10
09:10官方账号arXiv cs.LG@Damian Sójka, Marc Masana, Bartłomiej Twardowski, Sebastian Cygert
73°
研究人员挑战了测试时适应(TTA)中常用的教师-学生框架,发现指数移动平均方法仍会导致误差累积。论文提出使用不更新权值的固执教师(intransigent teacher),显著提升了在长序列数据集上的性能。该方法增强了模型对超参数变化的鲁棒性,可无缝应用于多种架构和实验设置,包括语义分割。
推荐理由:这篇论文提出了一个简单的改进方法,让教师模型不更新权重,就能显著提升测试时适应的性能。
09:09
09:09官方账号arXiv cs.LG@Taufikur Rahman Fuad, Md Abrar Jahin, Amir Hussain
RINSE是一种梯度自由的目标时间框架,在8个未见过的目标图上实现了最高的平均AUPRC。该方法通过识别低残差目标节点子集,构建修剪后的目标感知正常性模型。RINSE结合了可靠性门控排序融合和编码器集成,无需目标标签、梯度或针对每个目标的调整。
推荐理由:康奈尔大学提出RINSE方法,解决了图异常检测中的领域迁移问题,在8个目标图上表现最佳。
09:09
09:09官方账号arXiv cs.LG@Yotam Eshel, Guy Hadad, Guy Feigenblat, Yuri M. Brovman, Matt Gearhart, Bracha Shapira
DeepAffinity利用小型语言模型预测用户对产品品牌、尺寸、颜色等方面的长期偏好。该模型通过结构化提示和专用预测头进行微调,在基准测试中优于标准生成式微调方法。研究显示通用开源大模型缺乏任务特定调优时表现不佳,难以捕捉细微行为模式。该系统已在大型跨国电商平台提升推荐质量。
推荐理由:DeepAffinity用小模型预测电商用户长期偏好,比大模型更精准,已落地提升推荐效果。
09:07
9月2日
15:24
15:24量子位@量子位的朋友们
蚂蚁集团推出统一宽表系统OmniTable,论文获评VLDB 2026工业赛道最佳论文。该系统可处理35PB语料,数据清洗效率提升5.6倍。OmniTable解决了大模型训练数据预处理难题,大幅降低了人工清洗成本。
推荐理由:蚂蚁这套宽表系统能一次性处理35PB语料,效率提升5.6倍,再也不用为洗数据熬夜了。
10:50
10:50官方账号arXiv cs.AI@Kefeng Duan, Dewu Zheng, Yanlin Wang, Xiwen Wang, Ensheng Shi, Xilin Liu, Yuchi Ma, Jiachi Chen, Mingwei Liu, Zibin Zheng
精选73°
研究人员提出PTA-IRT框架,通过融合过程和结果信号来评估软件工程代理。该框架利用历史执行轨迹作为特权信息,包括探索的上下文、尝试的编辑和解决路径。在四个SWE基准测试中,PTA-IRT在低校准预算下始终优于先前的IRT基线。代码和数据已在GitHub公开。
推荐理由:DeepSoftwareAnalytics团队推出PTA-IRT,能更高效评估软件工程代理,比传统方法更准确。
10:50
10:50官方账号arXiv cs.AI@Kefeng Duan, Dewu Zheng, Yanlin Wang, Terry Yue Zhuo, Mingwei Liu, Jianxing Yu, Jiachi Chen, Ensheng Shi, Xilin Liu, Yuchi Ma, Zibin Zheng
精选73°
ACToR框架针对仓库级代码生成任务,在生成过程中识别关键令牌并按需触发检索。该方法在RepoExec和CoderEval两个基准测试中分别实现了8.4%和15.4的相对性能提升。研究还量化了关键令牌对生成失败的影响,突显了针对性检索策略的必要性。
推荐理由:DeepSoftwareAnalytics团队推出ACToR框架,能精准定位代码生成中的关键点,比现有方法表现更好。
10:49
10:49官方账号arXiv cs.AI@Kshitij Tayal, Arun Sharma, Genta Indra Winata, Anirban Das, Sambit Sahu
精选73°
自然语言正成为提升语言智能体的主要反馈渠道,能传达意图、偏好和因果结构。该研究提出语言强化学习(VRL)范式,围绕反馈生效时机和修改内容形成三大支柱:语言作为基础信号定义任务目标和奖励结构;语言作为反思性反馈指导测试时推理;语言作为学习信号通过训练调整模型参数。
推荐理由:这篇论文首次系统梳理了语言强化学习,将现有研究分为三大类,帮助理解语言如何重塑智能体开发。
10:49
10:48
10:48官方账号arXiv cs.AI@Dirk Bergemann, Andrew Koh, Stephen Morris
精选73°
研究人员开发了一种针对AI代理的机制设计框架,这些代理的对齐偏好和能力未知。该框架通过单向模仿结构实现诚实和服从的激励,并揭示了可实施政策的特征。研究团队将此框架应用于五种典型场景,包括能力伪装、对齐与可解释性权衡、同行评分纪律、竞争激励以及可扩展监督和奖励塑造。
推荐理由:这篇论文提出了AI代理机制设计的理论框架,解决了代理能力未知情况下的控制问题,并给出了五种应用场景。
10:41
10:41官方账号arXiv cs.AI@Qing Zhao, Haowei Li, Weijian Deng, Pengxu Wei, Liang Lin
精选73°
研究人员提出EvoSCM框架,为科学智能体配备显式结构化因果模型。该系统维护竞争性假设种群,通过 abduction 推理潜在机制、设计区分性干预、进行可证伪预测。在 DiscoverPhysics 基准测试中,EvoSCM 持续超越基线模型,提供更准确的解释和预测,同时更有效地利用实验交互。
推荐理由:EvoSCM 让 AI 能像科学家一样建立、测试和修正因果理论,在物理发现任务中表现优异。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。