9月3日
10:00
10:00官方账号arXiv cs.AI@Etcharla Revanth Rao, Priyanshu Karmakar, Shubhojit Mallick, Manish Gupta, Shreya Ghosh, Abhik Jana
精选73°
UTP-Bench是一个大规模旅行规划基准,整合了印度504个城市的真实旅行数据,包含景点、餐厅、住宿和多种交通网络。该基准引入了实证延迟分布和人群密度模式,用于评估旅行计划在随机条件下的表现。研究团队提出了三个评估指标:缓冲充分度评分(BAS)、人群感知时间评分(CATS)和交通延迟吸收评分(TDAS)。
推荐理由:UTP-Bench用真实数据测试GPT-5等模型,发现它们在时间缓冲、延迟感知和人群敏感规划方面与人类计划差距明显。
09:13
09:13官方账号arXiv cs.LG@Mohammad Waquas Usmani, Susmit Shannigrahi, Michael Zink
研究人员评估了选择性坐标加密对机器学习重建攻击的鲁棒性。实验使用PointNet和随机森林模型,在X和2X两种加密粒度下测试。结果显示,完全加密X坐标仍具挑战性,但2X方案会通过相邻坐标泄露足够信息,实现准确重建。
推荐理由:论文揭示了点云加密方案的安全漏洞,2X加密模式下机器学习仍能重建加密数据。
09:12
09:12官方账号arXiv cs.LG@Quan Hao, Mengyue Fan, Zifan Dong, Youru Li, Jianduo Zhao, Lechuan Xu, Hao Zhang, Fei Xia, Jigang Wang, Chong Qiu, Liguo Zhang
精选73°
ProbeMatchDTI是一种新型药物-靶点相互作用预测框架,包含IterProbe和BindingProbe两个组件。该模型在BindingDB和DrugBank基准测试中分别实现了2.0%和0.5%的AUC-ROC提升。研究通过特征级模式分析,展示了其在跨尺度生化模式匹配中的探针驱动行为。该框架已与证据引导的下游药物发现工作流程连接,可用于候选药物优化和验证规划。
推荐理由:ProbeMatchDTI框架能保留弱生化模式,在药物-靶点预测上超越现有方法2个百分点,代码已开源。
09:12
09:12官方账号arXiv cs.LG@Xixiang He, Xingming Li, Baiqi Wu, Qiyao Sun, Xuanyu Ji, Ao Cheng, Qingyong Hu
精选73°
研究人员提出MT-SDPO方法,通过自我锚点、答案验证资格和特权蒸馏三个组件整合多个冻结教师模型。该方法在Qwen3-8B模型上测试,将最弱领域性能提升14.79点,领域差距缩小74.7%。代码已在GitHub开源,地址为https://github.com/hexixiang/MT-SDPO。
推荐理由:MT-SDPO方法让每个样本选择最可靠的教师,而非按领域匹配,大幅提升多领域大模型性能。
09:10
09:10官方账号arXiv cs.LG@Damian Sójka, Marc Masana, Bartłomiej Twardowski, Sebastian Cygert
73°
研究人员挑战了测试时适应(TTA)中常用的教师-学生框架,发现指数移动平均方法仍会导致误差累积。论文提出使用不更新权值的固执教师(intransigent teacher),显著提升了在长序列数据集上的性能。该方法增强了模型对超参数变化的鲁棒性,可无缝应用于多种架构和实验设置,包括语义分割。
推荐理由:这篇论文提出了一个简单的改进方法,让教师模型不更新权重,就能显著提升测试时适应的性能。
09:09
09:09官方账号arXiv cs.LG@Taufikur Rahman Fuad, Md Abrar Jahin, Amir Hussain
RINSE是一种梯度自由的目标时间框架,在8个未见过的目标图上实现了最高的平均AUPRC。该方法通过识别低残差目标节点子集,构建修剪后的目标感知正常性模型。RINSE结合了可靠性门控排序融合和编码器集成,无需目标标签、梯度或针对每个目标的调整。
推荐理由:康奈尔大学提出RINSE方法,解决了图异常检测中的领域迁移问题,在8个目标图上表现最佳。
09:09
09:09官方账号arXiv cs.LG@Yotam Eshel, Guy Hadad, Guy Feigenblat, Yuri M. Brovman, Matt Gearhart, Bracha Shapira
DeepAffinity利用小型语言模型预测用户对产品品牌、尺寸、颜色等方面的长期偏好。该模型通过结构化提示和专用预测头进行微调,在基准测试中优于标准生成式微调方法。研究显示通用开源大模型缺乏任务特定调优时表现不佳,难以捕捉细微行为模式。该系统已在大型跨国电商平台提升推荐质量。
推荐理由:DeepAffinity用小模型预测电商用户长期偏好,比大模型更精准,已落地提升推荐效果。
09:07
09:02
08:57
08:57SuperTechFans博客/媒体
精选73°
Anthropic推出Claude Fable 5.1和Mythos 5.1,价格降低约25%。Fable 5.1面向公众,Mythos 5.1专用于网络安全和生命科学。新模型在编码、知识工作和长期推理任务上显著超越前代,并推出企业前沿安全措施(EFS)。
事件专题

推荐理由:Anthropic新模型降价25%,Fable 5.1编码能力提升,Mythos 5.1专注网络安全,还新增企业安全功能。
08:42

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。