9月3日
11:44
11:44官方账号arXiv cs.LG@Isaiah Andrews, Suproteem Sarkar
该研究评估了语言模型在概率预测方面的一致性。研究人员通过构建线性程序计算荷兰书利润,衡量模型预测的不一致性。研究发现语言模型预测存在显著不一致性,事件间逻辑关系越丰富,不一致性越高。无关上下文细节可使不一致性提高一个数量级。
推荐理由:荷兰书利润方法评估语言模型预测一致性,发现模型在概率预测上存在显著不一致,尤其在复杂逻辑关系下更明显。
11:43
11:43官方账号arXiv cs.LG@Yuzhang Luo, Chenpeng Wang, Jianhui Chen, Liangming Pan
精选73°
研究团队提出了一种基于影响函数的响应重写方法,在四个开源大模型上测试。与传统的重加权干预相比,重写方法产生了更强、更持久且双向的行为转变。影响函数选择的样本在重写干预中展现出更大的杠杆作用,且变化集中在目标相关行为上。这一发现在安全拒绝任务中也表现出相同的定性对比。
推荐理由:研究人员发现影响函数选中的样本通过重写而非重加权能更有效改变模型行为,这对训练数据归因方法评估有重要启示。
11:42
11:42官方账号arXiv cs.LG@Ge Sun, Gervasio Zaldivar, Yuan Tian, Gustavo Perez Lemus, Juhae Park, Dasha Safarian, Ming Han, Juan J. de Pablo
精选73°
HiPoly是一种基于G2RINS表示的三层分层图架构AI框架,可直接编码随机单体连接性、组成和分子量。该框架实现了从实验配方数据到物性预测、生成分子设计和基于物理验证的端到端工作流。研究团队展示了多组分聚合物系统热物理性能的最先进预测精度,消融研究证实每个分层设计选择独立贡献于模型性能。
推荐理由:HiPoly框架能从实验数据直接预测聚合物性质并设计可持续替代品,比传统方法更高效准确。
11:40
11:40官方账号arXiv cs.LG@Namgyu Ho, Huzama Ahmad, Woosung Koh, Se-Young Yun, Tal Schuster, Cicero Nogueira dos Santos
78°
研究团队提出声明式注意力(DA)协议,让模型在思维链中声明需要关注的内容区域。该协议将生成分为全局、聚焦和局部三种模式,在15个长上下文任务中,Gemma-4-31B和Qwen-3.6-27B模型解码时关注token分别减少52.0%和31.1%,准确率仅下降1.27pp和2.75pp。
推荐理由:新DA协议让模型自己决定关注哪部分内容,大幅减少计算量,Gemma和Qwen模型效果显著。
11:05
10:55
10:46
10:23
10:17
10:17Tech in Asia@Aiko Gao Ishida
精选
Google推出Gemini 3.8 Flash和Flash Cyber两个新模型。Gemini 3.8 Flash Cyber在CWE-Bench基准测试中达到47.2%的pass@1分数。该基准测试专门用于评估软件漏洞修复能力。Flash Cyber专注于网络安全领域的应用。

推荐理由:Google新发布的Gemini 3.8 Flash Cyber在软件漏洞修复基准上取得47.2%的pass@1分数,专为网络安全场景优化。
10:15
10:15官方账号arXiv cs.AI@Luca Migliaccio, Roberto Natella, Naghmeh Ivaki, Nuno Laranjeiro, Marco Vieira
精选73°
研究人员提出使用大模型自动向Solidity智能合约注入漏洞的方法。该方法针对OpenSCV的49种漏洞类型进行测试,从SmartBugs真实合约生成近1000个候选变体。经去重和验证后,确认32个包含25种漏洞类型的合约(存活率16.58%)。研究团队使用这些合约评估了三种静态分析工具,揭示了它们互补且不完整的覆盖特性。
推荐理由:论文展示用大模型自动生成带漏洞的智能合约,帮助测试安全工具,发现现有分析工具的局限性。
10:14
10:14shao__meng@shao__meng
精选73°
Anthropic 开源了 Claude Commerce Agents,包含购物智能体和商家智能体。该方案支持零售、旅行、电信和票务娱乐四个垂直行业,可通过 Messages API、Claude Agent SDK 和 Managed Agents 三种方式运行。架构采用单智能体 + Skills 设计,而非多子智能体,在质量和成本延迟上表现更优。
事件专题

推荐理由:Anthropic 开源了电商智能体方案,包含面向消费者和商家的两个智能体,采用单智能体架构,比子智能体方案更优。
10:12
10:12官方账号arXiv cs.AI@Mason Youngblood, Katie Mudd, Manuel Anglada-Tort, Cameron Jones, Elena Miu, Diana Omigie, Margaret Schedel
研究人员分析了生成式AI如何改变文化创作与传播。研究指出AI辅助创意能提高单个作品的新颖性,但可能降低整体多样性。人类与AI模型以互补方式搜索创意,混合团队表现优于单一团队。机器发现的解决方案可进入人类文化并持续存在。最终结果取决于组成要素:参与主体、比例及连接方式。
推荐理由:这篇论文分析了AI如何影响人类创造力,提出混合团队表现优于单一团队,探讨了AI与人类创意互补的可能性。
10:09
10:09官方账号arXiv cs.AI@Yan Zhong, Gefei Chen, Qiufang Ma, Zhen Wang, Zhiwei Fan, Lei Shi, Tingting Jiang
73°
研究人员提出UEAP-4k数据集,专为UGC增强图像的异常感知任务设计。该数据集包含真实业务场景中的4k图像,提供异常类别、位置和严重程度的细粒度标注。团队开发了DFAP-UGC方法,通过差异融合和空间查询实现鲁棒异常识别,在实验中超越传统基线方法。
推荐理由:OpenAI发布新数据集和方法,专门解决社交媒体图片增强后的异常检测问题,比传统方法更准确。
10:09
10:09官方账号arXiv cs.AI@Chuer Chen, Zichen Wang, Yi He, Zhengxi Yu, Nan Cao
精选73°
研究团队推出VMetaphor-Bench,这是首个评估文本到图像模型视觉隐喻生成的基准,包含1500个真实创意图像隐喻,分为3个级别和10个类别。研究采用混合评估框架,通过MLLM-as-judge范式,包含9594道多选题和3个感知维度的评分。对11个代表性T2I模型的评估显示,即使是专有模型在组合结构和跨域映射方面也存在困难。
推荐理由:研究人员发布了首个视觉隐喻生成基准,测试了11个模型,发现即使是最好的模型在隐喻表达方面也有明显不足。
10:08
10:08官方账号arXiv cs.AI@Adrien Mialland, Marc Plantevit, Julien Gallois, Céline Robardet
精选73°
ViSAR是一种针对视觉文档问答的检索增强生成方法,通过构建查询条件化的页面级相似矩阵,动态确定检索页面数量。该方法在多个编码器和大型视觉语言模型上测试,可将RAG延迟降低58.7%,同时保持或提高答案准确性。研究还发现相似矩阵结构与答案准确性相关,为检索质量感知的文档理解提供新方向。
推荐理由:ViSAR让文档问答系统更聪明,能根据问题复杂度自动调整检索页面数,速度提升近六成还不影响准确率。
10:07
10:07官方一手pandaily@contact@pandaily.com (Pandaily)
腾讯发布WorkBuddy开放平台,这是首个覆盖硬件、行业应用和开发者的国内AI智能体生态系统。平台推出了九款联合品牌设备,已接入超过100家合作伙伴。该平台旨在构建完整的AI智能体生态链。

推荐理由:腾讯上线WorkBuddy开放平台,联合100+伙伴推出9款联名设备,打造国内首个AI智能体生态。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。