今日头版 · 热报早读 · 2026 年 9 月 3 日 星期四

AI模型竞赛升级,安全防护加强

2026年9月3日,AI领域迎来多款重磅更新。Google发布Gemini 3.8系列,Flash (High)在Agent Arena排名第14,较前版本提升5.94%,定价每100万代币0.75-3.75美元。李飞飞团队推出Atlas世界模型,可从单张图片生成完整3D场景,支持1分钟1440p视频生成。AI安全防护升级,Anthropic发布EFS系统,OpenAI称Astra为最危险模型需监控思维链。

读今天的早读订阅日报过去 24 小时,从 817 条中筛出 85 条 · 77 个信源
正在升温更多 →

今日 3 件事

真正改变行业的三条,读完就能转述。

看完整日报 →
东盟 AI政策、融资、本地团队中国 AI国产模型与公司早读每天 8:00趋势升温词与周度变化
9月3日
12:18
12:18官方账号arXiv cs.AI@Hao Zhou, Mandar Kulkarni, Hao Chen, Yan Xin, Charlie, Zhang
精选73°
该研究提出了一种针对电信网络根因分析的结构化推理框架,在TeleLogs和TelecomTS两个5G数据集上测试。该框架将异构网络遥测数据组织为规范上下文,强制执行决策路径推理,并生成基于证据的解释。实验结果表明,与基线技术相比,该框架能持续提高诊断准确性和决策一致性。
推荐理由:电信专家团队用LLM解决5G/6G网络故障诊断,通过结构化推理减少幻觉,比传统方法更准更可靠。
12:17
12:17官方账号arXiv cs.AI@Qinghua Mao, Wanying Qu, Dadi Guo, Leitao Yuan, Qingyu Liu, Yu Li, Guanxu Chen, Yanwei Fu, Xi Lin, Xia Hu, Dongrui Liu
精选73°
SafeEvolve是一种经验驱动的安全对齐框架,通过安全提示和分层技能的组件级更新实现可审计的运行时控制。该框架采用SFT-RL两阶段范式,在AgentDojo基准测试中,Qwen3.5-4B模型的安全响应率降低3倍,同时良性效用从59.79%提升至61.86%。实验证明该方法在安全-效用权衡上优于现有基线模型。
推荐理由:SafeEvolve通过策略协同进化提升AI智能体安全性,在降低有害响应的同时保持性能,比现有方法更有效。
12:16
12:16官方账号arXiv cs.AI@Yihang Chen, Yuxiang Chen, Yuxuan Huang, Meng Fang, Weilin Luo, Jun Wang
精选73°
该研究提出双层协调反射模型,将协调者与工作者的交互建模为双层协调博弈。研究分析了文本反思作为语义记忆状态上的随机运动,推导了有限时间上界,并证明了在特定条件下的下界。研究还引入了随机反思记忆上升(SRMA)算法,在500个SWE-bench实例上达到72.2%的解决率。
推荐理由:清华团队提出多智能体LLM系统的博弈论框架,新算法在SWE-bench上超越基准2.2个百分点。
12:16
12:16官方账号arXiv cs.AI@Jianlyu Chen, Yuyang Hu, Hongjin Qian, Jiawei Liu, Wenqing Wei, Xiaolong Chen, Defu Lian, Zhicheng Dou, Chaozhuo Li, Qiwei Ye, Zheng Liu
精选73°
研究人员提出DisCo技能驱动型研究代理,能将广泛使用的ML仓库提炼为可重用技能。该代理创建了AREX-Skill Library,包含5000多个从1000个常用ML仓库中提炼的验证技能,组织成20个领域和178个能力家族。使用GPT-5.5作为骨干模型,在MLE-bench基准上得分提升134.3%,在PaperBench上提升34.4%,在FrontierCS上提升9.2%,在PassNet上提升14.0%。
推荐理由:DisCo代理把GitHub仓库变成可重用技能,在多个AI研究基准上大幅提升性能,比无技能版本表现更好。
12:14
12:14官方账号arXiv cs.AI@Kushagra Bhushan, Meghanadh Pulivarthi, Sai Krishna Reddy Sathi, Gaurav Pandey, Sonam Gupta, Vineet Kumar, Jaydeep Sen, Yatin Nandwani, Sachindra Joshi, Dinesh Raghu
精选73°
DKL是一种新方法,通过在基础语言模型上进行扩展预训练来注入新知识,然后与指令模型合并。实验显示,在检索失败情况下,DKL将RAG准确率从54.17提升至79.26。该方法避免了昂贵的指令微调,仅需较少训练数据即可实现知识注入。
推荐理由:DKL解决了RAG检索失败时的问题,比RAFT和PA-RAG方法更高效,还能保持指令模型的指令跟随能力。
12:14
12:14官方账号arXiv cs.AI@Urja Pawar, Rajitha Ramanayake, Owen O'Neill, Nabeel Kemal, Abhishek Mandal, Houssem Chatbri, Christopher Martin
精选73°
研究人员提出两种互补信号检测黑盒大模型幻觉:语义熵和token不确定性。他们开发了TopK方法聚合token信号,CoCoA方法结合目标响应不确定性和语义相似性,以及Gated和Stacked两种监督方法。研究在7个基准上测试了4个语言模型,Stacked方法在近半数情况下表现最佳,TopK和CoCoA无需监督标签也具竞争力。
推荐理由:这篇论文教你如何检测黑盒大模型的幻觉,有4种方法可选,无需监督标签也能用。
12:13
12:05
12:05官方一手arXiv: DeepSeek@Seungwoo Jung, Dohyeok Kwon, Seungmin Cha, Junseok Lee, Yeonho Yoo, Chuck Yoo, Gyeongsik Yang
精选73°
PARSER是一种新的残差稀疏化方法,用于压缩Mixture-of-Experts大模型。该方法通过引入输出重要性指标,将压缩目标从最小化独立矩阵误差转变为保留专家输出误差。在Qwen和DeepSeek模型上,PARSER将压缩后模型与未压缩模型的精度差距分别缩小1.41倍和1.44倍,同时实现相同的峰值内存减少。
推荐理由:PARSER方法通过输出重要性指标优化MoE模型压缩,在相同内存减少下提升模型精度。
11:49
11:49官方一手arXiv: DeepSeek@Zhaoyang Jiang, Zhizhong Fu, Yunsoo Kim, Zicheng Li, Xuanqi Peng, Fei Teng, Jiacong Mi, Honghan Wu
精选73°
该研究提出了一种行为融合模型,结合大语言模型和本体排序器进行罕见病诊断。在Phenopacket Store和RAMEDIS数据集上,融合方法将Phenomizer Recall@1分别提升7.86和20.18个百分点。当与DeepSeek-V4-Flash API结合时,融合模型将Recall@1从0.1657提升至0.2176,提升5.19个百分点,无需重新训练。90.8%的正确融合诊断保留了可检查的本体证据。
事件专题

推荐理由:研究将LLM与本体排序器融合,提升罕见病诊断准确率,同时保留可追溯的证据链。
11:43
11:43官方账号arXiv cs.LG@Yuzhang Luo, Chenpeng Wang, Jianhui Chen, Liangming Pan
精选73°
研究团队提出了一种基于影响函数的响应重写方法,在四个开源大模型上测试。与传统的重加权干预相比,重写方法产生了更强、更持久且双向的行为转变。影响函数选择的样本在重写干预中展现出更大的杠杆作用,且变化集中在目标相关行为上。这一发现在安全拒绝任务中也表现出相同的定性对比。
推荐理由:研究人员发现影响函数选中的样本通过重写而非重加权能更有效改变模型行为,这对训练数据归因方法评估有重要启示。
11:42
11:42官方账号arXiv cs.LG@Ge Sun, Gervasio Zaldivar, Yuan Tian, Gustavo Perez Lemus, Juhae Park, Dasha Safarian, Ming Han, Juan J. de Pablo
精选73°
HiPoly是一种基于G2RINS表示的三层分层图架构AI框架,可直接编码随机单体连接性、组成和分子量。该框架实现了从实验配方数据到物性预测、生成分子设计和基于物理验证的端到端工作流。研究团队展示了多组分聚合物系统热物理性能的最先进预测精度,消融研究证实每个分层设计选择独立贡献于模型性能。
推荐理由:HiPoly框架能从实验数据直接预测聚合物性质并设计可持续替代品,比传统方法更高效准确。
10:55
10:17
10:17Tech in Asia@Aiko Gao Ishida
精选
Google推出Gemini 3.8 Flash和Flash Cyber两个新模型。Gemini 3.8 Flash Cyber在CWE-Bench基准测试中达到47.2%的pass@1分数。该基准测试专门用于评估软件漏洞修复能力。Flash Cyber专注于网络安全领域的应用。

推荐理由:Google新发布的Gemini 3.8 Flash Cyber在软件漏洞修复基准上取得47.2%的pass@1分数,专为网络安全场景优化。
10:15
10:15官方账号arXiv cs.AI@Luca Migliaccio, Roberto Natella, Naghmeh Ivaki, Nuno Laranjeiro, Marco Vieira
精选73°
研究人员提出使用大模型自动向Solidity智能合约注入漏洞的方法。该方法针对OpenSCV的49种漏洞类型进行测试,从SmartBugs真实合约生成近1000个候选变体。经去重和验证后,确认32个包含25种漏洞类型的合约(存活率16.58%)。研究团队使用这些合约评估了三种静态分析工具,揭示了它们互补且不完整的覆盖特性。
推荐理由:论文展示用大模型自动生成带漏洞的智能合约,帮助测试安全工具,发现现有分析工具的局限性。
10:14
10:14shao__meng@shao__meng
精选73°
Anthropic 开源了 Claude Commerce Agents,包含购物智能体和商家智能体。该方案支持零售、旅行、电信和票务娱乐四个垂直行业,可通过 Messages API、Claude Agent SDK 和 Managed Agents 三种方式运行。架构采用单智能体 + Skills 设计,而非多子智能体,在质量和成本延迟上表现更优。
事件专题

推荐理由:Anthropic 开源了电商智能体方案,包含面向消费者和商家的两个智能体,采用单智能体架构,比子智能体方案更优。
10:09
10:09官方账号arXiv cs.AI@Chuer Chen, Zichen Wang, Yi He, Zhengxi Yu, Nan Cao
精选73°
研究团队推出VMetaphor-Bench,这是首个评估文本到图像模型视觉隐喻生成的基准,包含1500个真实创意图像隐喻,分为3个级别和10个类别。研究采用混合评估框架,通过MLLM-as-judge范式,包含9594道多选题和3个感知维度的评分。对11个代表性T2I模型的评估显示,即使是专有模型在组合结构和跨域映射方面也存在困难。
推荐理由:研究人员发布了首个视觉隐喻生成基准,测试了11个模型,发现即使是最好的模型在隐喻表达方面也有明显不足。