论文Agent 与开发者精选73°09:22统一ICL、SFT和KL正则化RL的贝叶斯视角DeepSeek研究员发表的论文,揭示了不同LLM训练方法背后的统一理论,解释了为什么冷启动监督预热对KL投影至关重要。#贝叶斯#RLHF#SFT#ICLaarXiv: DeepSeek@Junxin Fan原文稍后读已读值得跟进有用关注 贝叶斯
论文Agent 与开发者精选73°09:22ERPBench评测大模型企业决策能力ERPBench首次测试大模型企业决策能力在不同竞争市场环境下的迁移性,发现不同环境下最佳模型不同。#ERPBench#LLM Agents#企业决策#GeminiaarXiv: DeepSeek@Xinran Zhang 等 4 人原文稍后读已读值得跟进有用关注 ERPBench
论文Agent 与开发者精选09:21CABAL:多智能体模拟合谋评审影响AAAI-27评审周期发现合谋风险,CABAL框架首次完整模拟合谋评审全过程,揭示其影响机制。#CABAL#多智能体#合谋评审#LLMaarXiv cs.AI@Jicheng Zhou 等 8 人原文稍后读已读值得跟进有用关注 CABAL
产品多源确认精选73°11:32ATIBA:研究论文的完整性与质量检查工具ATIBA 自动检查论文引用完整性和会议合规性,用 GPT-5.4 做多模式审查,比人工检查更一致可靠。#ATIBA#GPT-5.4#ACM SIGSOFT#论文检查10 个信源在谈事件专题aarXiv: OpenAI@Veli Karakaya 等 4 人11 个信源在谈原文稍后读已读值得跟进有用关注 ATIBA
论文11:32AI智能体过程黑盒架构OpenAI/Hugging Face事件后,研究者提出区块链锚定的AI智能体黑盒架构,专为GRC审计设计。#AI智能体#区块链#GRC#审计aarXiv: OpenAI@Arslan Brömme原文稍后读已读值得跟进有用关注 AI智能体
论文多源确认73°11:29LLM评估需求质量研究发布Anthropic和OpenAI的10个模型在需求质量评估上表现不佳,误报率高且漏检严重。#LLM#requirements engineering#Anthropic#OpenAI10 个信源在谈事件专题aarXiv: Anthropic@Jannatul Shefa 等 4 人11 个信源在谈原文稍后读已读值得跟进有用关注 LLM
论文Agent 与开发者78°11:28ESPO:错误结构化提示优化方法ESPO方法让提示更短更准,在Qwen3 GSM8K上从15%提升到91.4%,比GEPA短47%还更准。#ESPO#提示词工程#NLP#Qwen3aarXiv cs.AI@Lihao Liu 等 4 人原文稍后读已读值得跟进有用关注 ESPO
论文精选73°11:28EditVid统一视频编辑框架无需训练EditVid一个框架就能做多种视频编辑,无需训练,效果比现有方法好一半以上。#EditVid#视频编辑#FiVE#IVEBenchaarXiv cs.AI@Adheesh Sunil Juvekar 等 9 人原文稍后读已读值得跟进有用关注 EditVid
论文精选73°11:28VLM引导的弱监督密集视频字幕生成VLM先看后合成,让视频字幕生成更精准,比传统方法更智能地找到事件变化点。#VLM#视频字幕#弱监督#事件定位aarXiv cs.AI@Ye-Chan Kim 等 7 人原文稍后读已读值得跟进有用关注 VLM
论文精选73°11:28大语言模型通过辅助视图提升知识获取这篇论文揭示了大模型预训练中知识获取的关键机制,解释了为什么数据多样性重要。#大语言模型#预训练#知识获取#辅助视图aarXiv cs.AI@Joseph Lee 等 5 人原文稍后读已读值得跟进有用关注 大语言模型
论文73°11:27概率因果影响框架实现可计算解释新PCI框架让复杂因果系统解释变得可行,比SHAP更尊重因果结构,比实际因果性更可扩展。#PCI#因果解释#实际因果性#SHAPaarXiv cs.AI@Rafal Urbaniak 等 10 人原文稍后读已读值得跟进有用关注 PCI
论文精选73°11:27大语言模型同策略蒸馏研究:单训练示例效果显著OpenAI新研究揭示OPD只需少量数据就能接近全数据效果,算法效率比数据量更重要。#OPD#大语言模型#蒸馏#状态覆盖率aarXiv cs.AI@Zixuan Fu 等 13 人原文稍后读已读值得跟进有用关注 OPD
论文11:26自主研究集群中的作弊与举报案例研究100个LLM代理自发形成作弊与举报机制,展示了AI群体自治的复杂行为模式。#LLM#自主代理#知识共同体#AI治理aarXiv cs.AI@Davide Paglieri 等 6 人原文稍后读已读值得跟进有用关注 LLM
论文精选73°11:26SWE-Gate:软件工程代理需满足代码审查要求DeepSoftwareAnalytics发布SWE-Gate基准,揭示AI编码助手通过功能测试≠满足实际开发要求#SWE-Gate#软件工程代理#代码审查#基准测试aarXiv cs.AI@Xin He 等 6 人原文稍后读已读值得跟进有用关注 SWE-Gate
论文11:25语言模型欺骗研究的因果框架这篇论文提出了语言模型欺骗研究的因果框架,区分了欺骗行为与欺骗机制,通过实验验证了看似欺骗的行为不一定有相应机制支持。#语言模型#欺骗机制#因果框架#开源模型aarXiv cs.AI@Yakov Pyotr Shkolnikov原文稍后读已读值得跟进有用关注 语言模型
模型精选73°11:25SENTINEL-RL:安全运营中心拓扑推理分离架构Sentinel-RL解决了LLM在安全运营中的两大瓶颈,能快速处理大规模网络拓扑,推荐更准确的 containment 行动。#SENTINEL-RL#PPO#SOC#拓扑推理aarXiv cs.AI@Uday Vallabhaneni 等 3 人原文稍后读已读值得跟进有用关注 SENTINEL-RL
模型精选73°11:25Terminal-Universe:将代理轨迹转化为可扩展终端环境Terminal-Universe能把代码执行轨迹变成可复用环境,让Qwen3.5-27B在终端任务上提升近12分。#Terminal-Universe#Qwen3.5-27B#Terminal-Bench#代码代理aarXiv cs.AI@Jie Wu 等 14 人原文稍后读已读值得跟进有用关注 Terminal-Universe
论文精选73°11:24人机交互实现测试时高效适应TAHI方法让人机交互数据成为缩小专业差距的信号,适应后的模型不仅个人任务成功率提升,还能跨用户泛化。#TAHI#人机交互#测试时适应#写作aarXiv cs.AI@Zora Zhiruo Wang 等 25 人原文稍后读已读值得跟进有用关注 TAHI
论文Agent 与开发者精选73°11:24AI智能体自然语言交互协议标准发布Ecma International发布NLIP标准,让不同AI智能体框架能互相通信,支持多种传输协议。#NLIP#AI智能体#MCP#A2AaarXiv cs.AI@Luyi Xing 等 12 人原文稍后读已读值得跟进有用关注 NLIP
论文多源确认11:23终端智能体环境演化方法研究研究人员提出环境演化方法,让终端智能体训练环境持续变难,在Qwen模型上提升了18%性能。#环境演化#终端智能体#Qwen3.6#Claude Opus3 个信源在谈事件专题aarXiv cs.AI@Zhiyuan Fan 等 12 人4 个信源在谈原文稍后读已读值得跟进有用关注 环境演化
论文11:23大语言模型推荐的认识论依据研究这篇论文提出了评估LLM推荐可信度的认识论担保框架,帮你判断何时该相信AI建议。#LLM#epistemic warrant#认识论担保#AI可靠性aarXiv cs.AI@Shai Vardi, João Sedoc原文稍后读已读值得跟进有用关注 LLM
论文精选73°11:22Gated DeltaNet在4位量化中保持性能的机制研究Minima团队把Qwen3.8-27B全量化到4位,性能不变还更小更快,揭秘了混合模型递归部分为什么好量化。#Gated DeltaNet#Qwen3.8-27B#NVFP4#量化1 个信源在谈事件专题aarXiv cs.AI@Sergii Kozyrev, Davyd Maiboroda2 个信源在谈原文稍后读已读值得跟进有用关注 Gated DeltaNet
论文精选73°11:22通过训练编译:将自然语言规范转为本地神经函数OpenAI新方法把自然语言描述变成可复用的本地神经函数,比远程调用更快,还部署了实际应用案例。#compile by training#FuzzyBench-Hard#神经函数#自然语言规范aarXiv cs.LG@Yuntian Deng 等 3 人原文稍后读已读值得跟进有用关注 compile by training
论文精选11:21黑盒LLM评估器可靠性研究失败OpenAI等公司的模型评估可能存在严重可靠性问题,同一模型在不同时间点表现差异巨大。#LLM#评估可靠性#模型评估#SpearmanaarXiv cs.LG@Haoyaun Zhu, Jie Zhang原文稍后读已读值得跟进有用关注 LLM
论文11:21思维链推理中可读性与可解释性的差异研究思维链文本的可读性不等于可解释性,研究揭示了LLM判断推理步骤重要性的局限性。#思维链#可解释性#LLM#推理模型aarXiv cs.LG@Kevin Du 等 4 人原文稍后读已读值得跟进有用关注 思维链
论文11:20低成本微型车自动驾驶开源平台发布MIT开源了微型自动驾驶平台,结合数字孪生技术,误差比纯实车训练更低。#自动驾驶#Ackermann#Webots#模仿学习aarXiv cs.LG@Gustavo Claudio Karl Couto 等 3 人原文稍后读已读值得跟进有用关注 自动驾驶
论文精选73°11:20前瞻性编码提升深度连续时间循环网络学习研究人员提出前瞻性编码方法,解决了深度循环网络中底层信号延迟和顶层误差衰减问题,在多个模型上提升了性能。#RQFs#连续时间循环网络#前瞻性编码#状态空间模型aarXiv cs.LG@Shivang Rawat 等 4 人原文稍后读已读值得跟进有用关注 RQFs
论文精选73°11:19顺序优于联合:RLVR与OPD方法对比研究OpenAI等机构常用方法被挑战,论文证明先OPD后RL的两阶段训练效果更好,还给出了实用切换信号。#RLVR#OPD#大模型推理#强化学习aarXiv cs.LG@Boyan Li 等 6 人原文稍后读已读值得跟进有用关注 RLVR
论文精选73°11:19硬件感知的FP4 FlashAttention-4NVIDIA研究团队推出Direct-P方法,解决了Blackwell FP4张量核心在注意力计算中的瓶颈问题。#FlashAttention-4#FP4#Blackwell#Direct-PaarXiv cs.LG@Robert Hu原文稍后读已读值得跟进有用关注 FlashAttention-4
论文精选73°11:18DRACO:动态评分细粒度信用分配IBM发布DRACO,解决长周期智能体训练中信用分配问题,无需验证器就能提升15.9分。#DRACO#GRPO#智能体#信用分配aarXiv cs.LG@Shubham Gandhi 等 4 人原文稍后读已读值得跟进有用关注 DRACO
论文11:18退化扩散模型的条件化研究论文解决了退化扩散模型条件化的难题,提出基于因果最优传输的新方法,适用于传统分数函数失效的场景。#扩散模型#因果最优传输#条件生成#退化扩散aarXiv cs.LG@Uğur Aydın, Tamer Başar原文稍后读已读值得跟进有用关注 扩散模型
论文精选73°11:17PreferenceEKF 实现高效主动奖励学习PreferenceEKF 用子空间推理解决奖励模型不确定性问题,比传统贝叶斯方法更高效。#PreferenceEKF#RLHF#强化学习#贝叶斯方法aarXiv cs.LG@Yutai Zhou, Erdem Bıyık原文稍后读已读值得跟进有用关注 PreferenceEKF
论文精选11:17单层注意力中布尔函数的头部复杂度这篇论文揭示了单层注意力模型中布尔函数计算的头部需求边界,为理解Transformer架构的计算能力提供了理论基础。#Transformer#注意力机制#布尔函数#计算复杂度aarXiv cs.LG@Rajmohan Rajaraman 等 3 人原文稍后读已读值得跟进有用关注 Transformer
论文精选73°11:15FLY-EVAL++:安全约束飞行评估协议FLY-EVAL++为飞行预测任务提供新评估标准,发现LLM在安全约束下存在显著差异,比单纯看准确率更重要。#FLY-EVAL++#Flight Trajectory and Attitude Prediction#LLM#安全评估aarXiv cs.LG@Yalun Wu 等 9 人原文稍后读已读值得跟进有用关注 FLY-EVAL++
论文11:14LLM4CKD:大模型用于慢性肾病早期筛查斯坦福团队提出LLM4CKD框架,用少量数据就能做肾病筛查,比传统方法更灵活。#LLM4CKD#慢性肾病#零样本学习#少样本学习aarXiv cs.LG@Muhammad Ashad Kabir, Sirajam Munira原文稍后读已读值得跟进有用关注 LLM4CKD
论文73°11:14可微分混合建模优化化学传输过程这篇论文提出了一个结合物理模型和神经网络的混合框架,能从实验数据自动发现本构定律,比传统黑盒模型更具物理一致性。#JAX#种群平衡方程#可微分建模#化学工程aarXiv cs.LG@Arthur Jessop 等 4 人原文稍后读已读值得跟进有用关注 JAX
模型中美对照精选73°11:14零售供应链需求适应的智能体框架零售供应链需求适应有新框架,用GPT/Qwen/DeepSeek提升成功率7%。#零售供应链#智能体#GPT#QwenaarXiv: DeepSeek@Lei Zheng 等 6 人原文稍后读已读值得跟进有用关注 零售供应链
论文11:13LLM能否从代码提交中提取架构设计决策研究测试了四种大模型从代码提交中提取架构设计决策的能力,发现虽有一定效果但仍有改进空间。#LLM#架构设计决策#代码提交#Gemini 3 Pro1 个信源在谈事件专题aarXiv: DeepSeek@Amey Karan 等 4 人2 个信源在谈原文稍后读已读值得跟进有用关注 LLM
论文多源确认精选73°11:13KC-Bench:评估LLM智能体知识冲突的动态基准研究人员发布了KC-Bench基准,专门测试AI智能体如何处理知识冲突,九个主流模型测试结果都不理想。#KC-Bench#LLM Agents#知识冲突#基准测试4 个信源在谈事件专题aarXiv: DeepSeek@Yaxing Lyu 等 5 人5 个信源在谈原文稍后读已读值得跟进有用关注 KC-Bench
论文精选11:12LLM推理轨迹中的预算与难度混淆问题DeepSeek-R1等模型推理轨迹中的'突破'可能只是难度信号,真正有价值的信息很少。#LLM#推理轨迹#DeepSeek-R1#MATHaarXiv: DeepSeek@Yigit Utku Bulut原文稍后读已读值得跟进有用关注 LLM