模型多源确认精选73°11:12Jina-OCR-v1发布:低成本GPU文档解析模型Jina团队发布了Jina-OCR-v1,能在低成本GPU上高效处理文档,速度翻倍且精度高。#Jina-OCR-v1#DeepSeek-OCR#FastMTP#文档解析2 个信源在谈事件专题aarXiv: DeepSeek@Alejandro Barón García 等 4 人3 个信源在谈原文稍后读已读值得跟进有用关注 Jina-OCR-v1
论文精选73°11:10LLM代码生成中的复合提示约束研究OpenAI等模型在复合提示下表现差异大,JSON+专家角色+中等紧急程度组合导致GPT-4o-mini性能下降12.2个百分点。#LLM#代码生成#提示工程#HumanEval+aarXiv: OpenAI@Shrenik Jadhav 等 6 人原文稍后读已读值得跟进有用关注 LLM
论文精选73°12:19TRACE框架实现自主机器人决策可追溯TRACE框架让自主机器人决策过程完全可追溯,解决了深度学习模型不可解释的问题。#TRACE#自主机器人#可解释AI#欧盟AI法案aarXiv cs.AI@Cagri Temel原文稍后读已读值得跟进有用关注 TRACE
论文精选73°12:18电信网络根因分析的结构化推理框架电信专家团队用LLM解决5G/6G网络故障诊断,通过结构化推理减少幻觉,比传统方法更准更可靠。#LLM#电信#根因分析#5GaarXiv cs.AI@Hao Zhou 等 6 人原文稍后读已读值得跟进有用关注 LLM
论文精选73°12:17SafeEvolve:基于智能体经验的策略协同进化框架SafeEvolve通过策略协同进化提升AI智能体安全性,在降低有害响应的同时保持性能,比现有方法更有效。#SafeEvolve#Qwen3.5-4B#AgentDojo#安全对齐aarXiv cs.AI@Qinghua Mao 等 11 人原文稍后读已读值得跟进有用关注 SafeEvolve
论文12:17工厂智能体子网络选择测量驱动方法工厂智能体如何通过子网络选择在有限硬件上高效运行,实测功耗仅1.3-5瓦。#工厂智能体#检索增强#子网络选择#边缘计算aarXiv cs.AI@Vasileios Rizeakos 等 5 人原文稍后读已读值得跟进有用关注 工厂智能体
论文精选73°12:16双层协调反射:多智能体LLM系统的博弈论方法清华团队提出多智能体LLM系统的博弈论框架,新算法在SWE-bench上超越基准2.2个百分点。#多智能体#LLM系统#博弈论#SWE-benchaarXiv cs.AI@Yihang Chen 等 6 人原文稍后读已读值得跟进有用关注 多智能体
模型Agent 与开发者精选73°12:16Repo-To-Skill:将GitHub仓库提炼为AI技能DisCo代理把GitHub仓库变成可重用技能,在多个AI研究基准上大幅提升性能,比无技能版本表现更好。#DisCo#GPT-5.5#MLE-bench#PaperBenchaarXiv cs.AI@Jianlyu Chen 等 11 人原文稍后读已读值得跟进有用关注 DisCo
论文Agent 与开发者78°12:15RVSD框架减少视觉语言模型幻觉清华团队提出RVSD框架,不用训练就能减少大视觉语言模型的幻觉,效果还特别好。#RVSD#视觉语言模型#视觉幻觉#语义空间视觉检索aarXiv cs.AI@Canjie Liu 等 4 人原文稍后读已读值得跟进有用关注 RVSD
论文精选73°12:14DKL:解耦知识学习提升指令模型DKL解决了RAG检索失败时的问题,比RAFT和PA-RAG方法更高效,还能保持指令模型的指令跟随能力。#DKL#RAG#Instruct LLM#知识注入aarXiv cs.AI@Kushagra Bhushan 等 10 人原文稍后读已读值得跟进有用关注 DKL
论文精选73°12:14黑盒大模型幻觉检测研究这篇论文教你如何检测黑盒大模型的幻觉,有4种方法可选,无需监督标签也能用。#LLMs#幻觉检测#语义熵#token不确定性aarXiv cs.AI@Urja Pawar 等 7 人原文稍后读已读值得跟进有用关注 LLMs
论文精选73°12:13Loom:通过嵌入空间重加权实现文本共识Loom框架通过嵌入空间重加权技术,在保持高准确率的同时大幅提升推理速度,适合工业场景的根因分析任务。#Loom#OpenRCA#根因分析#嵌入空间aarXiv cs.AI@Ron Begleiter 等 4 人原文稍后读已读值得跟进有用关注 Loom
论文多源确认精选73°12:09GRADSOLVE:GPU上ODE集合的快速精确梯度计算GRADSOLVE解决了ODE集合在GPU上求解与反向微分速度不匹配的问题,大幅提升计算效率。#GRADSOLVE#JAX#ODE#GPU7 个信源在谈事件专题aarXiv cs.LG@Alessio Spurio Mancini8 个信源在谈原文稍后读已读值得跟进有用关注 GRADSOLVE
论文精选73°12:06Cliff:从首次错误中学习过程奖励研究人员提出Cliff方法,通过识别首次错误来改进强化学习,性能提升显著且适用性广。#Cliff#RLVR#强化学习#推理模型aarXiv cs.LG@Peixuan Han 等 6 人原文稍后读已读值得跟进有用关注 Cliff
论文12:06Web Agent判别式世界模型研究斯坦福团队新论文提出Web Agent世界模型新训练方法,在WebArena基准上表现更好。#WebArena#Web Agent#世界模型#PRMaarXiv cs.LG@Kelvin Li 等 9 人原文稍后读已读值得跟进有用关注 WebArena
论文12:06语音脑机接口的通用通信度量OpenAI团队提出OVMI指标,解决了语音BCI系统难以比较的问题,优化后准确率提升16.3%。#语音脑机接口#OVMI#互信息#脑机接口aarXiv cs.LG@Dulhan Jayalath 等 3 人原文稍后读已读值得跟进有用关注 语音脑机接口
论文精选73°12:05PARSER方法压缩MoE大模型PARSER方法通过输出重要性指标优化MoE模型压缩,在相同内存减少下提升模型精度。#MoE#PARSER#Qwen#DeepSeekaarXiv: DeepSeek@Seungwoo Jung 等 7 人原文稍后读已读值得跟进有用关注 MoE
论文12:05AICOME框架验证AI测量个体与群体效应AICOME框架能从现有数据中恢复重要理论构念,周工作时长验证效果最佳,但信息受限时性能会下降。#AICOME#CFPS#情境测量#调查数据aarXiv cs.LG@Wenxin Jiang 等 3 人原文稍后读已读值得跟进有用关注 AICOME
论文11:53Graph Machine:通过边实现更优预训练Graph Machine 用边对象替代传统状态,在 Qwen3-0.6B 上预训练时,稀疏层仅需少量检索就能保持性能。#Graph Machine#Qwen3-0.6B#Transformer#稀疏路由aarXiv cs.LG@Lintai Hou原文稍后读已读值得跟进有用关注 Graph Machine
论文11:51语言不可读性对LLM安全的影响这篇论文揭示了LLM安全监控的盲点,提出了不依赖语言输出的沙箱防护方案。#LLM#语言不可读性#AI安全#沙箱aarXiv cs.LG@James Mickens原文稍后读已读值得跟进有用关注 LLM
模型Agent 与开发者多源确认78°11:51Nemotron-3模型在编程竞赛中超越人类金牌选手NVIDIA训练的编程竞赛模型首次在IOI中击败人类冠军,分数535.4远超金牌线361.12。#Nemotron-3#IOI#编程竞赛#GenCorrect2 个信源在谈事件专题aarXiv cs.LG@Aleksander Ficek 等 5 人3 个信源在谈原文稍后读已读值得跟进有用关注 Nemotron-3
论文精选73°11:51UE5M3 FP4块缩放实现稳定语言模型预训练NVIDIA提出新方法让FP4预训练更稳定,训练速度提升21.2%,模型性能全面超越现有方案。#Nemotron-H#FP4#UE5M3#量化训练aarXiv cs.LG@Robert Hu 等 3 人原文稍后读已读值得跟进有用关注 Nemotron-H
论文精选73°11:50Trace as State:长上下文Transformer的条件状态更新DeepSeek和GLM-5.2通过将推理痕迹前置,长上下文推理准确率大幅提升,最高达100%。#Trace as State#DeepSeek V4 Pro Preview#GLM-5.2#长上下文aarXiv: DeepSeek@Xu Zou, Jie Tang原文稍后读已读值得跟进有用关注 Trace as State
论文多源确认精选73°11:49大模型与本体排序器融合提升罕见病诊断研究将LLM与本体排序器融合,提升罕见病诊断准确率,同时保留可追溯的证据链。#本体排序器#罕见病诊断#大语言模型#DeepSeek-V4-Flash3 个信源在谈事件专题aarXiv: DeepSeek@Zhaoyang Jiang 等 8 人4 个信源在谈原文稍后读已读值得跟进有用关注 本体排序器
论文精选73°11:49FUSE框架评估LLMs危险能力FUSE框架首次系统评估了12个商业LLM的危险能力,发现模型间存在显著差异,新模型知识增强但安全提升有限。#FUSE#LLMs#Claude#DeepSeekaarXiv: DeepSeek@Zhengyi Jin 等 8 人原文稍后读已读值得跟进有用关注 FUSE
论文多源确认11:47语言模型中的门脸效应与拒绝行为研究Anthropic模型对人类说服技巧有反应,而OpenAI和Google模型反而更抗拒,这种差异很有意思。#Opus 5#门脸效应#拒绝行为#大语言模型10 个信源在谈事件专题aarXiv: OpenAI@Til Jordan11 个信源在谈原文稍后读已读值得跟进有用关注 Opus 5
论文11:44语言模型概率预测一致性研究荷兰书利润方法评估语言模型预测一致性,发现模型在概率预测上存在显著不一致,尤其在复杂逻辑关系下更明显。#语言模型#概率预测#荷兰书#一致性aarXiv cs.LG@Isaiah Andrews, Suproteem Sarkar原文稍后读已读值得跟进有用关注 语言模型
论文精选11:44可调线性生成先验在压缩传感中的全模型最优性这篇论文揭示了压缩传感中可调线性生成先验的理论边界,解释了为什么神经网络先验的可调性在实际应用中有效。#压缩传感#生成先验#线性模型#重建误差aarXiv cs.LG@Zhaoming Li, Paul Hand原文稍后读已读值得跟进有用关注 压缩传感
论文精选73°11:43CodePoisonRAG:检索增强代码生成知识投毒攻击研究人员展示了如何针对代码生成系统进行精准知识投毒,成功率高达93%,连安全防御都难以完全阻挡。#CodePoisonRAG#RACG#CWE#代码生成aarXiv cs.LG@Varun Gadey 等 3 人原文稍后读已读值得跟进有用关注 CodePoisonRAG
论文精选73°11:43从重加权到重写:解锁训练数据归因中样本的干预效果研究人员发现影响函数选中的样本通过重写而非重加权能更有效改变模型行为,这对训练数据归因方法评估有重要启示。#训练数据归因#影响函数#开源大模型#干预效果aarXiv cs.LG@Yuzhang Luo 等 4 人原文稍后读已读值得跟进有用关注 训练数据归因
论文11:42表格基础模型是否了解物理原理这篇论文测试了4个表格模型在316个物理方程上的表现,发现它们能插值物理但不懂单位和噪声机制。#TabPFN#TabDPT#表格基础模型#物理模型aarXiv cs.LG@Wassim Tenachi 等 4 人原文稍后读已读值得跟进有用关注 TabPFN
论文73°11:42医疗问答中的误导上下文机制研究医疗AI研究团队发现模型对断言比对证据更易受影响,开放推理轨迹能更好检测错误决策。#MedMisBench#医疗问答#推理模型#LLM监控aarXiv cs.LG@Robin Linzmayer, Noémie Elhadad原文稍后读已读值得跟进有用关注 MedMisBench
论文精选73°11:42HiPoly:分层聚合物原生AI框架HiPoly框架能从实验数据直接预测聚合物性质并设计可持续替代品,比传统方法更高效准确。#HiPoly#G2RINS#聚合物#分子设计aarXiv cs.LG@Ge Sun 等 8 人原文稍后读已读值得跟进有用关注 HiPoly
论文78°11:40语言模型可自主控制注意力机制新DA协议让模型自己决定关注哪部分内容,大幅减少计算量,Gemma和Qwen模型效果显著。#声明式注意力#Gemma-4-31B#Qwen-3.6-27B#长上下文1 个信源在谈事件专题aarXiv cs.LG@Namgyu Ho 等 6 人2 个信源在谈原文稍后读已读值得跟进有用关注 声明式注意力
论文精选73°10:15大模型自动注入智能合约漏洞论文展示用大模型自动生成带漏洞的智能合约,帮助测试安全工具,发现现有分析工具的局限性。#智能合约#大模型#漏洞检测#SolidityaarXiv cs.AI@Luca Migliaccio 等 5 人原文稍后读已读值得跟进有用关注 智能合约
论文10:12生成式AI对集体创造力的影响研究这篇论文分析了AI如何影响人类创造力,提出混合团队表现优于单一团队,探讨了AI与人类创意互补的可能性。#生成式AI#创造力#混合团队#文化创作aarXiv cs.AI@Mason Youngblood 等 7 人原文稍后读已读值得跟进有用关注 生成式AI
论文10:12大语言模型在市场机制中的竞争行为研究这篇论文测试了GPT、Claude等LLM在真实市场机制中的表现,发现它们比人类效率低,还公开了测试框架。#LLM#双向拍卖#市场均衡#思维链aarXiv cs.AI@Pawel Struski 等 4 人原文稍后读已读值得跟进有用关注 LLM
论文73°10:09UGC增强图像异常感知数据集与框架OpenAI发布新数据集和方法,专门解决社交媒体图片增强后的异常检测问题,比传统方法更准确。#UEAP-4k#DFAP-UGC#UGC#图像增强aarXiv cs.AI@Yan Zhong 等 7 人原文稍后读已读值得跟进有用关注 UEAP-4k
论文精选73°10:09文本到图像模型视觉隐喻生成基准研究研究人员发布了首个视觉隐喻生成基准,测试了11个模型,发现即使是最好的模型在隐喻表达方面也有明显不足。#VMetaphor-Bench#T2I#视觉隐喻#文本到图像aarXiv cs.AI@Chuer Chen 等 5 人原文稍后读已读值得跟进有用关注 VMetaphor-Bench
论文精选73°10:08ViSAR:无需训练的自适应k检索方法ViSAR让文档问答系统更聪明,能根据问题复杂度自动调整检索页面数,速度提升近六成还不影响准确率。#ViSAR#DocVQA#RAG#视觉文档问答aarXiv cs.AI@Adrien Mialland 等 4 人原文稍后读已读值得跟进有用关注 ViSAR