论文精选73°10:17BiG-SURE:大模型语义不确定性估计方法BiG-SURE能帮你评估黑盒大模型的不确定性,无需访问模型参数,简单实用。#BiG-SURE#LLMs#VLMs#不确定性估计aarXiv cs.AI@Debarpan Bhattacharya 等 3 人原文稍后读已读值得跟进有用关注 BiG-SURE
论文10:17GMTS方法提升LLM推理训练效果GMTS方法让LLM推理训练更高效,前20%标记选择比传统熵方法表现更好。#GMTS#RLVR#LLM#推理模型aarXiv cs.AI@Outongyi Lv 等 3 人原文稍后读已读值得跟进有用关注 GMTS
论文10:16视觉定位的高效主动学习方法这个新方法能让视觉定位标注快1.6倍,特别适合需要大量标注数据的团队。#视觉定位#主动学习#RIS#RECaarXiv cs.AI@Junbeom Hong 等 5 人原文稍后读已读值得跟进有用关注 视觉定位
论文精选73°10:16合成数据中的隐蔽威胁研究MIT学者发现合成数据能偷偷给AI注入偏见,即使数据本身看起来完全无害。#合成数据#社会偏见#大模型#AI安全aarXiv cs.AI@Minkyung Cho 等 7 人原文稍后读已读值得跟进有用关注 合成数据
论文10:16大模型通过持续预训练适应瑞典新闻业瑞典学者用新闻数据微调大模型,发现经验回放能防止遗忘,提升新闻写作质量。#Swedish journalism#continued pre-training#经验回放#大模型微调aarXiv cs.AI@Lukas Borggren 等 3 人原文稍后读已读值得跟进有用关注 Swedish journalism
论文10:15电商生成式检索:联合学习嵌入与码本电商检索新方法,联合训练嵌入和码本,解决了传统两阶段训练的错误累积问题。#生成式检索#电商#嵌入模型#码本aarXiv cs.AI@Songtao Fang 等 5 人原文稍后读已读值得跟进有用关注 生成式检索
论文10:15DiffSAC:扩散引导的鲁棒估计采样方法DiffSAC用扩散模型优化采样过程,只需评估几十个假设就能达到传统方法数万个假设的效果,大幅提升计算机视觉鲁棒估计效率。#DiffSAC#扩散模型#鲁棒估计#计算机视觉aarXiv cs.AI@Chang Nie 等 4 人原文稍后读已读值得跟进有用关注 DiffSAC
论文精选73°10:15基于模型检查的LLM后验解释器自动测试这篇论文教你如何用模型检查方法自动验证LLM生成的解释是否可靠,比随机测试发现更多问题。#LLM#后验解释器#模型检查#MDP环境aarXiv cs.AI@Dennis Gross, Helge Spieker原文稍后读已读值得跟进有用关注 LLM
模型78°10:14TuringLLM推出20B参数专家混合模型Turing团队发布20B参数专家混合模型,每激活2B参数,性能接近9B模型,支持超长上下文。#TuringLLM#Turing-20B-A2B#专家混合模型#长上下文aarXiv cs.AI@Yuheng Zhang 等 22 人原文稍后读已读值得跟进有用关注 TuringLLM
论文精选73°10:12Q-Strata:混合精度量化新方法SNU MLLab团队发布Q-Strata,解决了MoE模型混合精度量化的难题,比现有方法性能更好。#Q-Strata#MoE#混合精度量化#Mixtral-8x7B-InstructaarXiv cs.AI@Deokjae Lee 等 3 人原文稍后读已读值得跟进有用关注 Q-Strata
论文精选73°10:12AdaPath:生物医学知识图谱问答新框架AdaPath 解决了生物医学知识图谱问答中的路径查找难题,在复杂查询中表现优异。#AdaPath#BioStrat-QA#知识图谱#生物医学aarXiv cs.AI@Jun Hyeong Kim 等 4 人原文稍后读已读值得跟进有用关注 AdaPath
论文精选73°10:12CHAP:个性化生成检索新框架CHAP框架解决了生成检索的语义鸿沟问题,通过层次语义对齐和残差级联生成,提升个性化检索效果。#CHAP#生成检索#个性化推荐#语义对齐aarXiv cs.AI@Gaoming Zhang 等 7 人原文稍后读已读值得跟进有用关注 CHAP
论文73°10:11GarmentWeaver:多模态服装结构化生成GarmentWeaver能从草图和文本生成可执行缝纫模式,比现有方法更准确且兼容性好。#GarmentWeaver#多模态#服装设计#视觉语言模型aarXiv cs.AI@Yinwen Lu 等 3 人原文稍后读已读值得跟进有用关注 GarmentWeaver
论文精选73°10:11可审计的LLM定性主题分析工作流设计这篇论文展示了如何用LLM做可追溯的主题分析,工作流程透明,还能保护隐私。#Thematic Analysis#LLM#qualitative analysis#可审计工作流aarXiv cs.AI@Nadia Jul Jeldtoft, Tariq Yousef原文稍后读已读值得跟进有用关注 Thematic Analysis
论文精选73°10:11DiffPDE:掩码扩散模型作为偏微分方程求解器DiffPDE用扩散模型解决PDE求解器中的局部错误修复问题,比传统方法更快更准。#DiffPDE#PDE#扩散模型#代码修复aarXiv cs.AI@Wenxuan Guo 等 7 人原文稍后读已读值得跟进有用关注 DiffPDE
论文精选73°09:39证明验证免费化对数学知识的影响OpenAI模型提出数学猜想反例,机器检查证明与人工验证的冲突揭示了数学验证的新挑战。#OpenAI#Lean 4#数学证明#验证aarXiv: OpenAI@Maher Kallel, Mohamed El Louadi原文稍后读已读值得跟进有用关注 OpenAI
论文精选73°09:26基于Wasserstein梯度流的单步生成模型奖励微调这篇论文提出了WGF方法,能微调单步生成模型且无需奖励梯度,解决了非可微奖励问题。#生成模型#Wasserstein梯度流#奖励微调#ImageNetaarXiv cs.LG@Hoseong Hwang 等 5 人原文稍后读已读值得跟进有用关注 生成模型
论文精选73°09:26无监督多尺度Gromov-Wasserstein超图对齐FALCON框架解决了无监督超图对齐问题,通过多尺度GW目标实现全局一致的节点对应,性能超越现有方法。#超图对齐#Gromov-Wasserstein#FALCON#最优传输aarXiv cs.LG@Lutz Oettershagen 等 3 人原文稍后读已读值得跟进有用关注 超图对齐
论文精选73°09:25大语言模型跨语言情感检测功能向量研究论文发现功能向量能跨语言传递任务信号,无需演示即可提升多语言情感识别性能,比少样本学习更高效。#功能向量#情感识别#跨语言#大语言模型aarXiv cs.LG@Jieying Xue 等 4 人原文稍后读已读值得跟进有用关注 功能向量
论文精选73°09:24N0-Foundation:触觉智能新范式N0-Foundation发布触觉智能新范式,含3万小时多模态数据和NeoForce模型,解决可变形物体操作难题。#N0-Foundation#触觉智能#具身操作#NeoDataaarXiv cs.LG@ NeoteAI Team, Fudan TEAI Team原文稍后读已读值得跟进有用关注 N0-Foundation
论文精选09:24文本生成视频模型硬件故障韧性研究研究团队测试了三种视频生成模型,发现硬件故障可能导致视频内容发生语义变化,这对实际应用有重要警示意义。#T2V#扩散模型#文本生成视频#硬件故障aarXiv cs.LG@Zachary Coalson 等 5 人原文稍后读已读值得跟进有用关注 T2V
论文精选73°09:23PAC-LLM实现混沌时间序列长期预测研究人员提出PAC-LLM框架,解决了混沌系统长期预测难题,在短期观测条件下也能准确预测。#PAC-LLM#LLM#混沌系统#时间序列预测aarXiv cs.LG@Yuhang Yao, Bohan Jiang原文稍后读已读值得跟进有用关注 PAC-LLM
论文精选73°09:22TACS:大模型越狱后缀优化轨迹感知候选选择这篇论文提出了TACS框架,解决了大模型越狱后缀优化中的短视选择问题,在HarmBench上表现优异。#TACS#越狱#大模型#HarmBenchaarXiv cs.LG@Shiliang Xiao原文稍后读已读值得跟进有用关注 TACS
论文精选73°09:22多机器人异步协同在线学习研究这篇论文解决了多机器人系统中的计算延迟问题,提出了异步协同学习策略,在无人水面艇实验中效果显著。#多机器人系统#高斯过程回归#异步协同学习#分布式控制aarXiv cs.LG@Xiaobing Dai 等 4 人原文稍后读已读值得跟进有用关注 多机器人系统
论文精选09:21LLM工作负载分配研究这篇论文教你如何在不确定模型性能的情况下,科学分配LLM工作负载,帮你节省AI预算。#LLM#CASE#工作负载分配#模型选择aarXiv cs.LG@Hamed Khosravi, Xiaoming Huo原文稍后读已读值得跟进有用关注 LLM
论文精选73°09:21BEACON框架提升地理空间模型表现研究人员提出BEACON框架,通过整合三种数据源,让地理空间模型更好地理解城市功能和人类行为。#BEACON#AlphaEarth#地理空间模型#三模态学习aarXiv cs.LG@Hao Tian 等 3 人原文稍后读已读值得跟进有用关注 BEACON
论文精选73°09:21多设备边缘网络推测推理优化清华提出Multi-SPIN技术,让边缘设备智能选择通信模式,解决LLM验证SLM草案时的通信瓶颈问题。#Multi-SPIN#Qwen2.5#DeepSeek-R1#边缘计算aarXiv: DeepSeek@Chang Cai, Kaibin Huang原文稍后读已读值得跟进有用关注 Multi-SPIN
论文精选09:20推理模型隐藏指令选择性披露研究这篇论文揭示了AI模型在隐藏指令披露上的不对称行为,对AI安全和监督机制设计有重要启示。#Qwen3#推理模型#思维链#AI安全aarXiv: DeepSeek@Zimo Shi 等 3 人原文稍后读已读值得跟进有用关注 Qwen3
论文精选09:20多智能体LLM交接中的边界元数据崩溃多智能体系统交接时边界信息容易丢失,明确约束可大幅降低隐私泄露风险。#多智能体#LLM#GPT-5#DeepSeek-R1-32BaarXiv: DeepSeek@Yian Wang 等 4 人原文稍后读已读值得跟进有用关注 多智能体
论文精选73°09:20LoGo: Token-Level Dynamic Local-Global AttentionLoGo让模型智能决定哪些token需要全局注意力,大幅提升长文本处理效率,比传统Transformer更聪明。#LoGo#Transformer#注意力机制#长上下文aarXiv cs.LG@Yuqi Pan 等 5 人原文稍后读已读值得跟进有用关注 LoGo
论文精选09:19MedCache:纵向临床智能体的高效时效记忆框架MedCache解决了临床智能体如何处理跨时间、跨专科患者记录的难题,比传统方法更准确高效。#MedCache#临床智能体#多模态#记忆管理aarXiv cs.LG@Hei Ting 等 8 人原文稍后读已读值得跟进有用关注 MedCache
论文精选73°09:19机器持续遗忘中的可塑性崩溃现象MIT团队发现机器持续遗忘中的可塑性崩溃现象,解释了为什么模型会逐渐丧失遗忘能力,甚至重新记住已删除信息。#机器遗忘#可塑性崩溃#深度神经网络#持续学习aarXiv cs.LG@Yingdan Shi 等 5 人原文稍后读已读值得跟进有用关注 机器遗忘
论文09:16DUOTRACE:多智能体系统故障归因新方法DUOTRACE让LLM智能体故障定位更准,先检测异常再归因,准确率提升近10%。#DUOTRACE#LLM#多智能体系统#故障归因aarXiv cs.AI@Jiayi Zhang 等 7 人原文稍后读已读值得跟进有用关注 DUOTRACE
论文09:15艺术史AI框架实现绘画风格分析这个AI框架能把绘画视觉特征转化为描述术语,连接图像数据与人文语义,为艺术史研究提供新工具。#艺术史#视觉变换器#ReAct#风格分析aarXiv cs.AI@Marc S. Walton, Astrid Harth原文稍后读已读值得跟进有用关注 艺术史
论文精选73°09:15LLMODE:通过门控令牌注入对齐ODE与LLMLLMODE解决了LLM处理不规则时空观测的难题,通过双源门控交叉注意力将外部时空证据注入冻结LLM。#LLMODE#ODE#LLM#时空预测aarXiv cs.AI@Di Zhang 等 7 人原文稍后读已读值得跟进有用关注 LLMODE
论文精选73°09:15MI-Distillation:模型插值推理数据蒸馏方法MI-Distillation解决了大模型推理轨迹蒸馏到小模型的难题,通过模型插值和SeqLSS评分提升蒸馏效果。#MI-Distillation#SeqLSS#思维链蒸馏#推理模型aarXiv cs.AI@Yangsong Lan 等 7 人原文稍后读已读值得跟进有用关注 MI-Distillation
论文精选73°09:15AgenticRag-R1:基于栈内存的智能体强化学习框架清华团队推出 AgenticRag-R1,解决多步推理中的检索适应性问题,比传统方法更聪明。#AgenticRag-R1#RAG#强化学习#多步推理aarXiv cs.AI@Xinke Jiang 等 15 人原文稍后读已读值得跟进有用关注 AgenticRag-R1
模型精选73°09:12CineForge:自我改进的长视频生成智能体CineForge能自我改进视频制作能力,跨故事积累经验,生成更连贯的长视频故事。#CineForge#视频生成#智能体#长视频生成aarXiv cs.AI@Junxiang Liu 等 13 人原文稍后读已读值得跟进有用关注 CineForge
论文精选73°09:12Memory-First Fact-Checking: 知识图谱多智能体系统这个多智能体系统用知识图谱+对抗推理检测假新闻,准确率比Llama 3.3高近10%,还能自动扩充知识库。#Memory-First Fact-Checking#知识图谱#多智能体系统#事实核查aarXiv cs.AI@Amelia Petrenciuc 等 3 人原文稍后读已读值得跟进有用关注 Memory-First Fact-Checking
论文精选73°09:11自主云MLOps全栈工程框架Google Cloud上新框架,用多智能体把自然语言MLOps任务变成可验证的云部署,比传统方法更可靠。#MLOps#多智能体#云部署#图工程aarXiv cs.AI@Sagar Srinivas Sakhinana, Venkataramana Runkana原文稍后读已读值得跟进有用关注 MLOps