论文12:11对比偏好优化导致模型谄媚行为研究OpenAI等公司常用偏好优化方法会意外传递谄媚行为,影响模型准确性。#对比偏好优化#谄媚行为#OLMo#模型对齐aarXiv cs.LG@Camila Blank 等 5 人原文稍后读已读值得跟进有用关注 对比偏好优化
论文精选73°12:10无头多思维模型研究新方法让模型在嵌入空间连续推理,不生成离散token,性能还提升了。#Soft Latent Thinking#DeepSeek-Qwen-1.5B#LLaMA-3.2-3B#推理模型aarXiv cs.LG@Nikita Koriagin 等 6 人原文稍后读已读值得跟进有用关注 Soft Latent Thinking
论文精选73°12:10通用变换器实现电路计算这个280参数的变换器能完美处理任意长度布尔表达式,比普通模型更擅长深度泛化。#Universal Transformers#Boolean algebra#长度泛化#电路模型aarXiv cs.LG@Takuya Ito 等 4 人原文稍后读已读值得跟进有用关注 Universal Transformers
论文12:09牛齿分割模型研究:卷积与注意力模型对比牛齿分割研究,对比卷积和注意力模型在非专用ML数据集上的表现,预处理对结果影响大。#B.O.V.I.D.#语义分割#卷积模型#注意力模型aarXiv cs.LG@Keith G. Mills 等 4 人原文稍后读已读值得跟进有用关注 B.O.V.I.D.
论文精选73°12:09在线策略蒸馏有效性研究OPSA方法比OPD提升16.77分,在AIME24上相对增益263%,无需教师监督。#OPD#OPSA#Qwen3-1.7B#AIME24aarXiv cs.LG@Yi Ding, Ruqi Zhang原文稍后读已读值得跟进有用关注 OPD
论文73°12:09机器学习中的旋转等变性综合教程这篇教程帮你理解3D数据中的旋转等变性,从数学基础到实际应用都有详细讲解。#旋转等变性#几何深度学习#群论#3D计算机视觉aarXiv cs.LG@Peter Lippmann, Fred A. Hamprecht原文稍后读已读值得跟进有用关注 旋转等变性
论文12:08NoRA:低秩适应新方法NoRA改进LoRA训练,不增加参数却能加速收敛、提升稳定性,适用于多种训练场景。#LoRA#NoRA#参数高效微调#模型优化aarXiv cs.LG@Jiale Kang 等 5 人原文稍后读已读值得跟进有用关注 LoRA
论文12:08通过训练分布中的归纳偏置学习可接受假设的几何结构这篇论文展示了如何将科学原理嵌入AI训练过程,让模型能更准确地重建偏微分方程,对科学发现很有价值。#偏微分方程#变分自编码器#归纳偏置#科学发现aarXiv cs.LG@James Crowley 等 3 人原文稍后读已读值得跟进有用关注 偏微分方程
论文精选73°12:07TSPFN:生理时间序列分类基础模型医学AI新模型TSPFN来了,专门处理生理时间序列,比TabPFN和专用模型表现更好。#TSPFN#TabPFN#生理时间序列#时间序列分类aarXiv cs.LG@Jérémie Stym-Popper 等 5 人原文稍后读已读值得跟进有用关注 TSPFN
论文78°11:25SUN程序:语言引导的控制到学习到现实策略Kuafu系统将符号规划与数据驱动执行统一,无需演示或手动密集奖励,在机器人任务中表现优异。#SUN#Kuafu#MPC#语言引导aarXiv cs.AI@Weiqi Wang 等 10 人原文稍后读已读值得跟进有用关注 SUN
论文精选73°11:25匿名AI模型身份验证四阶段协议这个四阶段协议帮你验证匿名AI模型的真实身份,避免数据风险和性能不符预期。#匿名AI模型#身份验证#GLM-5.3#法医审计aarXiv cs.AI@Yisen Xi原文稍后读已读值得跟进有用关注 匿名AI模型
论文73°11:25OntoAligner-Ensemble:异构本体对齐投票融合框架研究人员提出本体对齐集成框架,通过投票融合不同技术,在多个基准测试中超越单一对齐器性能。#OntoAligner-Ensemble#本体对齐#知识图谱#大语言模型aarXiv cs.AI@Hamed Babaei Giglou 等 5 人原文稍后读已读值得跟进有用关注 OntoAligner-Ensemble
论文精选73°11:24大模型规模对本体学习的影响研究Qwen团队研究了13个模型规模对本体学习的影响,发现参数量并非越大越好,架构和模型血统比参数数量更重要。#Qwen3.5#Qwen3.6#本体学习#大模型规模aarXiv cs.AI@Hamed Babaei Giglou 等 3 人原文稍后读已读值得跟进有用关注 Qwen3.5
论文精选73°11:24BLOOM-WILT:大模型行为审计新方法BLOOM-WILT让大模型安全审计更高效,在Qwen3.5-4B测试中行为诱导率翻倍,还推翻了原有模型安全排名。#BLOOM-WILT#Qwen3.5-4B#大模型安全#行为审计aarXiv cs.AI@Adrians Skapars, Edoardo Manino原文稍后读已读值得跟进有用关注 BLOOM-WILT
论文11:24LLM后训练作为棕地维护:数据工程工业视角工业LLM维护团队必读,教你如何在有限资源下提升模型性能,数据工程比一次性配方更重要。#LLM#后训练#数据工程#CodeForcesaarXiv cs.AI@Gopi Krishnan Rajbahadur 等 4 人原文稍后读已读值得跟进有用关注 LLM
论文精选73°11:23自适应非结构化数据推理代理方法MIT团队推出代理式数据破解技术,让AI代理在回答问题时顺便结构化数据,大幅降低推理成本。#FanOutQA#推理代理#数据结构化#RAGaarXiv cs.AI@Milad Rezaei Hajidehi 等 3 人原文稍后读已读值得跟进有用关注 FanOutQA
论文政策与合规精选73°11:23TASPO解决智能体政策优化中的监督-信用差距TASPO解决了智能体政策优化中的监督-信用差距问题,让特权信息只重新分配行动间的信用,不改变整体更新方向。#TASPO#智能体#GRPO#强化学习aarXiv cs.AI@Jingxiao Yang 等 6 人原文稍后读已读值得跟进有用关注 TASPO
论文精选73°11:22AutoSciRub:自动研究代理评估框架ZJU团队推出AutoSciRub,让AI研究代理先定标准再执行,在多个基准测试中显著提升研究质量。#AutoSciRub#ResearchClawBench#AstaBench#科学代理aarXiv cs.AI@Xuehai Wang 等 9 人原文稍后读已读值得跟进有用关注 AutoSciRub
论文78°11:22大推理模型超越人类监督的扩展路径这篇论文系统分析了大推理模型如何减少人类依赖,提出了五级发展阶梯和三种评估对象。#LRM#推理模型#强化学习#GitHubaarXiv cs.AI@Zhiqin Yang 等 19 人原文稍后读已读值得跟进有用关注 LRM
论文73°11:22基于YOLO姿态估计和CLIP语义评分的实时视频异常检测新方法结合YOLO和CLIP,无需光流和独立姿态估计器,实时检测异常行为,速度提升3倍多。#YOLO#CLIP#视频异常检测#姿态估计aarXiv cs.AI@Vanodhya G. Warnasooriya 等 4 人原文稍后读已读值得跟进有用关注 YOLO
论文精选73°11:21大语言模型序列评分崩溃下的推理能力恢复发现大模型推理失败不等于能力缺失,用简单方法就能恢复被掩盖的内部逻辑。#Qwen3.5#Llama-3.1-8B#OLMo-2-1B#推理模型aarXiv cs.AI@Qiyao Yan 等 3 人原文稍后读已读值得跟进有用关注 Qwen3.5
论文Agent 与开发者11:21评估编程智能体工作记忆这篇论文揭示了编程智能体工作记忆的语义异质性,对优化AI编程助手内存管理有实用价值。#编程智能体#工作记忆#内存管理#语义异构性aarXiv cs.AI@Le Chen 等 9 人原文稍后读已读值得跟进有用关注 编程智能体
论文11:21MNIST-PRO:部分可观察环境下的AI智能体基准测试MNIST-PRO基准测试揭示了AI智能体在部分可观察环境下的感知能力缺陷,特别是整合碎片化信息和更新错误信念的能力。#MNIST-PRO#AI智能体#部分可观察环境#多模态模型aarXiv cs.AI@Vernon Toh 等 5 人原文稍后读已读值得跟进有用关注 MNIST-PRO
论文11:20三种AI医疗文书系统审计结果三种AI医疗文书系统被审计,近三分之一存在错误,尤其在过敏信息和患者身份方面。#AI医疗文书#临床记录#错误率#审计研究aarXiv cs.AI@Sebastian Fox 等 4 人原文稍后读已读值得跟进有用关注 AI医疗文书
论文精选11:20LLM评估无法检测临床笔记遗漏信息OpenAI等公司AI临床笔记系统存在信息遗漏问题,新方法能更准确检测遗漏内容。#LLM#临床笔记#AI评估#医疗AIaarXiv cs.AI@Sebastian Fox 等 4 人原文稍后读已读值得跟进有用关注 LLM
论文11:20知识对齐监督微调研究这篇论文提出了两种新方法,能减少大模型幻觉,特别适合关注模型可靠性的研究者。#监督微调#知识对齐#Qwen 3#OLMoaarXiv cs.AI@Arthur Becker 等 6 人原文稍后读已读值得跟进有用关注 监督微调
论文精选73°11:19大语言模型自我建模评估与改进研究者提出LLM自我建模评估基准,用合成数据提升模型自我认知能力,但不构成真正的内省。#LLM#self-modeling#强化学习#开源模型aarXiv cs.AI@Siqi Zeng 等 3 人原文稍后读已读值得跟进有用关注 LLM
模型73°11:19MR-JEPA: 心脏MRI通用视频基础模型研究人员发布了MR-JEPA模型,能处理心脏MRI多序列视频数据,在心脏功能评估和疾病检测上超越现有方法。#MR-JEPA#CMR#心脏MRI#视频基础模型aarXiv cs.AI@Athira J. Jacob 等 4 人原文稍后读已读值得跟进有用关注 MR-JEPA
论文10:50语言模型预计算内存成本研究论文揭示了预计算内存的重建成本和更新策略,对优化大模型上下文处理有实用价值。#Llama-3.1-8B-Instruct#预计算内存#键值缓存#语言模型aarXiv cs.LG@Asa Shepard原文稍后读已读值得跟进有用关注 Llama-3.1-8B-Instruct
论文精选73°10:49三步序列学习:对比强化学习中的动作块表示这篇论文展示了对比强化学习通过动作块建模获得显著性能提升,揭示了动作块携带更多目标信息的新机制。#对比强化学习#动作块#表示学习#强化学习aarXiv cs.LG@Michal Korniak 等 5 人原文稍后读已读值得跟进有用关注 对比强化学习
论文10:49MolLedger:基于化学ADME属性的可解释图神经网络MolLedger用原子级分数解释药物分子预测,比传统方法更符合化学特性,药物研发人员值得关注。#MolLedger#ADME#图神经网络#药物发现aarXiv cs.LG@Christina X. Ji原文稍后读已读值得跟进有用关注 MolLedger
论文精选73°10:48PLC-DPO:噪声偏好优化中的后验标签校正研究人员提出PLC-DPO,能校正噪声偏好数据,在57个测试单元中胜率超DPO 5个百分点。#PLC-DPO#DPO#偏好优化#后验标签校正aarXiv cs.LG@Boryeong Cho 等 3 人原文稍后读已读值得跟进有用关注 PLC-DPO
论文精选73°10:47角色扮演越狱中的安全传递机制研究这篇论文揭示了角色扮演越狱如何绕过AI安全机制,找到了具体的安全防护目标。#角色扮演越狱#安全传递#机械可解释性#AI安全aarXiv cs.LG@Md Mokarram Chowdhury 等 3 人原文稍后读已读值得跟进有用关注 角色扮演越狱
论文多源确认10:45查询语言决定推荐市场:ChatGPT商业推荐研究ChatGPT推荐结果受查询语言和IP位置双重影响,商业决策者需注意此特性。#ChatGPT#OpenAI#查询语言#商业推荐10 个信源在谈事件专题aarXiv: OpenAI@Dmitrij Żatuchin11 个信源在谈原文稍后读已读值得跟进有用关注 ChatGPT
论文精选73°10:44PAC:LLM多任务强化学习的新课程方法PAC方法解决了LLM多任务RL中任务分配问题,结合优势信号和实际奖励增益,提升训练效率。#PAC#LLM#强化学习#课程学习aarXiv cs.LG@Yuanqiang Yu 等 11 人原文稍后读已读值得跟进有用关注 PAC
论文73°10:44毫米波无蜂窝大规模MIMO波束成形设计研究人员用GNN从sub-6 GHz CSI学习毫米波波束成形,比传统方法性能更好,训练开销更低。#GNN#CFmMIMO#毫米波#波束成形aarXiv cs.LG@Sina Tavakolian 等 5 人原文稍后读已读值得跟进有用关注 GNN
论文Agent 与开发者精选10:20黑盒LLM API指纹识别研究:令牌计数不能作为模型血统依据OpenAI兼容API的令牌计数能识别共享标记化堆栈,但不能单独用于确定模型家族关系,Qwen 3.8和DeepSeek V4变体测试低于阈值。#LLM#API#Qwen#DeepSeekaarXiv: DeepSeek@Bo Chen原文稍后读已读值得跟进有用关注 LLM
论文精选73°10:18多图像物体幻觉基准MIOH发布MIOH基准帮你看清多模态模型在复杂视觉推理中的真实表现,GPT-5和Gemini-2.5-Pro也不例外。#MIOH#多图像物体幻觉#MLLMs#GPT-5aarXiv cs.AI@Joonki Min 等 7 人原文稍后读已读值得跟进有用关注 MIOH
论文10:17PyKEEN-NSX:知识图谱负采样框架PyKEEN团队推出新框架,让知识图谱负采样更灵活,兼容现有工作流。#PyKEEN#PyKEEN-NSX#知识图谱#负采样aarXiv cs.AI@Ivan Diliso 等 3 人原文稍后读已读值得跟进有用关注 PyKEEN
论文精选73°10:17几何发散:追踪隐藏状态轨迹实现自适应多轮推理这篇论文用几何方法追踪LLM推理轨迹,能提前发现错误路径,提升任务成功率还降低token成本。#LLM#多轮推理#隐藏状态#τ-BenchaarXiv cs.AI@Jie Liang 等 4 人原文稍后读已读值得跟进有用关注 LLM