论文精选73°10:13大模型SFT-RL标注预算分配研究研究人员发现小模型实验就能确定可转移的近最优区域,无需大规模搜索,大幅降低大模型训练成本。#SFT#RL#大模型#标注预算aarXiv cs.LG@Jingtan Wang 等 7 人原文稍后读已读值得跟进有用关注 SFT
论文73°10:12SAGE框架:从VLM教师学习自主策略SAGE框架让VLM只在关键时刻提供指导,大幅减少调用次数,学习到的策略甚至能超越VLM教师表现。#SAGE#VLM#强化学习#视觉语言模型aarXiv cs.LG@Matteo Merler 等 5 人原文稍后读已读值得跟进有用关注 SAGE
论文10:12结构检索中的表面形式偏差研究这篇论文揭示了嵌入检索在表面形式与意义分离时的严重偏差,数学领域完全失败,轨迹领域表现不一。#MathNet-Retrieve#ALFWorld#嵌入检索#表面形式偏差aarXiv cs.LG@Nabira Rashid, Manolis Kellis原文稍后读已读值得跟进有用关注 MathNet-Retrieve
论文精选73°10:11LLMs能否发现科学定律研究研究人员发布科学定律发现基准SCILAWS-BENCH,包含真实数据和合成世界两种测试场景,评估LLM科学发现能力。#SCILAWS-BENCH#LLMs#科学发现#基准测试aarXiv cs.LG@Yiming Huang 等 14 人原文稍后读已读值得跟进有用关注 SCILAWS-BENCH
论文精选73°10:11LRNBA神经网络压缩框架发布MIT团队发布LRNBA框架,用共享神经基压缩网络,参数相同下网络更深更宽,训练更稳定。#LRNBA#神经网络压缩#参数效率#RNNaarXiv cs.LG@Binshuai Wang原文稍后读已读值得跟进有用关注 LRNBA
论文精选73°10:11NashDreamer:零和博弈模型强化学习框架斯坦福团队推出NashDreamer,解决零和博弈中的非平稳性问题,比无模型基线训练效率更高。#NashDreamer#强化学习#零和博弈#多智能体aarXiv cs.LG@Tomáš Holeček, Viliam Lisý原文稍后读已读值得跟进有用关注 NashDreamer
论文精选73°10:10LatentPress: 超越文本与视觉的上下文压缩LatentPress 用连续记忆令牌替代文本和图像压缩,压缩速度提升 10 倍,性能超越传统方法。#LatentPress#上下文压缩#连续记忆令牌#LongMemEval1 个信源在谈事件专题aarXiv cs.LG@Zhengze Zhou, Hejian Sang2 个信源在谈原文稍后读已读值得跟进有用关注 LatentPress
论文73°10:09优化拜占庭节点在去中心化联邦学习中的放置这篇论文提出了BPI指标,解决了去中心化联邦学习中拜占庭节点放置的关键问题,比传统基于节点中心性的启发式方法更准确。#拜占庭节点#联邦学习#BPI#网络安全aarXiv cs.LG@Edoardo Gabrielli, Gabriele Tolomei原文稍后读已读值得跟进有用关注 拜占庭节点
论文10:08模仿学习在灵巧操作中的时间鲁棒性研究ACT模型模仿专家学习,但在加速条件下性能下降幅度远大于专家,揭示模仿学习的时间鲁棒性问题。#ACT#ParcelStow#模仿学习#灵巧操作aarXiv cs.LG@Clinton Enwerem 等 3 人原文稍后读已读值得跟进有用关注 ACT
论文精选73°10:08扩散模型作为无时间步迭代推理训练课程新研究将扩散模型转化为迭代推理器,解决数独和迷宫问题表现优异,无需并行回滚或外部验证器。#扩散模型#迭代推理#Sudoku-Extreme#Maze-UniqueaarXiv cs.LG@Mariia Drozdova 等 7 人原文稍后读已读值得跟进有用关注 扩散模型
论文精选10:07图神经网络中的边环结构特征研究这篇论文提出边环特征解决GNN的结构描述问题,在ZINC-12k上表现优异,比传统方法更高效。#图神经网络#边环#1-WL#ZINC-12kaarXiv cs.LG@Lilian Marey, Charlotte Laclau原文稍后读已读值得跟进有用关注 图神经网络
论文精选73°10:07PLES方法高效估计超参数缩放定律PLES让大模型训练调参效率提升10倍,用小规模实验预测大规模最优配置。#PLES#超参数缩放定律#贝叶斯优化#大语言模型aarXiv cs.LG@Zhiliang Chen 等 6 人原文稍后读已读值得跟进有用关注 PLES
技巧Agent 与开发者多源确认09:42LoopCAT:本地化开源翻译教学工具OpenAI用GPT-5.5/5.6开发的翻译教学工具,让学生既能操作工作流又能评估AI决策。#LoopCAT#GPT-5.5#GPT-5.6#翻译技术9 个信源在谈事件专题aarXiv: OpenAI@Gokhan Dogru, Adrià Martín Mor10 个信源在谈原文稍后读已读值得跟进有用关注 LoopCAT
论文09:41StainPresetNet实现多方向染色标准化StainPresetNet解决了染色标准化中的方向限制问题,计算效率提升90%,适合病理图像分析。#StainPresetNet#染色标准化#病理图像#深度学习aarXiv cs.AI@Hongtao Kang 等 7 人原文稍后读已读值得跟进有用关注 StainPresetNet
论文精选73°09:40潜在递归思想:冻结大模型的推理方法研究人员提出LRT方法,让冻结大模型在连续表示空间中进行推理,仅需少量计算就能超越传统方法。#LRT#冻结LLM#推理模型#连续空间aarXiv cs.AI@Zhaoliang Chen, Jie Fu原文稍后读已读值得跟进有用关注 LRT
论文09:39EDRAC:阿拉伯方言阅读理解基准测试阿拉伯方言NLP研究者必看,首个覆盖五大方言的阅读理解基准,揭示现有模型局限。#EDRAC#阿拉伯方言#阅读理解#机器学习aarXiv cs.AI@Noor Abo Mokh 等 18 人原文稍后读已读值得跟进有用关注 EDRAC
论文Agent 与开发者09:39代码生成中提示词的作用评估这篇论文揭示了代码生成模型中提示词的实际作用,告诉你哪些提示真正有效,哪些只是表面功夫。#Qwen2.5-3B-Instruct#Phi-3.5-mini#代码生成#提示词工程aarXiv cs.AI@Will Badr原文稍后读已读值得跟进有用关注 Qwen2.5-3B-Instruct
论文09:39StateSwap:多选题支持消除框架隐藏状态研究这篇论文揭示了大模型在多选题中不一致回答的内部机制,通过StateSwap技术证明了不同表述方式会激活不同内部状态。#StateSwap#多选题#大语言模型#内部表示aarXiv cs.AI@Chao Gao 等 6 人原文稍后读已读值得跟进有用关注 StateSwap
论文精选73°09:38文本引导流匹配实现高效晶体结构生成TFMat用文本控制晶体生成,在MP-20基准达到92.04%匹配率,比CrystalFlow更高效。#TFMat#CrystalFlow#晶体结构生成#流匹配aarXiv cs.AI@Wentao Li原文稍后读已读值得跟进有用关注 TFMat
论文精选09:38卫星太阳能供电生成AI研究卫星用太阳能供电运行生成AI,研究如何在有限能量下平衡图像质量和传输可靠性。#生成AI#太阳能#卫星#扩散模型aarXiv cs.AI@Jierui Zhang 等 4 人原文稍后读已读值得跟进有用关注 生成AI
论文精选73°09:37ARISE-RL:基于强化学习的智能体自我进化框架OpenAI新框架ARISE-RL用评分协同进化解决开放智能体训练难题,ECR-Bench基准测试验证效果。#ARISE-RL#强化学习#智能体#ECR-BenchaarXiv cs.AI@Fanrui Zhang 等 16 人原文稍后读已读值得跟进有用关注 ARISE-RL
论文09:37跨多源行为预训练模型CM-PTM发布CM-PTM模型解决了移动设备用户行为建模的跨源挑战,能更好捕捉用户兴趣,提升游戏推荐效果。#CM-PTM#用户表示#移动游戏#预训练模型aarXiv cs.AI@Chengqi Yang 等 10 人原文稍后读已读值得跟进有用关注 CM-PTM
论文09:37WorldBench:多语言智能体文化基准测试研究人员发布WorldBench基准,测试多语言智能体在真实场景中的表现,发现当前模型在长周期任务中表现脆弱。#WorldBench#多语言智能体#基准测试#LLM-as-a-JudgeaarXiv cs.AI@Leonardo Ranaldi 等 4 人原文稍后读已读值得跟进有用关注 WorldBench
论文精选73°09:36滞后耦合:模型内部表征可读性先于因果性MIT发现AI模型内部表征可读性先于因果性,这一滞后现象在12B参数规模下依然存在,挑战了传统模型理解。#Pythia#滞后耦合#内部表征#因果性aarXiv cs.AI@Xining Xun原文稍后读已读值得跟进有用关注 Pythia
模型精选73°09:36HiveTraceGuard-Pro发布:0.6B安全护栏模型俄语安全护栏新模型,在俄语提示注入检测上表现优异,延迟最低,开源权重已发布。#HiveTraceGuard-Pro#Qwen3-0.6B#护栏模型#提示注入aarXiv cs.AI@Nikita Oblakov 等 3 人原文稍后读已读值得跟进有用关注 HiveTraceGuard-Pro
论文78°09:35AgentFactory:自动化智能体系统设计与优化研究人员推出AgentFactory,能自动优化智能体系统,比手动设计和现有方法效果更好,平均提升9.1%。#AgentFactory#智能体#自动化优化#LLMaarXiv cs.AI@Enci Zhang 等 5 人原文稍后读已读值得跟进有用关注 AgentFactory
论文精选73°09:35从截断到承诺:离散扩散模型中的持久上下文这篇论文提出CRS采样方法,通过持久上下文提升扩散模型性能,在相同NFE下获得更低GenPPL。#离散扩散模型#CRS#贝叶斯误差#GenPPLaarXiv cs.AI@Satoshi Hayakawa原文稍后读已读值得跟进有用关注 离散扩散模型
论文精选73°09:35ViTAMINS:自监督视觉Transformer合成难例训练研究ViTAMINS用合成难例提升视觉Transformer性能,资源效率还更高,ViT-B就能打败V-JEPA的ViT-L。#ViTAMINS#Vision Transformers#自监督学习#图像分类aarXiv cs.AI@Nikos Giakoumoglou 等 4 人原文稍后读已读值得跟进有用关注 ViTAMINS
论文精选73°09:35高风险机器学习系统的因果证据治理框架欧盟AI法案下,这个CEG框架帮你证明AI决策不是靠偏见,而是靠真实因果关系。#因果推理#CEG#AI监管#公平性aarXiv cs.AI@Samah Kareem, Barış Çeliktaş原文稍后读已读值得跟进有用关注 因果推理
论文09:34数据驱动人格条件化A/B测试模拟这篇论文教你如何用LLM代理模拟A/B测试,比传统方法快且成本低,准确率高达90%#A/B测试#LLM#人格条件化代理#数据驱动aarXiv cs.AI@Ziyad Benomar 等 4 人原文稍后读已读值得跟进有用关注 A/B测试
论文精选73°09:33ClinTraceBench:临床推理纵向评估基准斯坦福团队发布临床推理基准,测试八种历史表示策略,发现压缩导致关系损失,小模型 Haiku 在全上下文下超越大模型 Sonnet。#ClinTraceBench#MIMIC-IV#临床推理#DeepSeek-V3aarXiv: DeepSeek@Huimin Wang 等 3 人原文稍后读已读值得跟进有用关注 ClinTraceBench
论文精选73°09:33微调大模型提升PR与问题分类研究人员微调了多个大模型来自动匹配PR和问题,准确率提升显著,还能解释模型决策依据。#CodeLlama-7B#GPT-4o#微调#PR分类aarXiv: DeepSeek@Mustafa Yasir Altunhan 等 3 人原文稍后读已读值得跟进有用关注 CodeLlama-7B
论文09:32PersianAnonymizer:评估基于LLM标注的波斯语NER匿名化波斯语数据匿名化新方案,用LLM标注训练轻量NER模型,消费级GPU上2分钟处理4万消息。#PersianAnonymizer#NER#DeepSeek-V3-0324#GPT-OSS-120BaarXiv: DeepSeek@Mohammad Hossein Shalchian 等 3 人原文稍后读已读值得跟进有用关注 PersianAnonymizer
论文精选73°09:32PARSER压缩MoE大模型新方法PARSER方法解决了MoE模型压缩中误差累积问题,在相同内存减少下提升模型精度。#MoE#PARSER#Qwen#DeepSeekaarXiv: DeepSeek@Seungwoo Jung 等 7 人原文稍后读已读值得跟进有用关注 MoE
论文Agent 与开发者精选73°09:07AgentProv:通过工具使用策略探测审计智能体LLM APIMIT研究团队推出AgentProv,通过工具调用分布检测API是否偷偷更换底层模型,准确率远超现有方法。#AgentProv#LLM API#工具使用#审计aarXiv: Anthropic@Xun Wang 等 5 人原文稍后读已读值得跟进有用关注 AgentProv
论文精选12:20ECGQuest:心电图语言模型评测与微调基准ECGQuest为心电图领域语言模型提供了首个专业评测基准,微调让小模型接近大模型表现。#ECGQuest#GPT-5#DeepSeek-R1-Distill-Qwen-14B#微调aarXiv: DeepSeek@Mohammadsina Hassannia 等 3 人原文稍后读已读值得跟进有用关注 ECGQuest
模型中美对照精选73°12:20DeepSeek 175B在消费级笔记本上完成20万蛋白质配体虚拟筛选DeepSeek 175B在普通笔记本上完成20万蛋白质筛选,比A100集群快100倍,误差仅0.88,让小团队也能做药物发现。#DeepSeek 175B#RTX 4060#蛋白质配体虚拟筛选#药物发现aarXiv: DeepSeek@Rui Xiao, Yili Xu原文稍后读已读值得跟进有用关注 DeepSeek 175B
论文12:14TMB框架实现神经网络混合效应模型TMB让神经网络混合效应模型实现更简单,自动微分替代手动推导,提升模型复杂度和准确性。#NMMs#TMB#神经网络混合效应模型#自动微分aarXiv cs.LG@Nan Zheng 等 5 人原文稍后读已读值得跟进有用关注 NMMs
论文12:12高效AI评估基准测试研究Vector Institute研究团队发现高效AI评估可能改变基准结论,不同优化方式对结果影响各异。#BBQ#BBQ-V#AI评估#基准测试aarXiv cs.LG@Ahmed El Kady 等 5 人原文稍后读已读值得跟进有用关注 BBQ
论文78°12:11FACET:任务条件特征变换实现持续学习FACET用一个适配器解决了持续学习中的灾难性遗忘问题,比LoRA合并方法更高效。#FACET#类增量学习#持续学习#特征变换aarXiv cs.LG@Yunxiang Fu 等 3 人原文稍后读已读值得跟进有用关注 FACET