11:20官方账号arXiv cs.AI@Arthur Becker, Jakob Kemmler, David Thulke, Christine Schäfer, Christian Dugast, Hermann Ney该研究探讨了监督微调(SFT)中目标响应可能引发模型幻觉的问题。研究团队在Qwen 3 4B和OLMo 3 7B模型上测试了知识对齐SFT方法。实验显示,该方法在WildHalu和Biography基准上减少了事实性幻觉,同时保留了模型通用能力。Recall Rewrite方法在UnknownBench上表现出最强的拒绝行为改进。论文监督微调知识对齐Qwen 3推荐理由:这篇论文提出了两种新方法,能减少大模型幻觉,特别适合关注模型可靠性的研究者。原文稍后读已读值得跟进有用关注 监督微调
11:57官方账号arXiv cs.LG@Thomas Winninger论文提出RFM-AGOP方法,通过适应RFM算法和探针初始化,在数秒内从推理模型Qwen 3和非推理模型Qwen 2.5中提取多维拒绝子空间。该方法在消融任务上表现优于现有方法,且计算成本较低。研究为LLM安全对齐提供了高效可扩展的监控手段。论文RFM-AGOPQwen 3Qwen 2.5推荐理由:想低成本搞懂LLM拒绝行为?这篇论文用RFM-AGOP几秒就定位到多维子空间,比传统方法快还准。原文稍后读已读值得跟进有用关注 RFM-AGOP