9月1日
11:20
11:20官方账号arXiv cs.AI@Arthur Becker, Jakob Kemmler, David Thulke, Christine Schäfer, Christian Dugast, Hermann Ney
该研究探讨了监督微调(SFT)中目标响应可能引发模型幻觉的问题。研究团队在Qwen 3 4B和OLMo 3 7B模型上测试了知识对齐SFT方法。实验显示,该方法在WildHalu和Biography基准上减少了事实性幻觉,同时保留了模型通用能力。Recall Rewrite方法在UnknownBench上表现出最强的拒绝行为改进。
推荐理由:这篇论文提出了两种新方法,能减少大模型幻觉,特别适合关注模型可靠性的研究者。
7月3日
11:57
11:57官方账号arXiv cs.LG@Thomas Winninger
论文提出RFM-AGOP方法,通过适应RFM算法和探针初始化,在数秒内从推理模型Qwen 3和非推理模型Qwen 2.5中提取多维拒绝子空间。该方法在消融任务上表现优于现有方法,且计算成本较低。研究为LLM安全对齐提供了高效可扩展的监控手段。
推荐理由:想低成本搞懂LLM拒绝行为?这篇论文用RFM-AGOP几秒就定位到多维子空间,比传统方法快还准。