8月26日
10:51
10:51官方一手arXiv: DeepSeek@Daming Luo, Christy Liang, Junyu Xuan
SteerCheck是一种预注册的归因审计工具,用于匹配离目标KL和分离均值、保护尾部、极性、转移和语义主张。研究发现,对齐泄漏与签名的余弦值强相关,25.3%的样本余弦值超过0.5,所有超过观察到的平均效果的样本余弦值均超过0.8。SteerCheck使得这些条件性和混合结论可审计。
推荐理由:SteerCheck是一个强大的审计工具,可以帮助研究人员识别和评估激活引导中的对齐泄漏问题,对于确保AI模型的可靠性和透明度非常有用。
7月21日
11:35
11:35官方账号arXiv cs.AI@Sheldon Yu, Tong Yu, Xunyi Jiang, Rohan Surana, Gagan Mundada, Sungchul Kim, Lina Yao, Julian McAuley, Junda Wu
论文提出SOPHIA方法,通过分析推理轨迹中隐状态转换,发现失败轨迹陷入自循环。该方法构建状态对索引的引导向量库,在推理时实时检测自循环并干预。在多个基准测试中,SOPHIA有效提升任务准确率和令牌效率。实验表明,细粒度控制能改善推理质量。
推荐理由:这篇论文教你如何让大模型不再自己绕圈圈,用激活引导精准干预推理过程,实测有效提升准确率。