10:20官方账号arXiv cs.LG@Zachary Speck, Asa Shepard使用124M参数的GPT - 2模型在OpenWebText数据集上训练32个模型,每个模型在第200步时替换一行批次数据测试示例影响,发现示例暴露后50步预测更好但最终无差异,跨熵等基准测试也显示无显著差异。论文GPT - 2OpenWebText预训练推荐理由:GPT - 2团队做了小规模单例反事实实验,测试示例学习后效果,和其他条件对比结果很有意思。原文稍后读已读值得跟进有用关注 GPT - 2
10:16官方账号arXiv cs.LG@Adam Karvonen, Euan Ong, Subhash Kantamneni, Samuel MarksCHIVE是一个基于智能体的pipeline,通过反事实提示编辑自动发现并研究LLM在自然场景中的意外行为,生成数千条附带反事实证据的高质量解释。研究人员用它评估多种常见可解释性技术,发现这些技术并未提升代理预测反事实行为的能力。此外,用CHIVE生成的数据训练模型预测反事实结果,能够泛化到多种分布外设置。论文表明CHIVE可自动发现自然发生的LLM行为解释,并为评估和改进解释方法提供新途径。论文CHIVELLM可解释性推荐理由:这篇论文搞了个CHIVE自动找模型意外行为,结果发现现有可解释性技术对预测反事实行为没啥用,但用来训练数据倒挺能泛化,值得做可解释性的人看看。原文稍后读已读值得跟进有用关注 CHIVE