9月3日
12:14
12:14官方账号arXiv cs.AI@Kushagra Bhushan, Meghanadh Pulivarthi, Sai Krishna Reddy Sathi, Gaurav Pandey, Sonam Gupta, Vineet Kumar, Jaydeep Sen, Yatin Nandwani, Sachindra Joshi, Dinesh Raghu
精选73°
DKL是一种新方法,通过在基础语言模型上进行扩展预训练来注入新知识,然后与指令模型合并。实验显示,在检索失败情况下,DKL将RAG准确率从54.17提升至79.26。该方法避免了昂贵的指令微调,仅需较少训练数据即可实现知识注入。
推荐理由:DKL解决了RAG检索失败时的问题,比RAFT和PA-RAG方法更高效,还能保持指令模型的指令跟随能力。
7月23日
13:07
13:07Stanford AI Lab@StanfordAILab
斯坦福团队提出一种无需梯度下降即可将事实知识写入Transformer MLP的封闭形式方法。该方法可直接将事实编码进Transformer块,无需训练。相关论文已被COLM 2026接收。研究者包括Jerry Liu、Garctrob、Ronny Junkins等。
推荐理由:斯坦福团队搞了个新招:不用梯度下降,直接把事实写进Transformer的MLP里,论文被COLM 2026收了,想了解怎么不训练就灌知识的可以看看。
7月2日
10:02
10:02官方账号arXiv cs.LG@Yiwen Xing, Philip Beaucamp, Joyraj Chakraborty, Afrah Farea, Yuanzhe Jin, Saiful Khan, Gennady Andrienko, Natalia Andrienko, Min Chen
对IEEE VIS会议过去十年200余篇VIS4ML论文进行系统调研。开发编码方案从ML特性、可视化、交互和动作四个视角分析。揭示了通过交互可视化将人类知识传递到ML工作流的不同路径。利用信息论成本效益分析解释VIS4ML现象,证实VA在ML工作流中的价值。
推荐理由:这篇论文梳理了200多篇VIS4ML论文,告诉你人在机器学习中怎么用可视化注入知识。想了解人机协作的路径和原理,这篇综述是很好的起点。