10:15官方账号arXiv cs.LG@Himil Vasava, Ming Jiang精选73°Themis(Llama-3-8B)和Prometheus(Mistral-7B)评分模型采用两阶段评估流程。低于15层注意力执行局部错误比较,高于15层MLP级联整合信号并写入评分。在Themis中决策形成于第26层,Prometheus在第25层。基础模型(Llama-3-8B)重现路由架构和决策形成,但不具备阶段分离,表明微调塑造了现有结构而非从头构建。论文ThemisLlama-3-8BPrometheus推荐理由:Themis和Prometheus评分机制被解析,微调如何改变LLM评估流程有新发现原文稍后读已读值得跟进有用关注 Themis
11:55官方账号arXiv cs.LG@Alberto AcedoOmega-S是一个即插即用的惩罚项,仅从权重矩阵计算,无需旧任务数据或Fisher矩阵。在Llama-3-8B上使用LoRA从代码微调到散文的实验中,Omega-S在10个种子中的9个上比无正则化保留更多原始能力。保留率从0.173提升到0.238(pass@1),即从62.9%提升到84.1%,且训练开销增加不到4%。实验表明,其实际生效机制是对节点度方差的正则化,而非名称暗示的拓扑目标。论文还量化了相同配置下保留率的标准差为0.104,并提供了全部代码和逐种子结果。论文Omega-SLlama-3-8BLoRA推荐理由:这篇论文提出了Omega-S,一个只需权重矩阵的正则项,能让微调少忘旧知识,Llama-3-8B上保留率从62.9%提到84.1%,开销只增加4%。原文稍后读已读值得跟进有用关注 Omega-S