09:10官方账号arXiv cs.LG@Nan Li研究团队针对2B开放权重模型在LM Playschool Challenge中的表现,发现模型失败不仅是知识不足,还有局部决策问题。他们提出三步训练方案:监督微调获取广泛游戏参与能力,使用回合局部偏好对修复特定对话游戏家族中的可验证失败,并保留对话游戏外的通用能力。该方法将公开clemscore从10.67提升至38.92,领域内分数从13.41提升至41.17,同时保持静态性能基本不变。论文LM Playschool Challenge2B模型对话游戏代理推荐理由:研究人员为小模型对话游戏代理设计了一套三步训练法,显著提升了特定任务表现,同时保持通用能力。原文稍后读已读值得跟进有用关注 LM Playschool Challenge
02:24官方账号Clement Delangue@ClementDelangue精选Kog在HuggingFace上开源了其2B参数模型,该模型此前被用于演示,运行速度达到3000+ tokens每秒。开源模型可供开发者下载和部署,适用于快速推理场景。AI模型KogHuggingFace2B模型推荐理由:Kog开源了一个2B模型,每秒能处理3000多个token,适合需要高速推理的任务。原文稍后读已读值得跟进有用关注 Kog