11:53官方账号arXiv cs.LG@Lintai HouGraph Machine (GM) 是一种保持 O(n) 大小状态的架构,通过稀疏动态路由访问状态。研究人员将 Qwen3-0.6B 中 75% 的密集 Transformer 层替换为 GM 稀疏层,在 157 亿 tokens 上从头预训练。每层每 KV 头仅检索 4096 个 token 中的 2 个时,损失仅略微下降;检索 4 个时,最佳模型损失略有改善。论文Graph MachineQwen3-0.6BTransformer推荐理由:Graph Machine 用边对象替代传统状态,在 Qwen3-0.6B 上预训练时,稀疏层仅需少量检索就能保持性能。原文稍后读已读值得跟进有用关注 Graph Machine
09:36官方账号arXiv cs.AI@Nikita Oblakov, Sabrina Sadiekh, Evgeniy Kokuykin精选73°HiveTraceGuard-Pro是一款0.6B参数的生成式护栏模型,基于Qwen3-0.6B通过LoRA微调而成。该模型支持俄语和英语,采用二元评分规则(安全/不安全)进行最终目标轮次判断。在包含19个基准组的测试中,HiveTraceGuard-Pro的综合得分为0.7432,在俄语提示注入召回率上达到0.999,延迟仅为14.3毫秒。AI模型HiveTraceGuard-ProQwen3-0.6B护栏模型推荐理由:俄语安全护栏新模型,在俄语提示注入检测上表现优异,延迟最低,开源权重已发布。原文稍后读已读值得跟进有用关注 HiveTraceGuard-Pro
09:46官方一手arXiv: DeepSeek@Vinay Kumar Chaganti该论文研究将8B推理教师模型deepseek-r1:8b蒸馏为0.6B学生模型Qwen3-0.6B(使用QLoRA,三个随机种子)。学生模型每篇处理时间0.8秒,教师模型需39秒,速度提升约48倍。在摘要质量上,学生模型恢复教师与基线之间58%的差距,比约束解码高16.8分,比少样本提示高4.9分。相同规模的非推理教师(非deepseek-r1)训练的学生表现不优于未经微调的基线,表明摘要提升源于教师的推理特性。推理教师传递写作质量,托管管线传递标签多样性;在22篇短源文章中,指令教师的学生更忠实(74 vs 55篇忠实),而推理系学生易编造内容。论文deepseek-r1Qwen3-0.6BQLoRA推荐理由:这篇论文对比了蒸馏不同教师模型的效果,发现推理型教师擅长教写作质量,托管型管线擅长教标签多样性,对选哪种蒸馏方案做端侧部署很有参考价值。原文稍后读已读值得跟进有用关注 deepseek-r1