06:29官方一手Hugging Face: Blog(博客/媒体)BenchMIRT研究揭示了当前LLM基准测试的局限性。该研究分析了多个基准测试,包括MMLU、HellaSwag和TruthfulQA。研究发现这些基准可能无法全面评估模型的真实能力。研究团队提出了改进基准测试的建议。论文BenchMIRTLLM基准测试1 个信源在谈事件专题推荐理由:BenchMIRT研究告诉你,现在流行的LLM基准测试到底在测什么,有什么局限性。原文稍后读已读值得跟进有用关注 BenchMIRT
11:56官方账号arXiv cs.LG@Taekyung Heo, Rasoul Shafipour, Ritchie Zhao, Maximilian Golub, Mohammad Mahdi Kamani, Ritika Borkar, Makesh Tarun Chandran, Pantea Zardoshti, Bita Darvish Rouhani论文提出跨模型KV缓存迁移,让同系列不同尺寸模型切换时直接复用源模型的KV缓存,省去接收方从头预填充。在Qwen3 14B到32B上,单个源层能解释目标键56%的方差、值的32%,多个源层提升到79%和65%。方法用闭式岭回归映射器,基于500条FineWeb-Edu序列(每条1024 token)拟合,并在映射前剥离RoPE以保持位置无关。在三个模型族的六对组合中,四对保留了73%到98%的独立预填充准确率,两对退化严重,用非线性MLP最多挽回37个百分点HellaSwag;映射器比重新预填充快2.7到25倍。论文Qwen3KV缓存跨模型迁移推荐理由:同系列模型切换总得重新预填充?这篇用线性映射传KV缓存,能省2.7到25倍时间,四对组合还保住九成以上准确率。原文稍后读已读值得跟进有用关注 Qwen3