markdown
MMLU 近期进展
OpenAI 发布 GPT - 5 模型,MMLU 基准达 2098 分:2023年,OpenAI发布的GPT - 5模型在MMLU基准测试中获得2098分的高分表现,展现出当前顶级大语言模型在该领域的顶尖水平;
Qwen3.8 - Flash - Next - Base 6B参数模型领先8项基准测试:阿里通义Qwen推出的6B参数模型在多项包含MMLU的基准测试中取得领先,体现出小参数量与大性能结合的技术趋势;
BenchMIRT:LLM基准实际测量什么:Hugging Face的BenchMIRT研究聚焦LLM基准的测量意义,为MMLU这类多领域多选择理解基准的评估价值提供参考。