9月2日
06:29
06:29官方一手Hugging Face: Blog博客/媒体
BenchMIRT研究揭示了当前LLM基准测试的局限性。该研究分析了多个基准测试,包括MMLU、HellaSwag和TruthfulQA。研究发现这些基准可能无法全面评估模型的真实能力。研究团队提出了改进基准测试的建议。
事件专题

推荐理由:BenchMIRT研究告诉你,现在流行的LLM基准测试到底在测什么,有什么局限性。
8月28日
19:02
19:02官方一手arXiv: DeepSeek@Rongfeng Wang, Shichao Weng, Zhiqiang Wang, Xinyu Liu, Yang Yi, Peilong Zhou, Hongwei Tang
精选73°
MetaNet提出了一种支持集控制器,可为每层预测专家保留阈值和有界路由偏差。在DeepSeek-MoE-16B-Chat模型上,保守设置激活专家数减少40%,MMLU准确率0.489;激进设置激活专家减少62%,准确率下降3.7个百分点。MMLU训练的控制器无需重训即可迁移到C-Eval,激活专家减少52%,准确率达0.386。
事件专题

推荐理由:MetaNet让MoE模型根据任务难度动态分配专家,大幅减少计算量同时保持准确率。
8月20日
01:55
01:55Gary Marcus@GaryMarcus
OpenAI 发布了 GPT - 5 模型,该模型在 MMLU 基准测试中取得了 2098 分的成绩,超过了上一代模型的记录,成为当前行业领先水平,专家表示其多领域任务处理能力显著提升。
事件专题

推荐理由:OpenAI 发了 GPT - 5 模型,能处理各种复杂任务,和之前模型比分数更高,适合需要高质量输出的场景。
7月2日
20:13
20:13量子位@闻乐
72°
该模型参数量达1万亿,在MMLU基准上取得86.2%的准确率,超越同规模Llama-3.1-405B。它完全基于国产芯片训练,训练成本仅为同类模型的30%。模型已开源,采用Apache 2.0许可证,在GitHub上获得超过2万星标。
事件专题

推荐理由:有个模型不用英伟达显卡就做到了万亿参数,性能还比Llama强,成本更低,开源可商用,搞大模型的可以试试。