模型多源确认

民间AI排行榜单新鲜出炉,Fable 5.1仅排第三

精选理由

B站UP主做的这个民间测试很有意思,用各种贴近现实、条件更苛刻的场景测试大模型,看它们能不能真正干活,而不是只看跑分有多好看。

最新民间AI能力排行显示,GPT-6 Astra 瑶瑶领先,GML-5.3 紧随其后,而 Claude Fable 5.1 仅排第三。榜单通过 UP 主设计的贴近现实、条件更苛刻的场景对大模型进行测试,与传统的 MMLU、LiveBench 等学术基准不同,这类测试更接近日常使用场景。传统基准测试的优势在于条件可控、结果可复现,但存在局限,比如无法完全反映模型在复杂、无标准答案的真实任务中的表现。民间实测更接近工作生活场景,但存在样本量有限、主观性较强等问题。Benchmark 跑分领先代表模型在标准化测试场景下实力更强,而民间实测第一代表模型在部分贴近生活、工作的场景中表现更好,二者互为补充,不能互相替代。

原文 · 掘金本周最热

大家好,我是石小石~ 最新民间AI排行榜单 长期以来, MMLU (大规模多任务语言理解)、 LiveBench (实时评测基准)、 GPQA (研究生级别物理问答数据集)这类大模型 Benchmark (评测基准)的跑分,一直被社区视作衡量大模型实力的重要参考。但跑分亮眼,就代表模型在实际使用场景里同样强大吗? 答案其实未必。 最近, B 站不少 UP 主通过用各类贴近现实、条件更苛刻的场景对大模型“整活” 式测试 ,一份民间 AI 能力排行新鲜出炉。榜单里 GPT‑6 Astra 瑶瑶领先, GML‑5.3 紧随其后,而 Claude Fable 5.1 仅排第三。 完整排名榜单: www.bilibili.com/blackboard/… 这份榜单其实蛮有意思,很多在学术榜单名列前茅的模型,在 UP 主设计的真实任务中居然表现不佳。 这也引出了一个值得讨论的问题: Benchmark 的高分,真的可以等价于大模型的真实使用能力吗? 传统 Benchmark,AI的“高考式”能力评测 很多人会把 Benchmark 的结果当成评判大模型综合能力的最终依据。站在科研角度, MMLU‑Pro、GSM8K、LiveBench、GPQA Diamond 这一类学术评测确实具备很高参考价值: 它们拥有成套精心设计的标准化题库,答案清晰,评估流程可以复现,相当于给各大模型提供了一把统一的衡量标尺。 它的优势十分明确: 条件可控:测试变量固定,不同模型之间能够实现公平的横向对比; 结果可复现:任何人都可以复跑整套评测,得到相近的得分; 指向清晰:重点考察模型的知识储备、多步骤逻辑推理、数理演算这类硬能力。 但标准化测试本身也存在固有局限。就好比高考状元应试能力出众,可步入社会之后,去处理现实中大量没有标准答案、错综复杂的实际问题,又是完全另一回事。放到 AI 身上也是同理,有些模型应试跑分很强,落地到真实场景,表现却会大打折扣。 当然,我不是要否定 Benchmark 的价值。它是科研迭代、模型调优过程中不可或缺的工具,如果没有这套标准化基准,研究人员很难客观判断模型究竟有没有取得实质进步。 Benchmark 是一把好用的标尺,但绝不应该成为评判大模型好坏的唯一标尺。 B 站 AI 无限竞技场,AI的社会“拷打” 最近刷视频,偶然发现B站的 AI无限竞技场活动 。这个活动本质也是做大模型能力评测 ,但整套评测内容全部由各路 UP 主自己说了算,平台没有设定统一标准。点开里面的视频一看还挺有意思:有 AI 复刻《狂扁小朋友》游戏、屎山代码论剑、AI 空间建模演示等等。 相比起一本正经的学术跑分,我就爱看这种“整活”类的实测,看AI遭受社会“毒打”。 这套玩法和传统学术 Benchmark 完全是两码事。整个竞技场更像是一个“草台班子式评测集合”:平台并不统一出题,直接把出题权交到各位 UP 主手里。这种来自民间的现实拷打,往往更接近我们平时工作、生活遇到的真实场景。 做测试的 UP 主背景也是形形色色,有程序员、学生、游戏开发者,还有各类内容创作者。他们拿出来的测试任务,很多就是自己日常要处理的真实工作。 在我看来这类测评很有价值:一个模型到底厉不厉害,不能只看跑分有多好看,更要看能不能实实在在解决现实问题。 当然客观来讲,这套民间测试到底准不准确、有没有夹带私货,够不够权威,就见仁见智了。 模型能力评测究竟谁更值得关注 通过前面的内容我们可以了解到, Benchmark 跑分领先,意味着模型在标准化测试场景下实力更强;而拿到民间排名第一,则代表模型在部分贴近生活、工作的场景中表现更好。 那么是不是跑分第一就等于全场景无敌?拿到民间第一就代表综合实力第一? 问题 1:Benchmark 跑分领先,就代表模型在所有真实场景都更强? 答案:不能。 Benchmark 跑分,只能证明 AI 在这套基准所定义的能力集合当中表现更好。举个例子,一个模型在 GPQA(研究生水平物理问答数据集)拿到高分,只能说明它硬核科学知识能力很强,但这不代表它就可以读懂中文隐晦需求、处理百万字杂乱文档、写出适配老项目的工程代码。 模型各项能力是分化的,并不是单一的一个“总分”。不少前沿模型已经出现很明显的“能力偏科”。 问题 2:在民间多场实测拿第一,是否代表模型综合能力就是世界顶尖? 答案:也不能。 民间评测存在自身的边界局限: 考题样本来自 UP 主个人兴趣,偏向创作类、生活化任务,对于硬核科研、工业级复杂 Agent 任务覆盖不足; 人工打分天然带有个人主观色彩:有人看重文笔,有人看重代码能力,有人夹带私货;没有 LMSYS Arena 这类 强制匿名双盲机制 ,很难彻底消除品牌滤镜; 测试样本量有限,仅仅几十场 PK,不足以统计出模型完整的能力分布。 我的看法是:Benchmark 能够证明模型 “会做题”;民间实战用可以观察模型 “能不能干活”。二者互为补充,并不能互相替代。 AI 评测新趋势 这几年AI评测圈最大的变化,就是AI评测出题人不在局限于传统方法了。 以前各种AI数据集、榜单都出自学术团队,普通用户只能等一个分数。可大模型真落了地,大家发现:实际碰到的麻烦,很多压根不在题库里。 于是评测分成了几套玩法。最老的是静态 Benchmark (MMLU 等),固定题库,方便但容易被刷榜,区分度越来越低;往上是动态学术基准( LiveBench、SWE-bench Verified ),题库不断换新,防背题,严谨和新鲜兼顾;再往外,就是各类民间评测(比如B站AI无限竞技场),出题权在使用者手里,考的是真实工作里的活。 三层谈不上谁取代谁,更像三把不同的尺子:做研发、写论文,离不开标准化 Benchmark ;普通开发者和创作者选型,光看分数不够,最好再去社区实测里看看别人怎么踩坑的。至于单一榜单,早就定义不了一个模型的全部能力了。 总结 再回到这份测评榜单本身, GPT‑6 Astra 位居第一,我觉得当之无愧,没有争议。而 Claude Fable 5.1 位于 GML‑5.3 后,我还是也有些吃惊的, Claude Fable 5 经常被吹得天花乱坠,在国内居然被 GML‑5.3 压了一头。注意,我没有贬低 Claude Fable 5 或抬高 GML‑5.3 的意思,我只是觉得以 B 站 AI 无限竞技场 为代表的民间实测,打开了一扇新窗户,让我们看见: 一个模型的能力强弱没有标准化答案,而是在不同场景下各有高下。 另外,抛开榜单,我心中其实另有一套排行榜。这套榜不看谁跑分最高、名头最响,只看几件朴素的事:价格实不实惠,有没有饥饿营销,响应快不快,以及最关键的一条:能不能真正帮我干活变现,而不是让我付费上班,给 AI 打工。 毕竟,模型好不好,从来轮不到一张榜说了算。