00:09lmarena.ai@lmarena_ai精选73°Arena 新增“事实性”排名信号,基于人类偏好与事实性的加权组合重新排列模型。该团队标注了超过 200 万条来自真实对话的 LLM 声明(Text Arena 130 万+,Search Arena 70 万+),通过验证声明正确性比较模型。开启事实性后,Claude Fable 5 下降至第 2,GPT-5.5 上升 13 位至第 7,Muse Spark 下降 13 位至第 20。Meta 整体从第 2 跌至第 5,Anthropic 仍居第 1;开源模型中,Xiaomi 从第 9 跃至第 6。AI模型ArenafactualityClaude Fable 510 个信源在谈事件专题推荐理由:Arena 现在能看模型在事实准确性上的表现,Claude 和 GPT-5.5 排名变化挺有意思,想挑更靠谱的模型可以看看。原文稍后读已读值得跟进有用关注 Arena
01:56lmarena.ai@lmarena_aiArena团队推出新的事实性信号方法,用于测量模型是否生成真实且可验证的声明。该方法分析了前沿模型在事实性上的表现差异,揭示了模型在真实世界可靠性中的关键指标。目前该评测尚未公开具体模型得分,但提供了新的评估维度。AI模型Arenafactuality模型评估推荐理由:Arena团队搞了个新方法测模型真假话,比基准靠谱,想知道你的模型有多爱吹牛?看点这个。原文稍后读已读值得跟进有用关注 Arena