02:25lmarena.ai@lmarena_ai72°LMSYS 发布 AutoEval,一种使用奖励模型基于数百万真实 Arena 用户偏好数据的新评估方法。它在文本、视觉、图像和代码领域均能与实时人工评估高度对齐,且将评估时间从数天缩短至数小时。AutoEval 使新模型能更快获得评分并直接显示在排行榜上。AI模型AutoEvalChatbot ArenaLMSYS推荐理由:以后新模型上线几小时就能看到评分了,比之前等几天快得多,而且数据来自真实用户偏好,可信度高。原文稍后读已读值得跟进有用关注 AutoEval
14:09IT之家(博客/媒体)精选Mozilla发布2026年《开源AI现状报告》,基于Chatbot Arena数据显示开源与闭源模型平均差距为3.3%。GPT-4级模型每100万Token价格从2022年末的20美元降至2025年12月的0.40美元,36个月内下降至50分之一。基于OpenRouter数据,DeepSeek V4 Flash以月消耗18.4T Tokens位居API调用量榜首,小米Mimo-V2.5和腾讯Hy3 Preview紧随其后。调查显示79%开发者采用开放模型,但仅51%能成功部署至生产环境,低于闭源模型的63%。行业MozillaDeepSeek V4 FlashOpenRouter1 个信源在谈事件专题推荐理由:Mozilla报告用数据告诉你开源模型有多猛:DeepSeek V4 Flash月用量18.4T Tokens碾压闭源,价格还暴跌50倍。原文稍后读已读值得跟进有用关注 Mozilla