05:57lmarena.ai@lmarena_ai73°Muse Spark 1.3由Meta开发,现已加入Agent Arena评测平台。该模型在数百万真实世界长周期智能体任务中进行测试,可使用网络搜索、文件系统和终端工具完成复杂工作流。与Muse Spark 1.2相比,新版本工具调用减少约20%,token使用减少约25%。AI模型Muse SparkMetaAgent Arena推荐理由:Meta的Muse Spark 1.3上线Arena,能更好协作并减少幻觉,比前代更实用。原文稍后读已读值得跟进有用关注 Muse Spark
01:48lmarena.ai@lmarena_ai88°Arena 平台推出 Agent Mode,允许用户测试 AI 智能体在真实任务中的表现,包括深度研究、生成报告、构建网站、调试代码等。该模式通过集成网页搜索、沙箱环境 bash、图像生成、文件写入和追问等工具,评估前沿模型如 GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro 和顶级开源模型的智能体能力。这标志着 AI 评测从对话转向复杂任务执行,为开发者提供了直观的模型选择依据。用户可直接在 Arena 中体验并对比不同模型的智能体性能。AI产品智能体评测平台GPT-5.52 个信源在谈事件专题推荐理由:Arena 的 Agent Mode 解决了 AI 评测脱离实际任务的问题,做智能体应用或选型的开发者可以直接上手对比 GPT-5.5 和 Claude Opus 4.7 的真实表现,值得一试。原文稍后读已读值得跟进有用关注 智能体