主要来源Mistral AI
查看原文事件专题 ·多源确认
Mistral Large 4 在 AutomationBench 办公自动化基准上领先
Mistral 在 AutomationBench 基准上测试了 Mistral Large 4,该基准覆盖 657 条业务工作流,场景包括 Gmail、Google Sheets、Slack 和 Salesforce 的模拟办公应用。Mistral Large 4 的成绩排在 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro 之前。这一基准主要考察模型执行真实办公自动化任务的能力。
当前结论
Mistral 晒了新基准成绩:Mistral Large 4 跑 657 个办公自动化任务,赢了 Kimi K3 和 DeepSeek V4 Pro,做 agent 介绍的可以看看。
11 个信源38° AI 热度最后更新 2026/10/7 14:06:15
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。