事件专题 ·多源确认

Mistral Large 4 在 AutomationBench 办公自动化基准上领先

Mistral 在 AutomationBench 基准上测试了 Mistral Large 4,该基准覆盖 657 条业务工作流,场景包括 Gmail、Google Sheets、Slack 和 Salesforce 的模拟办公应用。Mistral Large 4 的成绩排在 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro 之前。这一基准主要考察模型执行真实办公自动化任务的能力。

当前结论

Mistral 晒了新基准成绩:Mistral Large 4 跑 657 个办公自动化任务,赢了 Kimi K3 和 DeepSeek V4 Pro,做 agent 介绍的可以看看。

11 个信源38° AI 热度最后更新 2026/10/7 14:06:15

证据链

11 个信源
相关来源 1Artificial Analysis
查看原文
相关来源 3Guillaume Lample (Mistral)
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。