DeepSeek V4.1 Flash 技术报告分析不同编码代理框架性能
DeepSeek V4.1 Flash 的技术报告中,有一个实用的章节 5.3.4「Performance across agent scaffolds」 对比了 DeepSeek V4.1 Fla...
DeepSeek 新模型的技术报告里,专门分析不同编码框架对模型性能的影响,比如极简的 mini-SWE 反而比 Claude Code 表现好,这个细节挺有意思。
DeepSeek V4.1 Flash 技术报告的 5.3.4 节对比了该模型在不同编码代理框架(如 Claude Code、Codex、mini-SWE)上的基准测试表现。在 DeepSWE v1.1 基准上,极简的 mini-SWE 得分 74.2 最高,而 Claude Code 得分 69.8 高于 DSH PTC。在 Terminal-Bench v2.1 上,各配置得分集中在 84.1-90.6 之间。Claude Code 测了 4 个版本,结果稳定(DeepSWE 均值 68.9,Terminal-Bench 均值 87.8),排除了版本偶然性影响。
DeepSeek V4.1 Flash 的技术报告中,有一个实用的章节 5.3.4「Performance across agent scaffolds」 对比了 DeepSeek V4.1 Fla...
DeepSeek V4.1 Flash 的技术报告中,有一个实用的章节 5.3.4「Performance across agent scaffolds」 对比了 DeepSeek V4.1 Flash 在不同 Coding Agents 之间的 benchmark 差异,目的是为了说明模型不会依赖和耦合于某个特定的 Agent Harness Coding Agents 包括:Claude Code、Codex、OpenCode、Pi、mini-SWE 和 DSH;benchmark 包括 DeepSWE v1.1 和 Terminal-Bench v2.1 几个值得注意的评测数据: 1. 第三方框架并不弱。在 DeepSWE 上,为 Claude 模型设计的 Claude Code 拿到 69.8,高于 DSH PTC;极简的 mini-SWE 反而是全场最高的 74.2;Codex 和 OpenCode 最低。 2. DSH 内部三种模式差异不小:DeepSWE 上 Minimal 72.6 → Standard 70.5 → PTC 67.6,工具越多反而略降,工具更丰富的 harness 不一定更好,简单接口有时更稳。 3. Terminal-Bench 上各配置压缩在一个很窄的区间里(84.1–90.6),说明任务接近饱和时区分度下降。 4. Claude Code 测了 4 个版本,结果非常稳定(DeepSWE 68.4–69.8,均值 68.9;Terminal-Bench 均值 87.8),排除了 “碰巧挑了个有利版本” 的质疑。 huggingface.co/deepseek-ai/De… DeepSeek @deepseek_ai 🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. 🔹 Introducing the smallest model in our new architecture family, with native visual understanding. 🔹 Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 1 👀 405 📊 1 ⚡
- lmarena.ai09-10 15:32原文