DeepSeek 4.1 Flash 测试结果
浪费时间!DeepSeek 4.1 Flash
DeepSeek 推出了号称更快更强的 4.1 Flash,但实测网页开发任务耗时三小时,效率低下。
DeepSeek 4.1 Flash 模型输出速度达 335 tok/s,但实际任务耗时超过三小时。该模型原生支持多模态,在网页复刻测试中表现中下水平,建模能力中等。测试生成了 177 个文件和 100 个 Chrome 配置文件,总计 28959 个文件,占用 2.2GB 空间。80 的时间消耗在渲染→截图→视觉模型评审的验证闭环上。
浪费时间!DeepSeek 4.1 Flash
我曾经因为 DS 的风格和梁文锋说的那句话,而对 DS 充满了好感。 但是,我对DeepSeek的好感所剩无几了! 搞技术,实力为尊,做产品,体验为上,其它说再多都无用。 我这篇文章本来的标题是“辣鸡……”,后来想想算了! 我对DS 最近的印象是:新版 Pro 很拉胯,编程工具 DSH 很拉胯,API 莫名其妙扣掉 60 多块,还欠了 -12 块! 听说 DS 又出了一个新版本,我心不死,又跑来测了一下! 名字的长度是越来越离谱了: deepseek-v4.1-flash-expires-on-0910 。(对比GLM5.3 GPT5.6,Opus5) 听说是采用了新的模型结构, 原生支持多模态(敢情之前的是假多模态?),能力更强,速度更快,成本更低! 看起来挺不错的! 我就拿一个例子测了,测了这个例子之后,我再也不想往下测试了! 它确实很快,但是又超级慢! 快在 tokens 输出速度高达 335 tok/s,慢在实际任务,超过三小时! 终于它比GLM 还慢了! 1、测试结果 我先给大家看一下运行的汇总情况: PS:图中的高效调用,稳定输出是GPT生图乱加的!实际情况完全相反! 然后来看一下结果: 我先不展开说,大致结论是: 浪费了大量时间,但是结果一般! 例子已经上传,在线对比地址: topai.jarvisuni.com/Jarvis-Gara… 然后我来说一下过程以及过程中遇到的问题! 2、测试工具 这次还是用的 DeepSeek Harness。我是一点都不喜欢这个工具,体验太差了。 但是为了防止有人说第三方工具发挥不了 DS 的能力。所以我就用 DSH,然后就用它的标准模式。 启动命令如下: C:\Users\tony>dsh web dsh web: http: //127.0.0.1:3080 然后配置官方的 API 和添加这个测试模型: 官方工具、官方 API、官方模型! 电脑和操作系统和写指令的人不是 DS 的,这些没办法。 可能有人还说要 Linux 才能发挥 DS 的能力,DS 你可太会挑了,DS 的部分用户,已经有点迷信的成分了。 3、我的需求 需求内容如下: 文字内容如下: 我在网上看到一个很有意思的例子,就是有人做了一个在线车库,可以快速切换车库中的各种车辆,以及显示这个载具的数据,中间显示具体的内容,可以通过鼠标拖动查看不同角度,然后可以切换涂漆,可以切换视角,可以自动旋转展示!网页配色,布局,内容我希望你尽可能还原参考docs中的图 2 .png ,不同之处在于车库里的车子,以及骑车的人,以及车库的名字。 车子我希望你做一辆自行车,一辆电瓶车,一辆机车,一辆三蹦子,一辆五菱宏光,一辆特斯拉,一辆小米,一辆保时捷,一套钢铁侠的经典战甲。具体型号你自己定,要主流的型号。 骑车开车的人物根据参考docs中的图 1 .jpg 的头部形象进行设计,做一个 3 D Q 版卡通想象。车库的主人是 Jarvis。 我的需求就是这样,细节你来完成,我只负责验收。使用单个 HTML 和前端技术完成。页面是 3 D视图,需要对建模进行良好的渲染。车子的建模要精准,人物建模要抓住特征,搞帅气一些。 不参考和修改当前目录下的其他文件。车子要考虑玻璃的半透明效果和车内部建模。 当前已经有一个页面了,不要读取和修改。单独生成一个全新的页面。 为了不让它搞错,我给它的提示词,其实比给别人的还要多。 参考图如下: 东西给完之后,就开始干活了! 4、测试过程和问题 刚开始就遇到了一个小问题: 工具调用失败了! 从提示来看,像是在说这个模型不支持图片输入,然后切换到其它模型去识别图片了。 这个事情,我就已经感觉很奇怪了,这明明是个多模态模型,怎么就不支持图片输入呢? 为此,我专门配置到 Claude Code 中做了测试: 作为第三方的智能体,图片识别完全正常! 而且速度确实非常快,3 张图片识别完成只用了 8 秒钟,包括了思考过程。 这个速度确实相当可以了! 接下来它生成了任务清单: 这个清单还是很不直观,直接是一个 json 格式。感觉不是给人看的! 搞了一段时间后,它就进入到了验证运行错误的阶段: 从这里来看生成速度应该还可以,但是验证阶段,简直了……!!! 我不确定它在跑什么,但是很久,很卡。中间把 cURL 异常都弹出啦,科学工具重启,浏览器整个崩掉重启。 所以从上面的截图可以看到,我暂停了一次,然后继续! 接下来就是漫长和枯燥的等待: 我是从九点多开始的,断断续续,已经搞到十一点多了。 单看最新一轮的对话已经持续了 81 分钟了,完全没有停止的样子。提示信息也不变,就这么卡着。 什么子代理后台任务开了一大堆 ,好像很牛逼的样子。后来一查反而把效率拉低了! 我估计卡死也是因为并发太多的问题。 等着太无聊了,看了一下项目文件夹。 里面有一大堆文件: 还有专门的 Chrome 配置文件: 我测试了几十个顶尖模型,没有一个模型能干出这么多文件的。别人都是一个文件搞定,又快又好。 它搞了这么久,是不是结果会很好呢?其实也并没有! 我们来分析一下这个结果。 首先,它的网页复刻能力也是倒数的。 大的颜色和结构都在,但是细节错误不少。首先是颜色选择正常应该在左边啊,它移动到了中间,拖动提示词应该在颜色选择上方,其次是右边的选择应该是开关按钮而不是刷新按钮。 然后上线区域的高度和分割线也没处理好。其它字体、颜色、间距的细节就不说了。 页面还原能力比较糙! 其次,建模效果也一般,你这个人物搞这么丑,脸都没有,我怎么给你好评啊! 建模能力好像有所提升,比上一个版本细节了很多 自行车、电瓶车、摩托车这几个建模已经看起来像模像样了,但是特斯拉、小米、保时捷,还是很抽象! 能看出来是个车子,但是绝对不是小米。细节错误很多! 总体来说: 网页复刻中下水平,建模中等水平! 我最生气的还是: 它浪费时间,浪费空间,浪费 tokens! 我让它查了一下它生成了多少文件! 它说,测试文件生成了 177 个,33M。 还有 100 个 Chrome 用户配置!!!占了 2.2GB,总共 28959 个文件! 我可以骂人吗——SB! 无头校验一行命令就可以了。为啥搞这么多文件,你会不会啊! 人家都可以 ComputerUse 和 BrowserUse 了,嘎嘎快,嘎嘎好用,你在这里给我搞一堆 Chrome 配置文件! 然后我问了一下它为什么这么慢, 时间都去哪里了! 它给我做了一个时间去向总结(诚实版): 它的一句话总结是: 80% 的时间不在写代码,而在“渲染→截图→交给视觉模型看→改→再渲染”这个验证闭环上 。我跑了 18 个后台渲染任务 + 21 次视觉模型评审 ,每一次循环都是分钟级的。 具体的时间分布情况: 环节 耗时占比 具体数字 无头 Chrome 渲染截图 ~40% 18 个渲染任务累计 约 80 分钟 。单张截图 5s~234s,最慢一张 234s 视觉模型评审 ~12% 21 次 workflow 调用,每次 30~120s,约 15 分钟 真实建模/代码编写 ~25% 7 个源文件(约 3500 行)分块写入 排错(见下) ~15% 6 次以上的“猜→渲染→发现猜错”循环 环境摩擦 ~8% 无网络、编码、沙箱审批 它一张截图就能搞 234s(6 分钟),你说是不是SB! 然后它自己总结了自己犯了哪些错误: 1. **虚拟时间预算算错** (最贵,约 15 分钟) `--virtual-time-budget=12000` 意味着 Chrome 要跑约 750 帧,而软件渲染一帧要 0.2~0.8s → **单张截图 121 秒** 。正确值应该是 300~600ms(约 25 帧)。这一个参数就多烧了十几分钟。 2. **"只画两帧"的优化走了死路** (约 10 分钟) 为了省时间我加了 `__ONESHOT__` 模式,结果因为 `preserveDrawingBuffer` 与合成器时序问题, **所有截图全白** 。我花了 3 个循环才确认是"渲染确实发生了(279 次 draw call / 83796 三角形)但合成器没取到画面"。 3. **4 路并行渲染反而更慢** (约 12 分钟) SwiftShader 是纯 CPU 渲染,4 个 Chrome 抢同一个 CPU,600 秒超时,还留下 **43 个僵尸 Chrome 进程** 要清理。 4. **视觉模型大量幻觉,我追着假问题改了好几轮** - "Spacebar · 3 wheel 文字重叠"——页面里根本没有这个字符串 - "仪表台上的花束"——那其实是 Q 版人物透过挡风玻璃露出的粉色头发 - "三轮车只有一个后轮"——两个都在,只是 3/4 视角遮挡 - 同一个模型在不同截图里给同一辆车打 4/10 和 7/10 **真正的 bug 反而是数值审计找出来的** :我后来加的 IK 残差报告( `?diag=1` )一秒钟就暴露了"自行车/机车手臂差 9cm 够不到车把",DOM 矩形审计( `?layout=1` )一次就找出"小视口下列表面板溢出"。 **我应该一上来就做数值审计,而不是先做视觉评审。** 5. **Bug 发现得太晚,每个都要付一整轮渲染的代价** - `add()` 把已构造的 Mesh 当几何体传入 → 62 处调用点全部报错,整个 3D 场景不渲染 - `scene.add(g)` 漏写 → 九宫格里 8 个格子全空 - **IK 符号搞反** : `torso.rotation.x = +0.26` 实际是让骑手往后仰,不是往前倾 → 手臂永远够不到车把,我调了三轮角度才发现 6. **环境摩擦** :我的模型 **不支持读图** (必须绕道视觉子代理)、 **无外网** (three.js 只能从本机其他项目找一份并改写成 IIFE)、每次启动 Chrome 都要沙箱审批(前 3 次)、PowerShell 5.1 的 BOM/编码/ `if` 表达式语法各踩一次。 它自己都觉得自己的错误“罄竹难书”! 这只是它自己总结的,如果站在更高的维度来看,错误可能更多。 如果让 O 哥看了,可能直接建议“不要开始了,弃用就好”! 然后它还总结了一下,下次能快多少,据说可以压到 40~50 分钟! 从它的时间比例可以看出来,模型调用的时间就 20 多分钟,但是工具调用 161 分钟。 所以它对工具的控制能力是非常弱的。根本就没有用好工具! 大概率不是没用好,而是不太会。就是说它这个模型和 Harness,对工具的理解和控制并不好。 时至今日,Opus 5,GPT-6 这种都是又快又好,预判能力和有用信息的提取能力,以及工具的利用能力都非常强。这种东西没法量化,但是你一旦用了,一旦对比了,立马就有强烈的感受。 然后我再来做一个横向对比吧! 我先简单说一下,谷歌 3.8 Flash,网页复刻很好,3D 建模做得不咋地,但是速度几块,只要 3 分钟,这才叫 Flash 啊! 然后重点来对比下它真正的对手 GLM5.3Flash (价格也很便宜) 同样的例子,效果比 DS 好。网页布局方面还原度很高!DS 有的两个问题,它都做好了。 建模方面,人物的细节也要好很多: 目前钢铁侠的建模还是一个难点! 我之前一直吐槽 GLM 最大的问题就是“慢”! 这个例子从生成到验证也是花了不少时间的。我记得是一个小时多一些! 我当时觉得,效果很不错,但是速度太慢了! 现在一看,速度也还可以。 一个三小时,一个一小时,这么一对比,一小时的是不是快到飞起了! 我本来是想多测几个例子的,但是测完这个已经半夜了,我觉得它不光浪费了我的钱,扼杀了我生命了。我非常生气! 当时写下一句“辣鸡”就去睡觉了! 今天早上情绪稳定了很多。冷静下来看看,DS 的综合能力和国内外的顶尖模型相比,确实落后,它最新版的模型,都比不过人家几个月前的模型,更不用说和国外顶级模型去比了。 它的 Harness+model,在智能体任务上的整体体验还是挺糟糕的! 模型速度很快,但是完成任务的时间很久! 对工具和资源的控制能力很差! 浪费了大量时间和 tokens。本质上还是智商低,所以不停地试错,这种成本最终转嫁给了用户! 所以,我觉得这篇文章最适合的标题是:“浪费时间”! 一方面,表达我不应该浪费时间来测试,另一方面表达它官方这一套工具模型目前确实很浪费时间! 当价格优势和速度优势不再,能力又不拔尖,工具又草台,DS 的优势何在? 之前可能因为开源,现在所有国产模型都开源了,而且比它好。 DS今天这个样子,各种无脑吹,要付一半责任! 现在开始追,大规模招人,可能有点晚了! 再多说一句,DS 和宇树,就是被全民的热捧害死的,本来按它们自己的节奏,做自己,都挺好的。默默搞技术都挺好的。 不要觉得我骂人的话难听,智谱也被我骂过很多次,但是人家吸取教训越来越强了! 希望下次再测 DS 的文章开头是:“卧槽,牛逼了!” 最新几个模型的效果对比可以访问: topai.jarvisuni.com/Jarvis-Gara… 我已经全部上传了!之前的模型也上传了,一起通知下!