12:24Geek@geekbb75°VulcanBench 用 23 个真实软件工程任务评测模型,Qwen3.8-Max 跑完全套成本 126.25 美元,DeepSeek V4-Flash 仅需 13.60 美元。Qwen3.8-Max 每个任务耗时 20-25 分钟,是测试中最慢的模型,固定预算下最佳设置只排中游,默认设置垫底。六个原本能解决的任务贡献了 26 分降幅的 83%,其中三个得分直接归零。在准确率上 Grok 4.5 领先,按每美元准确率 DeepSeek V4-Flash 很难被击败。AI模型VulcanBenchQwen3.8-MaxDeepSeek V4-Flash7 个信源在谈事件专题推荐理由:VulcanBench 实测:Qwen3.8-Max 跑一趟 126 美元,DeepSeek V4-Flash 只要 13.6 美元,便宜 10 倍还更快。选性价比就 DeepSeek,选准确率就 Grok 4.5。原文稍后读已读值得跟进有用关注 VulcanBench
09:48官方一手pandaily@contact@pandaily.com (Pandaily)71°DeepSeek-V4-Flash-0731正式发布并开源,参数量304B,性能评分82.7。该模型超越V4-Pro预览版,定价为0.14/0.28美元。在VulcanBench基准上位列第一,HuggingFace热度榜第二。官方称其表现媲美Claude Opus-4.8。AI模型DeepSeekV4-Flash开源模型10 个信源在谈事件专题推荐理由:DeepSeek把304B的V4-Flash开源了,性能打平Claude Opus-4.8,价格还便宜,快去试试。原文稍后读已读值得跟进有用关注 DeepSeek