DeepSeek 发布 V4.1 Flash 模型,性能对标 GLM-5.3,KV 缓存技术大幅降低内存占用
DeepSeek V4.1 Flash เก่งระดับ GLM-5.3, Kimi K3 แต่ราคาถูกกว่าหลายเท่าตัว KV cache ประหยัดแรม
DeepSeek 新出的 V4.1 Flash 模型,性能不错,和 GLM-5.3 差不多,关键是内存消耗特别低,适合做 agentic 任务,价格也便宜很多。
DeepSeek 推出 V4.1 Flash 模型,其性能在测试中超过 V4 Pro,达到与 GLM-5.3、Kimi K3 相当的水平。该模型通过 CSA2 架构和 FP4 KV 缓存技术,将每 token 的缓存内存从 4KB 降低至 890 字节,内存占用减少 4 倍,使推理成本大幅下降。
DeepSeek V4.1 Flash เก่งระดับ GLM-5.3, Kimi K3 แต่ราคาถูกกว่าหลายเท่าตัว KV cache ประหยัดแรม
DeepSeek V4.1 Flash เก่งระดับ GLM-5.3, Kimi K3 แต่ราคาถูกกว่าหลายเท่าตัว KV cache ประหยัดแรม Body DeepSeek ปล่อยโมเดล DeepSeek V4.1 Flash โมเดลขนาดกลางระหว่าง V4 Pro กับ V4 Flash เดิม แต่กลับมีต้นทุนการให้บริการต่ำ ทำให้ค่าโทเค็นมีราคาถูกและโดยเฉพาะค่าแคชมีราคาถูกมากเนื่องจากปริมาณหน่วยความจำที่ใช้เก็บแคชแต่ละโทเค็นนั้นเล็กลงมาก ในแง่ของความเก่งโมเดล DeepSeek V4.1 Flash ทำคะแนนทดสอบได้ดีกว่า DeepSeek V4 Pro แทบทุกรายการ คะแนนทดสอบขึ้นไปเทียบชั้นกับ GLM-5.3, Kimi K3, หรือแม้แต่ Claude Opus 5 สถาปัตยกรรมของโมเดลเป็นแบบ 552B-A8B/A16B โดยช่วง prefill (ประมวลพรอมต์เดิม) จะใช้พารามิเตอร์ 8B และช่วง decode (สร้างโทเค็นใหม่) ใช้พารามิเตอร์ 16B ส่วน Compressed Sparse Attention 2 (CSA2) ใช้ร่วมกับ FP4 KV Caching ทำให้หน่วยความจำที่ใช้ในการแคชโทเค็นเหลือเพียง 890 ไบต์ต่อโทเค็นเล็กกว่า DeepSeek V4 Flash ถึง 4 เท่าตัว ความประหยัดแรมเช่นนี้ทำให้ค่าแคชของโมเดลเหลือเพียง 1/50 ของค่าอินพุตเท่านั้น ทำให้การรันงานแบบ agentic ถูกลงอย่างมาก ตอนนี้ DeepSeek เริ่มให้บริการ V4.1 Flash แล้ว โดยผู้ที่ซื้อ API จาก DeepSeek โดยตรงจะใช้โมเดลนี้แทนที่ DeepSeek V4 Pro ไปเลยโดยไม่ต้องคอนฟิกอะไรเพิ่มเติม ราคาเต็มของ API อยู่ที่ 0.3/1.2 ดอลลาร์ต่อล้านโทเค็น และแคช 0.006 ดอลลาร์ต่อล้านโทเค็น ที่มา - @deepseek_ai lew Thu, 10/09/2026 - 22:30