№deepseekv3·general
DeepSeek-V3
别名
- 首次出现
- 2026-05-22
- 最近出现
- 2026-09-02
- 累计提及
- 175
§ 01综述
DeepSeek-V3是DeepSeek公司研发的大规模语言模型,专注于高效稀疏注意力机制与分布式训练,近期在预训练性能和推理优化上取得显著进展,成为AI领域关注的热点。
DeepSeek-V3近期进展
DeepSeek-v3 671B测试:英伟达Blackwell GB300刷新MoE预训练世界纪录:DeepSeek-V3 671B模型在英伟达Blackwell GB300架构上完成预训练,以1648 TFLOPS/GPU的性能刷新MoE(混合专家)模型预训练的世界纪录,展示了其在超大规模训练中的高效性。
NVIDIA Blackwell Ultra创纪录:预训练DeepSeek-V3 671B达1648 TFLOPS/GPU:NVIDIA宣布,使用Blackwell Ultra平台预训练DeepSeek-V3 671B模型时,单GPU性能达到1648 TFLOPS,凸显了硬件与模型优化的协同效应。
PIVOT:令牌级稀疏注意力的高效查询组索引方法:DeepSeek提出PIVOT方法,通过令牌级稀疏注意力与高效查询组索引,提升模型在长文本处理中的效率,减少计算资源消耗,为V3的性能提升提供技术支撑。
OpenAI前CTO穆拉蒂创企TML发布Inkling模型,借鉴DeepSeek和Kimi主打性价比:TML公司推出的Inkling模型借鉴DeepSeek的架构设计,强调性价比,反映行业对高效模型的关注,DeepSeek-V3的技术路径可能影响后续模型发展。
当前焦点与观察点
DeepSeek-V3的核心进展围绕稀疏注意力优化与硬件协同展开,671B参数的预训练性能突破显示其在超大规模模型训练中的竞争力。PIVOT等技术的应用不仅提升推理效率,也为行业提供了降低计算成本的新思路。同时,竞争格局中,类似Inkling的模型借鉴DeepSeek的设计,说明高效、低成本成为AI模型发展的重要方向。此外,Google通过文档优化提升Gemini 3 Flash正确率至37.3%,虽与DeepSeek-V3直接对比有限,但反映行业对模型性能优化的持续探索,DeepSeek-V3的技术创新或为这类优化提供参考。