模型72°
DeepSeek或发布1M上下文单GPU模型
精选理由
DeepSeek可能发布基于华为昇腾的1M上下文单GPU模型,具备本地部署能力。
DeepSeek可能发布支持单GPU运行、拥有1M上下文窗口的模型。该模型经过高强度后训练,具备智能体团队功能,采用本地优先设计。模型将使用华为昇腾芯片训练,并包含完整训练配方。
原文 · Teortaxes
This might be a misunderstanding But it'd be very cool of DeepSeek to release a - single-GPU, screaming fast 1M context model - with extremely intense post-training, agent teams etc - with local-first skills - "trained on Huawei Ascend" - recipe included R1 moment #2 maybe.