DeepSeek被曝训练2万亿参数模型 拟扩至8万亿

9月21日 20:34
The Information相关说法将该项目与 DeepSeek V4.1 Pro 相连,发布窗口指向10月中旬到下旬,且训练体系强调与华为昇腾等国产AI芯片协同。

The Information发布的信息显示,DeepSeek正在进行一次模型规模跃迁:当前在训项目的参数规模被置于2万亿量级,并计划在未来进一步扩展到8万亿参数。由于DeepSeek V4.1 Flash已经释放新架构线索,外界将此2万亿项目与即将发布的DeepSeek V4.1 Pro相关联,发布时间窗口被放在假期之后、10月中旬到下旬。

技术层面,DeepSeek V4.1 Pro预计承接前一版本中的关键设计,包括CED+Engram、Prefill与Decode拆分,以及非对称式激活结构。围绕这些结构,相关分析给出的资源估算口径为:完成2万亿参数规模训练约需50到60万亿Token;按不同加速卡推算,所需卡数约为3万张H100/H200、1.5万张B200,或6万张昇腾910C。若改用昇腾950系列,卡数被估计在3万张左右,接近H200水平。

产业协同方面,DeepSeek的训练策略被描述为更紧密地绑定国产AI芯片,其中华为昇腾系列被列为重点路径。昇腾950分为PR与DT两条产品线,分别服务训练与推理,并在流程上拆分Prefill与Decode;这与DeepSeek新架构形成软硬件协同优化的空间。国内已有国产AI芯片训练万亿级大模型的公开案例,但达到2万亿参数且被明确确认的案例尚未出现。公开提及的超2万亿参数国产模型主要包括文心一言5.0、Kimi K3、千问Qwen 3.8 Max,MiniMax M3等仍在等待发布的产品也未说明采用国产AI芯片训练。