DeepSeek V4 Flash单日调用8万亿Token登顶全球

8月3日 14:40
该模型在OpenRouter与OpenCode平台均居榜首,通过MoE架构及激进的缓存折扣定价策略,单任务成本较降价后的OpenAI GPT-5.6 Luna低约六成。

2026年8月3日,海外开发者开源项目团队OpenCode宣布其平台上DeepSeek V4 Flash模型的单日处理量突破8万亿Token。与此同时,模型API分发平台OpenRouter数据显示,在7月27日至8月2日的统计周期内,该模型以7.22万亿Token的周调用量位居全球所有模型之首,较前一周增长13%。这一数据标志着中国开源大模型在全球开发者生态中的渗透率显著提升,并在多个关键平台同时占据主导地位。

DeepSeek V4 Flash在OpenCode平台的具体消耗结构中,5万亿Token来自免费试用额度,3万亿来自付费调用。该平台CEO Jay表示,模型上线后平台单日使用量及新订阅用户均增长30%。在技术架构上,该模型采用混合专家(MoE)设计,总参数规模为284B,激活参数为13B,支持最长100万Token上下文窗口。其单任务成本优势主要源于独特的缓存优化机制,提供了高达98%的缓存命中折扣,远超行业平均的90%水平。具体定价策略显示,输入Token在命中缓存时仅收取0.2元/百万Token,未命中时为1元/百万Token,输出价格为2元/百万Token。

面对DeepSeek V4 Flash的市场冲击,OpenAI于7月31日紧急调整策略,宣布将其GPT-5.6 Luna模型输出价格从每百万Token 6美元下调至1.2美元,输入价格从1美元降至0.2美元,降幅达80%。尽管OpenAI核心产品负责人Tibo在开发者社区亲自推广降价后的模型,但市场反馈显示开发者更倾向于DeepSeek的定价模式。数据显示,即便经历大幅降价,GPT-5.6 Luna的单任务成本仍比DeepSeek V4 Flash高出约60%。这一竞争态势反映出当前AI行业正从单纯追求模型性能指标转向对推理效率与商业化成本的综合考量,开源模型凭借极高的性价比正在重塑全球大模型市场竞争格局。