单日消耗 8 万亿 Token。

这一数字出自 AI 编程工具 OpenCode 的统计,对象是 DeepSeek V4 Flash 模型。

据该开源 Agent 平台披露,DeepSeek V4 Flash 正式版上线后,通过其平台产生的 Token 总量已达 8 万亿。细看构成,其中 5 万亿来自免费额度,剩余 3 万亿则源自付费套餐 OpenCode Go。

作为参照物,大模型路由平台 OpenRouter 接入了 400 余款模型,月处理量约 200 万亿 Token,日均约为 6.6 万亿。

这意味着,仅在 OpenCode 这一个渠道,DeepSeek 一款模型一天的 Token 消耗量,便超越了 OpenRouter 全平台的日均总和。

OpenRouter 平台上,DeepSeek V4 Flash 已成为本周热门之选。

低价策略是诱因之一:能力跃升而价格未涨,被压抑的需求自然迅速释放。但 8 万亿 Token 背后,更深层的变化在于用户习惯的重塑。

以往,用户提问,模型作答,交互即止。如今的 Agent 能自主读文件、改代码、跑程序、查结果,失败后还会重试。单次任务可能耗时数小时,调用数十次工具,甚至多 Agent 协同作业。

模型输出的代码量未必激增,但消耗的 Token 却可能翻升几十倍乃至数百倍。

曾有用户利用 Claude Opus 5 制作单页 3D 游戏。模型需不断生成页面、截图校验、再次修改。最终仅得到一个 HTML 文件,一条提示词却耗去 6.9 亿 Token,费用逼近 3000 元。

Agent 任务的爆发,迫使模型证明自身价值。除了智能水平,性价比成为关键考量;衡量标准也从「单次回答多聪明」,转变为「完成长任务花费多少、耗时多久、失败几次」。

依此标准,DeepSeek V4 Flash 确立了新的基准线。

每百万输出 Token,DeepSeek 收费 2 元人民币。Anthropic 的 Claude Opus 4.8 标准价 25 美元(约合 170 元),仅看输出单价,两者差距达 85 倍。

7 月底,DeepSeek 发布 V4 Flash 正式版,维持原有架构与规模,侧重后训练,强化编码及 Agent 能力。

次日,大模型竞技场 Arena 公布前端编码评测榜,将 V4 Flash 纳入「价格—性能」前沿行列。截至 8 月 2 日快照,V4 Flash 初步排名暂列 Opus 4.8 Thinking 之前。

Artificial Analysis 的 Intelligence Index v4.1 显示,V4 Flash Max 得分 50,Claude Opus 4.8 Max 得 56 分。前者跑完全套评测调用费约 72.02 美元,后者高达 3752.55 美元。

换言之,Opus 多获 6 分,但评测成本高出约 52 倍。

V4 Flash 尚未能证明全面超越 Opus,但只要二者同处候选名单,85 倍的价差便足以颠覆默认选择。

当价格相差数十倍,性能领先仅几个百分点时,这笔账愈发难以平衡。

受冲击者未必是最弱小模型。便宜快速的小模型仍胜任分类、提取、路由等简单工作。最强旗舰模型亦会继续处理疑难杂症,或作为高失败成本场景下的保险。

真正尴尬的是中间层模型:它们比 V4 Flash 略强,却贵数十倍;又不足以稳定解决 V4 Flash 无法攻克的问题。

这便是 DeepSeek 的斩杀线。它无需成为最强,只需做到「大多数时候能做完」,凭借近两个数量级的价格优势,便将更贵的模型挤出默认调用位。

为何 V4 Flash 能将高价模型卖成白菜价?

传统认知中,模型价格与其「聪明程度」正相关。越聪明,越昂贵。

目前主流大模型定价如此:Anthropic 的 Opus 4.8 和 Opus 5 输出均为 25 美元/百万 Token,Fable 5 为 50 美元/百万 Token;OpenAI 的 GPT-5.6 降价后,Luna 输出由 6 美元降至 1.2 美元,Terra 由 15 美元降至 12 美元,Sol 维持 30 美元不变。

国产模型方面,DeepSeek V4 Flash 为 2 元,新发布的 Qwen 3.8 Max 为 36 元,Kimi K3 为 100 元,GLM 5.2 为 28 元。

无论对比国产阵营还是国外旗舰,DeepSeek 的价格宛如一股「清流」。造成差异的原因何在?

最直观的是单次推理的直接成本。

该成本受激活参数量、精度、注意力机制、KV Cache 大小、输出长度、硬件利用率及并发量影响。同一模型若以更少计算完成推理,或让请求共享缓存,成本即降。

V4 Flash 总参数 2840 亿,但每 Token 仅激活约 130 亿参数。它采用混合注意力结构、低精度权重及长上下文缓存优化。

V4 系列模型架构图

据 DeepSeek 四月公开的 Preview 技术报告估算,在百万 Token 上下文下,V4 Flash 单 Token 推理计算量约为 DeepSeek V3.2 的 10%,KV Cache 约为后者的 7%。

此数据系 V3.2 内部架构对比,不意味着其综合成本仅为其他模型十分之一,但足以解释 DeepSeek 压低长任务价格的逻辑。

V4 系列改造了 Transformer 模块中的三个关键部分:注意力层改为先压缩再定位重点的 CSA 机制,以及极致压缩但全浏览的 HCA 机制,两者交错排列以平衡成本。

前馈层沿用 DeepSeekMoE:模型含大量细分专家与少量共享专家,每 Token 仅路由至小部分专家。

因此,V4 Flash 虽总参数 2840 亿,每 Token 实际激活仅约 130 亿;V4 Pro 总参数达 1.6 万亿,实际激活约 490 亿。模型获得大知识容量,却无需每生成一个 Token 都运行全部参数。

其次是服务成本。从训练、后训练、评测、安全,到推理基础设施、闲置算力等,这些费用虽不出现在 Token 账单中,却需厂商承担。

最后是商业定价。API 价格非单纯成本加成,厂商还需考量市场份额、迁移成本、品牌溢价、服务能力及客户对可靠性的支付意愿。

故模型价格绝非纯成本表。它既反映算力需求,也体现厂商对自身能力、品牌及可靠性的估值。

OpenAI 与 Anthropic 的高价,可能涵盖更高推理成本、产品生态、安全服务溢价,以及在高难任务上的定价权。

架构未变,Agent 能力为何大增?

V4 Flash 正式版暂未发布新技术报告。DeepSeek 7 月 31 日更新日志称,正式版结构与尺寸同 Preview 一致,仅重新进行后训练。

此前预览版报告已披露,后训练重点聚焦代码与 Agent:分别训练数学、代码、Agent 及指令遵循专家,利用 SFT 和 GRPO 强化各自能力,再通过十余个教师模型的 On-Policy Distillation 合并回单一模型。

工具调用被视为独立问题处理。

DeepSeek 设计专用调用格式,减少参数转义与格式错误;Interleaved Thinking 使模型在工具返回结果后保留前置推理;DSec 提供数十万并发沙箱,让模型反复练习运行代码、读取报错及修改。

这些后训练未增加新参数,却减少了 Agent 常见失败:选错工具、填错参数、遗忘状态或任务未完即停。

正式版在 Terminal Bench 2.1 上获 82.7 分,该成绩使用了未发布的 DeepSeek Harness 极简模式及 max 推理档。此外,DeepSeek 为 V4 Flash 加入原生 Responses API,并适配 Codex。

预训练奠定能力底座,后训练改变能力调用方式。

V4 Flash 可部署于「消费级」电脑?

V4 Flash 的另一变化,是让前沿 Agent 模型贴近本地设备。

虽每次推理仅激活 130 亿参数,但完整 2840 亿参数仍需存储调度,官方仓库权重文件合计约 167 GB。

DeepSeek 提供的 vLLM 服务示例需一台配备 4 张 GB300 的服务器。

社区项目 DwarfStar 通过低比特量化,将 V4 Flash q2 版本装入 96GB 或 128GB 统一内存设备,q4 版本建议至少 256GB 内存。部分 128GB Mac 测试中,短上下文速度可达每秒二十余 Token。

q2 版本能运行,不代表能复现官方 API 的 Agent 成绩。极低比特量化可能损害代码、长上下文及工具调用能力,社区运行时亦处于早期阶段。

换个视角,V4 Flash 的出现似乎是 DeepSeek 斩杀线的关键一刀。本地部署上,它斩掉了「高水平模型只能驻留机房」的部分门槛,将门槛降至高内存工作站级别。

一台高配 Mac 或 DGX Spark,已能以可交互速度运行激进压缩后的完整 V4 Flash。

最强模型也开始讲究性价比。

低价不等于少赚。

单价下降,Token 总量增速可能更快。

Sam Altman 曾在 7 月底播客中表示,OpenAI 预计模型将产生巨大用量,故无需依赖「极高毛利」覆盖训练成本。他们与 DeepSeek 梁文锋一样,坚信 AI 需求近乎无上限,使用量将持续爆发。

即使单次调用利润微薄,只要总量足够大,累计利润仍可覆盖下一代模型训练成本。

这也正是 V4 Flash 值得关注的缘由。

它未以绝对领先的榜单成绩证明自己最聪明;而是将过去仅旗舰模型才能承担的任务,压入一个可反复调用、持续试错、甚至允许浪费一些 Token 的价格区间。

聊天机器人时代,用户愿为更好回答多付几倍价格。进入 Agent 时代,模型不再只答一次。它需浏览文件、搜索资料、执行代码、截图校验,再根据结果重来。

单次任务中,智力上几分差距,或许只影响多试两轮;但几十倍价格差距,却决定任务是否有资格真正启动。

运行 AA 所有测试的费用与智能得分对比显示,DeepSeek 获 50 分仅花 72 美元,Fable 5 获 60 分花费 5600 美元。

未来模型竞争,难再用一张能力榜单概括。

用户需计算完成率、调用次数、响应速度及最终账单;模型厂商出售的,不再仅是每个 Token 的智能,而是每美元最终能完成多少工作。

由此观之,V4 Flash 真正斩掉的,是调用旗舰模型前那种不计成本的惯性。

当一个便宜 50 倍甚至 80 倍的模型,已能完成多数编码与 Agent 任务,昂贵模型便须反向证明:剩下那几分能力,究竟值不值得多付几十倍的钱。

我们正在招募伙伴

📮 简历投递邮箱[email protected]