AI 编程新闻6 min read

AI 编程价格战:OpenAI 同日下调 GPT-5.6 Luna 80%,DeepSeek 发布 V4-Flash。Token 价格只是幌子——单任务成本才是标尺

7 月 31 日,OpenAI 将 GPT-5.6 Luna 降价 80%,DeepSeek 同期上线 V4-Flash-0731。分析师开始按「智价比」排名模型。团队在采用任何 agent 之前,应建模的是单任务成本——而非 token 价格。

核心事件: 7 月 31 日,同一天发生了两件事。OpenAI 将 GPT-5.6 Luna 降价 80%——输入从每百万 token $1 降至 $0.20,输出从 $6 降至 $1.20——而 DeepSeek 发布了正式版 V4-Flash-0731,其输入每百万 token $0.14、输出 $0.28,并提供 98% 的缓存命中折扣。到了 8 月,分析师开始以「每美元智能」而非能力来给模型排名。对工程团队来说,真正有用的数字既不是标价也不是基准分数,而是单任务成本——而它会随每一种工作负载而变化。

同日双重组合拳

这次降价是 OpenAI 对中国开源权重模型持续施压的首次回应。Luna——GPT-5.6 家族中的批量推理模型——输入从 $1 降至 $0.20,输出从 $6 降至 $1.20。中端型号 Terra 降价 20%(输入 $2.50→$2.00,输出 $15→$12)。旗舰型号 Sol 维持 $5/$30 不变,但新增了「快速模式」——以 2 倍价格获得 2.5 倍速度,且智能毫不损失。OpenAI 还将 ChatGPT 与 Codex CLI 内部的自动评审模型从 GPT-5.4 切换为 Luna,估计这一高频 agent 工作负载的成本将降至原来的约十分之一。Luna 的输入价格现已与上一代 nano 级模型持平——OpenAI 正在以前小型模型的价格销售具备 agent 能力的模型。

同一天,DeepSeek 发布了正式版 V4-Flash-0731:架构与参数量与预览版完全一致,仅做了纯粹的后训练升级,聚焦于 agent 能力——终端操作、工具调用、多步执行。其 API 定价为:每百万 token 输入 $0.14 / 输出 $0.28(缓存未命中),缓存命中的输入价格为 $0.0028——98% 的折扣,而大多数服务商只提供约 90% 的折扣。DeepSeek 报告称,在 Artificial Analysis Intelligence Index v4.1 上其得分为 50,仅落后 Luna 的 51 分 1 分——而其单任务成本比 Luna 低约 60%。

度量标准变了

最说明问题的转变在于市场如今如何评估模型。华泰证券 8 月报告直言:GPT-5.6 的降价把竞争从「能力排名」推向「同等智能成本」。其数据为:V4-Flash-0731 的混合价格约为每百万 token $0.06,平均任务成本约为 $0.03——分别比 Luna 低约 65% 和 57%。Kimi K3 以 57 分代表了国产开源权重模型的能力天花板;V4-Flash 则在其能力区间内重置了成本地板。

这正是正确的框架,也正因如此,token 价格是错误的透镜。Agent 工作负载极其消耗 token 且上下文繁重:一个编程任务在工具调用、重试和长上下文之间就可能烧掉数十万 token。两个 token 价格相同的模型,完成单任务的成本可能相差数倍;而两个 token 价格相差悬殊的模型,单任务成本却可能几乎持平——因为其中一个会把 token 浪费在冗余输出上,另一个不会。DeepSeek 报告称,在同一套智能指数评测中,后训练使其输出 token 消耗降低了约 12%。Token 效率是一项成本特性,而不是质量上的注脚。

动态定价的变数

价格战还让账单变得更难预测。DeepSeek 在发布后随即宣布高峰时段加价——高峰窗口价格约翻倍——同一报道预计 V4-Pro 的 API 部署将于 8 月初上线。带高峰倍率的按量定价意味着,任务成本取决于你在何时运行它,而不仅仅是你消耗了多少 token。对团队而言,这把成本建模从一次性对比变成了一项持续纪律:在自己的工作负载上、在自己选择的时间、对照自己的验收标准来测量单任务成本——这正是有边界的试点的用途。

价格战没有改变什么

更便宜的 token 不会改变决策中与价格无关的部分:

  • 数据路径不标价。 你的提示词、上下文和日志是否离开你的环境,与它们花多少钱是两个独立的问题。无论价格战谁赢,受监管行业的团队仍然需要自托管、受管的环境
  • 审批关卡同样不标价。 市场领先者的 Auto Mode 移除了权限提示;在你的工作流中重新加入评审关卡的成本是一个真实的数字,而且对每家供应商来说都是同一个数字。
  • 总成本由工作负载决定。 一个单 token 最便宜的工具,在你的特定工作负载上可能单任务成本很高,反之亦然。唯一的方法是端到端运行你自己的任务并测量。

结论

7 月 31 日的价格战在狭义上是团队的好消息:有能力的 agent 越来越便宜,而且每家供应商都承受着结构性的定价压力。战略层面的解读则更微妙。当 token 价格趋近于电费成本时,差异化向技术栈上层移动——转向 agent 运行的环境、围绕其动作的关卡,以及让整个过程可审计的平台。这正是同一张检查清单适用之处:在你的代码上验证、建模真实的单任务成本、弄清数据路径,并把评审关卡保留在人类工作流中。廉价的 token 让糟糕的决策变得更便宜。但它们不会让决策变得更好。