一句话总结: 7 月 31 日,DeepSeek 上线 V4-Flash 正式版——284B 总参、仅 13B 激活的 MoE 模型,纯靠后训练优化,Terminal Bench 2.1 拿下 82.7 分,DeepSWE 从 7.3 暴涨到 54.4(6.5 倍),全面反超自家 V4-Pro 预览版。架构完全没变,变的只是训练方法。V4-Pro(1.6T 总参、49B 激活)8 月初登场。对编程团队来说,这是一次性价比的降维打击,也是一个信号:后训练优化,才是当下真正的能力杠杆。
发生了什么
7 月 31 日午后,DeepSeek 悄无声息地上线了 V4-Flash 正式版 API 公测。没有发布会,没有预热,没有 CEO 站台。只有一个模型,在每一项 Agent 基准测试上都改写了性价比规则。
模型架构与 4 月预览版完全一致:284B 总参的 MoE 架构,每次推理仅激活 13B 参数,100 万 token 原生上下文窗口,CSA+HCA 混合稀疏注意力机制。唯一的变化是后训练——而结果说明了一切:
| 基准测试 | V4-Flash 正式版 | V4-Pro 预览版 (4 月) | 含义 |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 67.9 (TB 2.0) | Agent 自主性逼近 Claude Opus 4.6 (85) |
| DeepSWE | 54.4 | 7.3 | 软件工程能力暴涨 6.5 倍 |
| Cybergym | 76.7 | — | 安全自动化达到生产可用水平 |
| Toolathlon Verified | 70.3 | — | 多工具编排能力可用 |
| NL2Repo | 54.2 | — | 仓库级代码理解 |
| DSBench-FullStack | 68.7 | — | 全栈开发任务 |
| DSBench-Hard | 59.6 | — | 高难度编程问题 |
仅 13B 激活参数的 Flash 已经超越了 744B 的 GLM-5.2,距离 Claude Opus 4.6(激活参数估计为 Flash 的 20–30 倍)仅差 2.3 分。而 V4-Pro(1.6T/49B 激活)还没出手。
这对编程团队意味着什么
1. 后训练杠杆被验证了
DeepSeek 官方明确写道:“模型结构、尺寸和预览版完全一致,仅重新进行了后训练。“DeepSWE 从 7.3 到 54.4 的 6.5 倍飞跃,不是硬件故事,是方法论故事。这意味着:模型能力的天花板不再由参数规模决定,训练数据质量、RLHF 策略、Agent 专项微调才是新的前沿。
对使用 AI 编程平台的团队来说,这意味着你今天部署的模型,三个月后可能天翻地覆——而你不需要升级任何硬件。你的评估流程必须是持续性的,不能是一次性动作。
2. Agent 工作负载的经济账重写了
V4-Flash 定价:输入约 2 元/百万 token,输出约 8 元/百万 token(缓存命中 0.2 元/百万 token)。大约是 GPT-4o 的 1/10,Claude Opus 的 1/7。一个每任务调用模型 50-100 次的编程 agent,现在对中低频任务也有了经济可行性。
换句话说:以前只能给高价值任务分配 agent 的团队,现在可以在每个 PR 上跑 agent。瓶颈从成本转向了 review 能力。
3. MIT 开源协议,不是“自定义许可证”
与 Kimi K3 的自定义许可证不同,DeepSeek V4 采用标准 MIT 协议——无商业使用限制、无归属要求、无禁止用途条款。对私有化部署来说,这意味着法律审查不再是一个阻塞点。加上 13B 激活参数的轻量体积,私有化部署 V4-Flash 的门槛远低于 104B 激活的 Kimi K3。
4. 原生支持 Responses API + Codex 兼容
V4-Flash 原生支持 OpenAI 的 Responses API 格式——这是新一代面向 Agent 的 API,替代了 Chat Completions 用于工具调用场景。同时专门适配了 Codex。实际效果:任何基于 OpenAI Agent 基础设施的代码库,几乎零成本迁移到 V4-Flash,以 1/10 的价格获得相当甚至更好的 Agent 性能。
Harness 浮出水面:DeepSeek 的 Agent 框架首次正式亮相
这次发布中,一个与基准分数同样重要的信号被很多人忽略了:DeepSeek 自研的 Agent Harness 框架首次以正式命名出现。Harness 团队由前 Jane Street 量化交易员崔添翼(6 枚 ACM 亚洲区域赛金牌)挂帅,2026 年 3 月专门组建,以构建 Agent 基础设施。
DeepSeek CEO 梁文锋曾将 AGI 路径比作爬楼梯:语言模型是第一级,思维链是第二级,Agent 是第三级,持续学习是第四级。Harness 就是第三级的工程实现——一个支持长周期多步骤自主任务、迭代自检、异常自动重试的框架。
这不是模型功能,这是基础设施。它意味着 DeepSeek 在构建的是一个完整的 Agent 技术栈,而不仅仅是模型目录。
V4-Pro 即将登场,意味着什么
V4-Pro 正式版预计 8 月初发布。规格:
- 1.6T 总参,49B 激活(MoE)
- 100 万 token 上下文,384K 最大输出
- 自适应深度思考引擎,四档算力调度
- 目标场景:复杂推理、多智能体协同、万亿级数据运算
如果 Flash 的后训练收益等比放大到 Pro——4 倍参数规模叠加同样的方法论——结果可能挑战甚至超越 GPT-5.6 Sol、Claude Opus 5 和 Fable 5。
中国 AI 生态正在经历一个密集发布窗口:Kimi K3(7 月 16 日,开放权重)、GLM-5.2(6 月,开源)、DeepSeek V4(7 月 31 日,MIT 协议)。六周内,三个前沿级模型,全部开放可用。
如何不跟风、真评估
- 跑你自己的 Agent 任务。 Terminal Bench 和 DeepSWE 是筛选工具,不是验收标准。定义 10-20 个有明确验收条件的有边界编程任务,对比的是通过率,不是排行榜分数。
- 算每任务成本,不是每 token 成本。 单价 1/10 的模型如果重试次数翻 3 倍,未必省钱。端到端追踪:消耗 token 数、reviewer 时间、任务通过率。
- 专门测试工具调用链路。 V4-Flash 的 Toolathlon 得分 70.3 不错但非完美。如果你的 agent 工作流涉及 5 个以上工具串联调用,验证模型是否能在全链路中保持上下文和参数格式正确。
- 私有化部署要实测推理成本。 13B 激活参数在 2026 年不算大,但 100 万 token 上下文窗口会改变显存计算。用你的实际任务长度跑你自己的推理栈。
- 关注 Pro 定价。 V4-Flash 的经济性已经很有冲击力。如果 V4-Pro 以 GPT-5.6 或 Opus 的 1/5 价格提供前沿性能,整个 Agent API 市场的定价模型都需要重估。
更深层的三个信号
信号一:后训练是新的护城河。 DeepSeek 用事实证明,一个 284B 的模型仅靠训练方法论就能击败自己的 1.6T 预览版。“更大模型 = 更好模型”的时代结束了。“更好训练 = 更好模型”的时代开始了。
信号二:中国开源浪潮是真实的,且在加速。 Kimi K3、GLM-5.2、DeepSeek V4 不是孤立事件,而是一个模式:前沿级模型、开放许可、密集发布。对于需要模型选择和部署灵活性的团队来说,选项空间从未如此广阔。
信号三:Agent 基础设施正在成为产品本身。 DeepSeek 这次发布的不仅是模型——还有 Harness、Responses API 和 Codex 兼容。模型是引擎,Agent 框架是整车。正在评估 AI 编程平台的团队应该问:平台是能路由到最适合任务的模型,还是把你锁死在单一供应商的技术栈里?
结语
DeepSeek V4-Flash 正式版令人印象深刻,不是因为它大,恰恰因为它小——却打出了重量级的拳。一个 13B 激活的模型在 Terminal Bench 拿下 82.7、DeepSWE 拿下 54.4,重写了人们对低成本曲线的所有假设。几天内将登场的 V4-Pro,将检验同样的后训练方法论能否在 1.6T 参数规模上继续放大。
对编程团队来说,行动路径很清晰:把 V4-Flash 加入你的评估清单,用自己的验收标准跑测试,计算每任务通过成本。排行榜是给观众看的,试点才是给建设者用的。
V4-Flash 系列
这是我们 V4-Flash 报道的中心。按你的关注点选择: