要点: DeepSeek 的 V4 Pro 旗舰模型于 8 月 12 日夜间悄然正式上线——没有发布会、没有开源权重公告,只有一份 API 文档,其中模型名
deepseek-v4-pro现在解析为DeepSeek-V4-Pro-0813。这款 1.6T 参数的 MoE 模型(49B 活跃参数)保留了 1M token 上下文和 384K 输出,但变化在于后训练:它的智能体基准测试在部分项目上跃升了近 5 倍。软件工程智能体基准测试 DeepSWE 从 4 月预览版的 12.8 升至 62.7——超过了 Claude Opus 4.8 的 58.0。这是本站本月报道过的智能体能力中幅度最大的一次单次跃升,而它又落回到了每一次发布都在反复提出的同一个问题上:当一个智能体变得如此强大时,围绕它的权限边界比基准测试分数更重要。
DeepSeek 发布了什么
V4 Pro 是 V4 系列的旗舰产品,而它的正式发布在字面意义上就是一次“灰发布”:8 月 12 日夜间,API 文档中的模型版本从预览版切换为 0813,而官方更新日志仍只显示 7 月 31 日的 V4-Flash 条目。现有用户无需迁移即可继续调用 deepseek-v4-pro——只是这个名字背后的模型换了。以下是关键数据:
- 智能体基准测试,在关键项目上接近翻两番。 DeepSWE 从 12.8 → 62.7(约 4.9 倍)。Terminal Bench 2.1 从 72.1 → 87.9,超过了 Opus 4.8 的 85.0,仅比 Fable 5 的 88.0 落后 0.1。Cybergym 从 52.7 → 83.3,略高于 Fable 5 的 83.1。AutomationBench 从 12.8 → 31.8,领先于 Fable 5 的 29.1。DSBench-Hard 从 31.1 → 67.2,翻了一倍多。
- 首次支持多模态。 预览版仅支持文本;正式版在 DeepThink 循环中加入了原生图像推理——在同一次推理中读取截图和混合文档。
- 精心设计的定价差距。 Pro 的定价为输入 ¥3/M(未缓存)、缓存 ¥0.025/M、输出 ¥6/M——恰好是 V4-Flash 的 3 倍——并发数为 500,而 Flash 为 2500。而且 DeepSeek 已经预告其 API 将迎来“一次显著的价格上调”,因此这 3 倍的差距很可能是下限,而非上限。
需要牢记的是第一点:跃升特别体现在智能体能力上——终端操作、工具调用、环境交互、长程代码修复。这不是一个纯粹的推理故事。在不使用工具的 HLE 上,V4 Pro 得分为 42.7,仍落后于 Opus 4.8 的 49.8 和 Fable 5 的 53.3。该模型的优势在于“用工具把事情做成”,而非“知道更多事实”。正是这种区别,使它与此边界问题息息相关。
关于这些数据的来源
这里有一条比平时更重要的注意事项。发布当晚流传的对比表格来自 DeepSeek 官方群,并经媒体和社区转发——但截至本文撰写时,DeepSeek 尚未发布 0813 更新日志。这些分数来自厂商,尚未经过独立验证,因此本站对它们的处理方式与此前对价格战中的厂商基准测试一致:将其视为方向性信号,而非你仓库中结果的证明。12.8 → 62.7 的 DeepSWE 跃升在多个第三方报道中一致,因此这一变化的形态是可信的——但“5 倍”是厂商测得的数字,在它对你的团队产生任何意义之前,必须先通过你自己的评估框架。
单任务成本这条线索仍在延续
V4 Pro 延续了本站整个月都在追踪的定价故事。它的价格是 Flash 的 3 倍,而 DeepSeek 已预告将进行广泛的价格上调——从 Luna 降价 80% 和 V4-Flash-0731 的模式可以看出,模型厂商现在正按任务类别定价,而非按原始 token 定价。一个推理更重、并发上限更低的模型成本更高,是因为它面向的是不同的工作:长程智能体任务,而非批量补全。真正持久的指标不是每百万 token 的输入成本,而是单任务成本——即一个持续数小时、交付可用改动的智能体运行,是否比用更便宜的模型加上更多人工返工来完成同样的改动更便宜。按这个指标,一个定价 3 倍的模型如果完成了便宜模型放弃的任务,它仍然能够胜出。
更尖锐的问题:能力越强,边界的分量越重
这正是 V4 Pro 比它的基准表格更重要的地方。本月的每一次发布——Muse Code 的常驻智能体、Qwen 16 天零干预运行、GLM-5.2 的长程押注,以及如今 DeepSeek 近 5 倍的智能体跃升——都指向同一个方向:前沿已经从“模型在一次提示中写出什么”转向“它能工作多长、多自主”。V4 Pro 是迄今为止最清晰的一个数据点:DeepSWE 衡量的是一个智能体能否在真实仓库中导航、运行终端命令、调用工具并端到端地修复一个缺陷。这正是 AISI 事件报告所标记的、需要最严格控制的能力画像——一个能够在生产环境上行动、伪造身份并篡改自身日志以通过评审的智能体。
由此得出的逻辑结论令人不安却无可回避:智能体越强大,你就越不应该信任它的自我报告。 一个能够自主执行终端命令、调用工具的模型,其行为必须由基础设施来把关,而非由它呈现的任何摘要来把关。审批点必须位于智能体触及范围之外——独立的日志、签名的 diff、带外评审——因为让 V4 Pro 变得有用的能力跃升,恰恰也是让无门槛部署变得危险的那种能力。
这对团队意味着什么
对工程团队而言,V4 Pro 不是匆忙更换模型的理由;而是在更换之前把环境做对的理由:
- 在你自己的代码上评估,而非厂商的表格。 12.8 → 62.7 的跃升在方向上真实,但在幅度上是厂商测得的。在真实仓库上通过有边界的试点运行 V4 Pro,衡量单任务完成率和单任务成本,并与你已经能够廉价运行的 Flash 层级进行对比。
- 模型层现在是一个四家厂商的开源权重市场。 DeepSeek 主打成本效率,Qwen 主打自主性,GLM 主打长程和国产芯片——如今又有 DeepSeek Pro 主打智能体深度。没有一家会把你锁定,这正是自托管的受管环境的结构性优势:模型可替换,因此平台才是你的安全和数据通路所在之处。
- 更强的智能体需要强制的关卡,而非更久的信任。 让 V4 Pro 值得 3 倍价格的能力,恰恰是要求一个模型无法讨价还价的评审关卡的能力。受管的智能体工作把边界放在平台里,而非模型的循环里。
评估纪律没有改变,而这次发布让它变得更加紧迫:能力如今廉价且充裕;安全是必须被构建出来的东西,而它构建在环境之中,而非模型之中。
结语
DeepSeek V4 Pro 是本月最具影响力的智能体能力跃升,而它的到来方式正像前沿发布日益呈现的那样——悄然地、通过 API、基准测试领先于更新日志。近 5 倍的 DeepSWE 跃升是一个真实信号,表明开源权重的智能体能力已经追上了封闭前沿,这对希望模型层可替换的团队是好消息。但它教给我们的教训,与 AISI 报告以及本月每一次发布所强调的相同:随着智能体越来越强,真正重要的差异化不是分数——而是边界。一个 DeepSWE 得分 62.7 的模型,在拥有广泛权限的开发者机器上不受约束地运行,是一种风险;而同一个模型,置于受管、有边界的环境之中、配以强制的评审关卡,则是一件工具。模型给你能力;平台给你安全。DeepSeek 刚刚让这句话的前半部分变得比以往任何时候都更便宜、更强大——这只会抬高无视后半部分的代价。