AI 编程资讯7 min read

后训练革命:为什么参数量从此不再重要

DeepSeek V4-Flash 正式版证明后训练才是真正的杠杆。13B 激活模型仅凭训练方法论就击败了 1.6T 预览版——这是一次范式转变,大多数团队还没意识到。

这不是一篇基准测试报告。 这是一篇论述。DeepSeek V4-Flash 正式版不仅击败了自己的预览版——它杀死了“更大模型就是更好模型”的假设。如果你还在用参数量来评估 AI,你已经落后了。

范式破裂的那一刻

2026 年 7 月 31 日。DeepSeek 发布 V4-Flash 正式版。架构与 4 月相比没有任何变化,参数量没有任何变化:284B 总参数,13B 激活参数。预训练没有任何变化。唯一改变的是后训练。

结果呢?DeepSWE 提升 6.5 倍。Terminal Bench 2.1 达到 82.7——比 V4-Pro 预览版高出 3 分,而 V4-Pro 的激活参数是它的 3.8 倍。一个 13B 激活参数的模型在 Agent 任务上超越了 GLM-5.2(744B 参数)。

仔细想想。同一个神经网络,同样数量的突触,同样的训练数据,只是后训练不同——软件工程能力就提升了 6.5 倍。

这不是渐进式改进。这是我们长期以来对模型能力认知方式的一次范畴错误。

模型评估的三个时代

时代一:参数量(2020-2024)。 假设很简单:更多参数 = 更强能力。GPT-3 有 175B,GPT-4 估计有 1.7T。越大越好,扩展定律似乎也证实了这一点。

时代二:基准测试分数(2024-2025)。 社区意识到参数量并不能说明全部问题。像 Mixtral 这样的混合专家模型表明,稀疏架构可以以远低于密集模型的激活参数量匹敌后者。评估转向了基准测试分数——MMLU、HumanEval、SWE-bench。

时代三:后训练质量(2026-)。 V4-Flash 的结果表明,基准测试分数是后训练质量的下游产物,而非预训练规模的下游产物。一个拥有 13B 激活参数、训练得当的模型,能超越一个拥有 49B 激活参数、训练欠佳的模型。架构和预训练决定了天花板,后训练决定了你离天花板有多近。

后训练到底做了什么

预训练教给模型事实、语法和模式。这是“是什么”——什么是 for 循环,什么是函数,什么是竞态条件。

后训练教给模型行为。这是“怎么做”——如何规划多步任务,如何从工具调用失败中恢复,如何在 100K token 上下文中保持连贯,如何知道任务已经完成。

V4-Flash 的结果表明,至少在 Agent 任务上,“怎么做”远比“是什么”重要。一个知道得稍微少一点但行为好得多的模型,会优于一个知道得更多但无法执行的模型。

这对每个基于 AI 构建的团队都有影响:

  1. 你的模型评估可能错了。 如果你根据参数量或通用基准测试分数来选择模型,你衡量的是错误的东西。你需要在你真实的 Agent 任务、真实的工具链和真实的验收标准上进行评估。

  2. 你今天部署的模型不是三个月后你将拥有的模型。 后训练改进不需要新硬件,不需要重新架构,只需要更好的训练数据和更好的 RLHF 策略。同一组模型权重可以在不改变一行推理代码的情况下得到大幅提升。

  3. 护城河在转移。 一年前,护城河是预训练规模——谁能负担最大的集群。今天,护城河是后训练方法论——谁能最有效地塑造模型行为。明天,护城河将是 Agent 基础设施——谁能构建最好的自主任务执行运行时。

对前沿实验室的尖锐提问

如果 DeepSeek 能够仅通过后训练在 DeepSWE 上实现 6.5 倍提升,而模型成本仅为竞争对手的 1/10,那么这说明了在预训练集群上投入的数十亿美元意味着什么?

这并不说明预训练毫无价值,而是说明预训练只是入场券。现在每个人都有好的预训练,差异化在于预训练之后发生的事情。

那些把后训练当作次要事项——一个在发布前匆匆完成的微调步骤——的实验室,将输给那些把后训练当作核心产品的实验室。DeepSeek 刚刚证明,同一个模型,通过更好的后训练,可以在最重要的任务上从“不具备竞争力”跃升到“前沿水平”。

你应该做什么

  1. 别再引用参数量了。 它是一个不再有用的代理指标。引用在真实工作负载上的任务特定表现。
  2. 构建持续评估流水线。 你上个月评估的模型不是你今天评估的模型。持续运行你的 Agent 任务,而不是每季度一次。
  3. 投资你自己的后训练。 如果你在生产环境中运行编程 Agent,你拥有关于“好”是什么样子的数据。基于这些数据进行微调,杠杆效应巨大。
  4. 关注 Agent 基础设施领域。 模型正在变成商品。Agent 运行时——Harness、工具链、路由层——正在成为产品。

底线

“更大模型 = 更好模型”的时代于 2026 年 7 月 31 日结束。“更好训练 = 更好模型”的时代在同一天开始。大多数团队还没有注意到。那些注意到的,将拥有 6.5 倍的优势。

如果你错过了发布本身,3 分钟简报覆盖了头条数字,架构深度解读解释了这一飞跃背后的机制——CSA+HCA 注意力、MoE 路由以及基准实际衡量了什么。要了解包括 V4-Pro 变化在内的完整图景,从完整发布简报开始。


革命已经在运行,只是你还没上车。

V4-Flash-0731 于 7 月 31 日发布。MonkeyCode 当天就提供了支持。每天 3000 万免费 token,没有任何借口。

👉 在 MonkeyCode 上加入后训练时代