AI 编程资讯12 min read

DeepSeek V4-Flash 深度解析:架构、基准测试,以及为什么后训练赢了

DeepSeek V4-Flash 正式版技术分析:MoE 架构、混合稀疏注意力、基准测试方法论,以及 DeepSWE 6.5 倍跃升揭示了现代模型训练的哪些真相。

技术论点: DeepSeek V4-Flash 正式版与 4 月预览版采用完全相同的 284B-MoE 架构,没有任何架构层面的改动。DeepSWE 6.5 倍的提升完全来自后训练。本文将解释其中原理,并探讨这对未来模型评估意味着什么。

1. 架构解析:底层是什么

混合专家(MoE),284B 总参数,13B 激活参数

V4-Flash 采用稀疏 MoE 架构。完整模型包含 2840 亿参数,分布在多个专家子网络中。每次前向传播仅激活 130 亿参数——约占总参数的 4.6%。这是根本性的权衡:训练一个巨型模型,但推理成本仅相当于一个小得多的模型。

专家路由在预训练阶段学习得到。每个 token 根据其输入表示被分配到一小部分专家。路由器与专家联合训练,因此专业化是自然涌现的,而非预先设定。

CSA + HCA:混合稀疏注意力

注意力机制结合了两种稀疏模式:

  • CSA(分块稀疏注意力,Chunked Sparse Attention): 序列被划分为固定大小的块。每个 token 关注自身所在块内的所有 token,以及来自前面块中稀疏选取的部分 token。这在不产生平方级扩展的情况下提供了局部连贯性。

  • HCA(层次压缩注意力,Hierarchical Compressed Attention): 长程依赖通过压缩表示来处理。来自远处块的键值对被聚合为一组较小的摘要向量,每个 token 都可以关注这些向量。正是这一点使得 1M token 上下文窗口成为可能,同时避免了全注意力的内存爆炸。

两者结合使得 1M token 上下文窗口变得切实可行:DeepSeek 报告称,在 1M token 下,KV 缓存内存仅为 V3.2 所需量的 10%,推理计算量仅为 V3.2 的 27%。

原生 1M token 上下文

上下文窗口原生支持 100 万 token——不是通过位置插值或 RoPE 扩展技巧实现的。这意味着注意力模式从一开始就在这个长度上训练,这对长文档检索精度至关重要。DeepSeek 声称在百万 token 文档上实现了 97% 的检索准确率。

2. 基准测试解读:什么变了,什么没变

预训练没有变

DeepSeek 明确表示:“模型结构、尺寸和预览版完全一致,仅重新进行了后训练”——模型结构和尺寸与预览版完全相同,仅重新做了后训练。

这意味着预训练语料、专家路由、注意力模式和基础知识都来自 4 月的原始检查点。编码事实性知识、语言理解和代码语法的权重都没有变化。

后训练瞄准了什么

V4-Flash 正式版的后训练阶段聚焦于三个领域:

  1. Agent 任务完成。 多步自主工作流,要求模型规划、执行、观察结果并调整。这正是 DeepSWE 和 Terminal Bench 所衡量的能力。

  2. 工具调用准确性。 正确的参数格式、适当的工具选择,以及跨链式 API 调用的错误恢复。这是 Toolathlon 所衡量的。

  3. 长上下文指令遵循。 在 100K+ token 上下文中保持任务连贯性。这体现在检索准确率和长文档基准测试的提升上。

数据一览,附方法论说明

基准测试 Flash 正式版 Flash 预览版 Pro 预览版 备注
Terminal Bench 2.1 82.7 67.9(TB 2.0) 测试集版本不同,不可直接对比
DeepSWE 54.4 7.3 同一测试集,6.5 倍提升是真实的
Cybergym 76.7 安全自动化,本次发布的新基准
Toolathlon Verified 70.3 工具调用,已验证子集
NL2Repo 54.2 仓库级代码理解
DSBench-FullStack 68.7 DeepSeek 内部基准
DSBench-Hard 59.6 DeepSeek 内部基准

DeepSWE 的对比是最干净的信号:同一测试集,同一架构,6.5 倍提升。Terminal Bench 的对比使用了不同测试集版本(2.1 vs 2.0),因此 82.7 与 67.9 之间的差距应理解为方向性参考,而非精确数值。

3. 这对模型评估意味着什么

参数量的启发式法则已经失效

一个 13B 激活参数的模型(V4-Flash)现在在 Agent 任务上超越了 744B 模型(GLM-5.2)。一个 13B 激活参数的模型与估计 300-400B 激活参数的模型(Claude Opus 4.6)仅差 2.3 分。参数量与能力之间的相关性从来就不完美,但现在已经以一种不可忽视的方式被打破了。

后训练是新的前沿

如果说预训练决定模型知道什么,那么后训练决定模型能用这些知识做什么。V4-Flash 的结果表明,至少在 Agent 任务上,后训练的质量比预训练的规模更重要。一个训练得当的 13B 模型,在自主编程最重要的任务上,能击败一个训练欠佳的 1.6T 模型。

基准测试通胀是真实的,且正在加速

V4-Flash 正式版在 Terminal Bench 2.1 上获得 82.7 分。三个月前,67.9 分就很令人印象深刻了。天花板在快速抬升,4 月还被视为“最先进”的模型现在已低于新的基线。团队需要持续评估流水线,而非一次性对比。

4. Harness 框架:不只是模型,更是基础设施

DeepSeek 的 Agent Harness 框架在本次发布中正式命名。该团队由前 Jane Street 量化交易员崔添翼领导,于 2026 年 3 月组建。Harness 提供:

  • 带有迭代自检的长周期任务规划
  • 工具调用失败时的自动重试
  • 跨多步工作流的状态管理
  • 与 Responses API 格式的集成

这一点意义重大,因为它意味着 DeepSeek 发布的不仅仅是一个模型——他们发布的是 Agent 运行时。模型 + Harness 组合才是产品,而不仅仅是模型权重。

5. 测试建议

如果你正在评估 V4-Flash 的编程能力:

  1. 运行你自己的 DeepSWE 等效测试。 定义 10-20 个有明确验收标准的限定性编程任务。不要相信基准测试,相信你自己的工作负载。
  2. 测量工具调用链长度。 如果你的 Agent 工作流链式调用 5 个以上工具,专门测试链尾的上下文漂移和参数损坏。
  3. 压力测试 1M token 上下文。 97% 检索准确率的声明令人鼓舞,但要用你真实的文档类型和查询模式来验证。
  4. 计算每个被接受任务的成本。 V4-Flash 的每 token 价格是 GPT-4o 的 1/10。如果它需要 2 倍的重试次数,仍然便宜 5 倍。测量实际的经济效益。

想要更广阔的视角?正面交锋对比让 V4-Flash 与 GPT-5.6、Claude、Kimi K3、GLM-5.2 正面对决,后训练分析解释了为什么训练方法论现在比参数数量更重要。要了解包括 Pro 变化在内的完整发布图景,从完整发布简报开始。


你读完了架构分析。现在去跑模型。

MonkeyCode 已支持 V4-Flash-0731。当天集成,每天 3000 万免费 token,无需配置硬件。

👉 在 MonkeyCode 上亲自测试