技术论点: DeepSeek V4-Flash 正式版与 4 月预览版采用完全相同的 284B-MoE 架构,没有任何架构层面的改动。DeepSWE 6.5 倍的提升完全来自后训练。本文将解释其中原理,并探讨这对未来模型评估意味着什么。
1. 架构解析:底层是什么
混合专家(MoE),284B 总参数,13B 激活参数
V4-Flash 采用稀疏 MoE 架构。完整模型包含 2840 亿参数,分布在多个专家子网络中。每次前向传播仅激活 130 亿参数——约占总参数的 4.6%。这是根本性的权衡:训练一个巨型模型,但推理成本仅相当于一个小得多的模型。
专家路由在预训练阶段学习得到。每个 token 根据其输入表示被分配到一小部分专家。路由器与专家联合训练,因此专业化是自然涌现的,而非预先设定。
CSA + HCA:混合稀疏注意力
注意力机制结合了两种稀疏模式:
-
CSA(分块稀疏注意力,Chunked Sparse Attention): 序列被划分为固定大小的块。每个 token 关注自身所在块内的所有 token,以及来自前面块中稀疏选取的部分 token。这在不产生平方级扩展的情况下提供了局部连贯性。
-
HCA(层次压缩注意力,Hierarchical Compressed Attention): 长程依赖通过压缩表示来处理。来自远处块的键值对被聚合为一组较小的摘要向量,每个 token 都可以关注这些向量。正是这一点使得 1M token 上下文窗口成为可能,同时避免了全注意力的内存爆炸。
两者结合使得 1M token 上下文窗口变得切实可行:DeepSeek 报告称,在 1M token 下,KV 缓存内存仅为 V3.2 所需量的 10%,推理计算量仅为 V3.2 的 27%。
原生 1M token 上下文
上下文窗口原生支持 100 万 token——不是通过位置插值或 RoPE 扩展技巧实现的。这意味着注意力模式从一开始就在这个长度上训练,这对长文档检索精度至关重要。DeepSeek 声称在百万 token 文档上实现了 97% 的检索准确率。
2. 基准测试解读:什么变了,什么没变
预训练没有变
DeepSeek 明确表示:“模型结构、尺寸和预览版完全一致,仅重新进行了后训练”——模型结构和尺寸与预览版完全相同,仅重新做了后训练。
这意味着预训练语料、专家路由、注意力模式和基础知识都来自 4 月的原始检查点。编码事实性知识、语言理解和代码语法的权重都没有变化。
后训练瞄准了什么
V4-Flash 正式版的后训练阶段聚焦于三个领域:
-
Agent 任务完成。 多步自主工作流,要求模型规划、执行、观察结果并调整。这正是 DeepSWE 和 Terminal Bench 所衡量的能力。
-
工具调用准确性。 正确的参数格式、适当的工具选择,以及跨链式 API 调用的错误恢复。这是 Toolathlon 所衡量的。
-
长上下文指令遵循。 在 100K+ token 上下文中保持任务连贯性。这体现在检索准确率和长文档基准测试的提升上。
数据一览,附方法论说明
| 基准测试 | Flash 正式版 | Flash 预览版 | Pro 预览版 | 备注 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | — | 67.9(TB 2.0) | 测试集版本不同,不可直接对比 |
| DeepSWE | 54.4 | 7.3 | — | 同一测试集,6.5 倍提升是真实的 |
| Cybergym | 76.7 | — | — | 安全自动化,本次发布的新基准 |
| Toolathlon Verified | 70.3 | — | — | 工具调用,已验证子集 |
| NL2Repo | 54.2 | — | — | 仓库级代码理解 |
| DSBench-FullStack | 68.7 | — | — | DeepSeek 内部基准 |
| DSBench-Hard | 59.6 | — | — | DeepSeek 内部基准 |
DeepSWE 的对比是最干净的信号:同一测试集,同一架构,6.5 倍提升。Terminal Bench 的对比使用了不同测试集版本(2.1 vs 2.0),因此 82.7 与 67.9 之间的差距应理解为方向性参考,而非精确数值。
3. 这对模型评估意味着什么
参数量的启发式法则已经失效
一个 13B 激活参数的模型(V4-Flash)现在在 Agent 任务上超越了 744B 模型(GLM-5.2)。一个 13B 激活参数的模型与估计 300-400B 激活参数的模型(Claude Opus 4.6)仅差 2.3 分。参数量与能力之间的相关性从来就不完美,但现在已经以一种不可忽视的方式被打破了。
后训练是新的前沿
如果说预训练决定模型知道什么,那么后训练决定模型能用这些知识做什么。V4-Flash 的结果表明,至少在 Agent 任务上,后训练的质量比预训练的规模更重要。一个训练得当的 13B 模型,在自主编程最重要的任务上,能击败一个训练欠佳的 1.6T 模型。
基准测试通胀是真实的,且正在加速
V4-Flash 正式版在 Terminal Bench 2.1 上获得 82.7 分。三个月前,67.9 分就很令人印象深刻了。天花板在快速抬升,4 月还被视为“最先进”的模型现在已低于新的基线。团队需要持续评估流水线,而非一次性对比。
4. Harness 框架:不只是模型,更是基础设施
DeepSeek 的 Agent Harness 框架在本次发布中正式命名。该团队由前 Jane Street 量化交易员崔添翼领导,于 2026 年 3 月组建。Harness 提供:
- 带有迭代自检的长周期任务规划
- 工具调用失败时的自动重试
- 跨多步工作流的状态管理
- 与 Responses API 格式的集成
这一点意义重大,因为它意味着 DeepSeek 发布的不仅仅是一个模型——他们发布的是 Agent 运行时。模型 + Harness 组合才是产品,而不仅仅是模型权重。
5. 测试建议
如果你正在评估 V4-Flash 的编程能力:
- 运行你自己的 DeepSWE 等效测试。 定义 10-20 个有明确验收标准的限定性编程任务。不要相信基准测试,相信你自己的工作负载。
- 测量工具调用链长度。 如果你的 Agent 工作流链式调用 5 个以上工具,专门测试链尾的上下文漂移和参数损坏。
- 压力测试 1M token 上下文。 97% 检索准确率的声明令人鼓舞,但要用你真实的文档类型和查询模式来验证。
- 计算每个被接受任务的成本。 V4-Flash 的每 token 价格是 GPT-4o 的 1/10。如果它需要 2 倍的重试次数,仍然便宜 5 倍。测量实际的经济效益。
想要更广阔的视角?正面交锋对比让 V4-Flash 与 GPT-5.6、Claude、Kimi K3、GLM-5.2 正面对决,后训练分析解释了为什么训练方法论现在比参数数量更重要。要了解包括 Pro 变化在内的完整发布图景,从完整发布简报开始。
你读完了架构分析。现在去跑模型。
MonkeyCode 已支持 V4-Flash-0731。当天集成,每天 3000 万免费 token,无需配置硬件。