核心事件: DeepSeek 于 7 月 31 日发布了 V4-Flash 正式版。没有发布会,没有炒作推文,只有一个已经上线的 API,以及一组让 4 月预览版看起来像测试版的基准测试成绩。V4-Pro 紧随其后。
关键数据
DeepSWE:7.3 → 54.4。 软件工程能力提升 6.5 倍。同样的模型架构,同样的参数量,唯一的区别是什么?后训练。
Terminal Bench 2.1:82.7。 比 Claude Opus 4.6 只低 2 分——而 Claude 的活跃参数约是它的 25 倍。比 4 月发布的 V4-Pro 预览版高出 3 分。
价格:约 $0.28/百万输入 token。 仅为 GPT-4o 的 1/10。对于一个每次任务调用模型 50 次的编程 Agent 来说,账完全不一样了。
真正的新东西
- Agent 性能是重头戏。 Terminal Bench、DeepSWE、Cybergym、Toolathlon——每个 Agent 基准测试都大幅跃升。这不是一个更好的聊天机器人,而是一个更好的自主工作者。
- 架构不变,训练更强。 284B 总参数,13B 激活参数,MoE 架构,1M token 上下文。骨架没变,大脑变了。
- MIT 许可证。 没有花里胡哨的自定义许可条款,部署到任何地方都可以。
- 原生支持 Responses API。 可以直接替换 OpenAI 面向 Agent 的 API 格式。
即将到来
V4-Pro 正式版——1.6T 参数,49B 激活参数——预计 8 月初发布。如果后训练带来的增益按比例放大,重量级赛场上将迎来一位新的挑战者。
立即行动
你不需要等 Pro。V4-Flash 已经上线,MIT 许可,价格仅为 GPT-4o 的 1/10,在 Agent 任务上的得分与 Claude Opus 旗鼓相当。今天就把它加入你的评估流程。
这些数字背后的工程故事,请看我们的V4-Flash 架构深度解读,或阅读完整发布分析了解包括 Pro 变化在内的全景。
V4-Flash 已经上线,MonkeyCode 同步支持。开干吧。
无需排队,无需信用卡,没有任何套路。
👉 立即开始用 V4-Flash 编程——每天 3000 万免费 token,零配置。