AI 编程价格战:OpenAI 同日下调 GPT-5.6 Luna 80%,DeepSeek 发布 V4-Flash。Token 价格只是幌子——单任务成本才是标尺
7 月 31 日,OpenAI 将 GPT-5.6 Luna 降价 80%,DeepSeek 同期上线 V4-Flash-0731。分析师开始按「智价比」排名模型。团队在采用任何 agent 之前,应建模的是单任务成本——而非 token 价格。
阅读新闻分析研究主题
10 篇研究文章与工程指南,主题为“AI 编程 agent”。每篇都以简明答案开头,并链接一手证据。
7 月 31 日,OpenAI 将 GPT-5.6 Luna 降价 80%,DeepSeek 同期上线 V4-Flash-0731。分析师开始按「智价比」排名模型。团队在采用任何 agent 之前,应建模的是单任务成本——而非 token 价格。
阅读新闻分析Claude Code 年化收入达到 $2.5B,而 Codex 约为 $1B。7 月,Auto Mode 在主流云平台全面上线,让 Claude 自行做出权限决策。赢面在经济学,风险在权限。
阅读新闻分析Google 的 Gemini 3.6 Flash(7 月 21 日 GA)将输出 token 削减 17%、输出价格下调 16.7%,并把 Computer Use 带入了生产 API。Token 效率如今已成为 agent 工作负载的首要成本指标。
阅读新闻分析智谱 GLM-5.2(6 月 17 日开源,MIT 协议,744B/40B,1M 上下文)周 token 用量居全球第五。两大差异点值得关注:长程任务架构与国产芯片的 Day-0 全栈适配——为国产算力而生,而非仅为跑分。
阅读新闻分析阿里巴巴 Qwen3.8-Max(8 月 3 日发布)宣称零干预编程:一个 16 天的真实项目全程无人参与,权重本周内开源。自主性成为新的能力声明——也让权限边界成为新的控制点。
阅读新闻分析Meta 于 8 月 5 日发布 Muse Code(beta 版)——基于 Muse Spark 1.2 模型的终端编程 agent。代码库级上下文、并行子代理、崩溃恢复,以及低于 Claude Code 和 Codex 40% 的定价。工程团队在采纳之前应核实什么。
阅读新闻分析月之暗面(Moonshot AI)于 2026 年 7 月以开源权重发布了 Kimi K3。模型卡声称了什么、其定制许可证要求什么,以及自托管团队应如何评估它。
阅读新闻分析开发者用上 AI 后感觉更快,但 DORA 2024 研究发现更高的 AI 采用率与交付吞吐量和稳定性的小幅下降相关。本文讲解如何安全、有纪律地推广编程 agent。
阅读研究OpenAI 称 GPT-5.6 提升了编程 agent 的能力与效率。本文梳理官方公布了什么、benchmark 证明不了什么,以及团队该如何测试它。
阅读新闻分析理解补全工具、对话式助手与自主编程 agent 的差异,以及受管开发平台的定位——为工程团队而写。
阅读研究