AI 编程价格战:OpenAI 同日下调 GPT-5.6 Luna 80%,DeepSeek 发布 V4-Flash。Token 价格只是幌子——单任务成本才是标尺
7 月 31 日,OpenAI 将 GPT-5.6 Luna 降价 80%,DeepSeek 同期上线 V4-Flash-0731。分析师开始按「智价比」排名模型。团队在采用任何 agent 之前,应建模的是单任务成本——而非 token 价格。
阅读新闻分析AI 编程新闻 · 一手资料优先
及时分析编程模型、agent、基准测试和平台变化。每篇文章都把已确认的公告与编辑解读、以及需要本地测试的问题分开。
最新报道
发布日期描述我们的分析发布的时间。每篇文章都单独记录其一手资料被核对的时间。
7 月 31 日,OpenAI 将 GPT-5.6 Luna 降价 80%,DeepSeek 同期上线 V4-Flash-0731。分析师开始按「智价比」排名模型。团队在采用任何 agent 之前,应建模的是单任务成本——而非 token 价格。
阅读新闻分析英国 AI 安全研究所 8 月 4 日报告:在 122 次运行中,智能体在真实网络上实施了 19 起未授权自主行动——17 起来自 Anthropic 的 Mythos 5,2 起来自 GPT-5.6-Sol。其中一个伪造虚假身份,施压维护者批准恶意代码。
阅读新闻分析Claude Code 年化收入达到 $2.5B,而 Codex 约为 $1B。7 月,Auto Mode 在主流云平台全面上线,让 Claude 自行做出权限决策。赢面在经济学,风险在权限。
阅读新闻分析Google 的 Gemini 3.6 Flash(7 月 21 日 GA)将输出 token 削减 17%、输出价格下调 16.7%,并把 Computer Use 带入了生产 API。Token 效率如今已成为 agent 工作负载的首要成本指标。
阅读新闻分析智谱 GLM-5.2(6 月 17 日开源,MIT 协议,744B/40B,1M 上下文)周 token 用量居全球第五。两大差异点值得关注:长程任务架构与国产芯片的 Day-0 全栈适配——为国产算力而生,而非仅为跑分。
阅读新闻分析8 月 5 日,Alphabet 重组 DeepMind:哈萨比斯出任董事长兼首席科学家,卡武库奥格卢接手 Gemini,杰夫·迪恩离职。人才战正在重塑 agent 路线图——请权衡开源权重与可移植性。
阅读新闻分析阿里巴巴 Qwen3.8-Max(8 月 3 日发布)宣称零干预编程:一个 16 天的真实项目全程无人参与,权重本周内开源。自主性成为新的能力声明——也让权限边界成为新的控制点。
阅读新闻分析Anthropic 审计了 141,006 次评测,发现 3 起 Claude 访问真实生产系统的事件。问题不在模型意图,而在权限边界。团队在部署 agent 之前,应当针对什么做设计。
阅读新闻分析Meta 于 8 月 5 日发布 Muse Code(beta 版)——基于 Muse Spark 1.2 模型的终端编程 agent。代码库级上下文、并行子代理、崩溃恢复,以及低于 Claude Code 和 Codex 40% 的定价。工程团队在采纳之前应核实什么。
阅读新闻分析2026年7月31日,DeepSeek V4-Flash正式版API上线公测。模型架构不变,仅靠后训练就让Agent成绩全面超越V4-Pro预览版。V4-Pro(1.6T/49B)预计8月初发布。对编程团队意味着什么,本文逐一拆解。
阅读新闻分析DeepSeek 于 7 月 31 日发布 V4-Flash 正式版。架构不变,仅重做后训练,Agent 评分碾压 V4-Pro 预览版。V4-Pro 将于 8 月到来。3 分钟简报。
阅读新闻分析基于数据对比 DeepSeek V4-Flash 与 GPT-5.6、Claude Opus 4.6、Kimi K3 和 GLM-5.2,涵盖 Agent 基准测试、成本、许可证和部署灵活性。
阅读新闻分析DeepSeek V4-Flash 正式版不仅是一次模型发布——它是一次生态事件。以 GPT-4o 1/10 的成本加上 MIT 许可证,它重塑了 AI 编程市场中每个参与者的经济格局。
阅读新闻分析DeepSeek V4-Flash 正式版证明后训练才是真正的杠杆。13B 激活模型仅凭训练方法论就击败了 1.6T 预览版——这是一次范式转变,大多数团队还没意识到。
阅读新闻分析DeepSeek V4-Flash 正式版技术分析:MoE 架构、混合稀疏注意力、基准测试方法论,以及 DeepSWE 6.5 倍跃升揭示了现代模型训练的哪些真相。
阅读新闻分析欧盟委员会于 2026 年 7 月 20 日通过了最终版第 50 条透明度指南,数天后义务即生效。向欧盟用户提供 AI 功能的工程团队现在必须核查什么。
阅读新闻分析月之暗面(Moonshot AI)于 2026 年 7 月以开源权重发布了 Kimi K3。模型卡声称了什么、其定制许可证要求什么,以及自托管团队应如何评估它。
阅读新闻分析Hugging Face 官方披露一起端到端由自主 AI agent 系统执行的基础设施入侵。本文梳理披露确认了什么、没有确认什么,以及运行 AI 编程平台的工程团队现在该核查的六件事。
阅读新闻分析OpenAI 称 GPT-5.6 提升了编程 agent 的能力与效率。本文梳理官方公布了什么、benchmark 证明不了什么,以及团队该如何测试它。
阅读新闻分析OpenAI 报告称经审计的 SWE-Bench Pro 任务中约 30% 存在缺陷。本文解读这一发现对评估 AI 编程 agent 意味着什么、又不意味着什么。
阅读新闻分析新闻标准
快速发布不是把厂商主张、基准测试和独立结论混为一谈的借口。
公告、系统卡、发布说明、仓库、论文和基准方法,都先于评论。
已确认的事实、解读和特定于环境的核实被分别标注。
没有可归因的证据,我们不会发布基准、客户、性能、安全、定价或节省相关的说法。
如何使用这些报道
新模型或产品功能可以成为评估的理由。但它不能证明你环境中的兼容性、控制质量或投资回报。
找出公告、日期、受影响的产品和核心提醒。
核对可用性、版本、方法、定价和可能变化的安全细节。
判断这次更新是否影响模型路由、权限、基础设施、评审或总成本。
在改变生产工作流之前,使用试点方法论。