AI 编程新闻5 min read

Gemini 3.6 Flash:Google 应对 agent 成本战的答案——更少的 token,而非更聪明的模型

Google 的 Gemini 3.6 Flash(7 月 21 日 GA)将输出 token 削减 17%、输出价格下调 16.7%,并把 Computer Use 带入了生产 API。Token 效率如今已成为 agent 工作负载的首要成本指标。

核心事件: 7 月 21 日,Google 将 Gemini 3.6 Flash 推向全面可用(GA)——它不是一款更会思考的模型,而是一款工作成本更低的模型。核心数字:输出 token 比 3.5 Flash 少 17%,输出价格下调 16.7%(每百万 token $9→$7.50),上下文窗口 100 万(1M)token,Computer Use 也升入生产 API。在 OpenAI 将 Luna 降价 80%、DeepSeek 发布 V4-Flash-0731 的同一周,Google 对 agent 成本战的回应是 token 效率——这正是本站围绕单任务成本一直主张的论据,如今它来自三大模型厂商之一。

Google 实际上发了什么

Gemini 3.6 Flash 于 7 月 21 日与 Google I/O 的发布内容一起进入 GA,其定位经过刻意设计。Google 自己的表述不是“更聪明”,而是“用更少完成更多”。据 Google 及独立追踪机构的数据,报告的指标如下:

  • 输出 token 减少 17%:同样的任务下,输出 token 比 Gemini 3.5 Flash 更少;Google 报告称在特定的软件工程任务上可节省高达 65%。
  • 输出价格下调 16.7%:每百万输出 token 的价格 $9→$7.50,输入价格维持每百万 $1.50 不变。
  • 1M token 上下文(输入 1,048,576 / 输出 65,536),支持文本、图像、视频、音频与 PDF。
  • Computer Use 进入生产 API——OSWorld-Verified 得分 83%,意味着该模型可通过 API 操作桌面界面:点击、填写表单、切换窗口。这是 GA 能力,不是实验。
  • 真实 agent 基准上的效率提升:DeepSWE 49%、MLE Bench 63.9%。Google 给出的机制是更短的执行路径——更少的试错循环、更少的冗余工具调用——而不是更大的推理开销。
  • 智能指数 50 分,与上一代基本持平。Google 并未声称这是一次前沿智能的跃升;这是一次“单位工作成本”的竞争动作。

独立评测者的评价印证了这一取舍:该模型在长上下文检索、计算机操作、图表理解与长周期编码上表现强劲;在一些基础编码和多模态生成任务上偏弱。其价值主张是效率,而不是全面领先。

Token 效率如今是一种定价策略

两周前,本站主张:对 agent 工作负载而言,真正重要的指标是单任务成本,而不是 token 价格——因为 agent 任务既消耗 token 又依赖上下文,而一个把输出 token 浪费在试错上的模型,无论其单 token 定价多低都很昂贵。同一周,四大厂商中的三家从不同方向收敛到了同一结论:OpenAI 将 Luna 的 token 价格下调 80%,DeepSeek 以 $0.14/$0.28 的价格转售后训练效率并叠加 98% 的缓存命中折扣,而 Google 发布了一款整场卖点就是“完成同样工作少花 17% 的 token”的模型。

这种收敛对团队很重要。它意味着 agent 工作的成本如今是模型 token 效率的函数,而不仅仅是其价目表——同一工作负载的实际成本,可能因你在哪家模型家族上运行而相差数倍,且与标价无关。实际后果是:单任务成本必须在你自己的工作负载上测量,而不是从定价页上读取。这正是有边界的试点存在的意义。

Computer Use 全面可用再次把边界问题摆上台面

比 token 数学更值得关注的是 Computer Use 达到全面可用。一个能通过 API 操作桌面界面——点击、输入、填写表单——的模型,与终端 agent 是不同类别的能力,因为它能触达的表面是宿主机器能运行的任何应用程序。这正是本站此前在 Anthropic 评测越界事件中分析过的那类边界:当一个 agent 能在真实系统上行动时,问题不在于它是否出于善意,而在于它物理上被允许触达什么。

对团队而言,Computer Use 的 GA 以一种具体的方式改变了风险讨论:它不再关乎你在合并前评审的代码,而是针对实时运行的应用程序实时采取的动作。评审关卡必须设在 agent 自身循环之外——沙箱化环境、作用域受限的凭证、网络出口控制——而且无论你评估的是哪家厂商的 computer-use agent,这一点都成立。这也是为什么 agent 运行的环境本身就是产品决策:一个共享的、受管且可自托管的环境配以受管的 agent 工作,可以让边界可执行;而一个带着 API 凭证的本地桌面 agent,其边界就落在机器恰好所在的位置。

结论

Gemini 3.6 Flash 是迄今为止最清晰的证据,证明 agent 市场已经从“哪家模型最聪明”转向“哪家模型能以最低成本、最安全地完成工作”。Google 比拼 token 效率;OpenAI 比拼头条降价幅度;DeepSeek 比拼后训练经济学;前沿厂商则继续推高能力。这一切都没有改变评估纪律:运行你自己的任务,测量真实的单任务成本,核实数据路径,并把评审关卡保留在人类工作流中。廉价的 token 与高效的模型让账算起来更好看——它们并不会改变边界本身应当是什么。