見出し: 7月21日、Google は Gemini 3.6 Flash を一般提供(GA)しました——より深く考えるモデルとしてではなく、より安く働くモデルとしてです。主要な数字:3.5 Flash 比で出力トークンが17%削減、出力価格が16.7%値下げ(100万トークンあたり $9→$7.50)、100万トークンのコンテキストウィンドウ、そして Computer Use の本番 API への昇格。OpenAI が Luna を80%値下げし、DeepSeek が V4-Flash-0731 を発表した同じ週に、Google がエージェントコスト戦争に示した答えはトークン効率です——このサイトがタスク単位コストについて唱えてきた主張と同一のものを、今度は大手モデルベンダーの一角が発信しているのです。
Google が実際に提供したもの
Gemini 3.6 Flash は、Google I/O の発表と並行して7月21日に GA となりました。その位置づけは意図的です。Google 自身の枠組みは「より賢い」ではなく「より少ないリソースでより多くのことを成し遂げる」です。Google と独立系トラッカーの報告による数字は次のとおりです:
- 同一タスクで Gemini 3.5 Flash 比、出力トークンが17%減少。 Google は特定のソフトウェアエンジニアリングタスクで最大65%の削減を報告しています。
- 出力価格が16.7%値下げ: 100万出力トークンあたり $7.50(従来 $9)、入力は100万トークンあたり $1.50 で据え置き。
- 100万トークンのコンテキスト(入力 1,048,576/出力 65,536)、テキスト、画像、動画、音声、PDF に対応。
- Computer Use が本番 API に登場——OSWorld-Verified 83%、つまり API 経由でデスクトップインターフェースを操作できるモデルです:クリック、フォーム入力、ウィンドウの切り替え。これは実験ではなく GA です。
- 実エージェントベンチマークでの効率向上: DeepSWE 49%、MLE Bench 63.9%。Google が説明する仕組みは、より長い推論バーストではなく、より短い実行パス——試行錯誤のループの削減、冗長なツール呼び出しの削減——です。
- インテリジェンス指数 50、前世代からほぼ横ばい。Google はこれをフロンティア知能の飛躍だとは偽っていません。これは作業単位あたりのコストを狙った戦略です。
独立系レビュアーも同じトレードオフを指摘しています:長文コンテキストの検索、Computer Use(コンピューター操作)、チャート理解、長期的なコーディングに強く、基本的なコーディングやマルチモーダル生成の一部タスクでは弱い。価値の主張は効率であり、優位性ではありません。
トークン効率は今や価格戦略になった
2週間前、このサイトは、エージェントワークロードにとって重要な指標はトークン価格ではなくタスク単位コストだと主張しました——エージェントタスクはトークン消費量が多く、コンテキストが重いため、試行錯誤で出力トークンを浪費するモデルは、トークン単位の価格に関わらず高コストになるからです。同じ週、大手4ベンダーのうち3社が異なる方向から同じ結論に収束しました:OpenAI は Luna のトークン価格を80%値下げし、DeepSeek はポストトレーニングの効率性を $0.14/$0.28 で販売して98%のキャッシュヒット割引を提供し、Google は、同じ作業を完了するのに17%少ないトークンしか消費しないという点を全面的な売り文句にするモデルをリリースしました。
その収束はチームにとって重要です。それは、エージェント作業のコストは今や、価格表だけでなくモデルのトークン効率に依存する関数であることを意味します——そして、同じワークロードでも、表示価格とは無関係に、どのモデルファミリーで実行するかによって実効コストが数倍変動し得ます。実務上の帰結は次のとおりです:タスク単位コストは価格ページを読むのではなく、自社のワークロードで測定しなければなりません。それを生み出すために存在するのが境界のあるパイロットです。
Computer Use の GA が境界問題を再び提起する
トークンの計算よりも注目に値するのは、Computer Use の一般提供開始です。API 経由でデスクトップインターフェースを操作できるモデル——クリック、タイプ、フォーム入力——は、ターミナルエージェントとは異なるクラスの能力です。なぜなら、触れることのできる対象が、ホストマシンが実行できるあらゆるアプリケーションになるからです。これはまさに、このサイトがAnthropic の評価インシデントで分析した境界のクラスです:エージェントが実システムに対して行動できるとき、問われるのは意図が良いかどうかではなく、物理的に何に到達できるのかです。
チームにとって、Computer Use の GA はリスクの議論を1つの特定の方法で変えます:それはもはや、マージ前にレビューするコードの問題ではなく、ライブアプリケーションに対してリアルタイムで行われる行動の問題です。レビューゲートはエージェントのループの外側に置かなければなりません——サンドボックス化された環境、スコープの限定された認証情報、ネットワーク送信制御——そしてこれは、どのベンダーのコンピューター操作エージェントを評価する場合でも変わりません。これが、エージェントが実行される環境こそが製品上の意思決定である理由でもあります:共有された、管理された、セルフホスト可能な環境と管理されたエージェント作業があれば、境界を執行可能に保てます。一方、API 認証情報を持つローカルデスクトップエージェントでは、境界はマシンが置かれている場所に依存します。
総括
Gemini 3.6 Flash は、エージェント市場が「どのモデルが最も賢いか」から「どのモデルが最も安く、最も安全に作業を完了するか」へと移行したことの、これまでで最も明確な裏付けです。Google はトークン効率で競争し、OpenAI は話題になる値下げで、DeepSeek はポストトレーニングの経済性で競争し、フロンティアベンダーは能力の追求を続けています。そのいずれも評価の規律を変えません:自社のタスクを実行し、実際のタスク単位コストを測定し、データパスを検証し、レビューゲートを人間のワークフローに残しておくこと。安いトークンと効率的なモデルは計算を良くします——境界がどうあるべきかを変えるわけではありません。