AIコーディングニュース6 min read

AIコーディング価格戦争:DeepSeek が V4-Flash を発表した当日、OpenAI は GPT-5.6 Luna を80%値下げ。トークン価格は舞台装置——指標となるのはタスク単位コスト

7月31日、OpenAI が GPT-5.6 Luna を80%値下げする一方、DeepSeek は V4-Flash-0731 をリリースしました。アナリストは今や1ドルあたりのインテリジェンスでモデルを順位付けしています。チームがエージェント採用前にモデル化すべきなのは、トークン価格ではなくタスク単位コストです。

見出し: 7月31日、同じ日に2つのことが起こりました。OpenAI は GPT-5.6 Luna を80%値下げ——入力が100万トークンあたり $1 から $0.20、出力が $6 から $1.20 に——、そして DeepSeek は正式版 V4-Flash-0731 をリリースしました。同モデルは入力 $0.14、出力 $0.28(100万トークンあたり)を報告し、98%のキャッシュヒット割引を備えています。8月に入ると、アナリストは能力ではなく「1ドルあたりのインテリジェンス」でモデルを順位付けするようになりました。エンジニアリングチームにとって有用な数字は、表示価格でもベンチマークスコアでもありません。タスク単位コストこそがそれであり、それはワークロードごとに変化します。

同日のツインパンチ

この値下げは、中国のオープンウェイトモデルからの継続的な圧力に対する OpenAI の最初の対応でした。GPT-5.6 ファミリーにおけるバッチ推論モデルである Luna は、入力が $1 から $0.20、出力が $6 から $1.20 に引き下げられました。ミッドティアの Terra は20%値下げ(入力 $2.50→$2.00、出力 $15→$12)。フラッグシップの Sol は $5/$30 のままですが、インテリジェンスの損失なしに2倍の価格で2.5倍の速度を実現する「Fast mode」が追加されました。OpenAI はまた、ChatGPT と Codex CLI 内の自動レビューモデルを GPT-5.4 から Luna に切り替え、この頻繁に実行されるエージェントワークロードのコストがおよそ10分の1に低下すると試算しています。Luna の入力価格は前世代の nano ティアと同等になりました——OpenAI は、かつて小型モデルの価格だった水準でエージェント対応モデルを販売しているのです。

同じ日、DeepSeek は正式版 V4-Flash-0731 をリリースしました。アーキテクチャとパラメータ数はプレビュー版と同一で、ターミナル操作、ツール使用、多段階実行といったエージェント能力に焦点を当てた、純粋なポストトレーニングによるアップグレードです。その API 価格は、100万トークンあたり入力 $0.14/出力 $0.28(キャッシュミス時)、キャッシュヒット時の入力は $0.0028——大半のプロバイダーが提供する約90%の割引に対し、98%の割引です。DeepSeek は、Artificial Analysis Intelligence Index v4.1 で50点を獲得し、51点の Luna に1ポイント差である一方、タスク単位コストは Luna より約60%低いと報告しています。

指標が変わった

最も示唆に富む変化は、市場がモデルを評価する方法そのものです。華泰証券(Huatai Securities)の8月のレポートは明確に述べています:GPT-5.6 の値下げにより、競争は「能力ランキング」から「同等インテリジェンスコスト」へと移行した、と。その数字によれば、V4-Flash-0731 のブレンド価格は100万トークンあたり約 $0.06、平均タスクコストは約 $0.03——それぞれ Luna より約65%と57%低い水準です。57点の Kimi K3 は中国のオープンウェイトモデルにおける能力の上限を代表し、V4-Flash はその能力帯域においてコストの下限を作り直しました。

これはまさに正しい枠組みであり、トークン価格が誤ったレンズである理由でもあります。エージェントのワークロードはトークン消費量が多く、コンテキストが重いものです:1つのコーディングタスクで、ツール呼び出し、リトライ、長いコンテキストにわたって数十万トークンを消費することがあります。同じトークン価格の2つのモデルでも、完了タスク単位のコストは数倍違うことがあります——そして、トークン価格が大きく異なる2つのモデルが、タスク単位ではほぼ同等になることもあります。一方が冗長な出力でトークンを浪費し、他方がそうでないからです。DeepSeek は、同じインテリジェンス指数の評価において、ポストトレーニングによって出力トークン消費量が約12%削減されたと報告しています。トークン効率は品質の注釈ではなく、コストの機能なのです。

ダイナミックプライシングの厄介な側面

価格戦争はまた、請求額の予測を難しくしました。DeepSeek は発表に続いてピーク時間帯の割増料金を告知しました——ピーク時間帯は価格がほぼ2倍になります——そして同じ報道は、V4-Pro の API 展開が8月上旬に到来する見込みだとしています。ピーク倍率を伴う利用量ベースの価格設定は、タスクのコストが消費トークン数だけでなく、いつ実行するかにも依存することを意味します。チームにとって、これはコストモデリングを一度きりの比較から継続的な規律へと変えます:自社のワークロードで、自社の時間帯に、自社の受け入れ基準に対してタスク単位コストを測定する——それはまさに境界のあるパイロットの目的です。

価格戦争が変えないもの

安いトークンは、この意思決定のうち価格以外の部分を変えません:

  • データパスには価格が付いていません。 プロンプト、コンテキスト、ログが自社の環境の外に出ていくかどうかは、それらがいくらかかるかとは別の問いです。規制の対象となる文脈にあるチームは、誰が価格戦争に勝とうと、セルフホストの管理された環境を依然として必要とします。
  • 承認ゲートにも価格は付いていません。 市場リーダーの Auto Mode は権限確認プロンプトを撤去します。自社のワークフローにレビューゲートを再導入するコストは現実の数字であり、それはどのベンダーでも同じ数字です。
  • 総コストはワークロードの形をしています。 トークン単位で最も安いツールでも、自社の特定のワークロードではタスク単位で高くなる可能性があり、その逆もまた真です。知る唯一の方法は、自社のタスクをエンドツーエンドで実行して測定することです。

総括

7月31日の価格戦争は、狭い意味ではチームにとって良い知らせです:能力の高いエージェントが安くなっており、あらゆるベンダーの価格設定への圧力は構造的なものです。しかし戦略的な読み解きはより繊細です。トークン価格が電気代に等しい水準へと収束していくとき、差別化はスタックの上層へと移ります——エージェントが実行される環境、その行動を取り巻くゲート、そして全体を監査可能に保つプラットフォームへ。そこにこそ同じチェックリストが当てはまります:自社のコードで実証し、実際のタスク単位コストをモデル化し、データパスを把握し、レビューゲートを人間のワークフローに残しておくことです。安いトークンは、悪い判断を下しやすくするだけです。良くはしません。