すべてのチームが問うている問い: コーディングエージェントにどのモデルを使うべきか?答えは制約条件 — コスト、デプロイ、ライセンス、タスクタイプ — によって変わる。以下が判断に必要なデータだ。
対戦者たち
| モデル | 総パラメータ | アクティブパラメータ | コンテキスト | ライセンス | リリース |
|---|---|---|---|---|---|
| DeepSeek V4-Flash | 284B | 13B | 100 万 | MIT | 2026 年 7 月 31 日 |
| DeepSeek V4-Pro | 1.6T | 49B | 100 万 | MIT | 2026 年 8 月(予定) |
| GPT-5.6 Sol | 非公開 | 推定 3-4T | 25.6 万 | プロプライエタリ | 2026 年 |
| Claude Opus 4.6 | 非公開 | 推定 300-400B | 20 万 | プロプライエタリ | 2026 年 |
| Kimi K3 | 2.8T | 104B | 100 万 | カスタム(オープンウェイト) | 2026 年 7 月 16 日 |
| GLM-5.2 | 744B | 744B | 100 万 | Apache 2.0 | 2026 年 6 月 |
エージェントベンチマーク: 直接対決
| ベンチマーク | V4-Flash | V4-Pro(前回) | Claude 4.6 | GLM-5.2 | 勝者 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 67.9 | 85.0 | ~75 | Claude |
| DeepSWE | 54.4 | 7.3 | — | — | V4-Flash |
| Cybergym | 76.7 | — | — | — | V4-Flash |
| Toolathlon | 70.3 | — | — | — | V4-Flash |
| NL2Repo | 54.2 | — | — | — | V4-Flash |
注: GPT-5.6 Sol と Kimi K3 は比較可能なエージェントベンチマークスコアを公開していない。比較は公開データが利用可能なモデルに限定される。
コスト比較: 100 万トークンあたりの価格
| モデル | 入力(100 万あたり) | 出力(100 万あたり) | V4-Flash 比 |
|---|---|---|---|
| V4-Flash | $0.28 | $1.10 | 1× |
| GPT-4o | $2.50 | $10.00 | ~9× |
| GPT-5.6 Sol | $5.00+ | $20.00+ | ~18× |
| Claude Opus 4.6 | $15.00 | $75.00 | ~54× |
| Claude Sonnet 4 | $3.00 | $15.00 | ~12× |
| Kimi K3 (API) | $1.50 | $6.00 | ~5× |
| GLM-5.2 (API) | $1.00 | $4.00 | ~4× |
タスクあたり平均 50 回のモデル呼び出し、各 10K 入力トークンのコーディングエージェントの場合:
| モデル | タスクあたりコスト | 1 日 100 タスク | 月間コスト |
|---|---|---|---|
| V4-Flash | $0.14 | $14 | $420 |
| GPT-4o | $1.25 | $125 | $3,750 |
| Claude Opus 4.6 | $7.50 | $750 | $22,500 |
| Kimi K3 | $0.75 | $75 | $2,250 |
デプロイ柔軟性
| モデル | セルフホスト可? | ハードウェア要件 | API 利用可? |
|---|---|---|---|
| V4-Flash | 可(MIT) | アクティブ 13B — 単一 GPU で可能 | 可 |
| V4-Pro | 可(MIT) | アクティブ 49B — マルチ GPU | 可(近日) |
| GPT-5.6 | 不可 | — | 可 |
| Claude Opus 4.6 | 不可 | — | 可 |
| Kimi K3 | 可(カスタムライセンス) | アクティブ 104B — 相当なハードウェア | 可 |
| GLM-5.2 | 可(Apache 2.0) | 744B 密 — 大規模ハードウェア | 可 |
V4-Flash は、セルフホストデプロイで単一 GPU で現実的に動作する唯一のフロンティアクラスのエージェントモデルだ。アクティブ 13B というパラメータ数は、マルチ GPU クラスターを用意できない、あるいは用意したくないチームにとって手の届くものとなっている。
判断フレームワーク
V4-Flash を選ぶべき場合:
- エージェントタスクあたりの最低コストを求める
- 控えめなハードウェアでセルフホストしたい
- MIT ライセンスが必須条件(法務レビュー不要)
- エージェントタスクが明確に定義され境界が明確
- 高ボリュームでエージェントを運用する(1 日 100 タスク以上)
GPT-5.6 か Claude Opus を選ぶべき場合:
- 複雑な推論で絶対的な最高性能を求める
- コストが主要な制約でない
- 学習カットオフ以降の世界知識が必要
- タスクが非常に大規模な単一応答コード生成を必要とする
Kimi K3 を選ぶべき場合:
- オープンウェイトが必要(オープンソースだけでは不十分)
- アクティブ 104B パラメータ用のハードウェアがある
- マルチモーダル機能が必要(K3 はネイティブマルチモーダル)
- カスタムライセンス条件がユースケースに許容可能
GLM-5.2 を選ぶべき場合:
- Apache 2.0 ライセンスが特に必要
- 中国 AI エコシステムに属し国内サポートを求める
- 744B 密モデル用のハードウェアがある
V4-Pro を待つべき場合:
- フロンティアクラスの推論が必要だが Claude Opus の価格は払えない
- マルチ GPU ハードウェアが利用可能
- 2026 年 8 月まで待てる
評決
ほとんどのコーディングチームにとって、答えは明らかだ:V4-Flash から始めよ。GPT-4o の 1/10 のコストで、Claude Opus に 2-3 ポイント差のエージェントスコア。経済性は決定的だ。追加の能力を必要とする 10-20% のタスクにフロンティアモデルを使い、残りは V4-Flash に任せろ。
待つ唯一の理由は V4-Pro を評価している場合だ — だが、V4-Flash の評価を今日から始めない理由はない。API は公開済み、MIT ライセンスは明確、コストは無視できるレベルだ。
これらの数字の背後にある方法論——各ベンチマークがどう構築され、スコアが実際に何を測定するか——は、アーキテクチャとベンチマークの深掘りを参照してください。これが AI コーディング市場全体をどう変えるかは、エコシステム分析で誰が勝ち、誰が圧力を受けるかを解説しています。完全版ローンチブリーフィングが全体像をまとめています。
数字は見た。次はモデルを動かす番だ。
V4-Flash vs GPT-5.6 vs Claude — 比較は自分のコードで動かすまでは机上の空論だ。MonkeyCode は毎日 3000 万トークン無料で、まさにそれを可能にする。