Am 31. Juli senkte OpenAI GPT-5.6 Luna um 80 %, DeepSeek lieferte V4-Flash-0731. Analysten ordnen nach Intelligenz pro Dollar ein. Kosten pro Aufgabe, nicht Token-Preis, sind vor der Agenten-Einführung zu modellieren.
Claude Code erreicht 2,5 Mrd. $ Jahresumsatz, Codex rund 1 Mrd. $. Im Juli wurde Auto Mode allgemein verfügbar – Claude trifft eigene Berechtigungsentscheidungen. Der Sieg ist Ökonomie, das Risiko: Berechtigungen.
Googles Gemini 3.6 Flash (GA, 21. Juli) senkt Output-Tokens um 17 % und den Output-Preis um 16,7 %, bringt Computer Use in die Produktions-API. Token-Effizienz ist nun die zentrale Kostenkennzahl für Agent-Arbeitslasten.
Zhipus GLM-5.2 (Open Source, MIT, 744B/40B, 1M Kontext) belegt weltweit Platz 5 beim wöchentlichen Token-Verbrauch. Vorteil: Langzeittasks und Day-0-Anpassung an einheimische Chips – gebaut für chinesische Silizium.
Alibabas Qwen3.8-Max beansprucht Zero-Intervention-Coding: 16 Tage reales Projekt ohne menschliche Hilfe, Gewichte folgen nächste Woche. Autonomie ist die neue Behauptung – die Berechtigungsgrenze wird zur Kontrolle.
Meta hat am 5. August Muse Code (Beta) eingeführt – einen Terminal-Coding-Agenten auf Muse Spark 1.2. Codebase-bewusster Kontext, parallele Sub-Agents, Crash-Recovery und Preise unter 40 % von Claude Code und Codex.
Moonshot AI hat Kimi K3 im Juli 2026 als Open-Weight-Modell veröffentlicht. Was die Model Card behauptet, was die benutzerdefinierte Lizenz verlangt und wie Self-Hosting-Teams es bewerten sollten.
OpenAI zufolge verbessert GPT-5.6 Fähigkeit und Effizienz von Coding-Agents – was angekündigt wurde, was Benchmarks nicht beweisen und wie Teams testen sollten.