Verwenden Sie akzeptierte, reviewbare Ergebnisse — nicht generierte Codezeilen — als Hauptmaßeinheit.
REPRODUZIERBARE EVALUIERUNG · REVIEWT 2026-08-05
MonkeyCode-Pilotforschungsmethodik.
Dieses Protokoll hilft Teams, eigene prüfbare Nachweise zu erzeugen. Es behauptet nicht, dass MonkeyCode irgendein Leistungs-, Qualitäts- oder Kostenresultat erreicht hat.
Protokoll
Definieren Sie den Test, bevor Sie das Werkzeug ausführen.
Behalten Sie abgelehnte Versuche und fehlende Messwerte. Das Entfernen von Fehlern oder das Umwandeln unbekannter Werte in null macht Vergleiche irreführend.
- 01Repräsentative Arbeit auswählen.
Wählen Sie mindestens drei begrenzte Aufgaben aus einem festen Repository-Commit: einen Defekt, eine kleine Funktion und eine Test- oder Dokumentationsänderung. Schließen Sie sensible Repositories aus öffentlichen Datensätzen aus.
- 02Abnahmekriterien einfrieren.
Halten Sie vor dem ersten Lauf erforderliche Tests, Build-Checks, Sicherheitsbeschränkungen, änderbare Dateien und die Entscheidungsregel des Reviewers fest.
- 03Den Vergleich kontrollieren.
Verwenden Sie für jeden Workflow dieselben Aufgabendefinitionen und die gleiche Repository-Baseline. Halten Sie Werkzeugversion, Modell, Endpunkt, Umgebung, Berechtigungen und wesentliche Prompt-Änderungen fest.
- 04Jeden Versuch aufzeichnen.
Messen Sie Echtzeitdauer, aktive Review-Zeit, Wiederholungen, Abnahmeergebnis, Modellnutzung, Rechenkosten und Fehlerkategorie. Eine Zeile steht für einen Versuch.
- 05Mit Grenzen veröffentlichen.
Entfernen Sie Geheimnisse und proprietäre Inhalte, versionieren Sie den Datensatz, legen Sie Ausschlüsse und fehlende Felder offen und berichten Sie Verteilungen und Stichprobengrößen — keine unbelegten allgemeinen Behauptungen.
Einen realen Fall beitragen
Ein abgeschlossenes Pilotprojekt in prüfbare Nachweise verwandeln.
Nutzen Sie die Fallvorlage, um Bewertungszeitraum, Stichprobengröße, Baseline, Entscheidung, Grenzen, Nachweis-URL und Veröffentlichungseinwilligung offenzulegen. Nennen Sie keinen Kunden ohne Genehmigung.
Datenwörterbuch
Felder in der leeren Pilot-Runs-Vorlage.
Die herunterladbare Datei enthält nur Kopfzeilen. Leer bedeutet nicht gemessen oder nicht verfügbar; null bedeutet einen gemessenen Wert von null.
| Feld | Definition |
|---|---|
| task_id / run_id | Stabile Aufgabenkennung und Laufnummer. Verwenden Sie eine Zeile pro Versuch. |
| repository_commit | Exakter SHA des Basis-Commits, der für den Lauf verwendet wurde. |
| monkeycode_version | Release, Image-Tag oder Quell-Commit, das unter Evaluierung steht. |
| model_id / endpoint_type | Exakte Modellkennung und einer von provider, gateway oder local. |
| run_started_at_utc | ISO-8601-UTC-Zeitstempel, zum Beispiel 2026-07-15T10:00:00Z. |
| accepted | Nur true, wenn die vordefinierten Abnahmekriterien und das Review-Gate bestanden sind. |
| retries | Anzahl der Wiederholungen innerhalb dieses aufgezeichneten Versuchs; zählen Sie separate Laufzeilen nicht mit. |
| elapsed_seconds / review_minutes | Echtzeitdauer des Versuchs und aktive menschliche Review-Zeit. |
| input_tokens / output_tokens | Vom Anbieter gemeldete Token-Zahlen; bei Nichtverfügbarkeit leer lassen. |
| model_cost / compute_cost / currency | Gemessene Kosten für diesen Versuch; unbekannte Werte leer lassen statt null einzutragen. |
| failure_category | Einer von none, setup, environment, model, tool, test, review, policy oder unknown. |
| notes | Bereinigter Kontext zur Interpretation des Laufs; niemals Quellcode, Prompts, Geheimnisse oder personenbezogene Daten aufnehmen. |
Interpretationsgrenzen
Ein Pilotprojekt stützt eine lokale Entscheidung, kein universelles Ranking.
Repository-Komplexität, Aufgabenauswahl, Modelländerungen, Umgebungskonfiguration, Review-Fähigkeiten und Netzwerkbedingungen beeinflussen alle Ergebnisse. Wiederholen Sie wesentliche Änderungen und behalten Sie die Rohzeilen hinter jeder Zusammenfassung.
Sicherheits-, Richtlinien- oder Zuverlässigkeitsfehler können den Rollout blockieren, selbst wenn die Durchschnittswerte günstig aussehen.
Diese Website stellt ein Protokoll und eine leere Vorlage bereit. Sie veröffentlicht keine erfundenen Benchmark-Daten.