REPRODUZIERBARE EVALUIERUNG · REVIEWT 2026-08-05

MonkeyCode-Pilotforschungsmethodik.

Dieses Protokoll hilft Teams, eigene prüfbare Nachweise zu erzeugen. Es behauptet nicht, dass MonkeyCode irgendein Leistungs-, Qualitäts- oder Kostenresultat erreicht hat.

Protokoll

Definieren Sie den Test, bevor Sie das Werkzeug ausführen.

Behalten Sie abgelehnte Versuche und fehlende Messwerte. Das Entfernen von Fehlern oder das Umwandeln unbekannter Werte in null macht Vergleiche irreführend.

  1. 01
    Repräsentative Arbeit auswählen.

    Wählen Sie mindestens drei begrenzte Aufgaben aus einem festen Repository-Commit: einen Defekt, eine kleine Funktion und eine Test- oder Dokumentationsänderung. Schließen Sie sensible Repositories aus öffentlichen Datensätzen aus.

  2. 02
    Abnahmekriterien einfrieren.

    Halten Sie vor dem ersten Lauf erforderliche Tests, Build-Checks, Sicherheitsbeschränkungen, änderbare Dateien und die Entscheidungsregel des Reviewers fest.

  3. 03
    Den Vergleich kontrollieren.

    Verwenden Sie für jeden Workflow dieselben Aufgabendefinitionen und die gleiche Repository-Baseline. Halten Sie Werkzeugversion, Modell, Endpunkt, Umgebung, Berechtigungen und wesentliche Prompt-Änderungen fest.

  4. 04
    Jeden Versuch aufzeichnen.

    Messen Sie Echtzeitdauer, aktive Review-Zeit, Wiederholungen, Abnahmeergebnis, Modellnutzung, Rechenkosten und Fehlerkategorie. Eine Zeile steht für einen Versuch.

  5. 05
    Mit Grenzen veröffentlichen.

    Entfernen Sie Geheimnisse und proprietäre Inhalte, versionieren Sie den Datensatz, legen Sie Ausschlüsse und fehlende Felder offen und berichten Sie Verteilungen und Stichprobengrößen — keine unbelegten allgemeinen Behauptungen.

Einen realen Fall beitragen

Ein abgeschlossenes Pilotprojekt in prüfbare Nachweise verwandeln.

Nutzen Sie die Fallvorlage, um Bewertungszeitraum, Stichprobengröße, Baseline, Entscheidung, Grenzen, Nachweis-URL und Veröffentlichungseinwilligung offenzulegen. Nennen Sie keinen Kunden ohne Genehmigung.

Datenwörterbuch

Felder in der leeren Pilot-Runs-Vorlage.

Die herunterladbare Datei enthält nur Kopfzeilen. Leer bedeutet nicht gemessen oder nicht verfügbar; null bedeutet einen gemessenen Wert von null.

FeldDefinition
task_id / run_idStabile Aufgabenkennung und Laufnummer. Verwenden Sie eine Zeile pro Versuch.
repository_commitExakter SHA des Basis-Commits, der für den Lauf verwendet wurde.
monkeycode_versionRelease, Image-Tag oder Quell-Commit, das unter Evaluierung steht.
model_id / endpoint_typeExakte Modellkennung und einer von provider, gateway oder local.
run_started_at_utcISO-8601-UTC-Zeitstempel, zum Beispiel 2026-07-15T10:00:00Z.
acceptedNur true, wenn die vordefinierten Abnahmekriterien und das Review-Gate bestanden sind.
retriesAnzahl der Wiederholungen innerhalb dieses aufgezeichneten Versuchs; zählen Sie separate Laufzeilen nicht mit.
elapsed_seconds / review_minutesEchtzeitdauer des Versuchs und aktive menschliche Review-Zeit.
input_tokens / output_tokensVom Anbieter gemeldete Token-Zahlen; bei Nichtverfügbarkeit leer lassen.
model_cost / compute_cost / currencyGemessene Kosten für diesen Versuch; unbekannte Werte leer lassen statt null einzutragen.
failure_categoryEiner von none, setup, environment, model, tool, test, review, policy oder unknown.
notesBereinigter Kontext zur Interpretation des Laufs; niemals Quellcode, Prompts, Geheimnisse oder personenbezogene Daten aufnehmen.

Interpretationsgrenzen

Ein Pilotprojekt stützt eine lokale Entscheidung, kein universelles Ranking.

Repository-Komplexität, Aufgabenauswahl, Modelländerungen, Umgebungskonfiguration, Review-Fähigkeiten und Netzwerkbedingungen beeinflussen alle Ergebnisse. Wiederholen Sie wesentliche Änderungen und behalten Sie die Rohzeilen hinter jeder Zusammenfassung.

Primäres Ergebnis

Verwenden Sie akzeptierte, reviewbare Ergebnisse — nicht generierte Codezeilen — als Hauptmaßeinheit.

Harte Gates

Sicherheits-, Richtlinien- oder Zuverlässigkeitsfehler können den Rollout blockieren, selbst wenn die Durchschnittswerte günstig aussehen.

Keine synthetischen Ergebnisse

Diese Website stellt ein Protokoll und eine leere Vorlage bereit. Sie veröffentlicht keine erfundenen Benchmark-Daten.