再現可能な評価 · レビュー済み 2026-08-05

MonkeyCode パイロット研究方法論。

このプロトコルは、チームが自らの監査可能な証跡を作るのに役立ちます。MonkeyCode がいかなる性能・品質・コストの結果を達成したとも主張しません。

プロトコル

ツールを実行する前にテストを定義する。

却下された試行と欠損した測定値は残してください。失敗を消したり不明値を 0 に変えたりすると、比較が誤解を招きます。

  1. 01
    代表的な作業を選択する。

    固定したリポジトリコミットから、少なくとも3つの境界のあるタスクを選びます:欠陥、小さな機能、テストまたはドキュメントの変更です。機密のリポジトリは公開データセットから除外してください。

  2. 02
    受け入れ基準を確定する。

    最初の実行前に、必要なテスト、ビルドチェック、セキュリティ制約、変更を許可するファイル、レビュー担当者の判断ルールを記録します。

  3. 03
    比較条件を管理する。

    各ワークフローで同じタスク定義とリポジトリのベースラインを使用します。ツールバージョン、モデル、エンドポイント、環境、権限、重要なプロンプトの変更を記録します。

  4. 04
    すべての試行を記録する。

    実時間、実働レビュー、リトライ、受け入れ結果、モデル使用量、計算コスト、失敗カテゴリを測定します。1行が1回の試行を表します。

  5. 05
    限界を示して公開する。

    機密情報と専有コンテンツを除去し、データセットにバージョンを付け、除外と欠損フィールドを開示し、分布とサンプル数を報告します——根拠のない普遍的な主張はしません。

実際のケースを寄稿する

完了したパイロットを監査可能な証跡に変える。

ケーステンプレートを使って、評価期間、サンプル数、ベースライン、判断、限界、証跡の URL、公開の同意を開示してください。承認なしに顧客を特定してはなりません。

データディクショナリ

空の pilot-runs テンプレートのフィールド。

ダウンロードできるファイルにはヘッダーのみが含まれます。空欄は未測定または取得不可を意味し、0 は測定値がゼロであることを意味します。

フィールド定義
task_id / run_id安定したタスク識別子と実行番号。試行ごとに1行を使用します。
repository_commit実行に使用したベースラインコミットの SHA の正確な値。
monkeycode_version評価対象のリリース、イメージタグ、またはソースコミット。
model_id / endpoint_type正確なモデル識別子と、provider・gateway・local のいずれか。
run_started_at_utcISO 8601 UTC タイムスタンプ。例:2026-07-15T10:00:00Z。
accepted事前定義された受け入れ基準と承認ゲートの両方を満たした場合のみ true。
retriesこの記録された試行内でのリトライ回数。別の実行行として数えないでください。
elapsed_seconds / review_minutes試行の実時間と、人間によるレビューの実働時間。
input_tokens / output_tokensプロバイダーが報告するトークン数。取得できない場合は空欄にします。
model_cost / compute_cost / currencyこの試行の実測コスト。不明な値は 0 を書くのではなく空欄にします。
failure_categorynone・setup・environment・model・tool・test・review・policy・unknown のいずれか。
notes実行を解釈するために必要なサニタイズ済みの文脈。ソース、プロンプト、機密情報、個人データは決して含めないでください。

解釈の限界

パイロットは普遍的なリーダーボードではなく、その場の判断を支えるものです。

リポジトリの複雑さ、タスクの選択、モデルの変更、環境構成、レビュー担当者のスキル、ネットワーク環境が結果に影響します。重要な変更は繰り返し、各サマリーの背後にある生データ行を保持してください。

主要な結果

生成されたコード行数ではなく、受け入れ済みでレビュー可能な結果を主な単位として使用します。

厳格なゲート

平均値が良好に見えても、セキュリティ・ポリシー・信頼性の失敗はロールアウトを妨げ得ます。

合成結果なし

このサイトはプロトコルと空白テンプレートを提供します。捏造されたベンチマークデータは公開しません。