生成されたコード行数ではなく、受け入れ済みでレビュー可能な結果を主な単位として使用します。
再現可能な評価 · レビュー済み 2026-08-05
MonkeyCode パイロット研究方法論。
このプロトコルは、チームが自らの監査可能な証跡を作るのに役立ちます。MonkeyCode がいかなる性能・品質・コストの結果を達成したとも主張しません。
プロトコル
ツールを実行する前にテストを定義する。
却下された試行と欠損した測定値は残してください。失敗を消したり不明値を 0 に変えたりすると、比較が誤解を招きます。
- 01代表的な作業を選択する。
固定したリポジトリコミットから、少なくとも3つの境界のあるタスクを選びます:欠陥、小さな機能、テストまたはドキュメントの変更です。機密のリポジトリは公開データセットから除外してください。
- 02受け入れ基準を確定する。
最初の実行前に、必要なテスト、ビルドチェック、セキュリティ制約、変更を許可するファイル、レビュー担当者の判断ルールを記録します。
- 03比較条件を管理する。
各ワークフローで同じタスク定義とリポジトリのベースラインを使用します。ツールバージョン、モデル、エンドポイント、環境、権限、重要なプロンプトの変更を記録します。
- 04すべての試行を記録する。
実時間、実働レビュー、リトライ、受け入れ結果、モデル使用量、計算コスト、失敗カテゴリを測定します。1行が1回の試行を表します。
- 05限界を示して公開する。
機密情報と専有コンテンツを除去し、データセットにバージョンを付け、除外と欠損フィールドを開示し、分布とサンプル数を報告します——根拠のない普遍的な主張はしません。
実際のケースを寄稿する
完了したパイロットを監査可能な証跡に変える。
ケーステンプレートを使って、評価期間、サンプル数、ベースライン、判断、限界、証跡の URL、公開の同意を開示してください。承認なしに顧客を特定してはなりません。
データディクショナリ
空の pilot-runs テンプレートのフィールド。
ダウンロードできるファイルにはヘッダーのみが含まれます。空欄は未測定または取得不可を意味し、0 は測定値がゼロであることを意味します。
| フィールド | 定義 |
|---|---|
| task_id / run_id | 安定したタスク識別子と実行番号。試行ごとに1行を使用します。 |
| repository_commit | 実行に使用したベースラインコミットの SHA の正確な値。 |
| monkeycode_version | 評価対象のリリース、イメージタグ、またはソースコミット。 |
| model_id / endpoint_type | 正確なモデル識別子と、provider・gateway・local のいずれか。 |
| run_started_at_utc | ISO 8601 UTC タイムスタンプ。例:2026-07-15T10:00:00Z。 |
| accepted | 事前定義された受け入れ基準と承認ゲートの両方を満たした場合のみ true。 |
| retries | この記録された試行内でのリトライ回数。別の実行行として数えないでください。 |
| elapsed_seconds / review_minutes | 試行の実時間と、人間によるレビューの実働時間。 |
| input_tokens / output_tokens | プロバイダーが報告するトークン数。取得できない場合は空欄にします。 |
| model_cost / compute_cost / currency | この試行の実測コスト。不明な値は 0 を書くのではなく空欄にします。 |
| failure_category | none・setup・environment・model・tool・test・review・policy・unknown のいずれか。 |
| notes | 実行を解釈するために必要なサニタイズ済みの文脈。ソース、プロンプト、機密情報、個人データは決して含めないでください。 |
解釈の限界
パイロットは普遍的なリーダーボードではなく、その場の判断を支えるものです。
リポジトリの複雑さ、タスクの選択、モデルの変更、環境構成、レビュー担当者のスキル、ネットワーク環境が結果に影響します。重要な変更は繰り返し、各サマリーの背後にある生データ行を保持してください。
平均値が良好に見えても、セキュリティ・ポリシー・信頼性の失敗はロールアウトを妨げ得ます。
このサイトはプロトコルと空白テンプレートを提供します。捏造されたベンチマークデータは公開しません。