可复现评估 · 已评审 2026-08-05

MonkeyCode 试点研究方法论。

本协议帮助团队产出自己可审计的证据。它不声称 MonkeyCode 取得了任何性能、质量或成本结果。

协议

在运行工具之前定义测试。

保留被拒绝的尝试与缺失的测量值。删除失败或把未知值改成 0,会让比较产生误导。

  1. 01
    选择有代表性的工作。

    从固定的仓库提交中挑选至少三个有边界的任务:一个缺陷、一个小功能,以及一个测试或文档变更。敏感仓库不要进入公开数据集。

  2. 02
    冻结验收标准。

    在第一次运行之前,记录必需的测试、构建检查、安全约束、允许改动的文件,以及评审者的决策规则。

  3. 03
    控制比较条件。

    对每种工作流使用相同的任务定义与仓库基线。记录工具版本、模型、端点、环境、权限与实质性的提示词变更。

  4. 04
    记录每一次尝试。

    测量自然耗时、活跃评审、重试次数、验收结果、模型用量、计算成本与失败类别。一行代表一次尝试。

  5. 05
    带边界地发布。

    去除机密与专有内容,对数据集进行版本化,披露排除项与缺失字段,并报告分布与样本数量——而不是没有依据的普遍性主张。

贡献真实案例

把完成的试点转化为可审计的证据。

使用案例模板披露评估窗口、样本量、基线、结论、局限、证据 URL 与发布许可。未经批准不得指名客户。

数据字典

空白 pilot-runs 模板中的字段。

可下载的文件只包含表头。留空表示未测量或不可用;0 表示测量值确实为零。

字段定义
task_id / run_id稳定的任务标识符与运行编号。每次尝试占一行。
repository_commit本次运行所使用的基础提交 SHA 的精确值。
monkeycode_version被评估的发布版本、镜像标签或源码提交。
model_id / endpoint_type精确的模型标识符,以及 provider、gateway 或 local 三者之一。
run_started_at_utcISO 8601 UTC 时间戳,例如 2026-07-15T10:00:00Z。
accepted仅当预定义的验收标准与评审关卡均通过时才为 true。
retries本次记录尝试内的重试次数;不要把独立的运行行计算在内。
elapsed_seconds / review_minutes尝试的自然耗时与人工评审的活跃时长。
input_tokens / output_tokens供应商报告的 token 数量;不可用时留空。
model_cost / compute_cost / currency本次尝试的实测成本;未知值留空,不要写成 0。
failure_categorynone、setup、environment、model、tool、test、review、policy 或 unknown 之一。
notes解读该运行所需的脱敏上下文;绝不能包含源码、提示词、机密或个人数据。

解读边界

试点支撑的是局部决策,而不是普遍的排行榜。

仓库复杂度、任务选择、模型变更、环境配置、评审者技能与网络条件都会影响结果。对实质性的变更进行重复实验,并保留每一份摘要背后的原始行。

主要结果

以验收通过、可评审的结果——而不是生成的代码行数——作为主要计量单位。

硬性关卡

即使平均值看起来不错,安全、策略或可靠性方面的失败也可能阻止上线。

不发布合成结果

本站提供协议与空白模板。它不发布捏造的基准测试数据。