开放数据结构 · 版本 1.0 · 2026-07-19

发布他人可以审计的 AI 编码证据。

这个开放工具包把测试前选定的任务、测试中观察到的每一次运行,以及一份有边界的案例摘要串联起来。文件按设计留空:我们不会把合成结果当作原创研究来展示。

可复用的研究资产

从预注册到可发布的案例。

CC0 许可的结构让独立的复现与比较更加容易。留空表示不可用;0 表示实测为零。发布结果时,请引用仓库的<a href="https://github.com/ct-jaryn/monkeycode-seo/blob/main/CITATION.cff" target="_blank" rel="noreferrer">带版本引文元数据</a>。

01 / CSV

预注册任务

在测试之前冻结提交、验收标准、允许的文件、检查项、安全约束与超时。

下载结构
02 / CSV

记录每一次尝试

保留通过与被拒绝的运行,含版本、时间、评审工作量、用量、成本、重试次数与失败类别。

下载结构
03 / CSV

发布有边界的案例

报告评估窗口、样本量、基线、结论、局限、证据与发布许可。

下载结构

最低证据标准

只有当案例的边界清晰可见时,它才是证据。

发布精确的版本与样本数量,保留失败记录,链接支撑性产物,披露利益冲突,并在点名某组织之前获得其同意。

不挑拣数据

每一次尝试都保留在运行文件中,包括设置、模型、测试、评审与策略失败。

不暗示匿名背书

匿名化的试点可以描述测量条件,但不得暗示客户认可。

不发布普遍排行榜

结果只支撑在测试仓库、模型、环境与时间窗口内的决策。

贡献证据

运行协议并发布带版本的数据集。