免费试点评估工具

AI 编码试点评分卡。

用六个明确的评估维度取代演示印象。基于同一组有边界任务的证据,按 1(不可接受)到 5(强)打分。

试点读数60/100 · 有希望,但有条件

深入排查得分最低的维度,并在更大范围推广前重复试点。

用相同任务

在带书面验收标准的有边界任务上对比各工作流。

统计全部投入

包含准备、提示、重试、评审、修正与运维。

执行硬门槛

安全或可靠性低于 3 分即阻止推广,无论平均分多高。

工具问答

常见问题

所有工具
试点分数是怎么算的?
六个等权维度——验收结果、评审投入、执行可靠性、安全与治理、开发者采用度、成本——各按 1 到 5 打分,归一化为 0–100 总分。安全与可靠性是硬门槛:任一低于 3 分即阻止推广,无论平均分多高。
为什么高平均分仍可能"不要扩大"?
因为高平均分可能掩盖关键控制项的失败。安全或可靠性低于 3 分时,结论就是"不要扩大",直到解决失败项、收集新证据并重复同一有边界试点。
评分卡会存储我的证据吗?
不会。打分和 JSON 导出完全在你的浏览器里进行,不上传任何内容。请配合试点方法论与 CSV 模板保留逐次证据。