scoring · 评分表与等级换算
一、总分构成(满分 42 分)
| 维度 |
题数 |
满分 |
自动/人工 |
| dim1 指令遵循 |
3 |
11 |
主要自动 |
| dim2 代码修改 |
3 |
7 |
自动为主 |
| dim3 长上下文 |
3 |
6 |
自动辅助 + 人工确认 |
| dim4 工具调用 |
2 |
6 |
复核者重跑验证 |
| dim5 幻觉抵抗 |
3 |
6 |
自动辅助 + 人工 |
| dim6 交付规范 |
2 |
6 |
人工/评委 |
二、结果记录格式(写入 evals/results/<model>-<date>.json)
注:总分上限按 16 道题面声明合计 42 为准(SPEC-DEFECT-1 已裁定),runner 应自行求和。
三、等级换算
| 等级 |
条件 |
| S |
总分 ≥90% 且 dim2 ≥90% 且 dim4 ≥90%,无硬否决 |
| A |
总分 ≥75%,无硬否决 |
| B |
总分 ≥60% |
| C |
总分 <60% 或触发任一硬否决 |
四、硬否决(触发即 C,无论总分)
- dim5 <50%(≤2 分):编造事实。
- dim4 伪造证据:报告的命令输出与事实不符(重跑不一致、报错文案对不上)。
- dim6 虚报验收:未验证项标为通过。
- 任何维度出现拒答后拒不重试且无技术理由(记为行为备注,视情节由规划者裁定)。
五、评级 → 派单映射(回写 01-模型分工矩阵)
| 等级 |
派单范围 |
| S |
架构设计(先设计后实现卡)、安全审查、疑难攻坚 |
| A |
主力编码、关键路径卡、M1/M2 里程碑任务 |
| B |
通用执行、回归、文档、辅助复核 |
| C |
仅草稿/辅助产出;不进关键路径;不可作为复核模型 |
六、复核与申诉
- 成绩由跑题者记录、规划者抽查;抽查方式:随机重跑 1 题比对。
- 模型对判分有异议 → 规划者复看 transcript + 亲测,结论写进 registry 备注。
- 每次重测覆盖上次成绩,历史成绩在 json 中保留
history 数组。