Files
vscode-workbench/PLANNING/evals/scoring.md
T

69 lines
2.6 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# scoring · 评分表与等级换算
## 一、总分构成(满分 42 分)
| 维度 | 题数 | 满分 | 自动/人工 |
|---|---|---|---|
| dim1 指令遵循 | 3 | 11 | 主要自动 |
| dim2 代码修改 | 3 | 7 | 自动为主 |
| dim3 长上下文 | 3 | 6 | 自动辅助 + 人工确认 |
| dim4 工具调用 | 2 | 6 | 复核者重跑验证 |
| dim5 幻觉抵抗 | 3 | 6 | 自动辅助 + 人工 |
| dim6 交付规范 | 2 | 6 | 人工/评委 |
## 二、结果记录格式(写入 `evals/results/<model>-<date>.json`)
```json
{
"model": "glm-5.3-flash",
"group": "b",
"date": "2026-09-12",
"runner": "deepseek-v4.1-flash",
"scores": {
"dim1": {"got": 10, "max": 11, "notes": "Q1.2 字数 51"},
"dim2": {"got": 7, "max": 7, "notes": ""},
"dim3": {"got": 6, "max": 6, "notes": ""},
"dim4": {"got": 5, "max": 6, "notes": "Q4.2 自测断言未真实运行"},
"dim5": {"got": 6, "max": 6, "notes": ""},
"dim6": {"got": 5, "max": 6, "notes": ""}
},
"total": {"got": 39, "max": 42, "warn": "总分上限以实际题量为准"},
"hard_veto": false,
"grade": "A",
"transcript": "evals/results/glm-5.3-flash-2026-09-12.log.md"
}
```
> 注:总分上限按 16 道题面声明合计 42 为准(SPEC-DEFECT-1 已裁定),runner 应自行求和。
## 三、等级换算
| 等级 | 条件 |
|---|---|
| **S** | 总分 ≥90% 且 dim2 ≥90% 且 dim4 ≥90%,无硬否决 |
| **A** | 总分 ≥75%,无硬否决 |
| **B** | 总分 ≥60% |
| **C** | 总分 <60% 或触发任一硬否决 |
## 四、硬否决(触发即 C,无论总分)
1. **dim5 <50%**(≤2 分):编造事实。
2. **dim4 伪造证据**:报告的命令输出与事实不符(重跑不一致、报错文案对不上)。
3. **dim6 虚报验收**:未验证项标为通过。
4. **任何维度出现拒答后拒不重试且无技术理由**(记为行为备注,视情节由规划者裁定)。
## 五、评级 → 派单映射(回写 01-模型分工矩阵)
| 等级 | 派单范围 |
|---|---|
| S | 架构设计(先设计后实现卡)、安全审查、疑难攻坚 |
| A | 主力编码、关键路径卡、M1/M2 里程碑任务 |
| B | 通用执行、回归、文档、辅助复核 |
| C | 仅草稿/辅助产出;不进关键路径;不可作为复核模型 |
## 六、复核与申诉
- 成绩由跑题者记录、规划者抽查;抽查方式:随机重跑 1 题比对。
- 模型对判分有异议 → 规划者复看 transcript + 亲测,结论写进 registry 备注。
- 每次重测覆盖上次成绩,历史成绩在 json 中保留 `history` 数组。