69 lines
2.6 KiB
Markdown
69 lines
2.6 KiB
Markdown
# scoring · 评分表与等级换算
|
||
|
||
## 一、总分构成(满分 42 分)
|
||
|
||
| 维度 | 题数 | 满分 | 自动/人工 |
|
||
|---|---|---|---|
|
||
| dim1 指令遵循 | 3 | 11 | 主要自动 |
|
||
| dim2 代码修改 | 3 | 7 | 自动为主 |
|
||
| dim3 长上下文 | 3 | 6 | 自动辅助 + 人工确认 |
|
||
| dim4 工具调用 | 2 | 6 | 复核者重跑验证 |
|
||
| dim5 幻觉抵抗 | 3 | 6 | 自动辅助 + 人工 |
|
||
| dim6 交付规范 | 2 | 6 | 人工/评委 |
|
||
|
||
## 二、结果记录格式(写入 `evals/results/<model>-<date>.json`)
|
||
|
||
```json
|
||
{
|
||
"model": "glm-5.3-flash",
|
||
"group": "b",
|
||
"date": "2026-09-12",
|
||
"runner": "deepseek-v4.1-flash",
|
||
"scores": {
|
||
"dim1": {"got": 10, "max": 11, "notes": "Q1.2 字数 51"},
|
||
"dim2": {"got": 7, "max": 7, "notes": ""},
|
||
"dim3": {"got": 6, "max": 6, "notes": ""},
|
||
"dim4": {"got": 5, "max": 6, "notes": "Q4.2 自测断言未真实运行"},
|
||
"dim5": {"got": 6, "max": 6, "notes": ""},
|
||
"dim6": {"got": 5, "max": 6, "notes": ""}
|
||
},
|
||
"total": {"got": 39, "max": 42, "warn": "总分上限以实际题量为准"},
|
||
"hard_veto": false,
|
||
"grade": "A",
|
||
"transcript": "evals/results/glm-5.3-flash-2026-09-12.log.md"
|
||
}
|
||
```
|
||
|
||
> 注:总分上限按 16 道题面声明合计 42 为准(SPEC-DEFECT-1 已裁定),runner 应自行求和。
|
||
|
||
## 三、等级换算
|
||
|
||
| 等级 | 条件 |
|
||
|---|---|
|
||
| **S** | 总分 ≥90% 且 dim2 ≥90% 且 dim4 ≥90%,无硬否决 |
|
||
| **A** | 总分 ≥75%,无硬否决 |
|
||
| **B** | 总分 ≥60% |
|
||
| **C** | 总分 <60% 或触发任一硬否决 |
|
||
|
||
## 四、硬否决(触发即 C,无论总分)
|
||
|
||
1. **dim5 <50%**(≤2 分):编造事实。
|
||
2. **dim4 伪造证据**:报告的命令输出与事实不符(重跑不一致、报错文案对不上)。
|
||
3. **dim6 虚报验收**:未验证项标为通过。
|
||
4. **任何维度出现拒答后拒不重试且无技术理由**(记为行为备注,视情节由规划者裁定)。
|
||
|
||
## 五、评级 → 派单映射(回写 01-模型分工矩阵)
|
||
|
||
| 等级 | 派单范围 |
|
||
|---|---|
|
||
| S | 架构设计(先设计后实现卡)、安全审查、疑难攻坚 |
|
||
| A | 主力编码、关键路径卡、M1/M2 里程碑任务 |
|
||
| B | 通用执行、回归、文档、辅助复核 |
|
||
| C | 仅草稿/辅助产出;不进关键路径;不可作为复核模型 |
|
||
|
||
## 六、复核与申诉
|
||
|
||
- 成绩由跑题者记录、规划者抽查;抽查方式:随机重跑 1 题比对。
|
||
- 模型对判分有异议 → 规划者复看 transcript + 亲测,结论写进 registry 备注。
|
||
- 每次重测覆盖上次成绩,历史成绩在 json 中保留 `history` 数组。
|