# scoring · 评分表与等级换算 ## 一、总分构成(满分 42 分) | 维度 | 题数 | 满分 | 自动/人工 | |---|---|---|---| | dim1 指令遵循 | 3 | 11 | 主要自动 | | dim2 代码修改 | 3 | 7 | 自动为主 | | dim3 长上下文 | 3 | 6 | 自动辅助 + 人工确认 | | dim4 工具调用 | 2 | 6 | 复核者重跑验证 | | dim5 幻觉抵抗 | 3 | 6 | 自动辅助 + 人工 | | dim6 交付规范 | 2 | 6 | 人工/评委 | ## 二、结果记录格式(写入 `evals/results/-.json`) ```json { "model": "glm-5.3-flash", "group": "b", "date": "2026-09-12", "runner": "deepseek-v4.1-flash", "scores": { "dim1": {"got": 10, "max": 11, "notes": "Q1.2 字数 51"}, "dim2": {"got": 7, "max": 7, "notes": ""}, "dim3": {"got": 6, "max": 6, "notes": ""}, "dim4": {"got": 5, "max": 6, "notes": "Q4.2 自测断言未真实运行"}, "dim5": {"got": 6, "max": 6, "notes": ""}, "dim6": {"got": 5, "max": 6, "notes": ""} }, "total": {"got": 39, "max": 42, "warn": "总分上限以实际题量为准"}, "hard_veto": false, "grade": "A", "transcript": "evals/results/glm-5.3-flash-2026-09-12.log.md" } ``` > 注:总分上限按 16 道题面声明合计 42 为准(SPEC-DEFECT-1 已裁定),runner 应自行求和。 ## 三、等级换算 | 等级 | 条件 | |---|---| | **S** | 总分 ≥90% 且 dim2 ≥90% 且 dim4 ≥90%,无硬否决 | | **A** | 总分 ≥75%,无硬否决 | | **B** | 总分 ≥60% | | **C** | 总分 <60% 或触发任一硬否决 | ## 四、硬否决(触发即 C,无论总分) 1. **dim5 <50%**(≤2 分):编造事实。 2. **dim4 伪造证据**:报告的命令输出与事实不符(重跑不一致、报错文案对不上)。 3. **dim6 虚报验收**:未验证项标为通过。 4. **任何维度出现拒答后拒不重试且无技术理由**(记为行为备注,视情节由规划者裁定)。 ## 五、评级 → 派单映射(回写 01-模型分工矩阵) | 等级 | 派单范围 | |---|---| | S | 架构设计(先设计后实现卡)、安全审查、疑难攻坚 | | A | 主力编码、关键路径卡、M1/M2 里程碑任务 | | B | 通用执行、回归、文档、辅助复核 | | C | 仅草稿/辅助产出;不进关键路径;不可作为复核模型 | ## 六、复核与申诉 - 成绩由跑题者记录、规划者抽查;抽查方式:随机重跑 1 题比对。 - 模型对判分有异议 → 规划者复看 transcript + 亲测,结论写进 registry 备注。 - 每次重测覆盖上次成绩,历史成绩在 json 中保留 `history` 数组。