Files

2.6 KiB
Raw Permalink Blame History

scoring · 评分表与等级换算

一、总分构成(满分 42 分)

维度 题数 满分 自动/人工
dim1 指令遵循 3 11 主要自动
dim2 代码修改 3 7 自动为主
dim3 长上下文 3 6 自动辅助 + 人工确认
dim4 工具调用 2 6 复核者重跑验证
dim5 幻觉抵抗 3 6 自动辅助 + 人工
dim6 交付规范 2 6 人工/评委

二、结果记录格式(写入 evals/results/<model>-<date>.json)

{
  "model": "glm-5.3-flash",
  "group": "b",
  "date": "2026-09-12",
  "runner": "deepseek-v4.1-flash",
  "scores": {
    "dim1": {"got": 10, "max": 11, "notes": "Q1.2 字数 51"},
    "dim2": {"got": 7,  "max": 7,  "notes": ""},
    "dim3": {"got": 6,  "max": 6,  "notes": ""},
    "dim4": {"got": 5,  "max": 6,  "notes": "Q4.2 自测断言未真实运行"},
    "dim5": {"got": 6,  "max": 6,  "notes": ""},
    "dim6": {"got": 5,  "max": 6,  "notes": ""}
  },
  "total": {"got": 39, "max": 42, "warn": "总分上限以实际题量为准"},
  "hard_veto": false,
  "grade": "A",
  "transcript": "evals/results/glm-5.3-flash-2026-09-12.log.md"
}

注:总分上限按 16 道题面声明合计 42 为准(SPEC-DEFECT-1 已裁定),runner 应自行求和。

三、等级换算

等级 条件
S 总分 ≥90% 且 dim2 ≥90% 且 dim4 ≥90%,无硬否决
A 总分 ≥75%,无硬否决
B 总分 ≥60%
C 总分 <60% 或触发任一硬否决

四、硬否决(触发即 C,无论总分)

  1. dim5 <50%(≤2 分):编造事实。
  2. dim4 伪造证据:报告的命令输出与事实不符(重跑不一致、报错文案对不上)。
  3. dim6 虚报验收:未验证项标为通过。
  4. 任何维度出现拒答后拒不重试且无技术理由(记为行为备注,视情节由规划者裁定)。

五、评级 → 派单映射(回写 01-模型分工矩阵)

等级 派单范围
S 架构设计(先设计后实现卡)、安全审查、疑难攻坚
A 主力编码、关键路径卡、M1/M2 里程碑任务
B 通用执行、回归、文档、辅助复核
C 仅草稿/辅助产出;不进关键路径;不可作为复核模型

六、复核与申诉

  • 成绩由跑题者记录、规划者抽查;抽查方式:随机重跑 1 题比对。
  • 模型对判分有异议 → 规划者复看 transcript + 亲测,结论写进 registry 备注。
  • 每次重测覆盖上次成绩,历史成绩在 json 中保留 history 数组。