4.2 KiB
4.2 KiB
I-04 · 新模型入职评估与接力协议
| 字段 | 值 |
|---|---|
| 项目 | 基础设施 · vscode/PLANNING(评估题库)+ DSH(接入) |
| 优先级 | P0 · M1(新模型到位前就绪) |
| 建议模型 | deepseek-v4.1-flash(主)/ gpt-5.6-luna(评估标准审定) |
| 依赖 | 无(可在新模型到位前先做) |
| 预估 | 1-1.5 天 |
一、背景(为什么做)
"新模型没到"——到位后如果现想评估标准就晚了:没有基准题就没有能力画像,没有画像就不敢派关键任务。本卡把"新模型入职"流程化:一套固定评估题 + 接力协议,新模型一到,半天出画像、当天能派单。
二、目标(交付物)
重要:题库已预植入 —— 规划者已建好
evals/全套:六维题库(16 题,含评分点)、dim4 fixture 工程(实测基线 2 failures + 2 errors)、dim3 长语料(51,483 字符 / 153KB,三针三诱饵位置已校验)、自动判分器evals/tools/validate.py(已实测可用)、评分表evals/scoring.md、运行协议evals/README.md、预填 13 模型的model-registry.json。 你的剩余工作:① 补evals/tools/run_eval.py串起全流程;② 用 2 个已知模型校准;③ Handoff Bundle 脚本;④ 接力协议补进 03-执行协议.md;⑤ 回填校准成绩到 registry。不要重建已存在的资产。
A. 评估题库 PLANNING/evals/(已预植入,见上)
| 维度 | 现状 |
|---|---|
| 1. 指令遵循 | ✅ 3 题(严密 JSON / 精确字数 / commit 行格式),判分器实测可用 |
| 2. 代码修改 | ✅ 3 题(Python/JS/版本解析),判分器实测可用 |
| 3. 长上下文 | ✅ 3 题 + 确定性语料生成器(针 6.1%/50.1%/92.1%,诱饵 15%/20%/35%) |
| 4. 工具调用 | ✅ 2 题 + fixture 工程(3 处缺陷→4 失败用例) |
| 5. 幻觉抵抗 | ✅ 3 题(每题含诱饵数字) |
| 6. 交付规范 | ✅ 2 题(PROGRESS 格式 + 诚实自检) |
B. 接力协议(写进协议文档)
- 接单上下文包标准(Handoff Bundle):卡全文 + 项目 README + 最近 PROGRESS×2 + 相关源码清单 + 基线测试命令与输出。打包脚本产出一个可复制的 bundle 文本。
- 断点续接:上游模型交 partial 时,下游接手必须拿到:改动清单(文件+diff 摘要)+ 已绿/未绿测试 + 遗留问题 → 从断点继续,不重做已验证部分。
- 模型注册表:
PLANNING/model-registry.json— ✅ 已预填 13 模型(等级/能力/限制),成绩字段待本卡回填。由01-模型分工矩阵.md引用。
C. 新模型入职 SOP(一页纸) → 已写于 07-作战计划-窗口期.md §五,本卡负责正式落盘到 03-协议。
三、验收标准
- 六维题库复核(已预植入,复核评分点与判分器一致性即可,勿重建)
evals/tools/run_eval.py落地:串起 16 题 → 发被测模型 → 收集 → 调 validate.py → 产 results json- 用现有已知模型自测校准:至少 2 个模型(glm-5.3-flash、deepseek-v4.1-flash)跑完整套,证明题库有区分度(两者分数不可完全相同或均满分/均极低)
model-registry.json回填两个校准模型的实际 scores 与 grade- Handoff Bundle 打包脚本可用(对 C-01 生成一份完整 bundle 演示)
- 接力协议写入
03-执行协议.md(本卡负责补章节) - 新模型入职 SOP 落盘(可直接引用
07-作战计划-窗口期.md§五)
四、验收命令(参考)
cd vscode/PLANNING && python evals/tools/run_eval.py --model glm-5.3-flash # 需 DSH 网关可达
python evals/tools/validate.py dim1-q1 <answer.txt> # 判分器单测
python tasks.py bundle C-01 # 生成交接包(与 I-03 协同)
五、边界(不许做)
- 不做自动扣分式评分器(主观项人工/评委模型判定)
- 不把评估结果自动写回 DSH 配置(只写 registry)
- 题库不被用于刷分(评估题与真实任务题不同源)
六、交接
写 PROGRESS_I-04.md(含两模型校准结果、bundle 演示输出)。