Files
vscode-workbench/PLANNING/tasks/I-04-新模型入职评估.md
T

65 lines
4.2 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# I-04 · 新模型入职评估与接力协议
| 字段 | 值 |
|---|---|
| 项目 | 基础设施 · `vscode/PLANNING`(评估题库)+ DSH(接入) |
| 优先级 | P0 · M1(新模型到位前就绪) |
| 建议模型 | deepseek-v4.1-flash(主)/ gpt-5.6-luna(评估标准审定) |
| 依赖 | 无(**可在新模型到位前先做**) |
| 预估 | 1-1.5 天 |
## 一、背景(为什么做)
"新模型没到"——到位后如果现想评估标准就晚了:**没有基准题就没有能力画像,没有画像就不敢派关键任务**。本卡把"新模型入职"流程化:一套固定评估题 + 接力协议,新模型一到,半天出画像、当天能派单。
## 二、目标(交付物)
> **重要:题库已预植入** —— 规划者已建好 `evals/` 全套:六维题库(16 题,含评分点)、dim4 fixture 工程(实测基线 2 failures + 2 errors)、dim3 长语料(51,483 字符 / 153KB,三针三诱饵位置已校验)、自动判分器 `evals/tools/validate.py`(已实测可用)、评分表 `evals/scoring.md`、运行协议 `evals/README.md`、预填 13 模型的 `model-registry.json`。
> **你的剩余工作**:① 补 `evals/tools/run_eval.py` 串起全流程;② 用 2 个已知模型校准;③ Handoff Bundle 脚本;④ 接力协议补进 03-执行协议.md;⑤ 回填校准成绩到 registry。**不要重建已存在的资产。**
**A. 评估题库 `PLANNING/evals/`(已预植入,见上)**
| 维度 | 现状 |
|---|---|
| 1. 指令遵循 | ✅ 3 题(严密 JSON / 精确字数 / commit 行格式),判分器实测可用 |
| 2. 代码修改 | ✅ 3 题(Python/JS/版本解析),判分器实测可用 |
| 3. 长上下文 | ✅ 3 题 + 确定性语料生成器(针 6.1%/50.1%/92.1%,诱饵 15%/20%/35%) |
| 4. 工具调用 | ✅ 2 题 + fixture 工程(3 处缺陷→4 失败用例) |
| 5. 幻觉抵抗 | ✅ 3 题(每题含诱饵数字) |
| 6. 交付规范 | ✅ 2 题(PROGRESS 格式 + 诚实自检) |
**B. 接力协议(写进协议文档)**
1. **接单上下文包标准**(Handoff Bundle):卡全文 + 项目 README + 最近 PROGRESS×2 + 相关源码清单 + 基线测试命令与输出。打包脚本产出一个可复制的 bundle 文本。
2. **断点续接**:上游模型交 partial 时,下游接手必须拿到:改动清单(文件+diff 摘要)+ 已绿/未绿测试 + 遗留问题 → 从断点继续,**不重做已验证部分**。
3. **模型注册表**:`PLANNING/model-registry.json` — ✅ 已预填 13 模型(等级/能力/限制),成绩字段待本卡回填。由 `01-模型分工矩阵.md` 引用。
**C. 新模型入职 SOP(一页纸)** → 已写于 `07-作战计划-窗口期.md` §五,本卡负责正式落盘到 03-协议。
## 三、验收标准
- [ ] 六维题库**复核**(已预植入,复核评分点与判分器一致性即可,勿重建)
- [ ] `evals/tools/run_eval.py` 落地:串起 16 题 → 发被测模型 → 收集 → 调 validate.py → 产 results json
- [ ] 用**现有已知模型**自测校准:至少 2 个模型(glm-5.3-flash、deepseek-v4.1-flash)跑完整套,**证明题库有区分度**(两者分数不可完全相同或均满分/均极低)
- [ ] `model-registry.json` 回填两个校准模型的实际 scores 与 grade
- [ ] Handoff Bundle 打包脚本可用(对 C-01 生成一份完整 bundle 演示)
- [ ] 接力协议写入 `03-执行协议.md`(本卡负责补章节)
- [ ] 新模型入职 SOP 落盘(可直接引用 `07-作战计划-窗口期.md` §五)
## 四、验收命令(参考)
```bash
cd vscode/PLANNING && python evals/tools/run_eval.py --model glm-5.3-flash # 需 DSH 网关可达
python evals/tools/validate.py dim1-q1 <answer.txt> # 判分器单测
python tasks.py bundle C-01 # 生成交接包(与 I-03 协同)
```
## 五、边界(不许做)
- 不做自动扣分式评分器(主观项人工/评委模型判定)
- 不把评估结果自动写回 DSH 配置(只写 registry)
- 题库不被用于刷分(评估题与真实任务题不同源)
## 六、交接
写 `PROGRESS_I-04.md`(含两模型校准结果、bundle 演示输出)。