65 lines
4.2 KiB
Markdown
65 lines
4.2 KiB
Markdown
# I-04 · 新模型入职评估与接力协议
|
||
|
||
| 字段 | 值 |
|
||
|---|---|
|
||
| 项目 | 基础设施 · `vscode/PLANNING`(评估题库)+ DSH(接入) |
|
||
| 优先级 | P0 · M1(新模型到位前就绪) |
|
||
| 建议模型 | deepseek-v4.1-flash(主)/ gpt-5.6-luna(评估标准审定) |
|
||
| 依赖 | 无(**可在新模型到位前先做**) |
|
||
| 预估 | 1-1.5 天 |
|
||
|
||
## 一、背景(为什么做)
|
||
|
||
"新模型没到"——到位后如果现想评估标准就晚了:**没有基准题就没有能力画像,没有画像就不敢派关键任务**。本卡把"新模型入职"流程化:一套固定评估题 + 接力协议,新模型一到,半天出画像、当天能派单。
|
||
|
||
## 二、目标(交付物)
|
||
|
||
> **重要:题库已预植入** —— 规划者已建好 `evals/` 全套:六维题库(16 题,含评分点)、dim4 fixture 工程(实测基线 2 failures + 2 errors)、dim3 长语料(51,483 字符 / 153KB,三针三诱饵位置已校验)、自动判分器 `evals/tools/validate.py`(已实测可用)、评分表 `evals/scoring.md`、运行协议 `evals/README.md`、预填 13 模型的 `model-registry.json`。
|
||
> **你的剩余工作**:① 补 `evals/tools/run_eval.py` 串起全流程;② 用 2 个已知模型校准;③ Handoff Bundle 脚本;④ 接力协议补进 03-执行协议.md;⑤ 回填校准成绩到 registry。**不要重建已存在的资产。**
|
||
|
||
**A. 评估题库 `PLANNING/evals/`(已预植入,见上)**
|
||
|
||
| 维度 | 现状 |
|
||
|---|---|
|
||
| 1. 指令遵循 | ✅ 3 题(严密 JSON / 精确字数 / commit 行格式),判分器实测可用 |
|
||
| 2. 代码修改 | ✅ 3 题(Python/JS/版本解析),判分器实测可用 |
|
||
| 3. 长上下文 | ✅ 3 题 + 确定性语料生成器(针 6.1%/50.1%/92.1%,诱饵 15%/20%/35%) |
|
||
| 4. 工具调用 | ✅ 2 题 + fixture 工程(3 处缺陷→4 失败用例) |
|
||
| 5. 幻觉抵抗 | ✅ 3 题(每题含诱饵数字) |
|
||
| 6. 交付规范 | ✅ 2 题(PROGRESS 格式 + 诚实自检) |
|
||
|
||
**B. 接力协议(写进协议文档)**
|
||
1. **接单上下文包标准**(Handoff Bundle):卡全文 + 项目 README + 最近 PROGRESS×2 + 相关源码清单 + 基线测试命令与输出。打包脚本产出一个可复制的 bundle 文本。
|
||
2. **断点续接**:上游模型交 partial 时,下游接手必须拿到:改动清单(文件+diff 摘要)+ 已绿/未绿测试 + 遗留问题 → 从断点继续,**不重做已验证部分**。
|
||
3. **模型注册表**:`PLANNING/model-registry.json` — ✅ 已预填 13 模型(等级/能力/限制),成绩字段待本卡回填。由 `01-模型分工矩阵.md` 引用。
|
||
|
||
**C. 新模型入职 SOP(一页纸)** → 已写于 `07-作战计划-窗口期.md` §五,本卡负责正式落盘到 03-协议。
|
||
|
||
## 三、验收标准
|
||
|
||
- [ ] 六维题库**复核**(已预植入,复核评分点与判分器一致性即可,勿重建)
|
||
- [ ] `evals/tools/run_eval.py` 落地:串起 16 题 → 发被测模型 → 收集 → 调 validate.py → 产 results json
|
||
- [ ] 用**现有已知模型**自测校准:至少 2 个模型(glm-5.3-flash、deepseek-v4.1-flash)跑完整套,**证明题库有区分度**(两者分数不可完全相同或均满分/均极低)
|
||
- [ ] `model-registry.json` 回填两个校准模型的实际 scores 与 grade
|
||
- [ ] Handoff Bundle 打包脚本可用(对 C-01 生成一份完整 bundle 演示)
|
||
- [ ] 接力协议写入 `03-执行协议.md`(本卡负责补章节)
|
||
- [ ] 新模型入职 SOP 落盘(可直接引用 `07-作战计划-窗口期.md` §五)
|
||
|
||
## 四、验收命令(参考)
|
||
|
||
```bash
|
||
cd vscode/PLANNING && python evals/tools/run_eval.py --model glm-5.3-flash # 需 DSH 网关可达
|
||
python evals/tools/validate.py dim1-q1 <answer.txt> # 判分器单测
|
||
python tasks.py bundle C-01 # 生成交接包(与 I-03 协同)
|
||
```
|
||
|
||
## 五、边界(不许做)
|
||
|
||
- 不做自动扣分式评分器(主观项人工/评委模型判定)
|
||
- 不把评估结果自动写回 DSH 配置(只写 registry)
|
||
- 题库不被用于刷分(评估题与真实任务题不同源)
|
||
|
||
## 六、交接
|
||
|
||
写 `PROGRESS_I-04.md`(含两模型校准结果、bundle 演示输出)。
|