Files
vscode-workbench/PLANNING/07-作战计划-窗口期.md
T

113 lines
5.2 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 07 · 作战计划 · 新模型窗口期(今晚起 11:00 前持续)
> 前提:新模型未到位,但**现有池子(已实测 glm/qwen/deepseek 系)完全够开工**。
> 本文档回答唯一问题:**现在,今晚,能干什么**。按顺序执行即可,不用等我。
---
## 一、窗口期优先级(按"现在就能做"排序)
### 第一梯队:今晚就能派给现有模型(不需要新模型)
| 顺序 | 卡片 | 派给谁 | 为什么现在 | 预计 |
|---|---|---|---|---|
| 1 | **I-04**(部分)| 你自己/任意模型 | 题库/fixtures/验证器**已经建好**(见下),只剩 runner 补充 | 1-2 小时 |
| 2 | **C-01** 路由修复 | glm-5.3-flash 或任意 A 级 | 不依赖新模型;半天见效 | 半天 |
| 3 | **E-02** 游客模式 | glm-5.3-flash / qwen3.8-flash | 同上,杠杆最大 | 1-2 天 |
| 4 | **D-02** PG 环境 | deepseek-v4-flash | 半小时的活,先清掉 | 0.5 天 |
| 5 | **I-01** 模型探测自动化 | deepseek-v4.1-flash | 新模型到位后正好用它跑全量画像 | 1-2 天 |
### 第二梯队:等你验收第一梯队后再放
- E-01 分享战报 → S-01 DSP 统一测试 → C-02 工具热榜
### 不该现在做的
- 所有依赖 S-03/D-01 设计类的重型卡(等 I-04 评估出 S 级模型画像后派更稳)
- I-03 调度器(虽然可以派,但优先让 I-04 先落地——调度器要调 registry)
---
## 二、I-04 已预植入的部分(今晚直接可用)
原 I-04 任务卡要求"建题库"。**题库 / fixtures / 判分器已由规划者建好**:
| 资产 | 路径 | 状态 |
|---|---|---|
| 六维题库(16 题) | `evals/questions/dim1~dim6-*.md` | ✅ 完成,含评分点 |
| dim4 fixture 工程 | `evals/fixtures/tooltask/`(calc.py + test_calc.py) | ✅ 实测:2 failures + 2 errors 基线 |
| dim3 长语料生成器 | `evals/assets/gen_longctx.py` | ✅ 实测:51,483 字符 / 153KB,三针三诱饵位置已校验 |
| dim3 语料成品 | `evals/assets/longctx-corpus.md` | ✅ 已生成 |
| 自动化判分器 | `evals/tools/validate.py` | ✅ 实测:dim1-q1/q3、dim2-q2 全绿(node 可用) |
| 评分表 | `evals/scoring.md` | ✅ 完成(36 分制 + 硬否决) |
| 运行协议 | `evals/README.md` | ✅ 完成 |
| 模型注册表 | `model-registry.json` | ✅ 13 模型预填,成绩待跑 |
**所以 I-04 剩余工作缩小为**:
1. 补 `evals/tools/run_eval.py`(串起 16 题 → 调用被测模型 → 收集回答 → 调 validate.py)
2. 跑 2 个已知模型校准(glm-5.3-flash、deepseek-v4.1-flash)
3. 补 Handoff Bundle 脚本 + 新模型入职 SOP 回填执行协议
---
## 三、今晚 11:00 前的执行清单(照做)
```text
[ ] 1. 派 C-01 给任一 A 级模型(用 05 模板 1,替换 <ID>=C-01)
[ ] 2. 派 E-02 给另一模型(并行,互不冲突——不同项目)
[ ] 3. 派 D-02 给 deepseek-v4-flash(半小时活)
[ ] 4. 自己跑一遍 I-04 剩余部分或派给 glm-5.3-flash
[ ] 5. 回收任意 PROGRESS,贴回来给我验收
```
**注意**:一次最多 3 张并行(风险表 R18);C-01 与 E-02 分属不同项目,并行安全。
---
## 四、可复制发令(今晚直接抄)
### C-01
```text
你是执行模型。读取任务卡:C:\Users\12914\Desktop\vscode\PLANNING\tasks\C-01-路由代理冲突修复.md
按 C:\Users\12914\Desktop\vscode\PLANNING\03-执行协议.md 作业。
先读 chunyu_project_react 的 README 与 docs/页面健康检查报告.md,跑基线,再实施。
完成后写 PROGRESS_C-01.md 到项目根,附 73 路由回归输出。
```
### E-02
```text
你是执行模型。读取任务卡:C:\Users\12914\Desktop\vscode\PLANNING\tasks\E-02-游客模式.md
按 C:\Users\12914\Desktop\vscode\PLANNING\03-执行协议.md 作业。
先读 english-drill README 与最近 2 份 AGI 迭代报告,跑基线(tests/e2e/run_e2e.py),再实施。
完成后写 PROGRESS_E-02.md,附游客路径 E2E 输出。
```
### D-02
```text
你是执行模型。读取任务卡:C:\Users\12914\Desktop\vscode\PLANNING\tasks\D-02-PG并发测试环境.md
按 PLANNING/03-执行协议.md 作业。目标:激活 dealerhub 的 4 个 skipped 并发用例。
完成后写 PROGRESS_D-02.md 到 backend 根,附 4 用例 passed 原始输出。
```
### I-04(剩余部分)
```text
你是执行模型。读取任务卡:PLANNING\tasks\I-04-新模型入职评估.md
注意:题库/fixtures/判分器已预植入 evals/ 目录(勿重建),你的剩余任务是:
① 补 evals/tools/run_eval.py ② 用 glm-5.3-flash 与 deepseek-v4.1-flash 各跑一遍校准
③ 补 Handoff Bundle 脚本 ④ 把接力协议补充进 03-执行协议.md
⑤ 回填 model-registry.json 的两个校准成绩
```
---
## 五、新模型到位当天(SOP)
```text
1. 复制 evals/ 到新模型会话,按 evals/README.md 跑六维(30-40 分钟)
2. 用 evals/tools/validate.py 判自动项;主观项交给一个已知合格模型打分
3. 成绩写入 PLANNING/model-registry.json(覆盖 scores,grade 按 scoring.md 换算)
4. 更新 01-模型分工矩阵.md 对应行
5. 派第一张低风险验证卡(建议 D-02 或 I-01 辅助位)观察真实交付
6. 合格 → 正式启用;不合格 → 降级/限场景
```