# 07 · 作战计划 · 新模型窗口期(今晚起 11:00 前持续) > 前提:新模型未到位,但**现有池子(已实测 glm/qwen/deepseek 系)完全够开工**。 > 本文档回答唯一问题:**现在,今晚,能干什么**。按顺序执行即可,不用等我。 --- ## 一、窗口期优先级(按"现在就能做"排序) ### 第一梯队:今晚就能派给现有模型(不需要新模型) | 顺序 | 卡片 | 派给谁 | 为什么现在 | 预计 | |---|---|---|---|---| | 1 | **I-04**(部分)| 你自己/任意模型 | 题库/fixtures/验证器**已经建好**(见下),只剩 runner 补充 | 1-2 小时 | | 2 | **C-01** 路由修复 | glm-5.3-flash 或任意 A 级 | 不依赖新模型;半天见效 | 半天 | | 3 | **E-02** 游客模式 | glm-5.3-flash / qwen3.8-flash | 同上,杠杆最大 | 1-2 天 | | 4 | **D-02** PG 环境 | deepseek-v4-flash | 半小时的活,先清掉 | 0.5 天 | | 5 | **I-01** 模型探测自动化 | deepseek-v4.1-flash | 新模型到位后正好用它跑全量画像 | 1-2 天 | ### 第二梯队:等你验收第一梯队后再放 - E-01 分享战报 → S-01 DSP 统一测试 → C-02 工具热榜 ### 不该现在做的 - 所有依赖 S-03/D-01 设计类的重型卡(等 I-04 评估出 S 级模型画像后派更稳) - I-03 调度器(虽然可以派,但优先让 I-04 先落地——调度器要调 registry) --- ## 二、I-04 已预植入的部分(今晚直接可用) 原 I-04 任务卡要求"建题库"。**题库 / fixtures / 判分器已由规划者建好**: | 资产 | 路径 | 状态 | |---|---|---| | 六维题库(16 题) | `evals/questions/dim1~dim6-*.md` | ✅ 完成,含评分点 | | dim4 fixture 工程 | `evals/fixtures/tooltask/`(calc.py + test_calc.py) | ✅ 实测:2 failures + 2 errors 基线 | | dim3 长语料生成器 | `evals/assets/gen_longctx.py` | ✅ 实测:51,483 字符 / 153KB,三针三诱饵位置已校验 | | dim3 语料成品 | `evals/assets/longctx-corpus.md` | ✅ 已生成 | | 自动化判分器 | `evals/tools/validate.py` | ✅ 实测:dim1-q1/q3、dim2-q2 全绿(node 可用) | | 评分表 | `evals/scoring.md` | ✅ 完成(36 分制 + 硬否决) | | 运行协议 | `evals/README.md` | ✅ 完成 | | 模型注册表 | `model-registry.json` | ✅ 13 模型预填,成绩待跑 | **所以 I-04 剩余工作缩小为**: 1. 补 `evals/tools/run_eval.py`(串起 16 题 → 调用被测模型 → 收集回答 → 调 validate.py) 2. 跑 2 个已知模型校准(glm-5.3-flash、deepseek-v4.1-flash) 3. 补 Handoff Bundle 脚本 + 新模型入职 SOP 回填执行协议 --- ## 三、今晚 11:00 前的执行清单(照做) ```text [ ] 1. 派 C-01 给任一 A 级模型(用 05 模板 1,替换 =C-01) [ ] 2. 派 E-02 给另一模型(并行,互不冲突——不同项目) [ ] 3. 派 D-02 给 deepseek-v4-flash(半小时活) [ ] 4. 自己跑一遍 I-04 剩余部分或派给 glm-5.3-flash [ ] 5. 回收任意 PROGRESS,贴回来给我验收 ``` **注意**:一次最多 3 张并行(风险表 R18);C-01 与 E-02 分属不同项目,并行安全。 --- ## 四、可复制发令(今晚直接抄) ### C-01 ```text 你是执行模型。读取任务卡:C:\Users\12914\Desktop\vscode\PLANNING\tasks\C-01-路由代理冲突修复.md 按 C:\Users\12914\Desktop\vscode\PLANNING\03-执行协议.md 作业。 先读 chunyu_project_react 的 README 与 docs/页面健康检查报告.md,跑基线,再实施。 完成后写 PROGRESS_C-01.md 到项目根,附 73 路由回归输出。 ``` ### E-02 ```text 你是执行模型。读取任务卡:C:\Users\12914\Desktop\vscode\PLANNING\tasks\E-02-游客模式.md 按 C:\Users\12914\Desktop\vscode\PLANNING\03-执行协议.md 作业。 先读 english-drill README 与最近 2 份 AGI 迭代报告,跑基线(tests/e2e/run_e2e.py),再实施。 完成后写 PROGRESS_E-02.md,附游客路径 E2E 输出。 ``` ### D-02 ```text 你是执行模型。读取任务卡:C:\Users\12914\Desktop\vscode\PLANNING\tasks\D-02-PG并发测试环境.md 按 PLANNING/03-执行协议.md 作业。目标:激活 dealerhub 的 4 个 skipped 并发用例。 完成后写 PROGRESS_D-02.md 到 backend 根,附 4 用例 passed 原始输出。 ``` ### I-04(剩余部分) ```text 你是执行模型。读取任务卡:PLANNING\tasks\I-04-新模型入职评估.md 注意:题库/fixtures/判分器已预植入 evals/ 目录(勿重建),你的剩余任务是: ① 补 evals/tools/run_eval.py ② 用 glm-5.3-flash 与 deepseek-v4.1-flash 各跑一遍校准 ③ 补 Handoff Bundle 脚本 ④ 把接力协议补充进 03-执行协议.md ⑤ 回填 model-registry.json 的两个校准成绩 ``` --- ## 五、新模型到位当天(SOP) ```text 1. 复制 evals/ 到新模型会话,按 evals/README.md 跑六维(30-40 分钟) 2. 用 evals/tools/validate.py 判自动项;主观项交给一个已知合格模型打分 3. 成绩写入 PLANNING/model-registry.json(覆盖 scores,grade 按 scoring.md 换算) 4. 更新 01-模型分工矩阵.md 对应行 5. 派第一张低风险验证卡(建议 D-02 或 I-01 辅助位)观察真实交付 6. 合格 → 正式启用;不合格 → 降级/限场景 ```