5.2 KiB
5.2 KiB
07 · 作战计划 · 新模型窗口期(今晚起 11:00 前持续)
前提:新模型未到位,但现有池子(已实测 glm/qwen/deepseek 系)完全够开工。 本文档回答唯一问题:现在,今晚,能干什么。按顺序执行即可,不用等我。
一、窗口期优先级(按"现在就能做"排序)
第一梯队:今晚就能派给现有模型(不需要新模型)
| 顺序 | 卡片 | 派给谁 | 为什么现在 | 预计 |
|---|---|---|---|---|
| 1 | I-04(部分) | 你自己/任意模型 | 题库/fixtures/验证器已经建好(见下),只剩 runner 补充 | 1-2 小时 |
| 2 | C-01 路由修复 | glm-5.3-flash 或任意 A 级 | 不依赖新模型;半天见效 | 半天 |
| 3 | E-02 游客模式 | glm-5.3-flash / qwen3.8-flash | 同上,杠杆最大 | 1-2 天 |
| 4 | D-02 PG 环境 | deepseek-v4-flash | 半小时的活,先清掉 | 0.5 天 |
| 5 | I-01 模型探测自动化 | deepseek-v4.1-flash | 新模型到位后正好用它跑全量画像 | 1-2 天 |
第二梯队:等你验收第一梯队后再放
- E-01 分享战报 → S-01 DSP 统一测试 → C-02 工具热榜
不该现在做的
- 所有依赖 S-03/D-01 设计类的重型卡(等 I-04 评估出 S 级模型画像后派更稳)
- I-03 调度器(虽然可以派,但优先让 I-04 先落地——调度器要调 registry)
二、I-04 已预植入的部分(今晚直接可用)
原 I-04 任务卡要求"建题库"。题库 / fixtures / 判分器已由规划者建好:
| 资产 | 路径 | 状态 |
|---|---|---|
| 六维题库(16 题) | evals/questions/dim1~dim6-*.md |
✅ 完成,含评分点 |
| dim4 fixture 工程 | evals/fixtures/tooltask/(calc.py + test_calc.py) |
✅ 实测:2 failures + 2 errors 基线 |
| dim3 长语料生成器 | evals/assets/gen_longctx.py |
✅ 实测:51,483 字符 / 153KB,三针三诱饵位置已校验 |
| dim3 语料成品 | evals/assets/longctx-corpus.md |
✅ 已生成 |
| 自动化判分器 | evals/tools/validate.py |
✅ 实测:dim1-q1/q3、dim2-q2 全绿(node 可用) |
| 评分表 | evals/scoring.md |
✅ 完成(36 分制 + 硬否决) |
| 运行协议 | evals/README.md |
✅ 完成 |
| 模型注册表 | model-registry.json |
✅ 13 模型预填,成绩待跑 |
所以 I-04 剩余工作缩小为:
- 补
evals/tools/run_eval.py(串起 16 题 → 调用被测模型 → 收集回答 → 调 validate.py) - 跑 2 个已知模型校准(glm-5.3-flash、deepseek-v4.1-flash)
- 补 Handoff Bundle 脚本 + 新模型入职 SOP 回填执行协议
三、今晚 11:00 前的执行清单(照做)
[ ] 1. 派 C-01 给任一 A 级模型(用 05 模板 1,替换 <ID>=C-01)
[ ] 2. 派 E-02 给另一模型(并行,互不冲突——不同项目)
[ ] 3. 派 D-02 给 deepseek-v4-flash(半小时活)
[ ] 4. 自己跑一遍 I-04 剩余部分或派给 glm-5.3-flash
[ ] 5. 回收任意 PROGRESS,贴回来给我验收
注意:一次最多 3 张并行(风险表 R18);C-01 与 E-02 分属不同项目,并行安全。
四、可复制发令(今晚直接抄)
C-01
你是执行模型。读取任务卡:C:\Users\12914\Desktop\vscode\PLANNING\tasks\C-01-路由代理冲突修复.md
按 C:\Users\12914\Desktop\vscode\PLANNING\03-执行协议.md 作业。
先读 chunyu_project_react 的 README 与 docs/页面健康检查报告.md,跑基线,再实施。
完成后写 PROGRESS_C-01.md 到项目根,附 73 路由回归输出。
E-02
你是执行模型。读取任务卡:C:\Users\12914\Desktop\vscode\PLANNING\tasks\E-02-游客模式.md
按 C:\Users\12914\Desktop\vscode\PLANNING\03-执行协议.md 作业。
先读 english-drill README 与最近 2 份 AGI 迭代报告,跑基线(tests/e2e/run_e2e.py),再实施。
完成后写 PROGRESS_E-02.md,附游客路径 E2E 输出。
D-02
你是执行模型。读取任务卡:C:\Users\12914\Desktop\vscode\PLANNING\tasks\D-02-PG并发测试环境.md
按 PLANNING/03-执行协议.md 作业。目标:激活 dealerhub 的 4 个 skipped 并发用例。
完成后写 PROGRESS_D-02.md 到 backend 根,附 4 用例 passed 原始输出。
I-04(剩余部分)
你是执行模型。读取任务卡:PLANNING\tasks\I-04-新模型入职评估.md
注意:题库/fixtures/判分器已预植入 evals/ 目录(勿重建),你的剩余任务是:
① 补 evals/tools/run_eval.py ② 用 glm-5.3-flash 与 deepseek-v4.1-flash 各跑一遍校准
③ 补 Handoff Bundle 脚本 ④ 把接力协议补充进 03-执行协议.md
⑤ 回填 model-registry.json 的两个校准成绩
五、新模型到位当天(SOP)
1. 复制 evals/ 到新模型会话,按 evals/README.md 跑六维(30-40 分钟)
2. 用 evals/tools/validate.py 判自动项;主观项交给一个已知合格模型打分
3. 成绩写入 PLANNING/model-registry.json(覆盖 scores,grade 按 scoring.md 换算)
4. 更新 01-模型分工矩阵.md 对应行
5. 派第一张低风险验证卡(建议 D-02 或 I-01 辅助位)观察真实交付
6. 合格 → 正式启用;不合格 → 降级/限场景