113 lines
5.2 KiB
Markdown
113 lines
5.2 KiB
Markdown
# 07 · 作战计划 · 新模型窗口期(今晚起 11:00 前持续)
|
||
|
||
> 前提:新模型未到位,但**现有池子(已实测 glm/qwen/deepseek 系)完全够开工**。
|
||
> 本文档回答唯一问题:**现在,今晚,能干什么**。按顺序执行即可,不用等我。
|
||
|
||
---
|
||
|
||
## 一、窗口期优先级(按"现在就能做"排序)
|
||
|
||
### 第一梯队:今晚就能派给现有模型(不需要新模型)
|
||
|
||
| 顺序 | 卡片 | 派给谁 | 为什么现在 | 预计 |
|
||
|---|---|---|---|---|
|
||
| 1 | **I-04**(部分)| 你自己/任意模型 | 题库/fixtures/验证器**已经建好**(见下),只剩 runner 补充 | 1-2 小时 |
|
||
| 2 | **C-01** 路由修复 | glm-5.3-flash 或任意 A 级 | 不依赖新模型;半天见效 | 半天 |
|
||
| 3 | **E-02** 游客模式 | glm-5.3-flash / qwen3.8-flash | 同上,杠杆最大 | 1-2 天 |
|
||
| 4 | **D-02** PG 环境 | deepseek-v4-flash | 半小时的活,先清掉 | 0.5 天 |
|
||
| 5 | **I-01** 模型探测自动化 | deepseek-v4.1-flash | 新模型到位后正好用它跑全量画像 | 1-2 天 |
|
||
|
||
### 第二梯队:等你验收第一梯队后再放
|
||
|
||
- E-01 分享战报 → S-01 DSP 统一测试 → C-02 工具热榜
|
||
|
||
### 不该现在做的
|
||
|
||
- 所有依赖 S-03/D-01 设计类的重型卡(等 I-04 评估出 S 级模型画像后派更稳)
|
||
- I-03 调度器(虽然可以派,但优先让 I-04 先落地——调度器要调 registry)
|
||
|
||
---
|
||
|
||
## 二、I-04 已预植入的部分(今晚直接可用)
|
||
|
||
原 I-04 任务卡要求"建题库"。**题库 / fixtures / 判分器已由规划者建好**:
|
||
|
||
| 资产 | 路径 | 状态 |
|
||
|---|---|---|
|
||
| 六维题库(16 题) | `evals/questions/dim1~dim6-*.md` | ✅ 完成,含评分点 |
|
||
| dim4 fixture 工程 | `evals/fixtures/tooltask/`(calc.py + test_calc.py) | ✅ 实测:2 failures + 2 errors 基线 |
|
||
| dim3 长语料生成器 | `evals/assets/gen_longctx.py` | ✅ 实测:51,483 字符 / 153KB,三针三诱饵位置已校验 |
|
||
| dim3 语料成品 | `evals/assets/longctx-corpus.md` | ✅ 已生成 |
|
||
| 自动化判分器 | `evals/tools/validate.py` | ✅ 实测:dim1-q1/q3、dim2-q2 全绿(node 可用) |
|
||
| 评分表 | `evals/scoring.md` | ✅ 完成(36 分制 + 硬否决) |
|
||
| 运行协议 | `evals/README.md` | ✅ 完成 |
|
||
| 模型注册表 | `model-registry.json` | ✅ 13 模型预填,成绩待跑 |
|
||
|
||
**所以 I-04 剩余工作缩小为**:
|
||
1. 补 `evals/tools/run_eval.py`(串起 16 题 → 调用被测模型 → 收集回答 → 调 validate.py)
|
||
2. 跑 2 个已知模型校准(glm-5.3-flash、deepseek-v4.1-flash)
|
||
3. 补 Handoff Bundle 脚本 + 新模型入职 SOP 回填执行协议
|
||
|
||
---
|
||
|
||
## 三、今晚 11:00 前的执行清单(照做)
|
||
|
||
```text
|
||
[ ] 1. 派 C-01 给任一 A 级模型(用 05 模板 1,替换 <ID>=C-01)
|
||
[ ] 2. 派 E-02 给另一模型(并行,互不冲突——不同项目)
|
||
[ ] 3. 派 D-02 给 deepseek-v4-flash(半小时活)
|
||
[ ] 4. 自己跑一遍 I-04 剩余部分或派给 glm-5.3-flash
|
||
[ ] 5. 回收任意 PROGRESS,贴回来给我验收
|
||
```
|
||
|
||
**注意**:一次最多 3 张并行(风险表 R18);C-01 与 E-02 分属不同项目,并行安全。
|
||
|
||
---
|
||
|
||
## 四、可复制发令(今晚直接抄)
|
||
|
||
### C-01
|
||
```text
|
||
你是执行模型。读取任务卡:C:\Users\12914\Desktop\vscode\PLANNING\tasks\C-01-路由代理冲突修复.md
|
||
按 C:\Users\12914\Desktop\vscode\PLANNING\03-执行协议.md 作业。
|
||
先读 chunyu_project_react 的 README 与 docs/页面健康检查报告.md,跑基线,再实施。
|
||
完成后写 PROGRESS_C-01.md 到项目根,附 73 路由回归输出。
|
||
```
|
||
|
||
### E-02
|
||
```text
|
||
你是执行模型。读取任务卡:C:\Users\12914\Desktop\vscode\PLANNING\tasks\E-02-游客模式.md
|
||
按 C:\Users\12914\Desktop\vscode\PLANNING\03-执行协议.md 作业。
|
||
先读 english-drill README 与最近 2 份 AGI 迭代报告,跑基线(tests/e2e/run_e2e.py),再实施。
|
||
完成后写 PROGRESS_E-02.md,附游客路径 E2E 输出。
|
||
```
|
||
|
||
### D-02
|
||
```text
|
||
你是执行模型。读取任务卡:C:\Users\12914\Desktop\vscode\PLANNING\tasks\D-02-PG并发测试环境.md
|
||
按 PLANNING/03-执行协议.md 作业。目标:激活 dealerhub 的 4 个 skipped 并发用例。
|
||
完成后写 PROGRESS_D-02.md 到 backend 根,附 4 用例 passed 原始输出。
|
||
```
|
||
|
||
### I-04(剩余部分)
|
||
```text
|
||
你是执行模型。读取任务卡:PLANNING\tasks\I-04-新模型入职评估.md
|
||
注意:题库/fixtures/判分器已预植入 evals/ 目录(勿重建),你的剩余任务是:
|
||
① 补 evals/tools/run_eval.py ② 用 glm-5.3-flash 与 deepseek-v4.1-flash 各跑一遍校准
|
||
③ 补 Handoff Bundle 脚本 ④ 把接力协议补充进 03-执行协议.md
|
||
⑤ 回填 model-registry.json 的两个校准成绩
|
||
```
|
||
|
||
---
|
||
|
||
## 五、新模型到位当天(SOP)
|
||
|
||
```text
|
||
1. 复制 evals/ 到新模型会话,按 evals/README.md 跑六维(30-40 分钟)
|
||
2. 用 evals/tools/validate.py 判自动项;主观项交给一个已知合格模型打分
|
||
3. 成绩写入 PLANNING/model-registry.json(覆盖 scores,grade 按 scoring.md 换算)
|
||
4. 更新 01-模型分工矩阵.md 对应行
|
||
5. 派第一张低风险验证卡(建议 D-02 或 I-01 辅助位)观察真实交付
|
||
6. 合格 → 正式启用;不合格 → 降级/限场景
|
||
```
|