规划中心(PLANNING)— 多模型协作总控
建立日期:2026-09-11 · 规划者:海鸥(规划师模式)· 执行者:DSH 模型池(glm / qwen / deepseek / kimi / MiniMax / gpt-5.6-luna / gemini-3.8 等) 模式:AGI 自驱 — 问题由规划者侦察确定,不等人喂需求。
一、这是什么
一套 「规划者 → 任务卡 → 执行模型 → 验收 → 回收」 的多模型协作体系。
- 规划者(海鸥):侦察全资产、确定问题、排出优先级、切成可独立执行的任务卡。只做规划与验收,不抢执行模型的活。
- 执行模型(DSH 池):一人一张任务卡,按卡执行到验收全绿,写 PROGRESS 交回。
- 操作员(你):从任务总表挑卡 → 丢给指定模型 → 收 PROGRESS → 结算。
核心资产是 task-manifest.json(机器可读任务清单)+ tasks.py(调度器,已实测可用)。
二、目录结构
PLANNING/
├── README.md ← 本文件(索引 + 使用方法)
├── 00-全局路线图.md ← 四阶段路线 M1–M4 + AGI 自定问题清单(含证据)
├── 01-模型分工矩阵.md ← 模型池分级 + 派单规则 + 任务→模型映射
├── 02-任务总表.md ← 全部 28 张任务卡的索引与状态
├── 03-执行协议.md ← 执行模型必须遵守的作业规范(PROGRESS 格式/红线)
├── 04-补充任务与储备池.md ← 第二批 6 卡定义 + 事件驱动卡 + 储备池状态
├── 05-派单提示词库.md ← 7 个场景的复制粘贴派单模板
├── 06-风险登记表.md ← 跨项目风险集中管理(19 项 + 应急预案)
├── 07-作战计划-窗口期.md ← 新模型未到位时的立即执行清单(照做即可)
├── 08-运行手册.md ← 稳态运营(每天/每周怎么跑,配合 tasks.py)
├── tasks.py ← 调度器(list/dispatch/bundle/collect/status,已实测)
├── model-registry.json ← 模型能力档案(13 模型预填,评估成绩回填)
├── evals/ ← 新模型入职评估(六维 16 题 + fixture + 判分器)
│ ├── README.md / scoring.md
│ ├── questions/dim1~dim6 ← 16 题(含评分点,勿发给被测模型)
│ ├── fixtures/tooltask/ ← dim4 迷你工程(实测基线 2 failures + 2 errors)
│ ├── assets/gen_longctx.py ← dim3 确定性语料生成器(51,483 字符已生成)
│ └── tools/validate.py ← 自动判分器(已实测可用)
├── task-manifest.json ← 机器可读任务清单(调度器输入,28 任务)
└── tasks/ ← 任务卡(一卡一文件,独立可执行)
├── C-01 ~ C-07 可乐工具(7)
├── E-01 ~ E-07 EnglishDrill(7)
├── D-01 ~ D-04 dealerhub(4)
├── S-01 ~ S-03 DSP(3)
├── I-01 ~ I-04 基础设施(4)
└── R-01 ~ R-03 预研(3,不碰代码,可立即并行)
三、怎么用(给操作员)
1. 打开 02-任务总表.md,按优先级挑一张卡(建议从 M1 里程碑的 5 张开始)
2. 把 tasks/XX.md 整卡内容发给任意模型:
- 在 DSH 里开 subagent,选卡上「建议模型」
- 或在任意客户端直接粘贴任务卡全文
3. 模型按 03-执行协议.md 作业,完成后在项目根写 PROGRESS_XX.md
4. 你把 PROGRESS 贴回来,由规划者(我)验收并更新总表状态
5. 全绿 → 标 done;失败 → 卡上补「失败记录」,换模型重派
给模型的最短发令(可直接复制):
你是执行模型。读取任务卡:<路径>。按 PLANNING/03-执行协议.md 的规范作业。
先读项目 README/AGENTS 与最近 PROGRESS,跑基线测试,再实施。
验收命令必须全绿方可交付,交付 = 代码 + PROGRESS 文件 + 命令输出摘要。
四、当前任务盘(28 张)
| 项目 | P0 | P1 | 合计 | 状态 |
|---|---|---|---|---|
| 可乐工具(chunyu) | 4 | 4 | 8 | 全部待派 |
| EnglishDrill | 4 | 4 | 8 | 全部待派 |
| dealerhub | 2 | 3 | 5 | 全部待派 |
| DSP | 1 | 2 | 3 | 全部待派 |
| 基础设施 | 2 | 2 | 4 | 全部待派 |
| 合计 | 13 | 15 | 28 | — |
分批依据:第二批见
04-补充任务与储备池.md;第四批预研卡(R-*)不碰代码、零冲突、随时可并行。 新模型到位前:题库已备好(evals/),模型一到当天出画像。
五、里程碑速览
| 里程碑 | 目标日期 | 内容 | 出口标准 |
|---|---|---|---|
| M1 止血修复 | 09-18 | C-01 路由修复 + E-01 分享战报 + E-02 游客模式 + I-03 调度器 + I-04 新模型入职 | 可乐工具 73 路由回归绿;EnglishDrill 游客可答题;调度器能派单;评估题库就绪 |
| M2 增长与体验 | 09-30 | C-02/C-03/C-04 + E-03/E-04 + S-01 | 工具热榜上线;代码运行器可用;每日一题上线;DSP 统一 E2E |
| M3 流量与结构 | 10-15 | C-05/C-06/C-07 + E-05/E-06/E-07 + D-01 |
两个站有 SEO 产物;PWA/推送上线;租户+资金流+表单落地;推荐 v2;预研出结论 |
| M4 收口运营 | 10-31 | S-02 + I-02 + 新项目储备启动 | CI/备份运转;全部 P0/P1 收口 |
六、红线(贯穿全体系)
- 任何模型不得伪造测试结果;跑不绿的就说跑不绿,附原始输出。
- 不提交密钥/
.env/(服务器数据)目录内容进任何仓库。 - 不删除既有测试;只许让它更绿。
- 不动任务卡「边界」里列出的文件。
- 一张卡只干一件事,不许夹带私货重构。