Files
vscode-workbench/PLANNING/README.md
T

6.0 KiB
Raw Blame History

规划中心(PLANNING)— 多模型协作总控

建立日期:2026-09-11 · 规划者:海鸥(规划师模式)· 执行者:DSH 模型池(glm / qwen / deepseek / kimi / MiniMax / gpt-5.6-luna / gemini-3.8 等) 模式:AGI 自驱 — 问题由规划者侦察确定,不等人喂需求。


一、这是什么

一套 「规划者 → 任务卡 → 执行模型 → 验收 → 回收」 的多模型协作体系。

  • 规划者(海鸥):侦察全资产、确定问题、排出优先级、切成可独立执行的任务卡。只做规划与验收,不抢执行模型的活。
  • 执行模型(DSH 池):一人一张任务卡,按卡执行到验收全绿,写 PROGRESS 交回。
  • 操作员(你):从任务总表挑卡 → 丢给指定模型 → 收 PROGRESS → 结算。

核心资产是 task-manifest.json(机器可读任务清单)+ tasks.py(调度器,已实测可用)。


二、目录结构

PLANNING/
├── README.md                 ← 本文件(索引 + 使用方法)
├── 00-全局路线图.md           ← 四阶段路线 M1–M4 + AGI 自定问题清单(含证据)
├── 01-模型分工矩阵.md         ← 模型池分级 + 派单规则 + 任务→模型映射
├── 02-任务总表.md             ← 全部 28 张任务卡的索引与状态
├── 03-执行协议.md             ← 执行模型必须遵守的作业规范(PROGRESS 格式/红线)
├── 04-补充任务与储备池.md      ← 第二批 6 卡定义 + 事件驱动卡 + 储备池状态
├── 05-派单提示词库.md         ← 7 个场景的复制粘贴派单模板
├── 06-风险登记表.md           ← 跨项目风险集中管理(19 项 + 应急预案)
├── 07-作战计划-窗口期.md       ← 新模型未到位时的立即执行清单(照做即可)
├── 08-运行手册.md             ← 稳态运营(每天/每周怎么跑,配合 tasks.py)
├── tasks.py                  ← 调度器(list/dispatch/bundle/collect/status,已实测)
├── model-registry.json       ← 模型能力档案(13 模型预填,评估成绩回填)
├── evals/                    ← 新模型入职评估(六维 16 题 + fixture + 判分器)
│   ├── README.md / scoring.md
│   ├── questions/dim1~dim6   ← 16 题(含评分点,勿发给被测模型)
│   ├── fixtures/tooltask/    ← dim4 迷你工程(实测基线 2 failures + 2 errors)
│   ├── assets/gen_longctx.py ← dim3 确定性语料生成器(51,483 字符已生成)
│   └── tools/validate.py     ← 自动判分器(已实测可用)
├── task-manifest.json        ← 机器可读任务清单(调度器输入,28 任务)
└── tasks/                    ← 任务卡(一卡一文件,独立可执行)
    ├── C-01 ~ C-07           可乐工具(7)
    ├── E-01 ~ E-07           EnglishDrill(7)
    ├── D-01 ~ D-04           dealerhub(4)
    ├── S-01 ~ S-03           DSP(3)
    ├── I-01 ~ I-04           基础设施(4)
    └── R-01 ~ R-03           预研(3,不碰代码,可立即并行)

三、怎么用(给操作员)

1. 打开 02-任务总表.md,按优先级挑一张卡(建议从 M1 里程碑的 5 张开始)
2. 把 tasks/XX.md 整卡内容发给任意模型:
   - 在 DSH 里开 subagent,选卡上「建议模型」
   - 或在任意客户端直接粘贴任务卡全文
3. 模型按 03-执行协议.md 作业,完成后在项目根写 PROGRESS_XX.md
4. 你把 PROGRESS 贴回来,由规划者(我)验收并更新总表状态
5. 全绿 → 标 done;失败 → 卡上补「失败记录」,换模型重派

给模型的最短发令(可直接复制):

你是执行模型。读取任务卡:<路径>。按 PLANNING/03-执行协议.md 的规范作业。
先读项目 README/AGENTS 与最近 PROGRESS,跑基线测试,再实施。
验收命令必须全绿方可交付,交付 = 代码 + PROGRESS 文件 + 命令输出摘要。

四、当前任务盘(28 张)

项目 P0 P1 合计 状态
可乐工具(chunyu) 4 4 8 全部待派
EnglishDrill 4 4 8 全部待派
dealerhub 2 3 5 全部待派
DSP 1 2 3 全部待派
基础设施 2 2 4 全部待派
合计 13 15 28 —

分批依据:第二批见 04-补充任务与储备池.md;第四批预研卡(R-*)不碰代码、零冲突、随时可并行。 新模型到位前:题库已备好(evals/),模型一到当天出画像。


五、里程碑速览

里程碑 目标日期 内容 出口标准
M1 止血修复 09-18 C-01 路由修复 + E-01 分享战报 + E-02 游客模式 + I-03 调度器 + I-04 新模型入职 可乐工具 73 路由回归绿;EnglishDrill 游客可答题;调度器能派单;评估题库就绪
M2 增长与体验 09-30 C-02/C-03/C-04 + E-03/E-04 + S-01 工具热榜上线;代码运行器可用;每日一题上线;DSP 统一 E2E
M3 流量与结构 10-15 C-05/C-06/C-07 + E-05/E-06/E-07 + D-01D-04 + S-03 + I-01 + R-01R-03 两个站有 SEO 产物;PWA/推送上线;租户+资金流+表单落地;推荐 v2;预研出结论
M4 收口运营 10-31 S-02 + I-02 + 新项目储备启动 CI/备份运转;全部 P0/P1 收口

六、红线(贯穿全体系)

  1. 任何模型不得伪造测试结果;跑不绿的就说跑不绿,附原始输出。
  2. 不提交密钥/.env/(服务器数据) 目录内容进任何仓库。
  3. 不删除既有测试;只许让它更绿。
  4. 不动任务卡「边界」里列出的文件。
  5. 一张卡只干一件事,不许夹带私货重构。