Files
vscode-workbench/PLANNING/01-模型分工矩阵.md
T

6.1 KiB
Raw Blame History

01 · 模型分工矩阵

依据:C:\Users\12914\.dsh\settings.yaml(10 个 provider 分组 / 19+ 模型)+ DSH模型能力测试报告.md 实测结论。 诚实声明:仅 glm-5.3-flash / qwen3.8-flash 有完整实测记录(视觉✅ 思考✅);其余分级为命名惯例 + 分组渠道推断,由 I-01 任务实测校准后更新本表。


一、模型池清单(实盘)

分组 基地 模型
b 156.225.30.43:65423/bai/v1 glm-5.3-flash、qwen3.8-flash、hy3、mimo-v2.5
command-code api.commandcode.ai deepseek/deepseek-v4-flash、z-ai/glm-5.3-flash、xiaomi/mimo-v2.5、meituan/LongCat-2.0:free、poolside/laguna-s-2.1-free
lt-fl platform.lantian.pro glm-5.3-flash、qwen3.8-flash、kimi-k3、MiniMax-M3、deepseek-v4-flash
lt-th 同上 glm-5.3-flash、MiniMax-M3
lt-zya 同上 gpt-5.6-luna
zy 同上 gemini-3.8-flash
lt-fll 同上 glm-5.3-flash
ginka 同上 deepseek-v4-flash
zz 同上 glm-5.3-flash
cc 同上 deepseek/deepseek-v4-flash-vision-exp、deepseek/deepseek-v4.1-flash

二、能力分级(S/A/B/C)

S 级 — 疑难与架构(限量使用)

模型 定位 派给什么 不派给什么
gpt-5.6-luna(lt-zya) 池内最强推理 架构决策、跨模块疑难 bug、安全审查(沙箱/越权)、调度器设计 大批量代码搬运(浪费)

A 级 — 主力编码与推理

模型 定位 派给什么
deepseek-v4.1-flash(cc) 主力编码 功能实现、重构、SSR 改造、复杂前端逻辑
deepseek-v4-flash(lt-fl/ginka/cc) 批量编码 脚本、CI、测试补齐、部署脚本
kimi-k3(lt-fl) 超长上下文 全库审计、跨文件一致性核查、文档提取
qwen3.8-flash(b/lt-fl) 推理密集(1M ctx) 测试用例设计、边界分析、回归矩阵

B 级 — 通用执行

模型 定位 派给什么
glm-5.3-flash(b/command-code/lt-fl/lt-th/lt-fll/zz) 万金油 中等功能、回归执行、PROGRESS 整理、文档
MiniMax-M3(lt-fl/lt-th) 通用 中等任务、前端组件
gemini-3.8-flash(zy) 视觉/多模态 UI 验收、截图分析、设计稿对照
deepseek-v4-flash-vision-exp(cc) 视觉实验 图片链路验证、Canvas 产物检查

C 级 — 免费池(草稿与批量)

模型 定位 派给什么
hy3 / mimo-v2.5 / LongCat-2.0 / laguna-s-2.1 免费额度 草稿、注释补全、低风险批量文本、数据集生成

三、派单规则(强制)

  1. 关键路径任务(M1 里程碑)必须用 A 级及以上;C 级只做辅助产出。
  2. 视觉验收(UI/Canvas/截图类验收)必须挂一个视觉模型(gemini-3.8-flash 优先)。
  3. 安全敏感(沙箱、执行器、鉴权改造)必须加一道 gpt-5.6-luna 审查。
  4. 长文档全库核查(如"73 路由逐条回归"的代码侧核查)用 kimi-k3 / qwen3.8-flash。
  5. 一卡一模型主执行 + 一模型复核;复核模型不得与被复核模型同源分组。
  6. 免费池消耗不计数,但验收标准不因模型免费而降低。
  7. 模型实测能力与执行表现,由 I-01 采集并回写本表——本表是活的。

四、任务 → 模型映射

任务 主执行 复核/辅助 理由
C-01 路由修复 deepseek-v4.1-flash glm-5.3-flash(73 路由回归) 精确重构 + 大批量回归
C-02 工具热榜 deepseek-v4.1-flash qwen3.8-flash(边界用例) 全栈功能 + 时间窗边界
C-03 代码运行器 deepseek-v4.1-flash gpt-5.6-luna(沙箱审查) 执行环境安全第一
C-04 AI 工具四件套 deepseek-v4.1-flash gemini-3.8-flash(图像质量验收) 图像链路
C-05 SEO 预渲染 deepseek-v4.1-flash kimi-k3(全页 meta 核查) 构建改造 + 全量核查
C-06 关注 feed 等 glm-5.3-flash qwen3.8-flash 三个小功能接线
E-01 分享战报 deepseek-v4.1-flash gemini-3.8-flash(Canvas 出图验收) 后端聚合 + Canvas
E-02 游客模式 deepseek-v4.1-flash qwen3.8-flash(迁移用例) 守卫改造 + 数据迁移
E-03 每日一题 glm-5.3-flash qwen3.8-flash(哈希/并发) 中等功能
E-04 引导+倒计时 glm-5.3-flash — 轻量前端 + 两字段
E-05 公开内容页 deepseek-v4.1-flash kimi-k3 SSR/预渲染改造
D-01 租户成员关系 gpt-5.6-luna(设计) → deepseek-v4.1-flash(实现) glm-5.3-flash(回归) 授权模型先设计后编码
D-02 PG 并发环境 deepseek-v4-flash — 环境脚本
S-01 DSP 测试基建 deepseek-v4.1-flash qwen3.8-flash(用例设计) 移植 harness
S-02 DSP 部署基线 deepseek-v4-flash — Docker/脚本
I-01 模型探测自动化 deepseek-v4.1-flash glm-5.3-flash 脚本 + 报告
I-02 CI + 备份 deepseek-v4-flash — 基建脚本
I-03 任务调度器 已预植入参考实现 → deepseek-v4.1-flash(复核完善) — 参考实现已实测,任务降级为复核
I-04 新模型入职评估 deepseek-v4.1-flash gpt-5.6-luna(评估标准审定) 题库已预植入,剩 runner+校准
R-01 商业化预研 kimi-k3 qwen3.8-flash 长文调研
R-02 行业切入预研 kimi-k3 glm-5.3-flash 长文调研
R-03 AI 选型预研 qwen3.8-flash kimi-k3 技术选型
D-04 前端表单校验 glm-5.3-flash deepseek-v4.1-flash 前端为主

五、上下文投喂规范(每个模型开工前给什么)

  1. 必给:任务卡全文 + 03-执行协议.md。
  2. 项目侧:项目 README + 最近 2 份 PROGRESS/迭代报告 + 相关源码文件清单。
  3. 不给:其他任务的卡(防止串味);(服务器数据) 目录任何内容;密钥。
  4. 长任务:超过单次会话预算时,模型先交"阶段报告 + 断点",由调度器续派第二阶段。