Files
vscode-workbench/PLANNING/01-模型分工矩阵.md
T

103 lines
6.1 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 01 · 模型分工矩阵
> 依据:`C:\Users\12914\.dsh\settings.yaml`(10 个 provider 分组 / 19+ 模型)+ `DSH模型能力测试报告.md` 实测结论。
> 诚实声明:仅 glm-5.3-flash / qwen3.8-flash 有完整实测记录(视觉✅ 思考✅);其余分级为命名惯例 + 分组渠道推断,由 I-01 任务实测校准后更新本表。
---
## 一、模型池清单(实盘)
| 分组 | 基地 | 模型 |
|---|---|---|
| b | `156.225.30.43:65423/bai/v1` | glm-5.3-flash、qwen3.8-flash、hy3、mimo-v2.5 |
| command-code | `api.commandcode.ai` | deepseek/deepseek-v4-flash、z-ai/glm-5.3-flash、xiaomi/mimo-v2.5、meituan/LongCat-2.0:free、poolside/laguna-s-2.1-free |
| lt-fl | `platform.lantian.pro` | glm-5.3-flash、qwen3.8-flash、kimi-k3、MiniMax-M3、deepseek-v4-flash |
| lt-th | 同上 | glm-5.3-flash、MiniMax-M3 |
| lt-zya | 同上 | gpt-5.6-luna |
| zy | 同上 | gemini-3.8-flash |
| lt-fll | 同上 | glm-5.3-flash |
| ginka | 同上 | deepseek-v4-flash |
| zz | 同上 | glm-5.3-flash |
| cc | 同上 | deepseek/deepseek-v4-flash-vision-exp、deepseek/deepseek-v4.1-flash |
---
## 二、能力分级(S/A/B/C)
### S 级 — 疑难与架构(限量使用)
| 模型 | 定位 | 派给什么 | 不派给什么 |
|---|---|---|---|
| **gpt-5.6-luna**(lt-zya) | 池内最强推理 | 架构决策、跨模块疑难 bug、安全审查(沙箱/越权)、调度器设计 | 大批量代码搬运(浪费) |
### A 级 — 主力编码与推理
| 模型 | 定位 | 派给什么 |
|---|---|---|
| **deepseek-v4.1-flash**(cc) | 主力编码 | 功能实现、重构、SSR 改造、复杂前端逻辑 |
| **deepseek-v4-flash**(lt-fl/ginka/cc) | 批量编码 | 脚本、CI、测试补齐、部署脚本 |
| **kimi-k3**(lt-fl) | 超长上下文 | 全库审计、跨文件一致性核查、文档提取 |
| **qwen3.8-flash**(b/lt-fl) | 推理密集(1M ctx) | 测试用例设计、边界分析、回归矩阵 |
### B 级 — 通用执行
| 模型 | 定位 | 派给什么 |
|---|---|---|
| **glm-5.3-flash**(b/command-code/lt-fl/lt-th/lt-fll/zz) | 万金油 | 中等功能、回归执行、PROGRESS 整理、文档 |
| **MiniMax-M3**(lt-fl/lt-th) | 通用 | 中等任务、前端组件 |
| **gemini-3.8-flash**(zy) | 视觉/多模态 | UI 验收、截图分析、设计稿对照 |
| **deepseek-v4-flash-vision-exp**(cc) | 视觉实验 | 图片链路验证、Canvas 产物检查 |
### C 级 — 免费池(草稿与批量)
| 模型 | 定位 | 派给什么 |
|---|---|---|
| **hy3 / mimo-v2.5 / LongCat-2.0 / laguna-s-2.1** | 免费额度 | 草稿、注释补全、低风险批量文本、数据集生成 |
---
## 三、派单规则(强制)
1. **关键路径任务**(M1 里程碑)必须用 A 级及以上;C 级只做辅助产出。
2. **视觉验收**(UI/Canvas/截图类验收)必须挂一个视觉模型(gemini-3.8-flash 优先)。
3. **安全敏感**(沙箱、执行器、鉴权改造)必须加一道 gpt-5.6-luna 审查。
4. **长文档全库核查**(如"73 路由逐条回归"的代码侧核查)用 kimi-k3 / qwen3.8-flash。
5. **一卡一模型主执行 + 一模型复核**;复核模型不得与被复核模型同源分组。
6. 免费池消耗不计数,但**验收标准不因模型免费而降低**。
7. 模型实测能力与执行表现,由 I-01 采集并回写本表——**本表是活的**。
---
## 四、任务 → 模型映射
| 任务 | 主执行 | 复核/辅助 | 理由 |
|---|---|---|---|
| C-01 路由修复 | deepseek-v4.1-flash | glm-5.3-flash(73 路由回归) | 精确重构 + 大批量回归 |
| C-02 工具热榜 | deepseek-v4.1-flash | qwen3.8-flash(边界用例) | 全栈功能 + 时间窗边界 |
| C-03 代码运行器 | deepseek-v4.1-flash | **gpt-5.6-luna(沙箱审查)** | 执行环境安全第一 |
| C-04 AI 工具四件套 | deepseek-v4.1-flash | gemini-3.8-flash(图像质量验收) | 图像链路 |
| C-05 SEO 预渲染 | deepseek-v4.1-flash | kimi-k3(全页 meta 核查) | 构建改造 + 全量核查 |
| C-06 关注 feed 等 | glm-5.3-flash | qwen3.8-flash | 三个小功能接线 |
| E-01 分享战报 | deepseek-v4.1-flash | gemini-3.8-flash(Canvas 出图验收) | 后端聚合 + Canvas |
| E-02 游客模式 | deepseek-v4.1-flash | qwen3.8-flash(迁移用例) | 守卫改造 + 数据迁移 |
| E-03 每日一题 | glm-5.3-flash | qwen3.8-flash(哈希/并发) | 中等功能 |
| E-04 引导+倒计时 | glm-5.3-flash | — | 轻量前端 + 两字段 |
| E-05 公开内容页 | deepseek-v4.1-flash | kimi-k3 | SSR/预渲染改造 |
| D-01 租户成员关系 | **gpt-5.6-luna(设计)** → deepseek-v4.1-flash(实现) | glm-5.3-flash(回归) | 授权模型先设计后编码 |
| D-02 PG 并发环境 | deepseek-v4-flash | — | 环境脚本 |
| S-01 DSP 测试基建 | deepseek-v4.1-flash | qwen3.8-flash(用例设计) | 移植 harness |
| S-02 DSP 部署基线 | deepseek-v4-flash | — | Docker/脚本 |
| I-01 模型探测自动化 | deepseek-v4.1-flash | glm-5.3-flash | 脚本 + 报告 |
| I-02 CI + 备份 | deepseek-v4-flash | — | 基建脚本 |
| I-03 任务调度器 | **已预植入参考实现** → deepseek-v4.1-flash(复核完善) | — | 参考实现已实测,任务降级为复核 |
| I-04 新模型入职评估 | deepseek-v4.1-flash | gpt-5.6-luna(评估标准审定) | 题库已预植入,剩 runner+校准 |
| R-01 商业化预研 | kimi-k3 | qwen3.8-flash | 长文调研 |
| R-02 行业切入预研 | kimi-k3 | glm-5.3-flash | 长文调研 |
| R-03 AI 选型预研 | qwen3.8-flash | kimi-k3 | 技术选型 |
| D-04 前端表单校验 | glm-5.3-flash | deepseek-v4.1-flash | 前端为主 |
---
## 五、上下文投喂规范(每个模型开工前给什么)
1. **必给**:任务卡全文 + `03-执行协议.md`。
2. **项目侧**:项目 README + 最近 2 份 PROGRESS/迭代报告 + 相关源码文件清单。
3. **不给**:其他任务的卡(防止串味);`(服务器数据)` 目录任何内容;密钥。
4. **长任务**:超过单次会话预算时,模型先交"阶段报告 + 断点",由调度器续派第二阶段。