103 lines
6.1 KiB
Markdown
103 lines
6.1 KiB
Markdown
# 01 · 模型分工矩阵
|
||
|
||
> 依据:`C:\Users\12914\.dsh\settings.yaml`(10 个 provider 分组 / 19+ 模型)+ `DSH模型能力测试报告.md` 实测结论。
|
||
> 诚实声明:仅 glm-5.3-flash / qwen3.8-flash 有完整实测记录(视觉✅ 思考✅);其余分级为命名惯例 + 分组渠道推断,由 I-01 任务实测校准后更新本表。
|
||
|
||
---
|
||
|
||
## 一、模型池清单(实盘)
|
||
|
||
| 分组 | 基地 | 模型 |
|
||
|---|---|---|
|
||
| b | `156.225.30.43:65423/bai/v1` | glm-5.3-flash、qwen3.8-flash、hy3、mimo-v2.5 |
|
||
| command-code | `api.commandcode.ai` | deepseek/deepseek-v4-flash、z-ai/glm-5.3-flash、xiaomi/mimo-v2.5、meituan/LongCat-2.0:free、poolside/laguna-s-2.1-free |
|
||
| lt-fl | `platform.lantian.pro` | glm-5.3-flash、qwen3.8-flash、kimi-k3、MiniMax-M3、deepseek-v4-flash |
|
||
| lt-th | 同上 | glm-5.3-flash、MiniMax-M3 |
|
||
| lt-zya | 同上 | gpt-5.6-luna |
|
||
| zy | 同上 | gemini-3.8-flash |
|
||
| lt-fll | 同上 | glm-5.3-flash |
|
||
| ginka | 同上 | deepseek-v4-flash |
|
||
| zz | 同上 | glm-5.3-flash |
|
||
| cc | 同上 | deepseek/deepseek-v4-flash-vision-exp、deepseek/deepseek-v4.1-flash |
|
||
|
||
---
|
||
|
||
## 二、能力分级(S/A/B/C)
|
||
|
||
### S 级 — 疑难与架构(限量使用)
|
||
| 模型 | 定位 | 派给什么 | 不派给什么 |
|
||
|---|---|---|---|
|
||
| **gpt-5.6-luna**(lt-zya) | 池内最强推理 | 架构决策、跨模块疑难 bug、安全审查(沙箱/越权)、调度器设计 | 大批量代码搬运(浪费) |
|
||
|
||
### A 级 — 主力编码与推理
|
||
| 模型 | 定位 | 派给什么 |
|
||
|---|---|---|
|
||
| **deepseek-v4.1-flash**(cc) | 主力编码 | 功能实现、重构、SSR 改造、复杂前端逻辑 |
|
||
| **deepseek-v4-flash**(lt-fl/ginka/cc) | 批量编码 | 脚本、CI、测试补齐、部署脚本 |
|
||
| **kimi-k3**(lt-fl) | 超长上下文 | 全库审计、跨文件一致性核查、文档提取 |
|
||
| **qwen3.8-flash**(b/lt-fl) | 推理密集(1M ctx) | 测试用例设计、边界分析、回归矩阵 |
|
||
|
||
### B 级 — 通用执行
|
||
| 模型 | 定位 | 派给什么 |
|
||
|---|---|---|
|
||
| **glm-5.3-flash**(b/command-code/lt-fl/lt-th/lt-fll/zz) | 万金油 | 中等功能、回归执行、PROGRESS 整理、文档 |
|
||
| **MiniMax-M3**(lt-fl/lt-th) | 通用 | 中等任务、前端组件 |
|
||
| **gemini-3.8-flash**(zy) | 视觉/多模态 | UI 验收、截图分析、设计稿对照 |
|
||
| **deepseek-v4-flash-vision-exp**(cc) | 视觉实验 | 图片链路验证、Canvas 产物检查 |
|
||
|
||
### C 级 — 免费池(草稿与批量)
|
||
| 模型 | 定位 | 派给什么 |
|
||
|---|---|---|
|
||
| **hy3 / mimo-v2.5 / LongCat-2.0 / laguna-s-2.1** | 免费额度 | 草稿、注释补全、低风险批量文本、数据集生成 |
|
||
|
||
---
|
||
|
||
## 三、派单规则(强制)
|
||
|
||
1. **关键路径任务**(M1 里程碑)必须用 A 级及以上;C 级只做辅助产出。
|
||
2. **视觉验收**(UI/Canvas/截图类验收)必须挂一个视觉模型(gemini-3.8-flash 优先)。
|
||
3. **安全敏感**(沙箱、执行器、鉴权改造)必须加一道 gpt-5.6-luna 审查。
|
||
4. **长文档全库核查**(如"73 路由逐条回归"的代码侧核查)用 kimi-k3 / qwen3.8-flash。
|
||
5. **一卡一模型主执行 + 一模型复核**;复核模型不得与被复核模型同源分组。
|
||
6. 免费池消耗不计数,但**验收标准不因模型免费而降低**。
|
||
7. 模型实测能力与执行表现,由 I-01 采集并回写本表——**本表是活的**。
|
||
|
||
---
|
||
|
||
## 四、任务 → 模型映射
|
||
|
||
| 任务 | 主执行 | 复核/辅助 | 理由 |
|
||
|---|---|---|---|
|
||
| C-01 路由修复 | deepseek-v4.1-flash | glm-5.3-flash(73 路由回归) | 精确重构 + 大批量回归 |
|
||
| C-02 工具热榜 | deepseek-v4.1-flash | qwen3.8-flash(边界用例) | 全栈功能 + 时间窗边界 |
|
||
| C-03 代码运行器 | deepseek-v4.1-flash | **gpt-5.6-luna(沙箱审查)** | 执行环境安全第一 |
|
||
| C-04 AI 工具四件套 | deepseek-v4.1-flash | gemini-3.8-flash(图像质量验收) | 图像链路 |
|
||
| C-05 SEO 预渲染 | deepseek-v4.1-flash | kimi-k3(全页 meta 核查) | 构建改造 + 全量核查 |
|
||
| C-06 关注 feed 等 | glm-5.3-flash | qwen3.8-flash | 三个小功能接线 |
|
||
| E-01 分享战报 | deepseek-v4.1-flash | gemini-3.8-flash(Canvas 出图验收) | 后端聚合 + Canvas |
|
||
| E-02 游客模式 | deepseek-v4.1-flash | qwen3.8-flash(迁移用例) | 守卫改造 + 数据迁移 |
|
||
| E-03 每日一题 | glm-5.3-flash | qwen3.8-flash(哈希/并发) | 中等功能 |
|
||
| E-04 引导+倒计时 | glm-5.3-flash | — | 轻量前端 + 两字段 |
|
||
| E-05 公开内容页 | deepseek-v4.1-flash | kimi-k3 | SSR/预渲染改造 |
|
||
| D-01 租户成员关系 | **gpt-5.6-luna(设计)** → deepseek-v4.1-flash(实现) | glm-5.3-flash(回归) | 授权模型先设计后编码 |
|
||
| D-02 PG 并发环境 | deepseek-v4-flash | — | 环境脚本 |
|
||
| S-01 DSP 测试基建 | deepseek-v4.1-flash | qwen3.8-flash(用例设计) | 移植 harness |
|
||
| S-02 DSP 部署基线 | deepseek-v4-flash | — | Docker/脚本 |
|
||
| I-01 模型探测自动化 | deepseek-v4.1-flash | glm-5.3-flash | 脚本 + 报告 |
|
||
| I-02 CI + 备份 | deepseek-v4-flash | — | 基建脚本 |
|
||
| I-03 任务调度器 | **已预植入参考实现** → deepseek-v4.1-flash(复核完善) | — | 参考实现已实测,任务降级为复核 |
|
||
| I-04 新模型入职评估 | deepseek-v4.1-flash | gpt-5.6-luna(评估标准审定) | 题库已预植入,剩 runner+校准 |
|
||
| R-01 商业化预研 | kimi-k3 | qwen3.8-flash | 长文调研 |
|
||
| R-02 行业切入预研 | kimi-k3 | glm-5.3-flash | 长文调研 |
|
||
| R-03 AI 选型预研 | qwen3.8-flash | kimi-k3 | 技术选型 |
|
||
| D-04 前端表单校验 | glm-5.3-flash | deepseek-v4.1-flash | 前端为主 |
|
||
|
||
---
|
||
|
||
## 五、上下文投喂规范(每个模型开工前给什么)
|
||
|
||
1. **必给**:任务卡全文 + `03-执行协议.md`。
|
||
2. **项目侧**:项目 README + 最近 2 份 PROGRESS/迭代报告 + 相关源码文件清单。
|
||
3. **不给**:其他任务的卡(防止串味);`(服务器数据)` 目录任何内容;密钥。
|
||
4. **长任务**:超过单次会话预算时,模型先交"阶段报告 + 断点",由调度器续派第二阶段。
|