87 lines
5.5 KiB
Markdown
87 lines
5.5 KiB
Markdown
# DeepSeek Harness 模型能力测试报告(2026-09-06)
|
||
|
||
## 附言:插件破坏事故与修复(2026-09-08)
|
||
|
||
**事故**:`dsh-client-ui-model-capabilities` 插件旧版的"思考/多模态开关"与"一键开启所有"
|
||
采用覆盖式写入(off=直接删除 `reasoningEfforts` 与 `thinkingFormat`;batch=全量改写为
|
||
`{off,low,high}` + 强制 zai),导致两处实测结论被破坏:
|
||
|
||
1. **lt-fl/qwen3.8-flash**:丢失 `medium` 档与 `high→xhigh` 映射、被强制 zai(本网关拒绝
|
||
`thinking.type`,只认 `enable_thinking`+`reasoning_effort low/medium/xhigh`)→ 已按
|
||
2026-09-06 探测结论恢复为 `thinkingFormat: qwen` + `off/low/medium/high: xhigh`。
|
||
**2026-09-10 复测通过**:`{enable_thinking:true, reasoning_effort:xhigh}` ✅ 200 返回
|
||
reasoning;`{enable_thinking:true, reasoning_effort:medium}` ✅ 200 返回 reasoning;
|
||
`{enable_thinking:false}`(off档)✅ 200 但上游仍返回 reasoning(同 09-06 结论:
|
||
该网关 qwen 无真正关闭档,off 只保证不发 thinking.type 不报 400)。zai 配置下必现
|
||
的 400 已消失。
|
||
2. **b/glm-5.3-flash**(agent 默认模型):视觉/思考声明被整体剥离 → 默认 agent 每请求
|
||
硬报 `UNSUPPORTED_REASONING_EFFORT` → 已恢复 `input:[text,image]` + zai +
|
||
`off/low/medium/high`,热重载生效实测通过。
|
||
|
||
**插件已重构为非破坏语义**(详见插件 README 与沙箱测试 23 项断言):
|
||
off=`reasoningEfforts: false`+档位存档可恢复、on=原样恢复自定义映射、batch=仅补缺不覆盖、
|
||
写入前按 pi-ai 规则校验;前端胶囊当前模型识别改为 会话投影 > 唯一匹配 > 默认模型消解,
|
||
识别不到显示"未知"而非默认"开"。
|
||
|
||
## 补充:lt-fl 分组能力补全(2026-09-06 第二轮)
|
||
|
||
`settings.yaml` 中 lt-fl(platform.lantian.pro)原先是两条裸模型(无上下文/思考/多模态声明),已实测补全:
|
||
|
||
| 探测项 | glm-5.3-flash | qwen3.8-flash |
|
||
|---|---|---|
|
||
| 基线请求 | ✅ 200 | ✅ 200 |
|
||
| enable_thinking(zai) | ✅ 200 → reasoning_content | ✅ 200 → reasoning 字段 |
|
||
| thinking.type | ✅ 200 → reasoning_content | ❌ 400(提示改用 reasoning_effort) |
|
||
| reasoning_effort=high | ✅ 200 → reasoning_content | ❌ 400(只认 low/medium/xhigh,xhigh 为默认) |
|
||
| 视觉(64px 红色 PNG) | ✅ "红色" | ✅ "红色" |
|
||
| developer 角色 | ❌ 400"角色信息不正确" | ❌ 400"Unexpected message role." |
|
||
| max_tokens=131072 | ✅ 接受 | ✅ 接受 |
|
||
| reasoning_effort xhigh/medium/low | — | ✅ 三档全部 200 且返回 reasoning |
|
||
|
||
**已更新 `C:\Users\12914\.dsh\settings.yaml` lt-fl 分组**(YAML 解析校验通过):
|
||
- glm-5.3-flash:`contextWindow: 1048576`、`maxTokens: 131072`、`input: [text, image]`、`thinkingFormat: zai`、`supportsDeveloperRole: false`、`off/low/high`
|
||
- qwen3.8-flash:`contextWindow: 1048576`、`maxTokens: 131072`、`input: [text, image]`、`supportsDeveloperRole: false`、`off/low/medium` + **`high → xhigh`**(网关不认 high;且无"关闭思考"档,off=不传参即上游默认 xhigh)
|
||
- 顺带清理:allowedModels 中已删除的 zzz-auto 三条残留已移除
|
||
- 备注:contextWindow 网关 /models 无元数据,按同模型 b 分组取值;131072 max_tokens 实测接受
|
||
|
||
---
|
||
|
||
## 测试范围
|
||
|
||
Harness 当前注册的分组(settings.yaml `subagent-model-selection.allowedModels`):
|
||
|
||
- **分组 b**(网关 `http://156.225.30.43:65423/bai/v1`):
|
||
- `b/glm-5.3-flash`
|
||
- `b/qwen3.8-flash`
|
||
- ~~分组 zzz-auto~~(用户已于今日删除,已从可选模型中移除)
|
||
|
||
## 测试方法(端到端,真实经过 Harness 路由)
|
||
|
||
每个模型各跑两个独立子代理(subagent,provider/model 固定指向被测模型):
|
||
|
||
1. **多模态**:要求子代理用 `read_image` 工具读取 64×64 纯红色 PNG
|
||
(`.mimo2codex-audit\red64.png`),回答图片主色。能答"红色"= 视觉真实可用(图片无法查看时会明确报告失败,不可伪装)。
|
||
2. **思考**:`reasoning_effort=high` 下解多步推理题
|
||
(5−2=3 剩余 → 2×3−3=3 新买 → 3+3=**6**),要求分步推理 + 单独答案行。
|
||
|
||
## 测试结果
|
||
|
||
| 模型 | 思考(effort=high) | 多模态(read_image) | 结论 |
|
||
|---|---|---|---|
|
||
| b/glm-5.3-flash | ✅ 答案=6,步骤正确(重跑二次均通过) | ✅ read_image 成功,回答"红色" | 思考+多模态均可用 |
|
||
| b/qwen3.8-flash | ✅ 答案=6,步骤正确 | ✅ read_image 成功,回答"红色" | 思考+多模态均可用 |
|
||
|
||
- 说明:glm-5.3-flash 第一次思考测试在**结果已正确交付后**运行器异常退出,随即干净重跑一次通过,判定有效。
|
||
- 与 `settings.yaml` 现有配置完全吻合:两模型均声明 `input: [text, image]`、`thinkingFormat: zai`、`reasoningEfforts: off/low/high` —— **实测与配置一致,无需修改能力声明**。
|
||
|
||
## 已做的配置动作
|
||
|
||
1. `C:\Users\12914\.dsh\settings.yaml`:按既有注释风格为两个 b 分组模型补记 2026-09-06 实测结论(视觉✅/思考✅),便于日后追溯。
|
||
2. 确认用户删除 zzz-auto 分组后 Harness 只暴露 b 分组两模型(`list_subagent_models` 复核)。
|
||
3. 无需其他配置变更:两模型的思考档位、图片输入、developer 角色回退(`supportsDeveloperRole: false`)均已在配置中且经实测验证有效。
|
||
|
||
## 历史参考
|
||
|
||
此前一轮测试的是 mimo2codex 代理(OpenCode Zen 网关 35 个模型)的能力,报告见
|
||
`.mimo2codex-audit\REPORT.md`;与本次 Harness 层面的测试相互独立。
|