Files
vscode-workbench/DSH模型能力测试报告.md
T

87 lines
5.5 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# DeepSeek Harness 模型能力测试报告(2026-09-06)
## 附言:插件破坏事故与修复(2026-09-08)
**事故**:`dsh-client-ui-model-capabilities` 插件旧版的"思考/多模态开关"与"一键开启所有"
采用覆盖式写入(off=直接删除 `reasoningEfforts` 与 `thinkingFormat`;batch=全量改写为
`{off,low,high}` + 强制 zai),导致两处实测结论被破坏:
1. **lt-fl/qwen3.8-flash**:丢失 `medium` 档与 `high→xhigh` 映射、被强制 zai(本网关拒绝
`thinking.type`,只认 `enable_thinking`+`reasoning_effort low/medium/xhigh`)→ 已按
2026-09-06 探测结论恢复为 `thinkingFormat: qwen` + `off/low/medium/high: xhigh`。
**2026-09-10 复测通过**:`{enable_thinking:true, reasoning_effort:xhigh}` ✅ 200 返回
reasoning;`{enable_thinking:true, reasoning_effort:medium}` ✅ 200 返回 reasoning;
`{enable_thinking:false}`(off档)✅ 200 但上游仍返回 reasoning(同 09-06 结论:
该网关 qwen 无真正关闭档,off 只保证不发 thinking.type 不报 400)。zai 配置下必现
的 400 已消失。
2. **b/glm-5.3-flash**(agent 默认模型):视觉/思考声明被整体剥离 → 默认 agent 每请求
硬报 `UNSUPPORTED_REASONING_EFFORT` → 已恢复 `input:[text,image]` + zai +
`off/low/medium/high`,热重载生效实测通过。
**插件已重构为非破坏语义**(详见插件 README 与沙箱测试 23 项断言):
off=`reasoningEfforts: false`+档位存档可恢复、on=原样恢复自定义映射、batch=仅补缺不覆盖、
写入前按 pi-ai 规则校验;前端胶囊当前模型识别改为 会话投影 > 唯一匹配 > 默认模型消解,
识别不到显示"未知"而非默认"开"。
## 补充:lt-fl 分组能力补全(2026-09-06 第二轮)
`settings.yaml` 中 lt-fl(platform.lantian.pro)原先是两条裸模型(无上下文/思考/多模态声明),已实测补全:
| 探测项 | glm-5.3-flash | qwen3.8-flash |
|---|---|---|
| 基线请求 | ✅ 200 | ✅ 200 |
| enable_thinking(zai) | ✅ 200 → reasoning_content | ✅ 200 → reasoning 字段 |
| thinking.type | ✅ 200 → reasoning_content | ❌ 400(提示改用 reasoning_effort) |
| reasoning_effort=high | ✅ 200 → reasoning_content | ❌ 400(只认 low/medium/xhigh,xhigh 为默认) |
| 视觉(64px 红色 PNG) | ✅ "红色" | ✅ "红色" |
| developer 角色 | ❌ 400"角色信息不正确" | ❌ 400"Unexpected message role." |
| max_tokens=131072 | ✅ 接受 | ✅ 接受 |
| reasoning_effort xhigh/medium/low | — | ✅ 三档全部 200 且返回 reasoning |
**已更新 `C:\Users\12914\.dsh\settings.yaml` lt-fl 分组**(YAML 解析校验通过):
- glm-5.3-flash:`contextWindow: 1048576`、`maxTokens: 131072`、`input: [text, image]`、`thinkingFormat: zai`、`supportsDeveloperRole: false`、`off/low/high`
- qwen3.8-flash:`contextWindow: 1048576`、`maxTokens: 131072`、`input: [text, image]`、`supportsDeveloperRole: false`、`off/low/medium` + **`high → xhigh`**(网关不认 high;且无"关闭思考"档,off=不传参即上游默认 xhigh)
- 顺带清理:allowedModels 中已删除的 zzz-auto 三条残留已移除
- 备注:contextWindow 网关 /models 无元数据,按同模型 b 分组取值;131072 max_tokens 实测接受
---
## 测试范围
Harness 当前注册的分组(settings.yaml `subagent-model-selection.allowedModels`):
- **分组 b**(网关 `http://156.225.30.43:65423/bai/v1`):
- `b/glm-5.3-flash`
- `b/qwen3.8-flash`
- ~~分组 zzz-auto~~(用户已于今日删除,已从可选模型中移除)
## 测试方法(端到端,真实经过 Harness 路由)
每个模型各跑两个独立子代理(subagent,provider/model 固定指向被测模型):
1. **多模态**:要求子代理用 `read_image` 工具读取 64×64 纯红色 PNG
(`.mimo2codex-audit\red64.png`),回答图片主色。能答"红色"= 视觉真实可用(图片无法查看时会明确报告失败,不可伪装)。
2. **思考**:`reasoning_effort=high` 下解多步推理题
(5−2=3 剩余 → 2×3−3=3 新买 → 3+3=**6**),要求分步推理 + 单独答案行。
## 测试结果
| 模型 | 思考(effort=high) | 多模态(read_image) | 结论 |
|---|---|---|---|
| b/glm-5.3-flash | ✅ 答案=6,步骤正确(重跑二次均通过) | ✅ read_image 成功,回答"红色" | 思考+多模态均可用 |
| b/qwen3.8-flash | ✅ 答案=6,步骤正确 | ✅ read_image 成功,回答"红色" | 思考+多模态均可用 |
- 说明:glm-5.3-flash 第一次思考测试在**结果已正确交付后**运行器异常退出,随即干净重跑一次通过,判定有效。
- 与 `settings.yaml` 现有配置完全吻合:两模型均声明 `input: [text, image]`、`thinkingFormat: zai`、`reasoningEfforts: off/low/high` —— **实测与配置一致,无需修改能力声明**。
## 已做的配置动作
1. `C:\Users\12914\.dsh\settings.yaml`:按既有注释风格为两个 b 分组模型补记 2026-09-06 实测结论(视觉✅/思考✅),便于日后追溯。
2. 确认用户删除 zzz-auto 分组后 Harness 只暴露 b 分组两模型(`list_subagent_models` 复核)。
3. 无需其他配置变更:两模型的思考档位、图片输入、developer 角色回退(`supportsDeveloperRole: false`)均已在配置中且经实测验证有效。
## 历史参考
此前一轮测试的是 mimo2codex 代理(OpenCode Zen 网关 35 个模型)的能力,报告见
`.mimo2codex-audit\REPORT.md`;与本次 Harness 层面的测试相互独立。