# DeepSeek Harness 模型能力测试报告(2026-09-06) ## 附言:插件破坏事故与修复(2026-09-08) **事故**:`dsh-client-ui-model-capabilities` 插件旧版的"思考/多模态开关"与"一键开启所有" 采用覆盖式写入(off=直接删除 `reasoningEfforts` 与 `thinkingFormat`;batch=全量改写为 `{off,low,high}` + 强制 zai),导致两处实测结论被破坏: 1. **lt-fl/qwen3.8-flash**:丢失 `medium` 档与 `high→xhigh` 映射、被强制 zai(本网关拒绝 `thinking.type`,只认 `enable_thinking`+`reasoning_effort low/medium/xhigh`)→ 已按 2026-09-06 探测结论恢复为 `thinkingFormat: qwen` + `off/low/medium/high: xhigh`。 **2026-09-10 复测通过**:`{enable_thinking:true, reasoning_effort:xhigh}` ✅ 200 返回 reasoning;`{enable_thinking:true, reasoning_effort:medium}` ✅ 200 返回 reasoning; `{enable_thinking:false}`(off档)✅ 200 但上游仍返回 reasoning(同 09-06 结论: 该网关 qwen 无真正关闭档,off 只保证不发 thinking.type 不报 400)。zai 配置下必现 的 400 已消失。 2. **b/glm-5.3-flash**(agent 默认模型):视觉/思考声明被整体剥离 → 默认 agent 每请求 硬报 `UNSUPPORTED_REASONING_EFFORT` → 已恢复 `input:[text,image]` + zai + `off/low/medium/high`,热重载生效实测通过。 **插件已重构为非破坏语义**(详见插件 README 与沙箱测试 23 项断言): off=`reasoningEfforts: false`+档位存档可恢复、on=原样恢复自定义映射、batch=仅补缺不覆盖、 写入前按 pi-ai 规则校验;前端胶囊当前模型识别改为 会话投影 > 唯一匹配 > 默认模型消解, 识别不到显示"未知"而非默认"开"。 ## 补充:lt-fl 分组能力补全(2026-09-06 第二轮) `settings.yaml` 中 lt-fl(platform.lantian.pro)原先是两条裸模型(无上下文/思考/多模态声明),已实测补全: | 探测项 | glm-5.3-flash | qwen3.8-flash | |---|---|---| | 基线请求 | ✅ 200 | ✅ 200 | | enable_thinking(zai) | ✅ 200 → reasoning_content | ✅ 200 → reasoning 字段 | | thinking.type | ✅ 200 → reasoning_content | ❌ 400(提示改用 reasoning_effort) | | reasoning_effort=high | ✅ 200 → reasoning_content | ❌ 400(只认 low/medium/xhigh,xhigh 为默认) | | 视觉(64px 红色 PNG) | ✅ "红色" | ✅ "红色" | | developer 角色 | ❌ 400"角色信息不正确" | ❌ 400"Unexpected message role." | | max_tokens=131072 | ✅ 接受 | ✅ 接受 | | reasoning_effort xhigh/medium/low | — | ✅ 三档全部 200 且返回 reasoning | **已更新 `C:\Users\12914\.dsh\settings.yaml` lt-fl 分组**(YAML 解析校验通过): - glm-5.3-flash:`contextWindow: 1048576`、`maxTokens: 131072`、`input: [text, image]`、`thinkingFormat: zai`、`supportsDeveloperRole: false`、`off/low/high` - qwen3.8-flash:`contextWindow: 1048576`、`maxTokens: 131072`、`input: [text, image]`、`supportsDeveloperRole: false`、`off/low/medium` + **`high → xhigh`**(网关不认 high;且无"关闭思考"档,off=不传参即上游默认 xhigh) - 顺带清理:allowedModels 中已删除的 zzz-auto 三条残留已移除 - 备注:contextWindow 网关 /models 无元数据,按同模型 b 分组取值;131072 max_tokens 实测接受 --- ## 测试范围 Harness 当前注册的分组(settings.yaml `subagent-model-selection.allowedModels`): - **分组 b**(网关 `http://156.225.30.43:65423/bai/v1`): - `b/glm-5.3-flash` - `b/qwen3.8-flash` - ~~分组 zzz-auto~~(用户已于今日删除,已从可选模型中移除) ## 测试方法(端到端,真实经过 Harness 路由) 每个模型各跑两个独立子代理(subagent,provider/model 固定指向被测模型): 1. **多模态**:要求子代理用 `read_image` 工具读取 64×64 纯红色 PNG (`.mimo2codex-audit\red64.png`),回答图片主色。能答"红色"= 视觉真实可用(图片无法查看时会明确报告失败,不可伪装)。 2. **思考**:`reasoning_effort=high` 下解多步推理题 (5−2=3 剩余 → 2×3−3=3 新买 → 3+3=**6**),要求分步推理 + 单独答案行。 ## 测试结果 | 模型 | 思考(effort=high) | 多模态(read_image) | 结论 | |---|---|---|---| | b/glm-5.3-flash | ✅ 答案=6,步骤正确(重跑二次均通过) | ✅ read_image 成功,回答"红色" | 思考+多模态均可用 | | b/qwen3.8-flash | ✅ 答案=6,步骤正确 | ✅ read_image 成功,回答"红色" | 思考+多模态均可用 | - 说明:glm-5.3-flash 第一次思考测试在**结果已正确交付后**运行器异常退出,随即干净重跑一次通过,判定有效。 - 与 `settings.yaml` 现有配置完全吻合:两模型均声明 `input: [text, image]`、`thinkingFormat: zai`、`reasoningEfforts: off/low/high` —— **实测与配置一致,无需修改能力声明**。 ## 已做的配置动作 1. `C:\Users\12914\.dsh\settings.yaml`:按既有注释风格为两个 b 分组模型补记 2026-09-06 实测结论(视觉✅/思考✅),便于日后追溯。 2. 确认用户删除 zzz-auto 分组后 Harness 只暴露 b 分组两模型(`list_subagent_models` 复核)。 3. 无需其他配置变更:两模型的思考档位、图片输入、developer 角色回退(`supportsDeveloperRole: false`)均已在配置中且经实测验证有效。 ## 历史参考 此前一轮测试的是 mimo2codex 代理(OpenCode Zen 网关 35 个模型)的能力,报告见 `.mimo2codex-audit\REPORT.md`;与本次 Harness 层面的测试相互独立。