5.5 KiB
5.5 KiB
DeepSeek Harness 模型能力测试报告(2026-09-06)
附言:插件破坏事故与修复(2026-09-08)
事故:dsh-client-ui-model-capabilities 插件旧版的"思考/多模态开关"与"一键开启所有"
采用覆盖式写入(off=直接删除 reasoningEfforts 与 thinkingFormat;batch=全量改写为
{off,low,high} + 强制 zai),导致两处实测结论被破坏:
- lt-fl/qwen3.8-flash:丢失
medium档与high→xhigh映射、被强制 zai(本网关拒绝thinking.type,只认enable_thinking+reasoning_effort low/medium/xhigh)→ 已按 2026-09-06 探测结论恢复为thinkingFormat: qwen+off/low/medium/high: xhigh。 2026-09-10 复测通过:{enable_thinking:true, reasoning_effort:xhigh}✅ 200 返回 reasoning;{enable_thinking:true, reasoning_effort:medium}✅ 200 返回 reasoning;{enable_thinking:false}(off档)✅ 200 但上游仍返回 reasoning(同 09-06 结论: 该网关 qwen 无真正关闭档,off 只保证不发 thinking.type 不报 400)。zai 配置下必现 的 400 已消失。 - b/glm-5.3-flash(agent 默认模型):视觉/思考声明被整体剥离 → 默认 agent 每请求
硬报
UNSUPPORTED_REASONING_EFFORT→ 已恢复input:[text,image]+ zai +off/low/medium/high,热重载生效实测通过。
插件已重构为非破坏语义(详见插件 README 与沙箱测试 23 项断言):
off=reasoningEfforts: false+档位存档可恢复、on=原样恢复自定义映射、batch=仅补缺不覆盖、
写入前按 pi-ai 规则校验;前端胶囊当前模型识别改为 会话投影 > 唯一匹配 > 默认模型消解,
识别不到显示"未知"而非默认"开"。
补充:lt-fl 分组能力补全(2026-09-06 第二轮)
settings.yaml 中 lt-fl(platform.lantian.pro)原先是两条裸模型(无上下文/思考/多模态声明),已实测补全:
| 探测项 | glm-5.3-flash | qwen3.8-flash |
|---|---|---|
| 基线请求 | ✅ 200 | ✅ 200 |
| enable_thinking(zai) | ✅ 200 → reasoning_content | ✅ 200 → reasoning 字段 |
| thinking.type | ✅ 200 → reasoning_content | ❌ 400(提示改用 reasoning_effort) |
| reasoning_effort=high | ✅ 200 → reasoning_content | ❌ 400(只认 low/medium/xhigh,xhigh 为默认) |
| 视觉(64px 红色 PNG) | ✅ "红色" | ✅ "红色" |
| developer 角色 | ❌ 400"角色信息不正确" | ❌ 400"Unexpected message role." |
| max_tokens=131072 | ✅ 接受 | ✅ 接受 |
| reasoning_effort xhigh/medium/low | — | ✅ 三档全部 200 且返回 reasoning |
已更新 C:\Users\12914\.dsh\settings.yaml lt-fl 分组(YAML 解析校验通过):
- glm-5.3-flash:
contextWindow: 1048576、maxTokens: 131072、input: [text, image]、thinkingFormat: zai、supportsDeveloperRole: false、off/low/high - qwen3.8-flash:
contextWindow: 1048576、maxTokens: 131072、input: [text, image]、supportsDeveloperRole: false、off/low/medium+high → xhigh(网关不认 high;且无"关闭思考"档,off=不传参即上游默认 xhigh) - 顺带清理:allowedModels 中已删除的 zzz-auto 三条残留已移除
- 备注:contextWindow 网关 /models 无元数据,按同模型 b 分组取值;131072 max_tokens 实测接受
测试范围
Harness 当前注册的分组(settings.yaml subagent-model-selection.allowedModels):
- 分组 b(网关
http://156.225.30.43:65423/bai/v1):b/glm-5.3-flashb/qwen3.8-flash
分组 zzz-auto(用户已于今日删除,已从可选模型中移除)
测试方法(端到端,真实经过 Harness 路由)
每个模型各跑两个独立子代理(subagent,provider/model 固定指向被测模型):
- 多模态:要求子代理用
read_image工具读取 64×64 纯红色 PNG (.mimo2codex-audit\red64.png),回答图片主色。能答"红色"= 视觉真实可用(图片无法查看时会明确报告失败,不可伪装)。 - 思考:
reasoning_effort=high下解多步推理题 (5−2=3 剩余 → 2×3−3=3 新买 → 3+3=6),要求分步推理 + 单独答案行。
测试结果
| 模型 | 思考(effort=high) | 多模态(read_image) | 结论 |
|---|---|---|---|
| b/glm-5.3-flash | ✅ 答案=6,步骤正确(重跑二次均通过) | ✅ read_image 成功,回答"红色" | 思考+多模态均可用 |
| b/qwen3.8-flash | ✅ 答案=6,步骤正确 | ✅ read_image 成功,回答"红色" | 思考+多模态均可用 |
- 说明:glm-5.3-flash 第一次思考测试在结果已正确交付后运行器异常退出,随即干净重跑一次通过,判定有效。
- 与
settings.yaml现有配置完全吻合:两模型均声明input: [text, image]、thinkingFormat: zai、reasoningEfforts: off/low/high—— 实测与配置一致,无需修改能力声明。
已做的配置动作
C:\Users\12914\.dsh\settings.yaml:按既有注释风格为两个 b 分组模型补记 2026-09-06 实测结论(视觉✅/思考✅),便于日后追溯。- 确认用户删除 zzz-auto 分组后 Harness 只暴露 b 分组两模型(
list_subagent_models复核)。 - 无需其他配置变更:两模型的思考档位、图片输入、developer 角色回退(
supportsDeveloperRole: false)均已在配置中且经实测验证有效。
历史参考
此前一轮测试的是 mimo2codex 代理(OpenCode Zen 网关 35 个模型)的能力,报告见
.mimo2codex-audit\REPORT.md;与本次 Harness 层面的测试相互独立。