Files
vscode-workbench/DSH模型能力测试报告.md
T

5.5 KiB
Raw Blame History

DeepSeek Harness 模型能力测试报告(2026-09-06)

附言:插件破坏事故与修复(2026-09-08)

事故:dsh-client-ui-model-capabilities 插件旧版的"思考/多模态开关"与"一键开启所有" 采用覆盖式写入(off=直接删除 reasoningEfforts 与 thinkingFormat;batch=全量改写为 {off,low,high} + 强制 zai),导致两处实测结论被破坏:

  1. lt-fl/qwen3.8-flash:丢失 medium 档与 high→xhigh 映射、被强制 zai(本网关拒绝 thinking.type,只认 enable_thinking+reasoning_effort low/medium/xhigh)→ 已按 2026-09-06 探测结论恢复为 thinkingFormat: qwen + off/low/medium/high: xhigh。 2026-09-10 复测通过:{enable_thinking:true, reasoning_effort:xhigh} ✅ 200 返回 reasoning;{enable_thinking:true, reasoning_effort:medium} ✅ 200 返回 reasoning; {enable_thinking:false}(off档)✅ 200 但上游仍返回 reasoning(同 09-06 结论: 该网关 qwen 无真正关闭档,off 只保证不发 thinking.type 不报 400)。zai 配置下必现 的 400 已消失。
  2. b/glm-5.3-flash(agent 默认模型):视觉/思考声明被整体剥离 → 默认 agent 每请求 硬报 UNSUPPORTED_REASONING_EFFORT → 已恢复 input:[text,image] + zai + off/low/medium/high,热重载生效实测通过。

插件已重构为非破坏语义(详见插件 README 与沙箱测试 23 项断言): off=reasoningEfforts: false+档位存档可恢复、on=原样恢复自定义映射、batch=仅补缺不覆盖、 写入前按 pi-ai 规则校验;前端胶囊当前模型识别改为 会话投影 > 唯一匹配 > 默认模型消解, 识别不到显示"未知"而非默认"开"。

补充:lt-fl 分组能力补全(2026-09-06 第二轮)

settings.yaml 中 lt-fl(platform.lantian.pro)原先是两条裸模型(无上下文/思考/多模态声明),已实测补全:

探测项 glm-5.3-flash qwen3.8-flash
基线请求 ✅ 200 ✅ 200
enable_thinking(zai) ✅ 200 → reasoning_content ✅ 200 → reasoning 字段
thinking.type ✅ 200 → reasoning_content ❌ 400(提示改用 reasoning_effort)
reasoning_effort=high ✅ 200 → reasoning_content ❌ 400(只认 low/medium/xhigh,xhigh 为默认)
视觉(64px 红色 PNG) ✅ "红色" ✅ "红色"
developer 角色 ❌ 400"角色信息不正确" ❌ 400"Unexpected message role."
max_tokens=131072 ✅ 接受 ✅ 接受
reasoning_effort xhigh/medium/low — ✅ 三档全部 200 且返回 reasoning

已更新 C:\Users\12914\.dsh\settings.yaml lt-fl 分组(YAML 解析校验通过):

  • glm-5.3-flash:contextWindow: 1048576、maxTokens: 131072、input: [text, image]、thinkingFormat: zai、supportsDeveloperRole: false、off/low/high
  • qwen3.8-flash:contextWindow: 1048576、maxTokens: 131072、input: [text, image]、supportsDeveloperRole: false、off/low/medium + high → xhigh(网关不认 high;且无"关闭思考"档,off=不传参即上游默认 xhigh)
  • 顺带清理:allowedModels 中已删除的 zzz-auto 三条残留已移除
  • 备注:contextWindow 网关 /models 无元数据,按同模型 b 分组取值;131072 max_tokens 实测接受

测试范围

Harness 当前注册的分组(settings.yaml subagent-model-selection.allowedModels):

  • 分组 b(网关 http://156.225.30.43:65423/bai/v1):
    • b/glm-5.3-flash
    • b/qwen3.8-flash
  • 分组 zzz-auto(用户已于今日删除,已从可选模型中移除)

测试方法(端到端,真实经过 Harness 路由)

每个模型各跑两个独立子代理(subagent,provider/model 固定指向被测模型):

  1. 多模态:要求子代理用 read_image 工具读取 64×64 纯红色 PNG (.mimo2codex-audit\red64.png),回答图片主色。能答"红色"= 视觉真实可用(图片无法查看时会明确报告失败,不可伪装)。
  2. 思考:reasoning_effort=high 下解多步推理题 (5−2=3 剩余 → 2×3−3=3 新买 → 3+3=6),要求分步推理 + 单独答案行。

测试结果

模型 思考(effort=high) 多模态(read_image) 结论
b/glm-5.3-flash ✅ 答案=6,步骤正确(重跑二次均通过) ✅ read_image 成功,回答"红色" 思考+多模态均可用
b/qwen3.8-flash ✅ 答案=6,步骤正确 ✅ read_image 成功,回答"红色" 思考+多模态均可用
  • 说明:glm-5.3-flash 第一次思考测试在结果已正确交付后运行器异常退出,随即干净重跑一次通过,判定有效。
  • 与 settings.yaml 现有配置完全吻合:两模型均声明 input: [text, image]、thinkingFormat: zai、reasoningEfforts: off/low/high —— 实测与配置一致,无需修改能力声明。

已做的配置动作

  1. C:\Users\12914\.dsh\settings.yaml:按既有注释风格为两个 b 分组模型补记 2026-09-06 实测结论(视觉✅/思考✅),便于日后追溯。
  2. 确认用户删除 zzz-auto 分组后 Harness 只暴露 b 分组两模型(list_subagent_models 复核)。
  3. 无需其他配置变更:两模型的思考档位、图片输入、developer 角色回退(supportsDeveloperRole: false)均已在配置中且经实测验证有效。

历史参考

此前一轮测试的是 mimo2codex 代理(OpenCode Zen 网关 35 个模型)的能力,报告见 .mimo2codex-audit\REPORT.md;与本次 Harness 层面的测试相互独立。