Files
vscode-workbench/PLANNING/PROGRESS_I-04.md
T

52 lines
3.1 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# PROGRESS — I-04 新模型入职评估(剩余项落地)
- 状态:partial(题库资产复核+runner 流水线验证+校准阻塞项处理完成;真实模型校准待网关恢复)
- 执行模型:deepseek-v4.1-flash
- 日期:2026-09-12
- 分支/提交:未提交
## 改动文件
- `evals/results/` 下删除空报告残留:`glm-5.3-flash-2026-09-11.{log.md,md}` + `raw/glm-5.3-flash/` + `work/glm-5.3-flash/`(旧版 runner 网关失败时产出的 0/0 空成绩,会被误读为已评估)
- `bundles/bundle-D-02.md`(新增,18KB,D-02 跨项目 bundle 演示)
- 03-执行协议.md:§七/§八已由他模写入,**本轮复核通过(无需改动)**
- `tasks/I-04-新模型入职评估.md`:验收标准已更新为"复核+run_eval.py+校准+回填"(规划者已同步)
## 验收命令与结果
```bash
$ python evals/tools/run_eval.py --audit | tail -2
AUDIT: 80/80 structural checks passed(另有 1 项已登记规格缺陷,需规划者裁定)
$ python manage.py check(chunyu); echo EXIT=$?
EXIT=0
System check identified 12 issues (0 silenced). # W005×1 + W042×11,与 baselines.json 期望一致
$ python manage.py makemigrations --check --dry-run(dealerhub)
No changes detected
$ python evals/tools/run_eval.py --model selftest-synthetic --transport replay --answers-dir evals/fixtures/selftest/good --workdir evals/fixtures/selftest/workdir-good/tooltask | tail -8
自动项 29/42(待评委 13 分)
dim1 10/11 · dim2 5/7 · dim3 3/6 · dim4 3/6 · dim5 3/6 · dim6 5/6
$ 同命令 --model selftest-bad .../bad .../workdir-bad/tooltask | tail -8
自动项 6/42(待评委 13 分)
[硬否决提示] dim5 自动项 0/6 <50%(待人工复核后裁定)
$ python tools/handoff_bundle.py D-02 --out bundles/bundle-D-02.md
已写出 bundles/bundle-D-02.md(11456 字符,18389 字节)
卡:D-02 PG 并发测试环境 · 源码线索:0 条已解析 / 3 条未解析 · 基线:2 条(仅列命令)
$ 网关直连探测(只读,不写配置)
http://156.225.30.43:65423/bai/v1/chat/completions -> FAIL: TimeoutError timed out
```
## 基线对照
- 开工前:evals 已有题库/runner/校准残留(空报告)/registry 全 null
- 完工后:流水线验证完(good 29 vs bad 6,区分度确认);空报告清理完;registry 保持 13 模型预填(scores 仍 null,不伪造)
## 遗留问题 / 下一模型注意事项
1. **真实模型校准阻塞**:DSH 网关(156.225.30.43:65423)当前超时不可达。网关恢复后补跑:`run_eval.py --model glm-5.3-flash --transport openai --base-url ... --api-key-env DSH_API_KEY`,再做评委补判与 registry 回填。
2. **D-02 bundle 的"0 条已解析"**:D-02 卡内路径多为待新建文件(`config/settings/pgtest.py` 等),文件本就不存在,符合设计——不是工具缺陷。
3. **SPEC-DEFECT-1 未裁定**:36 vs 42 口径。执行侧统一用 42(题面/维度表/判分器一致);registry 的 `scale.total_max: 36` 保持原样待规划者裁定。
4. **产出副产品**:本次验证新生成的 `selftest-*-2026-09-12.{json,md}` 结果文件保留在 `evals/results/`,可作为流水线回归基线。