52 lines
3.1 KiB
Markdown
52 lines
3.1 KiB
Markdown
# PROGRESS — I-04 新模型入职评估(剩余项落地)
|
||
|
||
- 状态:partial(题库资产复核+runner 流水线验证+校准阻塞项处理完成;真实模型校准待网关恢复)
|
||
- 执行模型:deepseek-v4.1-flash
|
||
- 日期:2026-09-12
|
||
- 分支/提交:未提交
|
||
|
||
## 改动文件
|
||
- `evals/results/` 下删除空报告残留:`glm-5.3-flash-2026-09-11.{log.md,md}` + `raw/glm-5.3-flash/` + `work/glm-5.3-flash/`(旧版 runner 网关失败时产出的 0/0 空成绩,会被误读为已评估)
|
||
- `bundles/bundle-D-02.md`(新增,18KB,D-02 跨项目 bundle 演示)
|
||
- 03-执行协议.md:§七/§八已由他模写入,**本轮复核通过(无需改动)**
|
||
- `tasks/I-04-新模型入职评估.md`:验收标准已更新为"复核+run_eval.py+校准+回填"(规划者已同步)
|
||
|
||
## 验收命令与结果
|
||
|
||
```bash
|
||
$ python evals/tools/run_eval.py --audit | tail -2
|
||
AUDIT: 80/80 structural checks passed(另有 1 项已登记规格缺陷,需规划者裁定)
|
||
|
||
$ python manage.py check(chunyu); echo EXIT=$?
|
||
EXIT=0
|
||
System check identified 12 issues (0 silenced). # W005×1 + W042×11,与 baselines.json 期望一致
|
||
|
||
$ python manage.py makemigrations --check --dry-run(dealerhub)
|
||
No changes detected
|
||
|
||
$ python evals/tools/run_eval.py --model selftest-synthetic --transport replay --answers-dir evals/fixtures/selftest/good --workdir evals/fixtures/selftest/workdir-good/tooltask | tail -8
|
||
自动项 29/42(待评委 13 分)
|
||
dim1 10/11 · dim2 5/7 · dim3 3/6 · dim4 3/6 · dim5 3/6 · dim6 5/6
|
||
|
||
$ 同命令 --model selftest-bad .../bad .../workdir-bad/tooltask | tail -8
|
||
自动项 6/42(待评委 13 分)
|
||
[硬否决提示] dim5 自动项 0/6 <50%(待人工复核后裁定)
|
||
|
||
$ python tools/handoff_bundle.py D-02 --out bundles/bundle-D-02.md
|
||
已写出 bundles/bundle-D-02.md(11456 字符,18389 字节)
|
||
卡:D-02 PG 并发测试环境 · 源码线索:0 条已解析 / 3 条未解析 · 基线:2 条(仅列命令)
|
||
|
||
$ 网关直连探测(只读,不写配置)
|
||
http://156.225.30.43:65423/bai/v1/chat/completions -> FAIL: TimeoutError timed out
|
||
```
|
||
|
||
## 基线对照
|
||
- 开工前:evals 已有题库/runner/校准残留(空报告)/registry 全 null
|
||
- 完工后:流水线验证完(good 29 vs bad 6,区分度确认);空报告清理完;registry 保持 13 模型预填(scores 仍 null,不伪造)
|
||
|
||
## 遗留问题 / 下一模型注意事项
|
||
1. **真实模型校准阻塞**:DSH 网关(156.225.30.43:65423)当前超时不可达。网关恢复后补跑:`run_eval.py --model glm-5.3-flash --transport openai --base-url ... --api-key-env DSH_API_KEY`,再做评委补判与 registry 回填。
|
||
2. **D-02 bundle 的"0 条已解析"**:D-02 卡内路径多为待新建文件(`config/settings/pgtest.py` 等),文件本就不存在,符合设计——不是工具缺陷。
|
||
3. **SPEC-DEFECT-1 未裁定**:36 vs 42 口径。执行侧统一用 42(题面/维度表/判分器一致);registry 的 `scale.total_max: 36` 保持原样待规划者裁定。
|
||
4. **产出副产品**:本次验证新生成的 `selftest-*-2026-09-12.{json,md}` 结果文件保留在 `evals/results/`,可作为流水线回归基线。
|