# Expand Diagnosis Eval Fixtures **状态**:已归档 **严重程度**:中 **发现时间**:2026-07-04 **来源**:P1-B follow-up **依赖**:`diagnosis-eval-harness` --- ## 背景 `diagnosis-eval-harness` 已经把固定 case、trace evaluator、JSON / Markdown report 和字段文档搭起来了。 现在还差一步:5 条固定诊断 case 里,只有 2 条有 fixture,另外 3 条还是 missing 状态。这个状态可以验证 evaluator 的错误报告能力,但还不能作为完整 baseline 展示。 --- ## 问题 当前 baseline 还不够完整: - `redis-timeout` 没有对应 trace fixture。 - `slow-response` 没有对应 trace fixture。 - `jvm-memory-risk` 没有对应 trace fixture。 - 仓库里还没有一份固定的 baseline JSON / Markdown 报告可供对比。 --- ## 目标 补齐固定诊断评测集,让它从“框架可跑”变成“基准可用”。 完成后应该做到: - 5 条固定 case 都能加载到对应 fixture。 - evaluator 能输出完整 baseline report。 - baseline report 被保存到仓库,后续 Agent 改动可以拿它做对比。 - 文档说明怎么重新生成和怎么看报告。 --- ## 范围 ### In scope - 补齐 3 个缺失 fixture。 - 保存 baseline JSON / Markdown 报告。 - 更新 eval 文档。 - 补充测试,确保 case 文件引用的 fixture 都存在。 ### Out of scope - 不新增 case 数量。 - 不改生产 Agent 主链路。 - 不引入 LLM-as-judge。 - 不启动真实 MySQL、Redis、Milvus 或 LLM。 --- ## 面试表达 可以这样讲: ```text 我先搭了评测 harness,然后把固定 case 的 trace fixture 补齐, 生成一份可复现的 baseline report。 这样以后每次改 prompt、tool 或 verifier, 都能看固定诊断集有没有行为回退,而不是只靠人工感觉。 ``` --- ## 相关文件 - `mvp/eval/cases/diagnosis-cases.json` - `mvp/eval/fixtures/` - `mvp/eval/reports/` - `mvp/eval/README.md` - `mvp/eval/schema.md` - `src/main/java/com/superbiz/agent/eval/DiagnosisTraceEvaluator.java` - `src/test/java/com/superbiz/agent/eval/DiagnosisTraceEvaluatorTest.java` - `openspec/specs/diagnosis-eval-harness/spec.md`