Files
SuperBizAgent-java/mvp/issues/archived/expand-diagnosis-eval-fixtures.md
T

2.1 KiB
Raw Blame History

Expand Diagnosis Eval Fixtures

状态:已归档
严重程度:中
发现时间:2026-07-04
来源:P1-B follow-up
依赖:diagnosis-eval-harness


背景

diagnosis-eval-harness 已经把固定 case、trace evaluator、JSON / Markdown report 和字段文档搭起来了。

现在还差一步:5 条固定诊断 case 里,只有 2 条有 fixture,另外 3 条还是 missing 状态。这个状态可以验证 evaluator 的错误报告能力,但还不能作为完整 baseline 展示。


问题

当前 baseline 还不够完整:

  • redis-timeout 没有对应 trace fixture。
  • slow-response 没有对应 trace fixture。
  • jvm-memory-risk 没有对应 trace fixture。
  • 仓库里还没有一份固定的 baseline JSON / Markdown 报告可供对比。

目标

补齐固定诊断评测集,让它从“框架可跑”变成“基准可用”。

完成后应该做到:

  • 5 条固定 case 都能加载到对应 fixture。
  • evaluator 能输出完整 baseline report。
  • baseline report 被保存到仓库,后续 Agent 改动可以拿它做对比。
  • 文档说明怎么重新生成和怎么看报告。

范围

In scope

  • 补齐 3 个缺失 fixture。
  • 保存 baseline JSON / Markdown 报告。
  • 更新 eval 文档。
  • 补充测试,确保 case 文件引用的 fixture 都存在。

Out of scope

  • 不新增 case 数量。
  • 不改生产 Agent 主链路。
  • 不引入 LLM-as-judge。
  • 不启动真实 MySQL、Redis、Milvus 或 LLM。

面试表达

可以这样讲:

我先搭了评测 harness,然后把固定 case 的 trace fixture 补齐,
生成一份可复现的 baseline report。
这样以后每次改 prompt、tool 或 verifier,
都能看固定诊断集有没有行为回退,而不是只靠人工感觉。

相关文件

  • mvp/eval/cases/diagnosis-cases.json
  • mvp/eval/fixtures/
  • mvp/eval/reports/
  • mvp/eval/README.md
  • mvp/eval/schema.md
  • src/main/java/com/superbiz/agent/eval/DiagnosisTraceEvaluator.java
  • src/test/java/com/superbiz/agent/eval/DiagnosisTraceEvaluatorTest.java
  • openspec/specs/diagnosis-eval-harness/spec.md