Files
SuperBizAgent-java/mvp/demo/archive/2026-07-22-legacy/trace-inspection-checklist.md
T

3.6 KiB

Trace 检查清单

运行 scripts/run-interview-demo-check.ps1 后,用这份清单检查 trace-response.json 和 interview-demo-summary.json。

1. Session

JSON path 检查点 面试讲点
data.runId / data.run.runId 是否等于 demo 响应中的 runId runId 精确绑定这一次诊断运行
data.session.sessionId 是否等于 mvp-demo-payment-timeout-001 sessionId 保留多轮上下文,Trace 精确回放依赖 runId
data.session.query 是否包含支付超时问题 Trace 记录了原始用户意图
data.session.answer 是否包含最终诊断答案 最终答案没有脱离 Trace
data.session.selfEvaluation 是否包含 verifier 或 rule evaluation 答案经过质量门,不只是模型原始输出
data.session.selfEvaluation.verifier_evaluation.gatekeeper_result.rule_set_version 如果是 Chat V2 链路,是否记录 Gatekeeper 规则版本 安全规则可审计、可回归
data.session.selfEvaluation.verifier_evaluation.prompt_audit.version 如果是 Chat V2 链路,是否记录 Prompt 审计版本 Prompt 变更可解释、可回归
data.session.selfEvaluation.verifier_evaluation.prompt_audit.prompts[*].version 是否记录 planner / executor / verifier / composer 版本 便于定位 Prompt 变更影响
data.session.feedback 提交反馈后是否变为 useful 用户反馈挂在当前 diagnosis run 上

2. Agent 步骤

JSON path 检查点 面试讲点
data.steps[*].agentName 是否有 Planner / Executor / Verifier 或等价步骤 流程被拆成可检查的 Agent 步骤
data.steps[*].thought 是否有高层步骤摘要 内部过程可审计,不只看最终文本
data.steps[*].durationMs 是否有步骤耗时 Trace 可用于耗时分析
data.steps[*].tokenCount 如可用,是否记录 token Trace 可用于模型成本分析

3. 工具证据

JSON path 检查点 面试讲点
data.toolInvocations[*].toolName 是否包含 lookup_knowledge、query_logs、query_metrics 等证据工具 Agent 通过工具收集证据,而不是无依据猜测
data.toolInvocations[*].inputParams 是否能看到每个工具的入参 工具输入可审计、可调试
data.toolInvocations[*].outputPreview 是否有受控长度的证据预览 保留证据但不倾倒巨大 payload
data.toolInvocations[*].success 是否区分成功和失败 工具失败对 Verifier 和 reviewer 可见
data.toolInvocations[*].retrievalDetails 是否包含检索 metadata 检索质量可事后检查
data.toolInvocations[*].retrievalDetails.evidence_refs 是否包含 raw_path + text Gatekeeper 可以用代码核对 Executor 引用
data.toolInvocations[*].relevanceLevel 是否有相关性等级 可解释检索结果强弱

4. Summary

JSON path 检查点 面试讲点
data.summary.persistedStepCount step 行是否持久化 Trace 来自存储,不是响应内存
data.summary.persistedToolCallCount tool 行是否持久化 工具证据在请求结束后仍可回放
data.summary.hasVerifierEvaluation 是否存在 Verifier 结果 最终答案经过质量门
data.summary.hasFeedback 提交反馈后是否为 true 人类反馈闭环完成

5. 好的结果长什么样

同一个 session id + run id
-> 最终答案
-> 持久化 agent steps
-> 持久化 evidence tool calls
-> verifier / self-evaluation
-> feedback attached to the same run