Files
SuperBizAgent-java/mvp/demo/trace-inspection-checklist.md
T

2.7 KiB

Trace 检查清单

运行 scripts/run-payment-timeout-demo.ps1 后,用这份清单检查 trace-response.json。

1. Session

JSON path 检查点 面试讲点
data.session.sessionId 是否等于 mvp-demo-payment-timeout-001 一个 session id 串起 chat、工具、verifier、feedback 和 trace
data.session.query 是否包含支付超时问题 Trace 记录了原始用户意图
data.session.answer 是否包含最终诊断答案 最终答案没有脱离 Trace
data.session.selfEvaluation 是否包含 verifier 或 rule evaluation 答案经过质量门,不只是模型原始输出
data.session.feedback 提交反馈后是否变为 useful 用户反馈挂在同一次诊断上

2. Agent 步骤

JSON path 检查点 面试讲点
data.steps[*].agentName 是否有 Planner / Executor / Verifier 或等价步骤 流程被拆成可检查的 Agent 步骤
data.steps[*].thought 是否有高层步骤摘要 内部过程可审计,不只看最终文本
data.steps[*].durationMs 是否有步骤耗时 Trace 可用于耗时分析
data.steps[*].tokenCount 如可用,是否记录 token Trace 可用于模型成本分析

3. 工具证据

JSON path 检查点 面试讲点
data.toolInvocations[*].toolName 是否包含 lookup_knowledge、query_logs、query_metrics 等证据工具 Agent 通过工具收集证据,而不是无依据猜测
data.toolInvocations[*].inputParams 是否能看到每个工具的入参 工具输入可审计、可调试
data.toolInvocations[*].outputPreview 是否有受控长度的证据预览 保留证据但不倾倒巨大 payload
data.toolInvocations[*].success 是否区分成功和失败 工具失败对 Verifier 和 reviewer 可见
data.toolInvocations[*].retrievalDetails 是否包含检索 metadata 检索质量可事后检查
data.toolInvocations[*].relevanceLevel 是否有相关性等级 可解释检索结果强弱

4. Summary

JSON path 检查点 面试讲点
data.summary.persistedStepCount step 行是否持久化 Trace 来自存储,不是响应内存
data.summary.persistedToolCallCount tool 行是否持久化 工具证据在请求结束后仍可回放
data.summary.hasVerifierEvaluation 是否存在 Verifier 结果 最终答案经过质量门
data.summary.hasFeedback 提交反馈后是否为 true 人类反馈闭环完成

5. 好的结果长什么样

同一个 session id
-> 最终答案
-> 持久化 agent steps
-> 持久化 evidence tool calls
-> verifier / self-evaluation
-> feedback attached to the same session