Files
SuperBizAgent-java/mvp/demo/interview-walkthrough.md

3.8 KiB
Raw Permalink Blame History

面试演示讲解稿

这是一份短时间 Agent 工程面试用讲解稿,不是完整系统文档。

1. 30 秒摘要

这是一个企业故障诊断 Agent MVP。
它接收支付超时问题,规划排查步骤,调用证据工具,
用 Verifier 检查答案,把完整 Trace 持久化,并支持用户反馈。

关键主张不是“模型回答了一次”,而是:

系统能展示用了什么证据、答案如何被检查、如何用 sessionId + runId 精确回放这次诊断。

2. Demo 流程

  1. 用 mvp-demo profile 启动服务。
  2. 运行固定的支付超时请求。
  3. 打开 mvp/demo/output/chat-response.json。
  4. 打开 mvp/demo/output/trace-response.json。
  5. 指出证据工具和 verifier evaluation。
  6. 提交 feedback,并展示它挂在当前 run 上。
  7. 打开 evidence-pipeline-scenarios.md,说明 PASS / LOW_CONFID / REJECT / no-evidence 的固定回归矩阵。

3. 命令

启动服务:

mvn spring-boot:run "-Dspring-boot.run.profiles=mvp-demo"

另开终端运行 Demo:

powershell -ExecutionPolicy Bypass -File mvp/demo/scripts/run-payment-timeout-demo.ps1

可选自定义 session:

powershell -ExecutionPolicy Bypass -File mvp/demo/scripts/run-payment-timeout-demo.ps1 -SessionId "mvp-demo-payment-timeout-002"

4. 展示什么

4.1 用户侧答案

文件:

mvp/demo/output/chat-response.json

话术:

这是用户看到的答案。这里的 sessionId 是稳定的,同时响应里会返回 runId,所以我后面可以精确追踪这一次回答是怎么来的。

4.2 证据 Trace

文件:

mvp/demo/output/trace-response.json

话术:

这才是 Agent 工程最重要的部分。
我可以检查 Agent 调用了哪些工具、每个工具拿到什么入参、是否成功、返回了什么证据预览。

重点字段:

  • data.toolInvocations[*].toolName
  • data.toolInvocations[*].inputParams
  • data.toolInvocations[*].outputPreview
  • data.toolInvocations[*].success

4.3 Verifier / 自评估

重点字段:

  • data.session.selfEvaluation
  • data.summary.hasVerifierEvaluation

话术:

最终答案不是 Executor 原始输出直接返回。
系统会基于持久化的工具 trace 做 Verifier 或规则自评估。
这样系统可以区分 PASS、LOW_CONFID、REJECT,而不是假装每个答案都同样可信。

4.4 反馈闭环

文件:

mvp/demo/output/feedback-response.json

必要时重新查询 Trace。

话术:

feedback 会挂在当前 diagnosis run 上。
这让后续挖掘 useful case 或 not_useful bad case 成为可能。

4.5 回归故事

如果被问到稳定性,可以补充:

我把运行时 Demo 和离线 eval 分开。
Demo 证明真实链路能跑通,offline eval baseline 证明固定 case 可以回归。
这两者分开是有意的:Demo 面向人类审阅,eval 面向自动化信号。

如果被问到怎么防止证据归因幻觉,可以补充:

Executor 的 claim 必须绑定 source_invocation_id、raw_path 和 evidence_excerpt。
Gatekeeper 用代码核验这些引用,并把 rule_set_version 写进 trace。
Verifier 只判断已核验证据能否推出 claim,Composer 只表达允许输出的内容。

5. 强面试表达

我关注的是 Agent 工程表面:
traceability、evidence persistence、verifier gating、feedback 和 regression checks。
模型答案只是系统的一部分。
更重要的是答案产出后,能否被审计、验证和持续改进。

6. 主动说明限制

这个 MVP 仍依赖 MySQL、Redis、Milvus 和模型凭证。
mvp-demo profile mock 了日志和指标,但不是完整生产运行环境。
密钥清理、默认隔离测试和生产可靠性是后续 hardening 工作。