test: add rag retrieval baseline
This commit is contained in:
@@ -0,0 +1,27 @@
|
||||
## Why
|
||||
|
||||
The RAG refactor needs a repeatable baseline before changing L0, metadata filtering, post-processing, or Spring AI retriever integration. Without fixed retrieval cases and measurable output, later changes can look cleaner architecturally while silently degrading recall or evidence quality.
|
||||
|
||||
## What Changes
|
||||
|
||||
- Add a retrieval evaluation baseline for RAG queries, separate from full diagnosis evaluation.
|
||||
- Define golden retrieval cases covering Chat-style knowledge lookup and AIOps-style alert diagnosis retrieval.
|
||||
- Add a lightweight offline evaluator that compares retrieved candidates against expected documents, breadcrumbs, and evidence keywords.
|
||||
- Preserve baseline JSON and Markdown reports so future changes can compare retrieval behavior.
|
||||
- No production retrieval behavior changes in this change.
|
||||
|
||||
## Capabilities
|
||||
|
||||
### New Capabilities
|
||||
|
||||
- `rag-retrieval-evaluation`: Defines fixed retrieval golden cases, deterministic retrieval evaluation, and baseline report preservation.
|
||||
|
||||
### Modified Capabilities
|
||||
|
||||
- None.
|
||||
|
||||
## Impact
|
||||
|
||||
- Adds retrieval evaluation fixtures, documentation, and scripts.
|
||||
- May read existing retrieval/tool trace output or saved fixtures, but does not require live LLM calls.
|
||||
- Does not change the `lookup_knowledge` runtime behavior, Milvus schema, document upload API, or Agent flow.
|
||||
Reference in New Issue
Block a user