feat(phase1): 实现文档分块向量化索引
Task 5.6: 向量化索引实现 - VectorIndexService 新增方法: - indexDocumentChunks(docId, chunks): 索引文档分块到 Milvus - deleteDocumentChunks(docId): 删除文档的所有向量 - buildDocumentMetadata(): 构建文档元数据(区分文件索引) 核心流程: 1. 上传时:文本提取 → 分块 → 向量化 → 存入 Milvus + MySQL 2. 检索时:问题向量化 → Milvus 语义检索 → 返回相似文档 3. 删除时:删除元数据 + 删除向量索引 实现细节: - 复用 indexSingleFile 的向量化逻辑 - metadata.docId 标识文档来源(区分 upload: 和 file:) - 删除表达式:metadata["docId"] == "xxx" - 自动去重:上传前删除旧向量数据 DocumentManagementService 完整实现: - uploadDocument: 完整向量化流程(移除 TODO) - deleteDocument: 同步删除向量索引(移除 TODO) 编译验证:BUILD SUCCESS Progress: 32/34 tasks completed (94%)
This commit is contained in:
@@ -42,8 +42,9 @@
|
||||
- [x] 5.3 文档上传接口 (DocumentController#upload, DocumentManagementService#uploadDocument)
|
||||
- [x] 5.4 文档查询接口 (DocumentController#query, DocumentService#queryDocuments)
|
||||
- [x] 5.5 文档删除接口 (DocumentController#delete, DocumentService#deleteDocument)
|
||||
- [ ] 5.6 混合检索工具 (DocumentSearchTool: 精确匹配 + 语义检索 + RRF 融合)
|
||||
- [ ] 5.7 文档管理集成测试 (DocumentIntegrationTest)
|
||||
- [x] 5.6 向量化索引 (VectorIndexService#indexDocumentChunks, 实现分块级别索引)
|
||||
- [ ] 5.7 混合检索工具 (DocumentSearchTool: 精确匹配 + 语义检索 + RRF 融合)
|
||||
- [ ] 5.8 文档管理集成测试 (DocumentIntegrationTest)
|
||||
|
||||
## 6. 全局完善
|
||||
|
||||
|
||||
Reference in New Issue
Block a user