2.1 KiB
2.1 KiB
TODO
当前状态
项目当前处于 Content Extract MCP 的 MVP 完成阶段。
已完成:
- 明确整体阅读流链路
- 明确
source -> item -> document/article的数据抽象 - 明确
MCP 负责提取,LLM 负责摘要的职责边界 - 搭建 Python MCP 服务骨架
- 实现
extract_url_content - 实现
extract_item_content - 完成标题与正文提取
- 完成质量标记与结构化错误输出
- 用参考文章完成真实提取测试
- 输出结构化提取 JSON 文件
- 设计并迭代 LLM 摘要 prompt
- 验证 LLM 输出的
result.json基本符合预期 - 已封装 LLM 摘要校验 workflow skill
P0 - 近期必须完成
- 为 LLM 摘要结果定义正式 JSON Schema
- 增加一个本地校验脚本,自动校验
result.json是否符合 schema - 把“提取 JSON -> LLM 摘要 JSON”串成一个标准化本地流程
- 清理或移除当前已不再使用的
src/summary_mcp/core/summarizer.py - 更新旧设计文档中仍然残留的
summary mcp描述,避免和当前实现冲突
P1 - 下一阶段推进
- 把上游 RSS 聚合结果映射成标准化
item - 补充
item的实际样例文件 - 定义规则过滤层的输入输出 schema
- 设计知识库入库格式
- 设计 webhook / 推送格式
- 给提取结果增加更多正文清洗策略,比如尾部噪音清理
P2 - 后续增强项
- 增加批量提取能力
- 引入 Playwright 作为动态页面兜底抓取方案
- 支持更多
content_kind,例如release、thread、video - 增加提取缓存、重试和更细粒度日志
- 重命名包和项目名,从
summary_mcp调整为更符合当前职责的名称 - 与 OpenClaw 做更正式的工作流编排整合
当前建议的下一步
优先做这两件事:
- 把上游 RSS 聚合结果映射成标准化
item - 补充一个真实
item样例文件并开始设计规则过滤 schema
收束上下文后建议先看
- docs/context-reset-brief.md
- docs/content-extract-mcp-mvp-archive.md
- TODO.md