Files
reader/docs/context-reset-brief.md
T
2026-03-24 17:01:35 +08:00

2.0 KiB
Raw Blame History

项目当前状态简报

当前已完成

  • 已明确整体链路:来源 -> 聚合池 -> 内容提取 MCP -> LLM 摘要 -> 校验 -> 过滤 -> 入库/推送
  • 已确定当前 MCP 的职责边界:
    • 只负责内容提取
    • 不负责摘要、分类、价值判断
  • 已完成 Python MCP 骨架
  • 已实现两个 tool:
    • extract_url_content
    • extract_item_content
  • 已完成真实 URL 提取验证
  • 已完成 LLM 摘要 prompt
  • 已完成 LLM 摘要结果 schema 校验器
  • 已完成“提取 JSON -> LLM 摘要 JSON -> 校验”的最小闭环脚本
  • 已完成 LLM 摘要校验 skill 封装
  • 已清理旧的启发式 summarizer.py
  • 已将旧的 MCP 设计文档更新为当前“Content Extract MCP”语义

当前关键文件

  • MCP 入口:
    • src/summary_mcp/server.py
  • 提取主流程:
    • src/summary_mcp/core/pipeline.py
  • LLM 结果模型:
    • src/summary_mcp/models/llm_result.py
  • LLM 校验器:
    • src/summary_mcp/validators/llm_result.py
  • 校验 CLI:
    • src/summary_mcp/validate_llm_result.py
  • 最小闭环脚本:
    • scripts/run_summary_loop.py
  • 当前提示词:
    • outputs/llm-summary-prompt.txt
  • MVP 归档:
    • docs/content-extract-mcp-mvp-archive.md
  • 当前 TODO:
    • TODO.md

当前已经验证通过

  • 参考文章 URL 可提取为结构化 JSON
  • LLM 可根据提取结果生成摘要 JSON
  • validator 可校验摘要 JSON
  • 最小闭环脚本可直接调用 LLM 接口并产出通过校验的结果

当前未开始的下一阶段

  • 让 FreshRSS 作为主聚合池
  • 设计 FreshRSS entry -> item 的映射
  • 准备真实 item 样例
  • 开始定义规则过滤层 schema

收束后建议从这里继续

优先从这两个问题继续:

  1. FreshRSS 的 entry 字段如何映射成 item
  2. 先做一个真实 item 样例文件,再讨论规则过滤

一句话结论

当前 MVP 已完成,下一阶段不再是继续打磨 MCP,而是开始接入 FreshRSS 上游并建立 item 标准化入口。