Files
reader/skills/keyword-cleanup-review/SKILL.md
T

3.0 KiB

name, description
name description
keyword-cleanup-review 审查和整理本仓库的每日关键词索引和频率统计。当用户需要检查 `data/term_index/term_stats.json`、最近的 `data/term_index/daily/*.json`、`configs/term_aliases.json`、`configs/term_stopwords.json` 或 `configs/filter_context.personal.json`,以提议别名合并、停用词、关注词或 `interest_keywords` 更新(但不直接修改配置)时使用。

关键词清理审查

使用此技能将仓库的关键词统计转化为可审查的清理建议。

工作流程

  1. 构建精简的审查数据包:
python skills/keyword-cleanup-review/scripts/build_review_bundle.py

可选参数:

  • --days 7
  • --top 50
  • --output outputs/term_index/review/keyword-cleanup-bundle.json
  1. 阅读生成的数据包和建议模式:
  • outputs/term_index/review/keyword-cleanup-bundle.json
  • skills/keyword-cleanup-review/references/suggestion-schema.md
  1. 生成两份输出:
  • 一份简短的供人工审阅的 Markdown 报告
  • 一份符合模式的 JSON 建议文件
  1. 严格保持边界:
  • 建议 configs/term_aliases.json 的修改
  • 建议 configs/term_stopwords.json 的修改
  • 建议 configs/filter_context.personal.json 的新增
  • 除非用户明确要求,否则不要直接编辑这些文件
  • 除非用户要求修改规则逻辑,否则不要建议直接编辑 configs/filter_rules.json

审查启发式规则

优先考虑以下决策:

  • 别名建议
    • 同一概念的不同命名、大小写、缩写或中英文变体
  • 停用词建议
    • 过于通用、过于宽泛或噪声过大,对过滤无帮助
  • 兴趣关键词建议
    • 高频且与用户的后端工程、AI Agent 和前沿技术关注方向一致
  • 关注词
    • 近期出现且可能重要,但证据尚不充分

建议保守为主。如果置信度较低,将词放入 watch_terms。

输入

主要输入:

  • data/term_index/term_stats.json
  • data/term_index/daily/*.json
  • configs/term_aliases.json
  • configs/term_stopwords.json
  • configs/filter_context.personal.json
  • configs/term_cleanup_policy.json
  • configs/term_watchlist.json
  • configs/term_change_log.json

打包脚本已将这些内容压缩为单个审查数据包。

输出要求

Markdown 输出应:

  • 简要总结当前状态
  • 列出值得处理的高频词
  • 分类别名、停用词、兴趣关键词和关注词建议
  • 用简短、具体的句子解释理由

JSON 输出应遵循:

  • references/suggestion-schema.md

仓库说明

当前仓库行为:

  • 关键词统计由程序维护,而非 LLM 维护
  • 统计基于 keywords 构建,而非 topics
  • 统计仅包含非 drop 候选项
  • data/term_index/term_stats.json 从每日文件重建,因此重新运行会覆盖同一天的数据而非重复计算
  • 清理策略、关注列表和变更日志是仓库管理的治理输入,审查时应予以尊重

保持建议与此设计保持一致。

资源

  • 脚本:
    • scripts/build_review_bundle.py
  • 参考文档:
    • references/suggestion-schema.md