--- name: keyword-cleanup-review description: 审查和整理本仓库的每日关键词索引和频率统计。当用户需要检查 `data/term_index/term_stats.json`、最近的 `data/term_index/daily/*.json`、`configs/term_aliases.json`、`configs/term_stopwords.json` 或 `configs/filter_context.personal.json`,以提议别名合并、停用词、关注词或 `interest_keywords` 更新(但不直接修改配置)时使用。 --- # 关键词清理审查 使用此技能将仓库的关键词统计转化为可审查的清理建议。 ## 工作流程 1. 构建精简的审查数据包: ```bash python skills/keyword-cleanup-review/scripts/build_review_bundle.py ``` 可选参数: - `--days 7` - `--top 50` - `--output outputs/term_index/review/keyword-cleanup-bundle.json` 2. 阅读生成的数据包和建议模式: - `outputs/term_index/review/keyword-cleanup-bundle.json` - `skills/keyword-cleanup-review/references/suggestion-schema.md` 3. 生成两份输出: - 一份简短的供人工审阅的 Markdown 报告 - 一份符合模式的 JSON 建议文件 4. 严格保持边界: - 建议 `configs/term_aliases.json` 的修改 - 建议 `configs/term_stopwords.json` 的修改 - 建议 `configs/filter_context.personal.json` 的新增 - 除非用户明确要求,否则不要直接编辑这些文件 - 除非用户要求修改规则逻辑,否则不要建议直接编辑 `configs/filter_rules.json` ## 审查启发式规则 优先考虑以下决策: - 别名建议 - 同一概念的不同命名、大小写、缩写或中英文变体 - 停用词建议 - 过于通用、过于宽泛或噪声过大,对过滤无帮助 - 兴趣关键词建议 - 高频且与用户的后端工程、AI Agent 和前沿技术关注方向一致 - 关注词 - 近期出现且可能重要,但证据尚不充分 建议保守为主。如果置信度较低,将词放入 `watch_terms`。 ## 输入 主要输入: - `data/term_index/term_stats.json` - `data/term_index/daily/*.json` - `configs/term_aliases.json` - `configs/term_stopwords.json` - `configs/filter_context.personal.json` - `configs/term_cleanup_policy.json` - `configs/term_watchlist.json` - `configs/term_change_log.json` 打包脚本已将这些内容压缩为单个审查数据包。 ## 输出要求 Markdown 输出应: - 简要总结当前状态 - 列出值得处理的高频词 - 分类别名、停用词、兴趣关键词和关注词建议 - 用简短、具体的句子解释理由 JSON 输出应遵循: - `references/suggestion-schema.md` ## 仓库说明 当前仓库行为: - 关键词统计由程序维护,而非 LLM 维护 - 统计基于 `keywords` 构建,而非 `topics` - 统计仅包含非 `drop` 候选项 - `data/term_index/term_stats.json` 从每日文件重建,因此重新运行会覆盖同一天的数据而非重复计算 - 清理策略、关注列表和变更日志是仓库管理的治理输入,审查时应予以尊重 保持建议与此设计保持一致。 ## 资源 - 脚本: - `scripts/build_review_bundle.py` - 参考文档: - `references/suggestion-schema.md`