- term_change_log: record watch term add history - term_watchlist: add initial watch terms from cleanup review - term_aliases: minor update - filter_context.personal: reorganize interest keywords - keyword-cleanup-review skill: clarify JSON as formal artifact, markdown as temp review copy - openclaw_delivery: add Python <3.11 UTC import compat - daily-keyword-index-design: update suggestion artifact semantics
152 lines
4.4 KiB
Markdown
152 lines
4.4 KiB
Markdown
---
|
|
name: keyword-cleanup-review
|
|
description: 审查和整理本仓库的每日关键词索引和频率统计。当用户需要检查 `data/term_index/term_stats.json`、最近的 `data/term_index/daily/*.json`、`configs/term_aliases.json`、`configs/term_stopwords.json` 或 `configs/filter_context.personal.json`,以提议别名合并、停用词、关注词或 `interest_keywords` 更新(但不直接修改配置)时使用。
|
|
---
|
|
|
|
# 关键词清理审查
|
|
|
|
使用此技能将仓库的关键词统计转化为可审查的清理建议。
|
|
|
|
## 工作流程
|
|
|
|
1. 构建精简的审查数据包(临时工作文件):
|
|
|
|
```bash
|
|
python skills/keyword-cleanup-review/scripts/build_review_bundle.py
|
|
```
|
|
|
|
可选参数:
|
|
|
|
- `--days 7`
|
|
- `--top 50`
|
|
- `--output outputs/term_index/review/keyword-cleanup-bundle.json`
|
|
|
|
2. 阅读建议模式:
|
|
|
|
- `skills/keyword-cleanup-review/references/suggestion-schema.md`
|
|
|
|
3. 运行 suggestions 生成脚本:
|
|
|
|
```bash
|
|
python scripts/generate_term_cleanup_suggestions.py ^
|
|
--bundle outputs/term_index/review/keyword-cleanup-bundle.json
|
|
```
|
|
|
|
默认生成:
|
|
|
|
- 一份符合模式的 JSON 建议文件(正式建议产物)
|
|
|
|
如需人工审阅展示稿,再显式加:
|
|
|
|
```bash
|
|
python scripts/generate_term_cleanup_suggestions.py ^
|
|
--bundle outputs/term_index/review/keyword-cleanup-bundle.json ^
|
|
--emit-markdown
|
|
```
|
|
|
|
这时才会额外生成:
|
|
|
|
- 一份简短的供人工审阅的 Markdown 报告(临时展示稿)
|
|
|
|
4. 严格保持边界:
|
|
|
|
- 建议 `configs/term_aliases.json` 的修改
|
|
- 建议 `configs/term_stopwords.json` 的修改
|
|
- 建议 `configs/filter_context.personal.json` 的新增
|
|
- 除非用户明确要求,否则不要直接编辑这些文件
|
|
- 除非用户要求修改规则逻辑,否则不要建议直接编辑 `configs/filter_rules.json`
|
|
|
|
## 审查启发式规则
|
|
|
|
优先考虑以下决策:
|
|
|
|
- 别名建议
|
|
- 同一概念的不同命名、大小写、缩写或中英文变体
|
|
- 停用词建议
|
|
- 过于通用、过于宽泛或噪声过大,对过滤无帮助
|
|
- 兴趣关键词建议
|
|
- 高频且与用户的后端工程、AI Agent 和前沿技术关注方向一致
|
|
- 关注词
|
|
- 近期出现且可能重要,但证据尚不充分
|
|
|
|
建议保守为主。如果置信度较低,将词放入 `watch_terms`。
|
|
|
|
## 输入
|
|
|
|
主要输入:
|
|
|
|
- `data/term_index/term_stats.json`
|
|
- `data/term_index/daily/*.json`
|
|
- `configs/term_aliases.json`
|
|
- `configs/term_stopwords.json`
|
|
- `configs/filter_context.personal.json`
|
|
- `configs/term_cleanup_policy.json`
|
|
- `configs/term_watchlist.json`
|
|
- `configs/term_change_log.json`
|
|
|
|
打包脚本已将这些内容压缩为单个审查数据包。
|
|
|
|
## 输出要求
|
|
|
|
Markdown 输出应:
|
|
|
|
- 简要总结当前状态
|
|
- 列出值得处理的高频词
|
|
- 分类别名、停用词、兴趣关键词和关注词建议
|
|
- 用简短、具体的句子解释理由
|
|
|
|
说明:Markdown 主要用于人工临时审阅,不必默认当作长期资产保留。
|
|
|
|
JSON 输出应遵循:
|
|
|
|
- `references/suggestion-schema.md`
|
|
|
|
说明:JSON 是 review / apply 之间的唯一正式建议产物,应优先保留。
|
|
|
|
## 产物保留策略
|
|
|
|
长期保留:
|
|
|
|
- `data/term_index/daily/*.json`
|
|
- `data/term_index/term_stats.json`
|
|
- `configs/filter_context.personal.json`
|
|
- `configs/term_watchlist.json`
|
|
- `configs/term_aliases.json`
|
|
- `configs/term_stopwords.json`
|
|
- `configs/term_change_log.json`
|
|
|
|
短期保留:
|
|
|
|
- `outputs/term_index/review/term-cleanup-suggestions-YYYY-MM-DD.json`
|
|
|
|
临时产物:
|
|
|
|
- `outputs/term_index/review/keyword-cleanup-bundle.json`
|
|
- `outputs/term_index/review/term-cleanup-suggestions-YYYY-MM-DD.md`
|
|
|
|
默认执行口径:
|
|
|
|
- bundle 只作为运行时工作文件,默认只保留当前最新一份
|
|
- Markdown 只作为人工展示层,优先按需生成,不默认长期归档
|
|
- JSON suggestions 是 review / apply 之间唯一正式建议输入
|
|
|
|
## 仓库说明
|
|
|
|
当前仓库行为:
|
|
|
|
- 关键词统计由程序维护,而非 LLM 维护
|
|
- 统计基于 `keywords` 构建,而非 `topics`
|
|
- 统计仅包含非 `drop` 候选项
|
|
- `data/term_index/term_stats.json` 从每日文件重建,因此重新运行会覆盖同一天的数据而非重复计算
|
|
- 清理策略、关注列表和变更日志是仓库管理的治理输入,审查时应予以尊重
|
|
|
|
保持建议与此设计保持一致。
|
|
|
|
## 资源
|
|
|
|
- 脚本:
|
|
- `scripts/build_review_bundle.py`
|
|
- `scripts/generate_term_cleanup_suggestions.py`
|
|
- 参考文档:
|
|
- `references/suggestion-schema.md`
|