Add keyword cleanup governance workflow

This commit is contained in:
zhuyongxin
2026-03-27 16:59:52 +08:00
parent 100044e1f7
commit 32ad584348
25 changed files with 1915 additions and 18 deletions
+15 -1
View File
@@ -15,6 +15,17 @@
这是当前推荐的生产模式。
## 词元统计运行数据
词元统计不放在 `outputs/` 下,而放在单独的运行数据目录:
- `data/term_index/daily/YYYY-MM-DD.json`
- 某一天的日报级 `keywords` 聚合结果
- `data/term_index/term_stats.json`
- 全局累计词频统计
这两类文件属于可重建的本地运行数据,不作为仓库长期跟踪产物。
## 调试扩展输出
当启用 `debug_artifacts` 时,才会额外写出这些中间文件:
@@ -57,6 +68,7 @@
- 默认优先保留最终产物,不把所有中间文件都当成长期资产
- 调试文件只在需要时生成
- `reference/` 只放可复用样例,不放真实生产批次数据
- `data/term_index/` 只保存本地词元统计运行数据,不纳入 git 跟踪
## 当前建议
@@ -65,5 +77,7 @@
- `openclaw-delivery-payload.json`
- `run-report.json`
- `freshrss.raw.json`
- `data/term_index/daily/YYYY-MM-DD.json`
- `data/term_index/term_stats.json`
其余文件默认都应视为调试辅助产物。
其中前 3 个是本次批处理产物,后 2 个是持续累积的词元统计数据。