敏感词检测器

Sensitive Word Detector

Detect sensitive keywords in text and list matched items.

📐 工作原理与说明
敏感词检测按词库匹配:命中数 = Σ 各敏感词在文本中的出现次数(可用 Aho-Corasick 自动机一次扫描匹配全部模式);命中率 = 命中词数 ÷ 文本总词数 × 100%;按命中位置的偏移量高亮并返回上下文片段,支持同音、变体与间隔符的模糊匹配以提高召回。

📚 深度解析:敏感词检测器 / 过滤器

💡 常见使用场景

示例:替换与高亮
文本“免费领取大奖”含敏感词“大奖”,替换模式用“*”覆盖为“免费领取***”(掩码长度随原词长度,1–6 位);高亮模式则在页面上把“大奖”标黄提示。多词用换行或逗号分隔,按正则精确匹配。

❓ 常见问题(FAQ)

掩码长度怎么定?
替换字符按原词长度重复,但限制在 1–6 位(Math.max(1,Math.min(6,长度))),既掩盖原词又不会过长影响排版。
能匹配部分词或大小写吗?
词表项会先做正则转义(特殊字符当字面量),按子串包含匹配,因此“大奖”会命中“中了大奖”。如需整词边界,可在词表项前后加边界符。