敏感词检测器
← ToolBox
/ 敏感词检测器
🌙
首页
‹
📝 文本处理
‹
敏感词检测器
Sensitive Word Detector
Detect sensitive keywords in text and list matched items.
📐 工作原理与说明
敏感词检测按词库匹配:命中数 = Σ 各敏感词在文本中的出现次数(可用 Aho-Corasick 自动机一次扫描匹配全部模式);命中率 = 命中词数 ÷ 文本总词数 × 100%;按命中位置的偏移量高亮并返回上下文片段,支持同音、变体与间隔符的模糊匹配以提高召回。
内容
敏感词(逗号或换行分隔)
违法,垃圾,诈骗,外挂
替换字符
检测并替换
复制清洗文本
📚 深度解析:敏感词检测器 / 过滤器
💡 常见使用场景
用户评论、弹幕、UGC 发布前,批量筛查是否含违规词,命中后替换成掩码或高亮提示。
把自定义敏感词表(如竞品名、内部术语)统一过滤,避免外发内容出现不该出现的词。
内容审核流水线里先做一轮关键词扫描,标出风险片段供人工复核,降低漏审概率。
示例:替换与高亮
文本“免费领取大奖”含敏感词“大奖”,替换模式用“*”覆盖为“免费领取***”(掩码长度随原词长度,1–6 位);高亮模式则在页面上把“大奖”标黄提示。多词用换行或逗号分隔,按正则精确匹配。
❓ 常见问题(FAQ)
掩码长度怎么定?
替换字符按原词长度重复,但限制在 1–6 位(Math.max(1,Math.min(6,长度))),既掩盖原词又不会过长影响排版。
能匹配部分词或
大小写
吗?
词表项会先做正则转义(特殊字符当字面量),按子串包含匹配,因此“大奖”会命中“中了大奖”。如需整词边界,可在词表项前后加边界符。