敏感词过滤应放在iris中间件层:用iris.handler在ctx.next()前统一处理,通过预读body、ac自动机构建trie树匹配,并支持热更新与并发安全。

敏感词过滤该放在 Iris 的哪一层
直接在路由处理器里写过滤逻辑最简单,但会重复、难维护。Iris 提供的 iris.Context 生命周期钩子中,ctx.Next() 前执行过滤最合适——也就是用中间件(iris.Handler)。这样所有需要过滤的路由统一挂载,不侵入业务代码。
注意:不要在 ctx.Values().Set() 之后再改请求体,因为 ctx.Request().Body 是单次读取流,中间件里读一次后后续处理器再读就是空的。
如何安全读取并重置请求 Body 实现过滤
敏感词检测必须基于原始请求内容(比如 POST /api/comment 的 JSON body),但 ctx.Request().Body 是 io.ReadCloser,读完就关闭。得先读出来、检测、再“伪造”一个可重读的 body 给下游。
- 用
io.ReadAll(ctx.Request().Body)拿到原始字节 - 检测前先判断 Content-Type 是否含
application/json或application/x-www-form-urlencoded,避免对文件上传等二进制请求误处理 - 检测命中后,直接
ctx.StatusCode(400)+ctx.JSON(iris.Map{"error": "包含敏感词"})并 return,不调用ctx.Next() - 未命中时,用
bytes.NewReader(data)包装原始数据,再通过ctx.Request().Body = ioutil.NopCloser(reader)(Go 1.19+ 推荐用io.NopCloser)重置 body
用什么方式匹配敏感词效率高又支持中文
正则 regexp.MustCompile 对少量词还行,但词库一过百,回溯爆炸、CPU 占用高;逐个 strings.Contains 更慢。推荐用 AC 自动机(Aho-Corasick),Go 有轻量库 github.com/BobuSumisu/ahocorasick,支持 Unicode,建树快、匹配 O(n)。
实操建议:
- 启动时一次性加载敏感词列表,构建
*ahocorasick.Trie实例,存在全局变量或app.RegisterDependency()注入 - 匹配时用
trie.FindAll([]byte(bodyStr)),返回所有命中位置和关键词,比布尔判断更利于日志审计 - 避免在每次请求里重新编译正则或重建 trie,那是典型性能陷阱
怎么让敏感词规则热更新不重启服务
Iris 本身不提供配置热重载,得自己加一层。最简方案是监听文件变化(如 sensitive_words.json),用 fsnotify 库捕获 WRITE 事件,触发 trie 重建。
关键细节:
- 重建过程要加
sync.RWMutex,读(过滤中间件)用RLock(),写(重建 trie)用Lock(),避免并发 panic - 新 trie 构建成功后再原子替换旧实例(
atomic.StorePointer或互斥写指针),不能边用边改结构 - 别依赖 HTTP 接口动态 POST 词库——没鉴权极易被刷,且无持久化,重启即丢
真正难的不是加过滤,而是词库版本管理、命中词脱敏上报、以及绕过 base64/unicode 编码的变体检测——这些得在匹配前做预标准化,否则形同虚设。











