必须在所有依赖 body 的操作前完成敏感词扫描,因 ctx.body() 底层为 io.readcloser,读一次即 eof,重复调用会空或 panic;需用 bytes.newreader(data) 恢复 body,禁用 resetbody();推荐 aho-corasick 算法高效匹配。

直接在 Fiber 的 Next 链中做请求体解析 + 敏感词扫描,比中间件更可控、更少踩坑;不推荐用 ctx.Body() 多次读取,也不建议在路由 handler 里重复写过滤逻辑。
为什么不能在 handler 里用 ctx.Body() 做敏感词检查
因为 ctx.Body() 底层调用的是 io.ReadCloser,读一次就 EOF,后续再调用会返回空或 panic。尤其当你的 handler 后面还接了 JSON 解析(ctx.BodyParser())、文件上传(ctx.FormFile())或日志中间件时,容易触发 http: read on closed response body 或静默丢数据。
- 必须在所有依赖 body 的操作前完成敏感词扫描
- 若使用
ctx.Request().Body手动读取,记得用bytes.NewReader(data)把数据塞回ctx.Request().Body,否则下游拿不到原始内容 - Fiber 的
ctx.Request().ResetBody()不可用 —— 它只重置内部 buffer,不恢复原始流
用自定义中间件统一拦截 POST/PUT/PATCH 请求体
核心思路:只对 Content-Type 为 application/json、application/x-www-form-urlencoded、multipart/form-data 的请求做检测;跳过 GET、HEAD、OPTIONS 和静态资源路径。
- 在中间件里调用
ctx.Request().Body()一次性读出全部字节,然后用bytes.NewReader(data)覆盖ctx.Request().Body - 对 JSON 数据:用
json.Unmarshal解析后递归遍历 map[string]interface{} 和 []interface{},提取所有字符串值做 DFA 或正则匹配 - 对 form-data:检查
ctx.Request().FormValue()的所有 key 对应 value,以及ctx.Request().MultipartForm().File中的文件名(常被用于传恶意 payload) - 命中敏感词后,直接
ctx.Status(400).JSON(fiber.Map{"error": "content contains sensitive word", "field": "content"})并 return,不调用next()
敏感词匹配别用 strings.Contains 或简单 replace
子串误匹配太常见:比如敏感词是 "管理",用户输入 "管理员" 就会被误杀。正则加单词边界又慢——尤其词库超 50 个时,re.Compile("|".join(words)) 生成的 pattern 会退化成 NFA 回溯爆炸。
- 生产环境优先用
ahocorasick(Python)或aho-corasick(Go),它基于 Trie + failure function,单次扫描支持 O(n+m) 匹配 m 个词 - Go 生态推荐
github.com/BobuSumisu/ahocorasick,初始化一次ac.NewAhoCorasick(),之后每次FindAllString都是常量级开销 - 如果词库固定且小于 20 个,可用预编译的
regexp.MustCompile(`\b(` + strings.Join(words, "|") + `)\b`),但必须显式加\b和re.escape等价处理(Go 用regexp.QuoteMeta)
文件上传场景下容易忽略的敏感点
很多人只扫表单字段,却放过了 multipart/form-data 中的文件名。攻击者常把恶意 payload 写进文件名(如 shell.php.jpg、../../etc/passwd),绕过 content 检查。
- 必须调用
ctx.Request().MultipartForm(),遍历form.File的每个*multipart.FileHeader - 对每个
FileHeader.Filename单独跑一遍敏感词扫描,不是只看form.Value - 注意:Fiber 默认不限制 multipart 解析内存,大文件上传可能触发 OOM;建议配合
f.ParseMultipartForm(32 设上限,并在中间件里提前校验 <code>Content-Length
真正难的不是“怎么扫”,而是“扫完怎么不破坏后续流程”——body 流重放、多类型解析兼容、文件名漏检,这三处最容易在线上突然报错。别图省事把过滤逻辑塞进某个 handler,统一收口到中间件,才能稳住。











