html中真正必须转义的只有、&、"、'这5个字符,因其直接参与标签解析与属性界定,不转义将导致dom错乱或xss漏洞;其余字符在utf-8编码下可原样显示。

直接说结论:HTML里真正必须转义的只有 、<code>>、&、"、' 这5个字符;其余全是可选,取决于你是否需要语义、排版或兼容性保障。
为什么只这5个字符必须转义
浏览器解析HTML时,会把 当成标签起始,<code>> 当成标签结束,& 后面如果跟着字母+分号(如 ©),会被识别为实体;" 和 ' 则是属性值的边界符号。不转义它们,轻则内容错位,重则触发XSS漏洞。
其他字符——比如 ©、®、×、€、中文、emoji——只要文档声明了 <meta charset="UTF-8">,且服务端/前端没做额外截断或过滤,就能原样显示,无需强制转义。
不转义 → 可能被当成 <code><div> 开始,后续文本消失或乱入DOM <li> <code>&不转义 →©会被解析成 ©,但&xyz;会原样显示为 &xyz;,而<script></script>可能被拼接执行-
"在属性中不转义 →title="say "hello""会让解析器在第一个"就结束属性值 -
只用于“此处绝不能换行”的场景,比如“第 1 章” -
或在HTML文本节点中无效,只在属性值或JS字符串里有意义 - 中文标点(,。!?)和汉字本身不需要转义,UTF-8下直接写最安全
- 优先用十进制实体(
∑),比十六进制更少出错 - 命名实体仅限常用几个:
<、>、&、"、'、©、®、™ -
是命名实体,但等价于,二者可互换 - Node.js 用
he.escape()(比内置encodeURIComponent更准) - Python 用
html.escape(text, quote=True),默认转义双引号,别关掉 - PHP 用
htmlspecialchars($str, ENT_QUOTES, 'UTF-8'),ENT_QUOTES必须显式传 - 不要自己写正则替换
&→&,它无法处理嵌套或已转义的情况(如&)
常见错误:把空格、换行、中文全转成实体
有人看到 就以为“所有空格都要转”,结果把普通段落里的连续空格写成 ,导致无法选中、复制、搜索,也破坏屏幕阅读器朗读节奏。
换行符 \n 更不能盲目转成 <br> 或
:HTML默认忽略空白符合并,真要保留换行得靠 white-space: pre-line CSS,而不是堆实体。
什么时候该用数字实体而非命名实体
命名实体像 © 看起来清晰,但不是所有浏览器都支持全部命名形式;而十进制 © 和十六进制 © 兼容性更好,尤其在老IE或XML上下文中。
如果你了解HTML,CSS和JavaScript,您已经拥有所需的工具开发Android应用程序。本动手本书展示了如何使用这些开源web标准设计和建造,可适应任何Android设备的应用程序 - 无需使用Java。您将学习如何创建一个在您选择的平台的Android友好的网络应用程序,然后转换与自由PhoneGap框架到一个原生的Android应用程序。了解为什么设备无关的移动应用是未来的潮流,并开始构建应用程序,提供更
更关键的是:有些字符根本没有命名实体。比如数学符号 ∑(U+2211)、emoji ?(U+1F680),只能用 ∑ 或 🚀(注意是十进制);十六进制写法需加 x 前缀:∑、🚀。
服务端输出前的转义最容易漏掉的点
后端模板(如 Jinja2、Twig、ERB)通常有自动转义开关,但开发者常在「已信任内容」判断上出错。比如认为用户昵称“Tom&Jerry”是纯文本,直接 {{ name|safe }} 输出,结果 & 被当实体解析,显示成 “Tom&Jerry”——表面看对,实则埋下XSS隐患(若昵称来自表单且未过滤)。
真正安全的做法是:所有动态插入HTML内容的地方,统一走 escape() 函数,哪怕只是插入一个用户名。
最常被忽略的其实是属性值里的单引号——很多人只防双引号,却忘了 data-id='user's-profile' 会在 's 处截断。所以无论单双引号,只要插进属性,就得全转义。










