elementtree 默认不支持 cdata,所有文本均被自动转义;python 3.8+ 可通过重写 _serialize_xml 钩子注入 cdata,需自定义类型标记并注册序列化器,且须预处理内容中的 ]]> 避免解析错误。

ElementTree 默认不支持 CDATA,写进去的内容会被转义
ElementTree 的设计哲学是把 XML 当成数据结构处理,不是文本模板引擎。它没有原生 CDATA 支持,xml.etree.ElementTree 所有文本内容(包括 element.text 和 element.tail)都会被自动转义:比如 <script></script> 变成 <script>,]]> 本身也保不住——你塞进去的字符串只是普通文本,序列化时照样被扫一遍。
常见错误现象:
– 直接赋值 elem.text = "hello]]>",结果输出是 <![CDATA[<div>hello</div>]]>
– 用 etree.tostring() 看到的是双重转义的垃圾
这不是 bug,是设计使然。想绕过转义,得干预序列化过程本身。
用 _serialize_xml 钩子注入 CDATA(Python 3.8+ 安全方案)
Python 3.8 起,xml.etree.ElementTree 允许通过注册自定义序列化器来接管特定标签的输出逻辑。这是目前最干净、不破坏 ElementTree 正常行为的方式。
实操建议:
- 定义一个标记 CDATA 内容的特殊文本对象(比如用
type区分),避免污染原始字符串 - 重写
_serialize_xml函数,在遇到该类型时跳过转义,直接输出 - 必须用
register_namespace或显式设置default_namespace避免命名空间干扰 - 调用
etree.tostring()时传入method="xml"(默认就是),否则钩子不触发
示例关键片段:
from xml.etree import ElementTree as ET
<p>class CDATA:
def <strong>init</strong>(self, text):
self.text = text</p><p>def _serialize_cdata(write, elem, qnames, namespaces, short_empty_elements):
if isinstance(elem.text, CDATA):
write("")
else:</p><h1>fallback to default</h1><pre class="brush:php;toolbar:false;"> _original_serialize(write, elem, qnames, namespaces, short_empty_elements)替换内置序列化器(仅影响当前 etree 模块)
_original_serialize = ET._serialize_xml ET._serialize_xml = _serialize_cdata
使用
root = ET.Element("root") child = ET.SubElement(root, "content") child.text = CDATA("<script>alert(1)</script>") print(ET.tostring(root, encoding="unicode"))
输出:alert(1)]]>
老版本 Python(
Python 3.7 及更早版本没开放序列化钩子,强行改 _escape 函数风险高:它被多处调用,改错会导致整个 etree 不稳定;且 _escape 是 C 实现的私有函数,不同发行版行为可能不一致。
更现实的选择是切换解析器:
- 用
xml.dom.minidom:支持createCDATASection(),API 明确,但内存占用大、速度慢,适合小文件 - 用第三方库如
lxml:提供etree.CDATA()工厂函数,行为稳定,但引入新依赖 - 纯字符串拼接(仅限简单场景):手动构造 XML 字符串,跳过 etree 序列化,但失去树操作能力,容易出错
注意:minidom 的 toxml() 默认带缩进和换行,若需紧凑输出要传 encoding="utf-8" 并自己 strip(),且不支持 namespace 前缀自动声明。
CDATA 内容里不能出现 ]]>,否则会提前闭合
这是 XML 规范硬性限制,和 Python 实现无关。哪怕你用 lxml 或 minidom,只要最终生成的字符串含 ]]>(连续三个字符),解析器就会认为 CDATA 结束,后面内容变成普通文本或报错。
常见踩坑点:
- 用户输入里带
]]>(比如代码示例、正则表达式、注释)没做预处理 - 拼接多个 CDATA 片段时,中间漏了分隔符,导致
]]> 连在一起 - 误以为 CDATA 是“万能 HTML 注入区”,实际它只是跳过解析,不解决 XSS,也不改变语义
安全做法:对原始内容做一次替换,比如把 ]]> 拆成 ]]>(即闭合 + 新开),或统一替换成编码形式(如 <code>\u301D 等 Unicode 替代符),前提是消费方能对应解码。
这事没法靠 ElementTree 自动兜底,必须在塞进 CDATA 前手动检查。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










