ujson通过纯c实现绕过python解释器开销,内存预分配、跳过类型检查与unicode转义,在编码速度上比标准json快2–5倍,但不支持datetime等复杂类型及自定义hook。

因为 ujson 是纯 C 实现,绕过了 Python 解释器的执行开销,直接操作内存和底层编码逻辑。
ujson 的 C 实现跳过了 Python 的逐层递归解析
原生 json 模块在 CPython 中虽有部分 C 扩展,但核心序列化逻辑仍依赖 Python 层的递归遍历和对象转换——每次类型判断、字符串拼接、字典键检查都经过解释器调度,带来可观的函数调用与对象创建开销。而 ujson 整个编码器(lib/ultrajsonenc.c)完全用 C 写,数字转字符串用 Google 的 double-conversion 库,UTF-8 编码路径高度内联,没有 Python 对象封装成本。
- 典型场景下,
ujson.dumps()比json.dumps()快 2–5 倍,尤其在大量字符串或数值数组时优势更明显 - 它不生成带空格的格式化输出(除非显式传
indent),减少了不必要的字符写入 - 没有对每个 dict key 做
isinstance(key, str)检查,而是直接假设输入结构合法,省掉运行时类型断言
内存分配策略更激进,但也更轻量
ujson 在编码前预估输出长度并一次性 malloc 缓冲区,避免像标准库那样频繁 realloc 和 copy;解码时也复用内部缓冲池,减少 GC 压力。这在处理百万级元素列表时,内存占用能低 10–20%。
Miller (mlr) 是一个命令行工具,用于查询、整形和重新格式化名称索引数据,如 CSV、TSV、JSON 和 JSON Lines。它将 awk、sed、cut、join 和 sort 的功能整合到一个专为结构化数据处理而构建的单一工具中。
- 测试显示:解析 256 个双精度数,
ujson.loads()耗时约 65ms,json.loads()约 120ms - 但要注意:
ujson不支持自定义default函数或object_hook,遇到不可序列化类型(如datetime、Decimal)会直接报错或静默失败 - 它的错误提示不如
json清晰——比如 JSON 格式错误时可能只抛ValueError,不带具体偏移位置
ensure_ascii=False 不只是“支持中文”,它省掉了 escape 开销
原生 json.dumps() 默认把非 ASCII 字符转成 \uXXXX 形式,这个过程涉及 Unicode 编码查表和字符串重建;而 ujson.dumps(data, ensure_ascii=False) 直接按 UTF-8 字节流写入,跳过转义步骤。
- 含中文的 dict 序列化,开启
ensure_ascii=False后,ujson性能提升比json更显著 - 但注意:输出是合法 UTF-8 字节串,如果后续要写入文件或 HTTP 响应,需确认接收端能正确处理 raw UTF-8(比如某些老 HTTP 客户端默认当 ISO-8859-1)
-
orjson更进一步——它默认只返回bytes,连.encode('utf-8')这步都省了
真正影响落地效果的,往往不是“快多少”,而是你是否提前处理好了数据类型兼容性——ujson 不吃 datetime,不认 dataclass,也不接受自定义 encoder。换库前先扫一遍你的数据结构,比盲目替换更重要。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










