c++解析odt/ods需先用libzip解压获取content.xml,再用pugixml解析xml;二者轻量、支持命名空间、无需boost/qt,且避免rapidxml(不支持命名空间)和odfdom-cpp(已废弃)。

没有标准 C++ 库能直接解析 ODT/ODS —— 它们本质是 ZIP 包裹的 XML,必须手动解压 + 解析 XML,或依赖第三方绑定。
ODT/ODS 文件不是二进制文档,而是 ZIP 压缩包
直接用 fopen 读取 .odt 文件只会看到乱码,因为它是 ZIP 格式。LibreOffice/OpenOffice 保存的 .odt、.ods、.odp 都遵循 OASIS OpenDocument v1.3 规范,内部结构固定:
- 根目录含
content.xml(主体文本/表格数据) - 还有
styles.xml、meta.xml、mimetype等文件 -
mimetype文件必须是纯文本且第一行,不可压缩(ZIP 中该文件无压缩)
所以第一步永远是:用 ZIP 库解压,再读取 content.xml。
推荐用 libzip + pugixml 组合解析 content.xml
这两个库轻量、头文件友好、C++11 可用,且不依赖 Boost 或 Qt:
-
libzip用于打开 ZIP 流、定位并提取content.xml内容(注意:不要写临时文件,用zip_fread+ 内存 buffer) -
pugixml解析 XML 节点,比tinyxml2更快、命名空间支持更稳(ODF 大量使用text:、table:等前缀) - 避免用
rapidxml:它不处理命名空间,而content.xml中table:table-row这类节点无法直接匹配
示例关键逻辑:
zip_t* za = zip_open("report.odt", 0, &err);
zip_file_t* f = zip_fopen(za, "content.xml", 0);
char buf[64*1024];
ssize_t n = zip_fread(f, buf, sizeof(buf)-1);
buf[n] = '\0';
zip_fclose(f);
<p>pugi::xml_document doc;
pugi::xml_parse_result result = doc.load_string(buf);
// 注意:必须显式声明命名空间,如 doc.child("office:document-content").child("office:body").child("office:text")</p>
ODS 表格解析要特别注意 table:table-row 和 office:value-type
content.xml 中表格数据藏在 table:table → table:table-row → table:table-cell,但单元格内容不总在 text:p 里:
- 数值型单元格(如 123.45)可能带
office:value="123.45"和office:value-type="float"属性,真实值应优先取属性而非子文本 - 空单元格可能只有
<table-cell></table-cell>,没有子节点,不能假设cell.child("text:p")一定存在 - 合并单元格由
table:number-columns-spanned和table:number-rows-spanned控制,需自行做坐标映射
别硬套 CSV 思维——ODS 是结构化布局模型,不是二维数组。
不建议自己实现 ZIP/XML 解析,也别碰 odfdom-cpp
odfdom-cpp 是 Java 的 ODFDOM 的非官方 C++ 移植,已三年未更新,构建失败率高,且严重依赖旧版 Xerces-C++(与现代 CMake 冲突);而手写 ZIP 解析容易漏掉 mimetype 的特殊处理(它必须是 ZIP 第一个条目、未压缩、无 extra field),导致部分 LibreOffice 生成的 ODS 识别失败。
真正省事又可控的方式,是用 libzip 提取 XML 字符串,再交给 pugixml 解析——两库加起来不到 2MB 编译体积,静态链接无运行时依赖,Windows/macOS/Linux 全平台验证过。
C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!











