直接用 fwrite 写结构体数组有风险,因结构体可能存在内存对齐、字节序、非pod成员等问题,导致跨平台或升级后崩溃;应优先使用 json 等文本格式,或 protobuf/flatbuffers 等二进制协议。

直接用 fwrite 写结构体数组有风险,别这么干
多数人第一反应是把结构体数组当成一块连续内存,用 fwrite 一把写进文件。这在“结构体里全是 POD 类型、没指针、没虚函数、编译器没加 padding 或你已用 #pragma pack 对齐”的极少数情况下能跑通,但一换平台、一升级编译器、一加个 std::string 就崩。常见错误现象包括:读出来字段错位、数值全乱、程序崩溃——因为 sizeof(MyStruct) 不等于你想象中各字段字节之和,而且不同架构下字节序(endianness)还可能不一致。
实操建议:
- 确认结构体是否满足“标准布局(standard-layout)”且不含非 trivial 成员(比如
std::string、std::vector、带构造函数的类);不满足就别碰二进制直写 - 用
static_assert(std::is_standard_layout_v<mystruct>)</mystruct>和static_assert(std::is_trivially_copyable_v<mystruct>)</mystruct>在编译期卡住非法结构体 - 如果只是临时调试、同平台同编译器反复读写,且结构体简单,可加
#pragma pack(1)强制紧凑对齐,但必须同步记录该对齐方式,否则后续维护者会踩坑
推荐用文本格式序列化:JSON + nlohmann/json
对大多数工程场景,用 JSON 是更安全、可读、跨语言的选择。C++ 里最成熟的是 nlohmann/json 库,它支持结构体自动映射(需手动定义 to_json/from_json),也兼容 C++17 结构化绑定。
示例:假设结构体为
struct Person {
int id;
std::string name;
double score;
};
你需要补充序列化逻辑:
void to_json(nlohmann::json& j, const Person& p) {
j = nlohmann::json{{"id", p.id}, {"name", p.name}, {"score", p.score}};
}
void from_json(const nlohmann::json& j, Person& p) {
j.at("id").get_to(p.id);
j.at("name").get_to(p.name);
j.at("score").get_to(p.score);
}
然后保存数组:
std::vector<person> people = {/* ... */};
nlohmann::json j = people;
std::ofstream ofs("data.json");
ofs <p>注意点:</p><div class="aritcle_card flexRow artxards">
<div class="artcardd flexRow">
<a class="aritcle_card_img" rel="nofollow" href="/xiazai/skill4025" title="C++ 算法竞赛自动化测试数据生成与校验框架"><img
src="https://img.php.cn/upload/skill/000/000/081/178988956499722.jpg" alt="C++ 算法竞赛自动化测试数据生成与校验框架" onerror="this.onerror='';this.src='/static/lhimages/moren/morentu.png'" ></a>
<div class="aritcle_card_info flexColumn">
<a rel="nofollow" href="/xiazai/skill4025" title="C++ 算法竞赛自动化测试数据生成与校验框架" class="overflowclass">C++ 算法竞赛自动化测试数据生成与校验框架</a>
<p class="overflowclass">根据原题生成新题面、验证器及完整测试数据,自动套用 testlib 模板,用于用户要求生成测试数据时。</p>
</div>
<a rel="nofollow" href="/xiazai/skill4025" title="C++ 算法竞赛自动化测试数据生成与校验框架" class="aritcle_card_btn flexRow flexcenter"><b></b><span>下载</span>
</a>
</div>
</div><ul>
<li>
<code>dump(2)</code> 生成可读 JSON;线上部署可改用 <code>dump()</code> 去空格省空间</li>
<li>若结构体字段名含特殊字符或需重命名(如 C++ 字段叫 <code>m_name</code>,JSON 要叫 <code>name</code>),在 <code>to_json</code> 里显式映射</li>
<li>大数组(>10MB)时,<code>dump()</code> 会一次性分配内存,可能触发 OOM;此时应考虑流式写入(需自行分块转 JSON 片段)</li>
</ul><h3>需要高性能二进制?用 <code>protobuf</code> 或 <code>flatbuffers</code>
</h3><p>当结构体字段多、数组量级达百万级、且对 IO 吞吐/内存占用敏感(比如高频行情数据落盘),纯文本 JSON 就不够用了。这时应切换到 schema-driven 的二进制协议。</p><p>对比选型:</p><ul>
<li>
<code>protobuf</code>:需写 <code>.proto</code> 文件定义结构,生成 C++ 代码,体积小、兼容性好,但序列化/反序列化有运行时开销,且默认不支持 zero-copy</li>
<li>
<code>flatbuffers</code>:无需解析即可直接访问字段(zero-copy),生成 C++ 头文件,无运行时依赖,但 schema 修改后旧数据可能无法兼容读取,且对嵌套 vector 支持略弱</li>
</ul><p>关键提醒:</p><ul>
<li>二者都要求你提前定义 schema,不能直接序列化任意 struct;这意味着你得接受“先写协议再写代码”的流程约束</li>
<li>生成的代码默认不处理字节序转换,跨大小端平台传输时需额外封装(<code>flatbuffers</code> 提供 <code>EndianSwap</code> 工具,<code>protobuf</code> 需自己 wrap)</li>
<li>不要手写二进制格式——哪怕只是一次性工具,未来加个字段或改个类型,读旧文件的逻辑就会散落在各处,没人敢动</li>
</ul><h3>结构体含指针或 STL 容器时,必须自定义序列化逻辑</h3><p>只要结构体里出现 <code>std::string</code>、<code>std::vector</code>、<code>char*</code>、<code>std::shared_ptr</code> 等,任何试图 <code>memcpy</code> 或 <code>fwrite</code> 整个对象的行为都是未定义行为。它们的内存布局不是连续的,且析构/生命周期由 RAII 管理。</p><p>正确做法是把序列化视为“深拷贝到线性缓冲区”的过程:</p><ul>
<li>对每个容器成员,先写长度(<code>size_t</code>),再逐个写元素(递归调用其序列化函数)</li>
<li>对 <code>std::string</code>,等价于写 <code>s.size()</code> + <code>s.data()</code>(注意 null terminator 不用写)</li>
<li>对裸指针(如 <code>int*</code>),必须明确语义:是指向堆内存?指向全局数组?还是仅作标记?没有上下文信息就无法安全序列化</li>
<li>若结构体本身是多态的(含虚函数表),<code>typeid</code> 和 vptr 都不能直接保存,必须用 type tag + 工厂函数重建对象</li>
</ul><p>最容易被忽略的一点:序列化函数和反序列化函数必须严格一一对应,字段顺序、类型、长度一个都不能错。建议在文件头写 magic number + version 字段,读取时校验,避免用新程序打开旧格式文件导致静默数据损坏。</p></person>C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!










