最可靠方法是用 fopen + fread 手动分块读写:打开源文件,每次读100mb写入新文件,严格检查 fread 返回值,用 size_t 存大小,零填充序号命名(如 archive_0001.bin),先 stat 获取文件大小并重置指针,合并时流式处理并校验序号与 crc32。

用 fopen + fread 手动分块读写最可靠
标准库没提供“自动切文件”的函数,std::filesystem 也只管元数据,真正切分必须自己控制读写粒度。核心逻辑是:打开源文件 → 每次读 100 * 1024 * 1024 字节 → 写入新文件 → 关闭再开下一个。别用 std::ifstream::read 配 gcount() 做边界判断,它在二进制模式下对 EOF 处理容易多读 1 字节或提前截断。
实操建议:
- 用
fopen(..., "rb")和fwrite,避免 C++ 流的缓冲干扰和换行符转换 - 每次
fread返回值必须严格检查,等于请求字节数才继续;小于则说明是最后一块,直接退出 - 用
size_t存储块大小,别用int——100MB 超过 2^31-1 的风险虽小但存在 - Windows 下注意路径分隔符用
'\'或正斜杠,否则fopen返回NULL
命名规则要兼顾可排序、可识别、跨平台
碎片文件名不能只靠序号(如 part1, part2),否则 100+ 块时排序错乱(part10 排在 part2 前)。也不建议带点号或空格,某些 shell 或旧工具会误解析。
实操建议:
- 固定前缀 + 零填充序号 + 后缀,例如:
archive_0001.bin、archive_0002.bin - 序号位数按总块数预估:100MB 文件最大约 10TB,对应最多 100000 块,用 5 位(
_00001)足够 - 后缀统一用
.bin或.dat,别用.part——部分归档工具会把它当压缩包子文件误处理 - 完整路径拼接时,用
snprintf而非字符串拼接,避免栈溢出或格式错误
stat 或 std::filesystem::file_size 必须先调用
不查原始文件大小就硬切,会导致最后一块远小于 100MB 却仍被当成完整块写入,后续拼接失败。更糟的是,如果源文件在读取中途被其他进程修改(比如日志轮转),file_size 结果和实际可读长度不一致,fread 可能返回 0 且不报错。
组合式C++代码评审方案,融合静态分析、AI推理、多轮迭代评审和C++专项检查,适用于PR审查、增量代码审查、全项目评审和代码质量评分,触发词包括review cpp、cpp代码评审、C++review、代码审查。
实操建议:
- Linux/macOS 用
stat获取st_size;Windows 用GetFileSizeEx,别依赖_filelength(已废弃) - C++17 起可用
std::filesystem::file_size(path),但要注意:它抛异常而非返回错误码,需try/catch - 获取大小后立刻
fseek(fp, 0, SEEK_SET)重置文件指针,否则后续fread从末尾开始读 - 若源文件大于 4GB,确保编译器启用了大文件支持(如 Linux 加
-D_FILE_OFFSET_BITS=64)
合并碎片时 fwrite 的 size_t 溢出是静默陷阱
把碎片按序读入内存再一次性写入,看似简单,但 100MB × N 块很容易突破 size_t 上限(尤其 32 位环境),fwrite(ptr, 1, total_bytes, out) 中 total_bytes 若溢出,会变成极小值,导致只写几字节就返回成功。
实操建议:
- 合并必须流式进行:逐个打开碎片 →
fread小块(如 64KB)→fwrite→ 关闭,不缓存整块到内存 - 每次
fwrite后检查返回值是否等于请求字节数,不等则立即报错退出 - 碎片文件名必须严格按序验证,用
std::stoi提取序号并比对是否连续,跳号或重复直接中止 - 合并目标文件用
"wb"模式打开,别用"ab"——万一上一次中断残留了半块,会污染结果
真正麻烦的不是切分本身,而是碎片在传输或存储中损坏却没被发现。加个简单的 CRC32 校验(每块末尾追 4 字节)成本很低,但能避开绝大多数静默数据腐坏问题。
C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!










