不能直接用 std::hash 做文件去重,因为其结果不跨平台稳定且不支持任意长度文件内容;必须使用确定性哈希如 md5,确保同一文件在不同机器上生成相同值,从而可靠去重。

为什么不能直接用 std::hash 做文件去重
因为 std::hash 不是跨平台稳定的哈希算法,不同编译器、不同标准库实现可能给出不同结果;而且它只支持内置类型或特化类型,无法直接处理任意长度的文件内容。真正做文件去重必须用确定性哈希(如 MD5),否则同一文件在不同机器上算出不同值,去重就失效了。
MD5 虽然密码学上已不安全,但对非恶意场景下的文件内容比对依然足够可靠——只要两个文件 MD5 完全一致,几乎可以断定内容相同。
怎么用 OpenSSL 快速计算文件 MD5
Linux/macOS 通常自带 OpenSSL;Windows 可以从 slproweb.com 下载预编译版。不建议自己编译,容易链接失败。
- 先打开文件,用
fopen以"rb"模式读取,避免文本模式换行符干扰 - 每次读
8192字节(不是 1 字节!小块读太慢,大块读内存压力高) - 调用
MD5_Update累积计算,别一次性把整个文件 load 到内存 - 最后用
MD5_Final输出 16 字节二进制结果,再转成 32 字符小写十六进制字符串
示例关键片段:
unsigned char md5_hash[MD5_DIGEST_LENGTH];
MD5_CTX ctx;
MD5_Init(&ctx);
while ((bytes = fread(buf, 1, sizeof(buf), fp)) > 0) {
MD5_Update(&ctx, buf, bytes);
}
MD5_Final(md5_hash, &ctx);
char md5_str[33] = {0};
for (int i = 0; i
<h3>如何避免重复扫描和误判</h3>
<p>直接遍历目录逐个计算所有文件 MD5 很慢,尤其遇到大文件或海量小文件。更合理的做法是:先按文件大小分组,只有大小相同的文件才值得比 MD5。</p>
- 用
std::map<size_t std::vector>></size_t>把路径按大小归类 - 对每个 size 对应的文件列表,再逐个计算 MD5 并查重
- 遇到第一个相同 MD5 时,可选择保留最早出现的路径,其余标记为重复
- 注意:硬链接会共享 inode,但
stat()的st_size相同,MD5 也必然相同——这属于合法重复,不是 bug
别跳过空文件:它们大小都是 0,但 MD5 是确定的(d41d8cd98f00b204e9800998ecf8427e),必须参与比对。
实际使用中容易被忽略的细节
Windows 下路径分隔符是 \,但 OpenSSL 和 C++ 文件操作本身不care,真正要注意的是:用 std::filesystem::path 构造路径时,operator/ 会自动适配;而手拼字符串时若混用 / 和 \,可能导致 fopen 失败但错误码不明显。
- 务必检查
fopen返回值是否为nullptr,有些文件可能权限不足或被占用 - 不要用
std::ifstream配合rdbuf()->pubseekoff获取大小——某些文件系统(如 procfs)不支持 seek,会返回 0 - MD5 字符串建议存为
std::string而非const char*,避免悬垂指针 - 如果后续要导出结果,用 tab 分隔而非空格,防止路径含空格时解析错乱
真正麻烦的从来不是算 MD5,而是处理各种边界:符号链接循环、只读文件、设备文件、网络挂载超时……先跑通单个文件,再加健壮性逻辑。
C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!











