实时差异对比需流式处理:用fseek+fread分块读取,二进制模式打开,通过inotify/readdirectorychangesw监听变更,结合滚动哈希逐行比对并校验原文,注意路径编码与文件锁问题。

用 fseek + fread 逐块读取比对,别直接 fopen 全读进内存
大文件(比如几百 MB 的日志)一上来就 fread 全部载入内存,要么爆掉,要么卡死。实时差异对比的核心是「流式处理」:不求一次看全,只比当前可见的增量变化。
实际做法是给两个文件各维护一个读取偏移量,每次从各自当前位置读固定大小块(如 4KB),用 memcmp 判断是否一致。不一致时记录位置,再往前回溯找行边界(用 memrchr 找上一个 \n),保证差异落在整行粒度。
常见错误是把「差异位置」直接当成「行号」——但二进制偏移 ≠ 行号,必须按 \n 计数;还有人用 std::ifstream::tellg() 在文本模式下反复跳转,Windows 下换行符 \r\n 会导致偏移错乱,务必用二进制模式打开:std::ios::binary。
用 inotify(Linux)或 ReadDirectoryChangesW(Windows)监听文件变更,不是轮询
轮询(比如每 100ms stat() 一次)浪费 CPU,还可能漏掉瞬时修改。Linux 下用 inotify_add_watch(fd, path, IN_MODIFY) 注册监听后,read() 就能拿到事件结构体,里面带 wd 和 mask,确认是目标文件被写入;Windows 下得调用 ReadDirectoryChangesW 配合重叠 I/O,注意它返回的是相对路径,要和原始路径拼接才能定位到具体文件。
容易踩的坑:inotify 对单次写入超过 INOTIFY_BUF_LEN(通常 8KB)的事件会截断,需循环 read() 直到 errno == EAGAIN;Windows 下若没设 FILE_FLAG_NO_BUFFERING,可能看到缓存未刷盘的“假变更”。
diff 原理的最小可行实现:三路比较(old / new / base)不如双路滚动哈希高效
真实 diff 用 Myers 算法做最长公共子序列(LCS),但实时场景里没必要——你只关心「这次改了哪几行」,不是生成最短编辑脚本。更轻量的做法是为每行计算滚动哈希(如 Rabin-Karp),维护一个滑动窗口内的哈希表:std::unordered_map<uint64_t std::vector>></uint64_t>,键是行内容哈希,值是该哈希在旧文件中出现的所有行号。
新文件每读一行,算哈希查表:如果没命中,就是新增;如果命中但行号已用过,说明是移动;如果命中且行号未用过,标记为匹配。关键点在于哈希碰撞必须校验原文(strcmp),别只信哈希值;另外哈希种子不能固定,否则攻击者可构造碰撞让对比失效。
跨平台路径与编码问题:std::filesystem::path 不能解决所有事
std::filesystem::path 能统一斜杠、处理 ..,但它不处理字符编码。Linux/macOS 默认 UTF-8,Windows 控制台默认 GBK 或 UTF-16,用 fopen(path.c_str(), "rb") 没问题,但一旦涉及文件名打印、日志输出,path.filename().string() 在 Windows 上可能吐出乱码。
实操建议:Windows 下统一用 std::wstring 接收命令行参数(wmain),内部路径操作转 std::filesystem::path 时用 u8path 或 wstring() 构造;日志输出前强制转 UTF-8(用 WideCharToMultiByte(CP_UTF8, ...))。别依赖 setlocale(LC_ALL, ""),它在不同环境行为不一致。
真正的难点不在算法,而在如何定义「实时」:是毫秒级响应?还是容忍秒级延迟?前者必须用内核事件监听+内存映射(mmap);后者用定时 stat + 增量哈希就够了。还有个隐形成本:文件锁。多个进程同时写一个文件时,flock 或 LockFileEx 不处理好,比对过程可能读到撕裂数据。
C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!











