最稳妥方式是用std::getline配合std::string,检查文件打开状态,宽字符文件需std::wifstream+locale;大文件应reserve、关同步;空行和无换行末行需正确处理。

用 std::getline 读取文本行最稳妥
直接用 std::getline 是 C++ 里逐行读取 TXT 文件的首选方式,它自动处理换行符(\n、\r\n),不丢字符、不截断空行,也避免 operator>> 遇到空格或制表符就停住的问题。
常见错误是写成 while (file >> line) —— 这根本读不到带空格的整行,连 "hello world" 都只拿到 "hello"。
- 必须搭配
std::string使用:std::string line;,不能用char[]或std::vector<char></char>直接传给getline - 文件打开后务必检查状态:
if (!file.is_open()),Windows 下路径含中文或空格时容易静默失败 - 循环体里别在
getline前清空line:它会自动覆盖,手动line.clear()多余且可能干扰移动语义
Windows 下读取 ANSI 编码 TXT 文件要小心
记事本保存为“ANSI”编码的 TXT,在 VS 默认项目设置下,std::getline 会把非 ASCII 字符(比如中文)读成乱码或截断,不是函数问题,是流没正确绑定编码。
简单绕过办法:用 std::wifstream + std::wstring,并显式指定本地 locale:
std::wifstream file(L"test.txt");
file.imbue(std::locale("")); // 激活系统 ANSI 编码(如 GBK)
std::wstring line;
while (std::getline(file, line)) {
// line 现在能正确包含中文
}
- 文件路径必须用
L"xxx"宽字符串字面量 -
std::locale("")在 Windows 上通常对应系统区域设置,Linux/macOS 可能无效,需改用具体 locale 名(如"zh_CN.UTF-8") - 如果原始文件其实是 UTF-8 无 BOM,
std::locale("")会失败;此时应改用第三方库(如 ICU)或手动检测 BOM 后转码
大文件读取时性能关键在缓冲区和 I/O 方式
读几百 MB 的日志文件时,逐行 getline 本身不慢,但频繁分配 std::string 内存、或反复调用 file.tellg() 查位置,会导致明显卡顿。
- 提前预留空间:
line.reserve(1024);能减少多次内存重分配(尤其每行长度较稳定时) - 避免在循环里调用
file.gcount()或file.tellg():它们触发底层 seek,对 HDD 影响显著 - 纯顺序读取无需随机访问时,关掉同步:
std::ios::sync_with_stdio(false);可提速 10%~30% - 若只需扫描某几列(如 CSV 第三列),别整行读再
std::stringstream拆——改用std::istreambuf_iterator手动跳过字段更高效
遇到空行或末尾无换行符时行为要心里有数
std::getline 对空行返回 true 并把 line 设为空字符串,这是正确行为;但若文件最后一行没换行符,getline 仍能读出该行内容,并在下次调用时才返回 false —— 很多人误以为会漏掉最后一行。
- 判断是否读到有效内容,应检查
line.empty()而非仅依赖循环条件 - 若业务逻辑需过滤空行,写成
if (line.empty()) continue;即可,别用file.peek() == '\n'判断——不可靠且破坏流位置 - 某些嵌入式或旧设备生成的日志,末尾可能多一个
\r:用line.erase(std::remove(line.begin(), line.end(), '\r'), line.end());清理比正则快得多
真正麻烦的是混合编码 + BOM + 不规则换行符 + 超长行的生产环境日志,这时候光靠标准库很难鲁棒处理,得加一层预检和 fallback 解码逻辑。
C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!











