java读取带bom的utf-8文件时,bom(ef bb bf)会被当作普通字符读入,导致开头出现\ufeff引发解析异常;必须在字节层面检测并跳过bom后再解码,不可依赖字符串过滤。

Java 读取带有 BOM 的 UTF-8 文件时,如果直接用 new String(bytes, "UTF-8") 或 Files.readString(path, StandardCharsets.UTF_8)(Java 11+),BOM(EF BB BF)会被当作普通字符读入,导致字符串开头出现不可见的“零宽空格”或解析失败(如 JSON 解析报错、XML 声明不匹配等)。关键不是“过滤字符串”,而是**在字节层面跳过 BOM 再解码**。
方式一:读取字节流时手动检测并跳过 BOM
适用于需要精细控制编码、兼容老版本 Java(
- 先读取前 3 个字节,判断是否为
0xEF 0xBB 0xBF - 如果是,后续字节从第 4 位开始解码;否则从第 0 位开始
- 注意:必须用
InputStream(而非 Reader),避免提前解码
public static String readUtf8WithoutBom(Path path) throws IOException {
byte[] raw = Files.readAllBytes(path);
int offset = 0;
if (raw.length >= 3 && raw[0] == (byte) 0xEF && raw[1] == (byte) 0xBB && raw[2] == (byte) 0xBF) {
offset = 3;
}
return new String(raw, offset, raw.length - offset, StandardCharsets.UTF_8);
}
方式二:使用 Apache Commons IO(推荐快速落地)
引入 commons-io:2.11.0+,其 FileUtils.readFileToString() 和 IOUtils.toString() 默认自动识别并跳过 UTF-8 BOM:
在 Java 中初始化和管理阿里云 SDK客户端。包括单例模式、线程安全、endpoint 与 region 配置、VPC 终端节点、同步与异步等。
- 无需手动判断,一行搞定:
String content = FileUtils.readFileToString(file, StandardCharsets.UTF_8); - 底层已对常见 BOM(UTF-8/UTF-16BE/UTF-16LE)做了兼容处理
- 适合项目已依赖 Commons IO 或追求简洁性
方式三:Java 11+ 使用 Files.readString + 自定义 Charset(轻量无依赖)
若不想引入第三方库,又用 Java 11+,可封装一个带 BOM 感知的 Charset:
- 创建包装类,重写
decode()方法,在解码前跳过 BOM 字节 - 或更简单:先用
Files.readAllBytes()获取字节数组,再按方式一处理(见上) - 注意:
Files.readString(path, charset)本身不处理 BOM,必须自己剥离字节
额外提醒:写入时避免生成 BOM
读取问题常伴随写入问题。Java 标准库(Files.write()、OutputStreamWriter)默认**不会写入 BOM**。但若用某些编辑器(如 Windows 记事本)保存 UTF-8 文件,会主动加 BOM。因此:
- 开发中统一用 IDE(IntelliJ/VS Code)以 “UTF-8 without BOM” 模式保存源文件
- 生成配置文件时,明确指定不写 BOM(例如用
Files.write(path, content.getBytes(StandardCharsets.UTF_8))是安全的) - 不要依赖
"UTF-8"字符串名——它在部分旧 JDK 中可能隐含 BOM 行为,始终用StandardCharsets.UTF_8
Java免费学习笔记:立即使用
解锁 Java 大师之旅:从入门到精通的终极指南










