
JavaScript 的 indexOf() 和 charAt() 基于 Unicode 码点而非视觉字形工作;半宽片假名如 'ゲ' 实际由两个独立码点(半宽ケ + 半宽浊点)组成,导致索引返回 1 且 charAt(1) 正确取到 'ケ'。
javascript 的 `indexof()` 和 `charat()` 基于 unicode 码点而非视觉字形工作;半宽片假名如 `'ゲ'` 实际由两个独立码点(半宽ケ + 半宽浊点)组成,导致索引返回 1 且 `charat(1)` 正确取到 `'ケ'`。
在 JavaScript 字符串操作中,'トゲ'.indexOf('ケ') 返回 1、'トゲ'.charAt(1) 返回 'ケ',这一行为看似反直觉,实则完全符合 Unicode 编码规范与 JavaScript 的字符串模型。
关键在于:该字符串 'トゲ' 并非由三个“视觉上独立的字符”构成,而是由三个 Unicode 码点(code points)组成:
- 'ト' → U+FF8D(半宽ト)
- 'ケ' → U+FF9E(半宽ケ)
- '゙' → U+FF9F(半宽浊点,即「濁点」)
注意:Unicode 中不存在独立的“半宽ゲ”字符(即 U+FF9E + U+FF9F 的组合不构成一个复合字符,也不生成新的预组合码点)。它只是两个相邻的半宽符号——'ケ'(U+FF9E)和'゙'(U+FF9F)——在渲染时被字体引擎合成为视觉上的「ゲ」。但 JavaScript 的字符串 API(如 charAt()、indexOf()、length、split(''))均以 UTF-16 code units(对基本多文种平面字符等价于码点)为单位处理,不进行字形合成或规范化感知。
Java JDK 25 来自 OpenJDK 官方归档,版本为 JDK 25,本条下载地址已指向官方 Windows x64 zip 安装包直链,适合调试旧项目或兼容旧版 Java 运行环境。
验证如下:
const str = 'トゲ';
console.log(str.length); // 3 —— 三个 UTF-16 code units
console.log([...str]); // ['ト', 'ケ', '゙'] —— 展开为三个码点
console.log(str.charAt(0)); // 'ト'
console.log(str.charAt(1)); // 'ケ' ← 正确返回第二个码点
console.log(str.charAt(2)); // '゙'
// indexOf 按码点匹配:
console.log(str.indexOf('ケ')); // 1 —— 'ケ' 位于索引 1
console.log(str.indexOf('゙')); // 2 —— '゙' 位于索引 2
⚠️ 注意事项:
- 不要将视觉字形(glyph)与逻辑字符(code point)混淆。'ゲ' 是渲染效果,不是单个字符。
- 若需按“用户感知字符”(如一个合成假名)操作,请使用 Array.from(str) 或扩展运算符 [...str](二者均基于 Unicode 码点,对大多数日文字符已足够),或更健壮地使用 Intl.Segmenter 进行图形簇(grapheme cluster)分割(尤其适用于含 emoji 或变体序列的场景)。
- 全宽「ゲ」(U+30B2)是独立码点,'ゲ'.length === 1,行为符合直觉;而半宽组合形式本质是兼容性设计,牺牲了字符串原子性以保持编码简洁。
总结:JavaScript 的字符串方法严格遵循 Unicode 标准,以码点为最小单位。理解 ト、ケ、゙ 是三个独立码点,而非“ト”“ケ”“ゲ”的视觉简写,是正确处理日文半宽字符的关键。开发中涉及文本定位、截取或搜索时,应始终以码点视角建模,必要时借助标准化(如 String.prototype.normalize('NFC'))或高级分段 API 提升语义准确性。
Java免费学习笔记:立即使用
解锁 Java 大师之旅:从入门到精通的终极指南










