因为sublime text的多光标、正则替换和列编辑能力可快速完成“视觉对齐→文本规整→结构导出”三步,2分钟处理80%脏数据,但仅适用于静态html表格,不支持语义解析或动态内容。

为什么直接用 sublime-text 处理网页表格比写脚本更快?
因为多数网页表格是 HTML <table> 嵌套结构,但实际抓下来常混着空格、换行、<code><br>、<span></span> 和不可见字符,而 sublime-text 的多光标 + 正则批量替换 + 列编辑能力,能在 2 分钟内干掉 80% 的脏数据——前提是别试图用它做语义解析,只做“视觉对齐→文本规整→结构导出”三步。
Ctrl+Alt+Shift+P 定位表格区域后怎么快速剥离 HTML 标签?
别用全量正则删标签(容易误杀内容),先聚焦在 <td> 和 <code><th> 内容上:
<ul>
<li>用 <code>Ctrl+Shift+P 打开命令面板,输入 Select by Name: td 或 Select by Name: th(需提前安装 HTMLPrettify 或 Tag 插件)
<td> 后,按 <code>Ctrl+Shift+L 拆成多光标,再按 Ctrl+Shift+Space(或手动删除)去掉首尾标签,只留中间文本
、<br>、\n 统一替换为单个空格:正则模式开 .*,搜索 |<br>|\s+,替换为 (一个空格)colspan/rowspan),sublime-text 不会自动补空值,得人工在对应位置敲 null 或空字符串用列编辑把不规则行转成 JSON 数组结构
网页表格经常“头不对尾”:标题行 5 列,数据行有 4 列或 6 列。这时候不能靠自动格式化,得靠视觉对齐:
- 把清洗后的纯文本粘贴进新 tab,用
Ctrl+Shift+J合并多行(如有换行符干扰),再用Ctrl+Shift+M选中所有行首/行尾空白 - 把光标放在第一列文字起始处,按住
Alt(Windows/Linux)或Cmd+Opt(macOS),拖动鼠标纵向选中所有行的“第一列”,松手后批量加"key": " - 同理选中第二列,加
",和闭合引号;每列之间用,隔开,最后一列后加};整行开头补{ - 最终每行应形如:
{"name": "张三", "age": "28", "city": "北京"}—— 注意数值是否带引号:字符串必须引号,数字若确定无前导零可后续用jq或 Python 转类型,别在 Sublime 里硬判断
导出 JSON 前必须检查的三个隐藏坑
Sublime 不校验 JSON 语法,但浏览器或后端解析器会报错:
Miller (mlr) 是一个命令行工具,用于查询、整形和重新格式化名称索引数据,如 CSV、TSV、JSON 和 JSON Lines。它将 awk、sed、cut、join 和 sort 的功能整合到一个专为结构化数据处理而构建的单一工具中。
- 末尾多逗号:最后一行后面不能有
,,否则JSON.parse()直接失败;可用正则,\s*}$检查结尾 - 中文引号或全角符号:从网页复制的内容可能含
“”或,,全部替换成英文"和, - 字段名重复:比如两列都叫
id,Sublime 不提示,但生成的 JSON 对象键会覆盖;建议用正则"(\w+)":提取所有键,复制到新窗口去重检查
真正麻烦的不是清洗,而是原始 HTML 表格里藏了动态加载内容、注释节点或 JS 插入的伪表格——这种得回退到 requests + BeautifulSoup 抓源码,Sublime 只适合处理已落地的静态 HTML 片段。










