re.sub()比re.findall()更适合清洗电话号码,因其可直接删除或替换干扰字符一步到位,而re.findall()易误提非号码片段且需二次拼接;匹配中国手机号应使用r'1[3-9]\d{9}'排除非法号段,并兼顾固话、全角字符及不可见符处理,最后辅以长度、首位和phonenumbers库校验。

为什么re.sub()比re.findall()更适合清洗电话号码
清洗目标是“得到干净号码”,不是“提取所有可能片段”。用re.findall()容易漏掉干扰字符(比如括号里混着字母或空格),还得二次拼接;而re.sub()直接删/替,一步到位。
常见错误是写成re.findall(r'\d+', text)再''.join(),结果把“订单号12345”也拖进来了——电话号码清洗必须带上下文锚定。
匹配中国手机号要避开10、12、19等非法号段
国内手机号是11位,但不是所有以1开头的11位数字都合法。运营商号段有明确范围,硬匹配r'1\d{10}'会把10086、12321这类服务号也当手机号清洗,后续校验失败率高。
推荐用更稳的模式:r'1[3-9]\d{9}',它排除了10、11、12开头的非法段。如果数据里混有带区号的固话(如010-12345678),得单独处理:r'0\d{2,3}-?\d{7,8}',注意-?允许有无横线,\d{2,3}覆盖北京010、上海021、地级市0571等不同长度区号。
清理常见脏数据时,别忽略全角字符和不可见符
爬虫抓取或Excel导出的数据常含全角空格 、中文括号()、零宽空格\u200b,这些不会被\s或\D匹配到,导致清洗后仍残留乱码。
SkillSub Pro - Python 题解与代码注释双功能技能功能概述SkillSub Pro - Python 题解与代码注释双功能技能是一项面向实际任务的技能,主要用于SkillSub Pro 是一个 Python 题解生成与代码注释的 双功能合体技能 ,专为学生、算法学习者和开发者设计;✅ 一个技能,两种用途 :;核心要点📝 题解模式 :输入题目/题号,自动生成完整 Python 题解(含详细注释、解题思路、复杂度分析);💬 注释模式 :输入 Python 代码,自动添加详细中。它将相关步骤、
- 先统一转半角:用
text.translate(str.maketrans('()- ', '()-. ')) - 再清除不可见符:
re.sub(r'[\u200b-\u200f\u2028\u2029\ufeff]', '', text) - 最后执行号码提取:
re.sub(r'[^0-9]', '', text)或按前述号段过滤
清洗后验证长度和首位,比单纯正则更可靠
正则能剔除明显非法字符,但不能保证结果可用。比如13800138000符合1[3-9]\d{9},却是移动测试号;17000000000虽在号段内,但实际已停用。生产环境建议加一层轻量校验:
清洗后立即检查:
– 长度是否为11(手机)或8–12(固话含区号)
– 首位是否为1(手机)或0(固话)
– 用phonenumbers库做基础格式解析(phonenumbers.parse('+8613800138000', None)),它内置号段更新,比正则更准
真正麻烦的从来不是正则怎么写,而是原始数据里藏着“138-0013-8000(客服)”这种人眼可读、机器难分的混合字段——得靠业务规则兜底,而不是指望一个正则包打天下。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










