正则表达式是处理不规则输入数据最直接有效的工具,可精准清洗空白与不可见字符、统一替换全角标点、提取手机号、日期及凭证号等关键字段。

正则表达式是处理不规则输入数据最直接有效的工具之一。它不依赖结构,只认模式,面对杂乱空格、混排标点、中英文夹杂、隐藏字符等典型问题,能精准定位、批量清洗、按需提取,比逐个字符串方法更稳定、更可复用。
清理干扰性空白与不可见字符
中文输入法常引入全角空格( )、零宽空格(\u200b)、行分隔符(\u2028)、全角标点等“看不见的问题”。仅用.strip()或.replace(' ', '')无法覆盖。
- 统一替换所有空白类字符为单个半角空格:
re.sub(r'[\s\u200b\u2028\u3000]+', ' ', text).strip() - 去除首尾残留空白后仍保留内部合理空格,避免把“张 三”变成“张三”
- 对全角标点做映射替换更稳妥,例如:
text.translate(str.maketrans(',。!?;:""''()', ',.!?;:"\'\'()'))
提取关键字段(如手机号、日期、编号)
从日志、表单、网页文本中捞出结构化信息,无需解析整段内容,靠特征模式即可。
图片提示词生成器?不止如此。 马甲系统 —— 把脑海中的画面,翻译成AI能理解的专业表达。 用得越多,它越懂你:首次需要多问几句确认方向,用久了几乎一说就懂。 用得越多,它越快:缓存机制让后续对话越来越省。 RAG进化:成功案例持续入库,越跑越聪明。 输入「新手指南」查看完整功能介绍
- 匹配11位中国大陆手机号:
re.findall(r'1[3-9]\d{9}', text) - 提取形如“2026-06-15”或“2026/06/15”的日期:
re.findall(r'\b\d{4}[-/]\d{2}[-/]\d{2}\b', text) - 抓取以7开头的5位凭证号(如71234):
re.findall(r'(?(利用\b或否定环视防误匹配)
标准化与格式验证
清洗不只是删,更是“转”——把不同写法统一成规范格式,并提前拦截非法输入。
- 将多种电话格式((010)1234-5678、010-12345678、13812345678)归一为“+86 138 1234 5678”:
re.sub(r'(\d{1,4})[-\s()]*?(\d{3,4})[-\s()]*?(\d{4})', r'+86 \1 \2 \3', phone) - 验证邮箱是否基本合规:
re.match(r'^[^\s@]+@[^\s@]+\.[^\s@]+$', email) is not None - 检查身份证号长度和末位校验码逻辑(需额外算法),但至少先筛掉明显错误:
re.fullmatch(r'\d{17}[\dXx]', id_num)
在Pandas中批量清洗文本列
面对DataFrame中的文本列(如用户留言、地址、备注),用str.replace、str.extract等向量化方法效率远高于循环。
- 清洗地址列中的多余空格和全角符号:
df['address'] = df['address'].str.replace(r'[\s\u200b\u2028\u3000]+', ' ', regex=True).str.strip() - 新增一列提取所有手机号:
df['mobile_list'] = df['content'].str.findall(r'1[3-9]\d{9}') - 用str.extract生成结构化新列(如从“订单号:ORD20260615-001”中抽ID):
df[['order_id']] = df['note'].str.extract(r'订单号:(\w+-\w+)')










