
本文介绍使用正则表达式在pandas中识别并保留包含“数字+字母”组合(如门牌号+街道名)的真实地址,自动过滤掉纯文字地址和仅有邮编的无效记录,确保地理数据清洗的准确性。
本文介绍使用正则表达式在pandas中识别并保留包含“数字+字母”组合(如门牌号+街道名)的真实地址,自动过滤掉纯文字地址和仅有邮编的无效记录,确保地理数据清洗的准确性。
在地址数据清洗任务中,常需区分“真实可定位地址”与“无效或不完整地址”。典型无效模式包括:
- 纯文本(如 San Diego County, California),无任何数字;
- 仅含邮编(如 92570),虽为数字但缺乏门牌号/街道等结构化信息。
理想目标是仅保留含“数字+后续字母”的地址片段——这通常对应门牌号(如 4150 Ute Dr 中的 4150 后紧跟 Ute),而非孤立邮编(92570 后无紧邻字母,或仅跟逗号/空格)。
✅ 推荐方案:用 str.contains() 匹配“数字+字母”模式
import pandas as pd
d = {
'col1': [
'San Diego County, California',
'4150 Ute Dr, San Diego, California',
'Vista del Lago, Perris, California, 92570'
],
'col2': ['prov_1', 'prov_2', 'prov_3']
}
df = pd.DataFrame(data=d)
# 保留至少一处「1–4位数字 + 可选空格 + 字母」的行
filtered_df = df[df['col1'].str.contains(r'\d{1,4}\s*[a-zA-Z]+', na=False)]
print(filtered_df)
输出:
col1 col2 1 4150 Ute Dr, San Diego, California prov_2
✅ *为什么用 `\d{1,4}\s[a-zA-Z]+`?**
- \d{1,4}:匹配 1–4 位数字(覆盖常见门牌号长度,避免误捕 5 位邮编);
- \s*:允许零个或多个空格(适配 123 Main 或 123 St);
- [a-zA-Z]+:强制后续必须有至少一个字母(排除 92570, 这类纯邮编场景);
- na=False:安全处理可能存在的缺失值(NaN),避免报错。
? 替代方案:提取首个匹配片段(适用于调试或特征工程)
若需进一步分析匹配内容,可用 str.extract():
# 提取首个「数字+字母」组合(如 '4150 Ute') df['address_prefix'] = df['col1'].str.extract(r'(\d+\s*[a-zA-Z]+)', expand=False) print(df[['col1', 'address_prefix']])
输出:
col1 address_prefix 0 San Diego County, California NaN 1 4150 Ute Dr, San Diego, California 4150 Ute 2 Vista del Lago, Perris, California, 92570 NaN
⚠️ 注意事项:
- 邮编规则因国家而异(如美国 ZIP 是 5 或 10 位,加拿大为字母数字混合),若数据含国际地址,建议结合 uszipcode 等库做二次校验;
- 正则中 \d{1,4} 是经验性约束,若业务中存在 12345 Oak Ave 类长门牌号,可放宽为 \d{1,6},但需警惕与邮编重叠风险;
- 始终添加 na=False 参数,防止 NaN 值导致布尔索引失败;
- 复杂地址建议先标准化(如用 usaddress 库解析),再按字段(如 AddressNumber, StreetName)精准过滤。
通过该方法,你能在预处理阶段高效识别真实门牌地址,显著提升后续地理编码、空间分析或客户定位的可靠性。











