pandas.series.str.extract() 适用于结构化正则提取混合文本数字列,需定制精准模式避免宽泛匹配错误;对复杂或多匹配场景应使用 str.extractall() 并妥善整形;apply+自定义函数可兜底异常数据;提取后须显式类型转换确保后续计算可靠。

用 pandas.Series.str.extract() 提取数字和文本模式
混合列(如 "Apple2023"、"v2.1.5-beta")不能靠简单空格或分隔符切分,得靠正则识别结构。直接用 str.split() 容易错切或丢数据,str.extract() 更可控——它只抓你明确写的模式,不强行分割。
常见错误是写太宽泛的正则,比如 r'(\D+)(\d+)' 会把 "v2.1.5" 中的点号当成 \D+ 一部分,结果提取出 "v2.1.5" 和空字符串。应该按实际格式定制:
- 版本号类(
"v2.1.5-beta"):用r'v(?P<version>\d+\.\d+\.\d+)-(?P<stage>\w+)'</stage></version> - 产品名+年份(
"iPhone15"):用r'(?P<name>[a-zA-Z]+)(?P<year>\d{2,4})'</year></name>,注意\d{2,4}防止把"iOS16"的16当成年份误判为2016 - 含小数或负号的数值(
"temp-23.5°C"):用r'(?P<value>-?\d+\.?\d*)(?P<unit>°C|°F|%)'</unit></value>,-?和\.?覆盖负数和整数场景
当正则无法覆盖全部样本时,用 apply() + 自定义函数兜底
str.extract() 遇到不匹配行会返回 NaN,但真实数据常有例外(比如突然冒出 "N/A" 或 "TBD")。硬塞进正则只会让整个列变稀疏,不如主动分类处理。
写一个函数,先判断是否符合主模式,再 fallback 到其他逻辑:
def split_mixed(x):
if pd.isna(x):
return pd.Series([None, None])
x = str(x)
# 主模式:字母开头 + 数字结尾
m = re.match(r'^([a-zA-Z]+)(\d+)$', x)
if m:
return pd.Series([m.group(1), int(m.group(2))])
# 次要模式:纯数字或纯文本
if x.isdigit():
return pd.Series(['UNKNOWN', int(x)])
if x.isalpha():
return pd.Series([x, None])
return pd.Series([x, None]) # 无法解析,保留原值
<p>df[['text_part', 'num_part']] = df['mixed_col'].apply(split_mixed)
</p>
关键点:apply() 返回 pd.Series 才能自动扩展成多列;别忘了 str() 强转,避免 float 类型(如 123.0)导致 re.match 失败。
str.extractall() 处理一列含多个数字/文本片段的情况
像 "CPU:i7-12800H RAM:16GB SSD:512GB" 这种,不是“一个文本+一个数字”,而是多个键值对混在一起。str.extract() 只能取第一个匹配,必须换 str.extractall()。
Python 3.14.2是Python编程语言在2025年12月5日发布的稳定版本,属于3.14系列的第二个维护更新。该版本包含了18项修复,重点解决了多进程、数据类及正则表达式等模块的回归问题,并修复了CVE-2025-12084等安全漏洞。此版本标志着自由线程模式(移除GIL)正式获得官方支持,是Python发展的重要里程碑。
它返回一个 MultiIndex 的 Series,需用 unstack() 或 pivot() 整形:
pattern = r'(\w+):([\d\w]+(?:GB|GHz)?)' # 提取所有键值对 extracted = df['spec_col'].str.extractall(pattern) # 转成宽表,每行对应原行,每列为一种键(如 CPU、RAM) wide = extracted.unstack(level=1).droplevel(0, axis=1) wide.columns = ['CPU', 'RAM', 'SSD'] # 手动重命名,因 extractall 不保证顺序
注意:extractall() 对空值敏感,若某行没匹配到任何内容,该行在结果中直接消失——需要提前用 df.join() 补回索引,否则行数对不上。
性能与类型陷阱:别让 object 列拖慢后续计算
拆分后的新列默认是 object 类型,即使全是数字,pandas 也不会自动转 int64 或 float64。这会导致 .sum() 报错、plot() 画不出图、merge() 匹配失败。
安全转换方式:
- 数值列:用
pd.to_numeric(col, errors='coerce'),'coerce'把异常值(如"N/A")转成NaN,比.astype(int)更鲁棒 - 文本列:显式调用
.astype('string')(pandas 1.0+),避免后期str.contains()在object上报AttributeError - 混合列(如版本号):别强转
float,保留string并用str.split('.').str[0]取主版本,更可靠
最易被忽略的是:正则提取后,空匹配生成的 NaN 是浮点型 nan,和字符串 "NaN" 完全不同,fillna('MISSING') 前务必确认原始 NaN 类型是否统一。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










