apply()结果全为nan最常见原因是函数无return或返回值长度不匹配;需确保每条分支显式返回、确认输入类型、优先向量化操作。

apply() 传入自定义函数时,为什么结果全是 NaN?
最常见原因是函数没有明确返回值,或返回了与输入长度不匹配的数据。Pandas 的 apply() 在 axis=0(默认)时按列调用函数,传入的是 Series;axis=1 时按行调用,传入的是 Series(但索引是列名)。如果函数里写了 print() 却忘了 return,Python 默认返回 None,Pandas 就填成 NaN。
实操建议:
- 函数开头先加
print(type(x), x.shape)确认输入类型和维度 - 确保每条分支都有
return,避免隐式返回None - 对单个元素做计算时,优先用向量化操作(如
df['col'] * 2),而非apply()+ lambda - 若必须用
apply()处理整行,显式指定axis=1,否则默认按列运行,函数会收到一列数据而非一行
用 apply() 处理多列组合逻辑,怎么写函数才不报错?
比如想根据 'age' 和 'salary' 两列生成新标签:'junior_highpay'、'senior_lowpay' 等。直接在 lambda 里写多条件容易嵌套混乱,也难调试。
实操建议:
- 定义清晰的命名函数,接收一个
row参数(axis=1时),用row['age']、row['salary']访问字段 - 避免在函数内修改原
row(它是只读视图),所有逻辑靠return输出新值 - 提前处理缺失值:在函数开头加
if pd.isna(row['age']) or pd.isna(row['salary']): return 'unknown' - 不要在函数里调用
df.loc或其他依赖全局 DataFrame 的操作——apply 是逐行/列独立执行的,没有上下文
示例:
def classify_worker(row):
if pd.isna(row['age']) or pd.isna(row['salary']):
return 'unknown'
if row['age'] 15000:
return 'junior_highpay'
elif row['age'] >= 45 and row['salary'] <p>然后调用:<code>df['category'] = df.apply(classify_worker, axis=1)</code></p><div class="aritcle_card flexRow artxards">
<div class="artcardd flexRow">
<a class="aritcle_card_img" rel="nofollow" href="/xiazai/skill6081" title="python-code-analyz"><img
src="https://img.php.cn/upload/skill/000/000/081/179077148379011.jpg" alt="python-code-analyz" onerror="this.onerror='';this.src='/static/lhimages/moren/morentu.png'" ></a>
<div class="aritcle_card_info flexColumn">
<a rel="nofollow" href="/xiazai/skill6081" title="python-code-analyz" class="overflowclass">python-code-analyz</a>
<p class="overflowclass">专业Python代码分析与优化,支持语法检查、安全扫描、性能评估、复杂度分析及重构后优化代码生成。</p>
</div>
<a rel="nofollow" href="/xiazai/skill6081" title="python-code-analyz" class="aritcle_card_btn flexRow flexcenter"><b></b><span>下载</span>
</a>
</div>
</div><h3>apply() 性能太慢,什么情况下该换 map() 或 vectorize?</h3><p><code>apply()</code> 本质是 Python 循环,遇到上万行就明显卡顿。它适合逻辑复杂、难以向量化的场景;但如果是查表、简单分段、字符串截取等,有更快替代。</p><p>实操建议:</p>
- 单列映射用
map():比如df['dept_id'].map({1: 'HR', 2: 'IT'}),比apply(lambda x: dept_dict.get(x))快 3–5 倍 - 纯数值计算且函数不含 Pandas/Numpy 特性,可用
np.vectorize()包一层(注意:只是语法糖,真正提速得靠numpy.ufunc) - 字符串操作优先用
.str访问器:df['name'].str.upper()、df['email'].str.contains('@'),比apply()快一个数量级 - 别为了“看起来简洁”硬套
apply()——比如df['x'].apply(lambda v: v ** 2)应直接写df['x'] ** 2
apply() 配合 lambda 时,哪些参数容易被忽略?
很多人只记得 axis,却漏掉关键控制项,导致行为不符合预期。
实操建议:
-
result_type:当函数返回 list/tuple 时,设为'expand'可自动拆成多列,'reduce'强制返回 Series,'broadcast'把标量结果广播到整行/列 -
args和kwargs:传额外参数不用闭包,例如df['score'].apply(scale_score, args=(100,), factor=1.2) -
raw=True(仅 axis=1):传入 numpy array 而非 Series,省去索引对齐开销,但失去列名访问能力,适合纯数值密集计算 - 注意
apply()返回类型可能自动推断错误(比如返回 int 却含 NaN,被迫转成 float64),必要时用.astype()显式转换
容易被忽略的一点:当函数返回字典(如 {'a': 1, 'b': 2})且未设 result_type='expand',Pandas 会把整个 dict 当作单个 object 存进单元格——不是你想要的两列。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










