如何正确过滤Pandas DataFrame中非数值的收入数据

浅强大大_2441

浅强大大_2441

2026-03-29

401人浏览

原创

本文详解python中因布尔逻辑错误导致条件判断失效的典型问题,重点剖析if variable == "a" or "b"的陷阱,并提供高效、地道的pandas向量化过滤方案。

本文详解python中因布尔逻辑错误导致条件判断失效的典型问题,重点剖析if variable == "a" or "b"的陷阱,并提供高效、地道的pandas向量化过滤方案。

在使用Pandas处理结构化数据时,一个常见却极易被忽视的错误是错误的条件表达式写法,它会导致if语句永远为真,从而跳过本应保留的有效数据。你提供的代码中,关键问题出在这一行:

if variable == "Unknown" or 'Unavailable':

这段代码并非检查variable是否等于 "Unknown" 或 "Unavailable",而是等价于:

if (variable == "Unknown") or ("Unavailable"):

由于非空字符串 "Unavailable" 在布尔上下文中恒为 True(Python中所有非空容器/字符串/数字均视为真值),整个条件永远成立,因此程序无一例外地执行 print('Passed ...') 和 pass,所有行都被跳过——哪怕variable实际是 45000 这样的合法数值。

✅ 正确的显式写法有两种:

# 方式1:重复变量名(清晰但略冗长)
if variable == "Unknown" or variable == "Unavailable":

# 方式2:推荐!使用成员检查(简洁、可扩展、易读)
if variable in ["Unknown", "Unavailable"]:

然而,更根本的问题在于:手动遍历DataFrame索引(for i in range(len(df)))违背了Pandas的设计哲学。它低效、易错,且无法利用底层优化。专业实践中,应始终优先采用向量化操作(vectorized operations)

以下是推荐的现代Pandas解决方案:

import pandas as pd

# 读取数据(保持原路径,但建议使用相对路径或with语句)
df = pd.read_excel('C:/Users/Miles/PycharmProjects/pythonProject1/Reservation Data.xlsx')

# ✅ 步骤1:创建布尔掩码,筛选出"Median Income"为有效数值的行
# ~ 表示逻辑非;isin() 判断是否属于指定列表;astype('number') 可选,用于后续数值计算
mask = ~df['Median Income'].isin(["Unknown", "Unavailable"])

# ✅ 步骤2:直接用掩码过滤DataFrame,获取干净子集
filtered_df = df[mask].copy()  # .copy() 避免SettingWithCopyWarning

# ✅ 步骤3:安全提取所需列(自动对齐,无需逐行append)
result_list = filtered_df[
    ['Native American Population', 'Median Income']
].values.tolist()  # 转为嵌套列表,等效于你的another_list

print("成功提取有效记录数:", len(result_list))
print("示例数据:", result_list[:3])

? 额外增强建议(提升鲁棒性)

  • 若“Median Income”列混有NaN、空字符串或空白格,可扩展掩码:
    mask = (
        ~df['Median Income'].isin(["Unknown", "Unavailable"]) &
        df['Median Income'].notna() &
        df['Median Income'].astype(str).str.strip().ne('')
    )
  • 如需后续对Median Income做数值运算,可统一转换并填充异常值:
    df['Median Income'] = pd.to_numeric(df['Median Income'], errors='coerce')
    # 此时"Unknown"/"Unavailable"自动转为NaN,再用dropna()或fillna()处理

⚠️ 重要提醒
避免使用df.at[i, col]在循环中反复索引——这是O(n)操作,而向量化过滤是接近O(1)的底层优化。对于万级数据,性能差异可达数十倍。同时,pass在条件分支中通常冗余,直接省略更符合Python风格。

总结:修正布尔逻辑是基础,拥抱向量化思维才是写出高效、可维护数据分析代码的关键。

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

2025.12.04

280

15

Python 数据清洗与预处理实战
Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术,包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换,结合 NumPy 高效处理大规模数据。通过实战案例,帮助学习者掌握 如何处理混乱、不完整数据,为后续数据分析与机器学习模型训练打下坚实基础。

2026.01.31

212

21

Python数据分析与Pandas高级实战
Python数据分析与Pandas高级实战

本专题围绕 Python 数据分析展开,系统讲解 Pandas 的高级用法,包括数据清洗、透视表、时间序列分析以及多表合并与分组操作。通过实战案例,帮助开发者掌握高效处理与分析数据的方法,提高数据处理效率与分析能力。

2026.04.13

271

25

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

0

15

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

2026.09.23

0

15

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

2026.09.23

0

15

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

2026.09.22

0

12

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

2026.09.22

0

13

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

2026.09.22

0

19

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.1万人学习