如何删除 Pandas 中特定列中的重复行？-Python教程-PHP中文网

首页

后端开发

Python教程

如何删除 Pandas 中特定列中的重复行？

Patricia Arquette

Dec 14, 2024 am 06:03 AM

How to Drop Duplicate Rows Across Specific Columns in Pandas?

使用 Python Pandas 删除多列中具有重复值的行

pandas drop_duplicates 函数是一个强大的工具，用于从 DataFrame 中删除重复行，但是如果您只想要删除子集中重复的行列？

示例

考虑以下 DataFrame：

A	B	C
foo	0	A
foo	1	A
foo	1	B
bar	1	A

假设您想要删除与 A 列和 C 列匹配的行。在这种情况下，您需要删除第 0 行和第 1 行。

将 drop_duplicates 与 keep 一起使用参数

要实现此目的，您可以使用 drop_duplicates 函数，并将 keep 参数设置为 False。该参数指定如何处理重复行。默认情况下，keep 设置为first，这意味着将保留第一次出现的重复行。将 keep 设置为 False 将删除所有重复的行。

以下代码演示如何删除 A 列和 C 列中具有重复值的行：

import pandas as pd

df = pd.DataFrame({"A": ["foo", "foo", "foo", "bar"], "B": [0, 1, 1, 1], "C": ["A", "A", "B", "A"]})

# Drop rows with duplicate values in columns 'A' and 'C'
df = df.drop_duplicates(subset=['A', 'C'], keep=False)

print(df)

输出：

  A  B  C
2 foo  1  B
3 bar  1  A

如您所见，第 0 行和第 1 行已被删除，因为它们与 A 列和 C 列重复。

以上是如何删除 Pandas 中特定列中的重复行？的详细内容。更多信息请关注PHP中文网其他相关文章！

声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

我如何使用美丽的汤来解析HTML？Mar 10, 2025 pm 06:54 PM

本文解释了如何使用美丽的汤库来解析html。它详细介绍了常见方法，例如find（），find_all（），select（）和get_text（），以用于数据提取，处理不同的HTML结构和错误以及替代方案（SEL）

Python中的数学模块：统计Mar 09, 2025 am 11:40 AM

Python的statistics模块提供强大的数据统计分析功能，帮助我们快速理解数据整体特征，例如生物统计学和商业分析等领域。无需逐个查看数据点，只需查看均值或方差等统计量，即可发现原始数据中可能被忽略的趋势和特征，并更轻松、有效地比较大型数据集。本教程将介绍如何计算平均值和衡量数据集的离散程度。除非另有说明，本模块中的所有函数都支持使用mean()函数计算平均值，而非简单的求和平均。也可使用浮点数。 import random import statistics from fracti

python对象的序列化和避难所化：第1部分Mar 08, 2025 am 09:39 AM

Python 对象的序列化和反序列化是任何非平凡程序的关键方面。如果您将某些内容保存到 Python 文件中，如果您读取配置文件，或者如果您响应 HTTP 请求，您都会进行对象序列化和反序列化。从某种意义上说，序列化和反序列化是世界上最无聊的事情。谁会在乎所有这些格式和协议？您想持久化或流式传输一些 Python 对象，并在以后完整地取回它们。这是一种在概念层面上看待世界的好方法。但是，在实际层面上，您选择的序列化方案、格式或协议可能会决定程序运行的速度、安全性、维护状态的自由度以及与其他系