Maison >développement back-end >Tutoriel Python >série Excel d'opération Python : nettoyage des données

série Excel d'opération Python : nettoyage des données

coldplay.xixi
coldplay.xixiavant
2021-03-02 10:20:003993parcourir

série Excel d'opération Python : nettoyage des données

Bien que Python fonctionne avec Excel, l'article précédent parlait de lecture, d'insertion et d'analyse simple des données. Un autre point très important est le nettoyage des données. Alors, qu'est-ce que le nettoyage des données ? Pour parler franchement, cela signifie supprimer les valeurs indésirables dans le texte des données, telles que : les valeurs nulles existantes, les espaces redondants, les formats de données, etc.

Recommandations d'apprentissage gratuites associées : Tutoriel vidéo Python

Importer la bibliothèque Python et lire les données Excel.
# 导入 pandas 库import pandas as pd# read_excel() 读取 excel 数据# DataFrame() 将读取到的数据转换为 DataFrame 数据df = pd.DataFrame(pd.read_excel('data.xlsx'))
2, nettoyage des données (supprimer les valeurs nulles)
# dropna() 函数去除 df 数据表中存在空值的所有行df.dropna(how='any')# mean() 函数计算 age 字段所在列的平均值age_pre = df['age'].mean()# 使用 fillna() 函数对存在的空值进行填充,将 age_pre 的值填充到字段为空的值内面df['age'].fillna(age_pre)
3, nettoyage des données (effacer les espaces dans les champs)
# 清除字段的空格df['name'] = df['name'].map(str.strip)
4, nettoyage des données (supprimer un certain changement de nom de colonne )
# rename() 函数对列进行重命名df.rename(columns={'name': 'name_new'})
5, nettoyage des données (suppression des valeurs en double dans une colonne)
# 从前往后查找某个列中的重复值,如果存在则清除后面所出现的重复值df['name'].drop_duplicates()# 从后往前查找某个列中的重复值,如果存在则清除前面所出现的重复值df['city'].drop_duplicates(keep='last')# 两种正好是按照相反的清除顺序
6, nettoyage des données (remplacement de la valeur des données)
# 将某一列中的具体值进行替换df['name'].replace('laow', 'lwsbc')

Connexe gratuit recommandations d'apprentissage : tutoriel python(vidéo)

Ce qui précède est le contenu détaillé de. pour plus d'informations, suivez d'autres articles connexes sur le site Web de PHP en chinois!

Déclaration:
Cet article est reproduit dans:. en cas de violation, veuillez contacter admin@php.cn Supprimer