簡介Python的sklearn機器學習演算法-Python教學-PHP中文網

首頁

後端開發

Python教學

簡介Python的sklearn機器學習演算法

coldplay.xixi

Jan 22, 2021 am 09:55 AM

python

簡介Python的sklearn機器學習演算法

免費學習推薦：python影片教學

匯入必要通用模組

import pandas as pdimport matplotlib.pyplot as pltimport osimport numpy as npimport copyimport reimport math

一機器學習通用框架：以knn為例

#利用邻近点方式训练数据不太适用于高维数据from sklearn.model_selection import train_test_split#将数据分为测试集和训练集from sklearn.neighbors import KNeighborsClassifier#利用邻近点方式训练数据#1.读取数据data=pd.read_excel(&#39;数据/样本数据.xlsx&#39;)#2.将数据标准化from sklearn import preprocessingfor col in data.columns[2:]:#为了不破坏数据集中的离散变量，只将数值种类数高于10的连续变量标准化
       if len(set(data[col]))>10:
              data[col]=preprocessing.scale(data[col])#3.构造自变量和因变量并划分为训练集和测试集X=data[[&#39;month_income&#39;,&#39;education_outcome&#39;,&#39;relationship_outcome&#39;, &#39;entertainment_outcome&#39;,&#39;traffic_&#39;, &#39;express&#39;,
       &#39;express_distance&#39;,&#39;satisfac&#39;, &#39;wifi_neghbor&#39;,&#39;wifi_relative&#39;, &#39;wifi_frend&#39;, &#39;internet&#39;]]y=data[&#39;wifi&#39;]X_train,X_test,y_train,y_test=train_test_split(X,y,test_size=0.3)#利用train_test_split进行将训练集和测试集进行分开，test_size占30%#4.模型拟合model=KNeighborsClassifier()#引入训练方法model.fit(X_train,y_train)#进行填充测试数据进行训练y_predict=model.predict(X_test)#利用测试集数据作出预测#通过修改判别概率标准修改预测结果proba=model.predict_proba(X_test)#返回基于各个测试集样本所预测的结果为0和为1的概率值#5.模型评价#(1)测试集样本数据拟合优度，model.score(X,y)model.score(X_test,y_test)#(2)构建混淆矩阵，判断预测精准程度"""
混淆矩阵中行代表真实值，列代表预测值
TN:实际为0预测为0的个数       FP:实际为0预测为1的个数
FN:实际为1预测为0的个数       TP:实际为1预测为1的个数

精准率precision=TP/(TP+FP)——被预测为1的样本的的预测正确率
召回率recall=TP/(TP+FN)——实际为1的样本的正确预测率
"""from sklearn.metrics import confusion_matrix
cfm=confusion_matrix(y_test, y_predict)plt.matshow(cfm,cmap=plt.cm.gray)#cmap参数为绘制矩阵的颜色集合，这里使用灰度plt.show()#(3)精准率和召回率from sklearn.metrics import precision_score,recall_score
precision_score(y_test, y_predict)# 精准率recall_score(y_test, y_predict)#召回率#(4)错误率矩阵row_sums = np.sum(cfm,axis=1)err_matrix = cfm/row_sums
np.fill_diagonal(err_matrix,0)#对err_matrix矩阵的对角线置0，因为这是预测正确的部分，不关心plt.matshow(err_matrix,cmap=plt.cm.gray)#亮度越高的地方代表错误率越高plt.show()

二資料處理

#1.构造数据集from sklearn import datasets#引入数据集#n_samples为生成样本的数量，n_features为X中自变量的个数，n_targets为y中因变量的个数，bias表示使线性模型发生偏差的程度，X,y=datasets.make_regression(n_samples=100,n_features=1,n_targets=1,noise=1,bias=0.5,tail_strength=0.1)plt.figure(figsize=(12,12))plt.scatter(X,y)#2.读取数据data=pd.read_excel(&#39;数据/样本数据.xlsx&#39;)#3.将数据标准化——preprocessing.scale（data）from sklearn import preprocessing#为了不破坏数据集中的离散变量，只将数值种类数高于10的连续变量标准化for col in data.columns[2:]:
       if len(set(data[col]))>10:
              data[col]=preprocessing.scale(data[col])

三回歸

1.一般最小平方法線性迴歸

import numpy as npfrom sklearn.linear_model import LinearRegressionfrom sklearn.model_selection import train_test_split

X=data[[&#39;work&#39;, &#39;work_time&#39;, &#39;work_salary&#39;,
       &#39;work_address&#39;, &#39;worker_number&#39;, &#39;month_income&#39;, &#39;total_area&#39;,
       &#39;own_area&#39;, &#39;rend_area&#39;, &#39;out_area&#39;,
       &#39;agricultal_income&#39;, &#39;things&#39;, &#39;wifi&#39;, &#39;internet_fee&#39;, &#39;cloth_outcome&#39;,
       &#39;education_outcome&#39;, &#39;medcine_outcome&#39;, &#39;person_medicne_outcome&#39;,
       &#39;relationship_outcome&#39;, &#39;food_outcome&#39;, &#39;entertainment_outcome&#39;,
       &#39;agriculta_outcome&#39;, &#39;other_outcome&#39;, &#39;owe&#39;, &#39;owe_total&#39;, &#39;debt&#39;,
       &#39;debt_way&#39;, &#39;distance_debt&#39;, &#39;distance_market&#39;, &#39;traffic_&#39;, &#39;express&#39;,
       &#39;express_distance&#39;, &#39;exercise&#39;, &#39;satisfac&#39;, &#39;wifi_neghbor&#39;,
       &#39;wifi_relative&#39;, &#39;wifi_frend&#39;, &#39;internet&#39;, &#39;medical_insurance&#39;]]y=data[&#39;total_income&#39;]model=LinearRegression().fit(X,y)#拟合模型model.score(X,y)#拟合优度model.coef_#查看拟合系数model.intercept_#查看拟合截距项model.predict(np.array(X.ix[25,:]).reshape(1,-1))#预测model.get_params()#得到模型的参数

#2.邏輯迴歸Logit

from sklearn.linear_model import LogisticRegression#2.1数据处理X=data[[&#39;month_income&#39;, &#39;education_outcome&#39;,&#39;relationship_outcome&#39;, &#39;entertainment_outcome&#39;,&#39;traffic_&#39;, &#39;express&#39;,
       &#39;express_distance&#39;,&#39;satisfac&#39;, &#39;wifi_neghbor&#39;,&#39;wifi_relative&#39;, &#39;wifi_frend&#39;, &#39;internet&#39;]]y=data[&#39;wifi&#39;]X_train,X_test,y_train,y_test=train_test_split(X,y,test_size=0.3)#利用train_test_split进行将训练集和测试集进行分开，test_size占30%#2.2模型拟合model = LogisticRegression()model.fit(X_train,y_train)model.score(X_test,y_test)#2.3模型预测y_predict = model.predict(X_test)#2.4通过调整判别分数标准，来调整判别结果decsion_scores = model.decision_function(X_test)#用于决定预测值取值的判别分数y_predict = decsion_scores>=5.0#将判别分数标准调整为5#2.5通过 精准率——召回率曲线图 寻找最优判别标准#由于随着判别标准的变化，精确率和召回率此消彼长，因此需要寻找一个最佳的判别标准使得精准率和召回率尽可能大from sklearn.metrics import precision_recall_curve
precisions,recalls,thresholds = precision_recall_curve(y_test,decsion_scores)#thresholds表示所有可能得判别标准，即判别分数最大与最小值之间的范围#由于precisions和recalls中比thresholds多了一个元素，因此要绘制曲线，先去掉这个元素plt.plot(thresholds,precisions[:-1])plt.plot(thresholds,recalls[:-1])plt.show()y_predict = decsion_scores>=2#根据上图显示，两线交于-0.3处，因此将判别分数标准调整为-0.3#2.6绘制ROC曲线:用于描述TPR和FPR之间的关系，ROC曲线围成的面积越大，说明模型越好"""TPR即是召回率_越大越好，FPR=(FP)/(TN+FP)_越小越好"""from sklearn.metrics import roc_curve
fprs,tprs,thresholds = roc_curve(y_test,decsion_scores)plt.plot(fprs,tprs)plt.show()#2.7绘制混淆矩阵from sklearn.metrics import confusion_matrix,precision_score,recall_score
cfm =confusion_matrix(y_test, y_predict)# 构建混淆矩阵并绘制混淆矩阵热力图plt.matshow(cfm,cmap=plt.cm.gray)#cmap参数为绘制矩阵的颜色集合，这里使用灰度plt.show()precision_score(y_test, y_predict)# 精准率recall_score(y_test, y_predict)#召回率

四模型評價

#1.混淆矩阵，精准率和召回率from sklearn.metrics import confusion_matrix,precision_score,recall_score"""
混淆矩阵中行代表真实值，列代表预测值
TN:实际为0预测为0的个数       FP:实际为0预测为1的个数
FN:实际为1预测为0的个数       TP:实际为1预测为1的个数

精准率precision=TP/(TP+FP)——被预测为1的样本的的预测正确率
召回率recall=TP/(TP+FN)——实际为1的样本的正确预测率
"""cfm =confusion_matrix(y_test, y_predict)# 构建混淆矩阵并绘制混淆矩阵热力图plt.matshow(cfm,cmap=plt.cm.gray)#cmap参数为绘制矩阵的颜色集合，这里使用灰度plt.show()precision_score(y_test, y_predict)# 精准率recall_score(y_test, y_predict)#召回率#2.精准率和召回率作图:由于精准率和召回率此消彼长，应当选择适当的参数使二者同时尽可能的大#3.调和平均值"""精准率和召回率的调和平均值"""from sklearn.metrics import f1_score
f1_score(y_test,y_predict)#4.错误率矩阵row_sums = np.sum(cfm,axis=1)err_matrix = cfm/row_sums
np.fill_diagonal(err_matrix,0)#对err_matrix矩阵的对角线置0，因为这是预测正确的部分，不关心plt.matshow(err_matrix,cmap=plt.cm.gray)#亮度越高的地方代表错误率越高plt.show()

大量免費學習推薦，請造訪python教學(影片)

以上是簡介Python的sklearn機器學習演算法的詳細內容。更多資訊請關注PHP中文網其他相關文章！

陳述

本文轉載於：CSDN。如有侵權，請聯絡admin@php.cn刪除

Python和時間：充分利用您的學習時間Apr 14, 2025 am 12:02 AM

要在有限的時間內最大化學習Python的效率，可以使用Python的datetime、time和schedule模塊。 1.datetime模塊用於記錄和規劃學習時間。 2.time模塊幫助設置學習和休息時間。 3.schedule模塊自動化安排每週學習任務。

Python：遊戲，Guis等Apr 13, 2025 am 12:14 AM

Python在遊戲和GUI開發中表現出色。 1)遊戲開發使用Pygame，提供繪圖、音頻等功能，適合創建2D遊戲。 2)GUI開發可選擇Tkinter或PyQt，Tkinter簡單易用，PyQt功能豐富，適合專業開發。

Python vs.C：申請和用例Apr 12, 2025 am 12:01 AM

Python适合数据科学、Web开发和自动化任务，而C 适用于系统编程、游戏开发和嵌入式系统。Python以简洁和强大的生态系统著称，C 则以高性能和底层控制能力闻名。

2小時的Python計劃：一種現實的方法Apr 11, 2025 am 12:04 AM

2小時內可以學會Python的基本編程概念和技能。 1.學習變量和數據類型，2.掌握控制流（條件語句和循環），3.理解函數的定義和使用，4.通過簡單示例和代碼片段快速上手Python編程。

Python：探索其主要應用程序Apr 10, 2025 am 09:41 AM

Python在web開發、數據科學、機器學習、自動化和腳本編寫等領域有廣泛應用。 1)在web開發中，Django和Flask框架簡化了開發過程。 2)數據科學和機器學習領域，NumPy、Pandas、Scikit-learn和TensorFlow庫提供了強大支持。 3)自動化和腳本編寫方面，Python適用於自動化測試和系統管理等任務。