新手在机器学习中常见的五大问题

新手在机器学习中常见的五大问题

Apr 12, 2023 pm 05:34 PM

机器学习

处理缺失值

新手在机器学习中常见的五大问题

在数据预处理中，关键步骤是处理缺失的数据，因为机器学习模型不会接受NaN值作为它们的输入。有很多种方法可以填充这些NaN值，但我们首先需要理解缺失值的重要性。

很简单的一种方法是从机器学习数据集中删除所有缺失值，但在这之前，请先检查机器学习数据集中出现的NaN值的总体百分比。如果小于1%，我们可以删除所有缺失值，否则我们需要通过选择其他方法，如集中趋势测量、KNN Imputer等来估算数据。

当我们在特征中使用数字时，我们使用平均或中位数。均值是平均值我们可以通过将一行所有值汇总然后除以它们的量来计算。中位数也表示一个平均值，中位数将数据按大小顺序排列起来,形成一个数列,居于数列中间位置的那个数据。当一组数据中的个别数据变动较大时，常用中位数来描述这组数据的集中趋势。

如果机器学习数据集中存在偏态分布，往往使用中位数要比均值好。

异常值/离群值

异常值是与其他观测值有显著差异的数据点。有时，这些异常值也可能很敏感。在处理异常值之前，建议先检查机器学习数据集。

例如：

基于观测降雨量的深度值预测中离群值具有重要意义。
房价预测中的异常值则没有任何意义。

数据泄露

什么是机器学习模型中的数据泄漏问题呢？

当我们用于训练模机器学习型的数据包含机器学习模型试图预测的信息时，就会发生数据泄漏。这会导致模型部署后的预测结果不可靠。

这个问题可能是由于数据标准化或归一化方法造成的。因为我们大多数人在将数据分割成训练集和测试集之前会继续使用这些方法。

选择合适的机器学习模型

实时，我觉得不必要地转向一些复杂的模型可能会对面向业务的人产生一些可解释性问题。例如，线性回归将比神经网络算法更容易解释。

主要根据数据集的大小和复杂性来选择对应的机器学习模型，如果我们处理复杂的问题，我们可以使用一些高效的机器学习模型，如SVN、KNN、随机森林等。

大多数时候，数据探索阶段会有助于我们选择对应的机器学习模型。如果在可视化中数据是线性可分离的，那么我们可以使用线性回归。如果我们对数据不了解，支持向量机和KNN将会很有用。

另外还存在一个模型可解释问题，例如，线性回归比神经网络算法更容易解释。

验证指标

指标是模型预测器和实际数据的定量度量。如果问题是回归方面的，则关键指标是准确性(R2评分)，MAE(平均绝对误差)和RMSE(均方根误差)。如果是分类方面的问题，关键指标则是精确，召回，F1score和混淆矩阵。

以上是新手在机器学习中常见的五大问题的详细内容。更多信息请关注PHP中文网其他相关文章！

声明

本文转载于：51CTO.COM。如有侵权，请联系admin@php.cn删除

外推指南

外推指南Apr 15, 2025 am 11:38 AM

介绍假设有一个农民每天在几周内观察农作物的进展。他研究了增长率，并开始思考他的植物在几周内可以生长的高度。从Th

软AI的兴起及其对当今企业的意义

软AI的兴起及其对当今企业的意义Apr 15, 2025 am 11:36 AM

软AI（被定义为AI系统，旨在使用近似推理，模式识别和灵活的决策执行特定的狭窄任务 - 试图通过拥抱歧义来模仿类似人类的思维。但是这对业务意味着什么

为AI前沿的不断发展的安全框架

为AI前沿的不断发展的安全框架Apr 15, 2025 am 11:34 AM

答案很明确 - 只是云计算需要向云本地安全工具转变，AI需要专门为AI独特需求而设计的新型安全解决方案。云计算和安全课程的兴起在

生成AI的3种方法放大了企业家：当心平均值！

生成AI的3种方法放大了企业家：当心平均值！Apr 15, 2025 am 11:33 AM

企业家，并使用AI和Generative AI来改善其业务。同时，重要的是要记住生成的AI，就像所有技术一样，都是一个放大器 - 使得伟大和平庸，更糟。严格的2024研究O

Andrew Ng的新简短课程

Andrew Ng的新简短课程Apr 15, 2025 am 11:32 AM

解锁嵌入模型的力量：深入研究安德鲁·NG的新课程想象一个未来，机器可以完全准确地理解和回答您的问题。这不是科幻小说；多亏了AI的进步，它已成为R

大语言模型（LLM）中的幻觉是不可避免的吗？

大语言模型（LLM）中的幻觉是不可避免的吗？Apr 15, 2025 am 11:31 AM

大型语言模型（LLM）和不可避免的幻觉问题您可能使用了诸如Chatgpt，Claude和Gemini之类的AI模型。这些都是大型语言模型（LLM）的示例，在大规模文本数据集上训练的功能强大的AI系统

60％的问题 - AI搜索如何消耗您的流量

60％的问题 - AI搜索如何消耗您的流量Apr 15, 2025 am 11:28 AM

最近的研究表明，根据行业和搜索类型，AI概述可能导致有机交通下降15-64％。这种根本性的变化导致营销人员重新考虑其在数字可见性方面的整个策略。新的

麻省理工学院媒体实验室将人类蓬勃发展成为AI R＆D的核心

麻省理工学院媒体实验室将人类蓬勃发展成为AI R＆D的核心Apr 15, 2025 am 11:26 AM

埃隆大学（Elon University）想象的数字未来中心的最新报告对近300名全球技术专家进行了调查。由此产生的报告“ 2035年成为人类”，得出的结论是，大多数人担心AI系统加深的采用

See all articles

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序，用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

AI Hentai Generator

AI Hentai Generator

免费生成ai无尽的。

热门文章

R.E.P.O.能量晶体解释及其做什么（黄色晶体）

4 周前By尊渡假赌尊渡假赌尊渡假赌

R.E.P.O.最佳图形设置

4 周前By尊渡假赌尊渡假赌尊渡假赌

刺客信条阴影：贝壳谜语解决方案

2 周前ByDDD

R.E.P.O.如果您听不到任何人，如何修复音频

4 周前By尊渡假赌尊渡假赌尊渡假赌

R.E.P.O.聊天命令以及如何使用它们

4 周前By尊渡假赌尊渡假赌尊渡假赌

热工具

DVWA

DVWA

Damn Vulnerable Web App (DVWA) 是一个PHP/MySQL的Web应用程序，非常容易受到攻击。它的主要目标是成为安全专业人员在合法环境中测试自己的技能和工具的辅助工具，帮助Web开发人员更好地理解保护Web应用程序的过程，并帮助教师/学生在课堂环境中教授/学习Web应用程序安全。DVWA的目标是通过简单直接的界面练习一些最常见的Web漏洞，难度各不相同。请注意，该软件中

记事本++7.3.1

记事本++7.3.1

好用且免费的代码编辑器

安全考试浏览器

安全考试浏览器

Safe Exam Browser是一个安全的浏览器环境，用于安全地进行在线考试。该软件将任何计算机变成一个安全的工作站。它控制对任何实用工具的访问，并防止学生使用未经授权的资源。

mPDF

mPDF

mPDF是一个PHP库，可以从UTF-8编码的HTML生成PDF文件。原作者Ian Back编写mPDF以从他的网站上“即时”输出PDF文件，并处理不同的语言。与原始脚本如HTML2FPDF相比，它的速度较慢，并且在使用Unicode字体时生成的文件较大，但支持CSS样式等，并进行了大量增强。支持几乎所有语言，包括RTL（阿拉伯语和希伯来语）和CJK（中日韩）。支持嵌套的块级元素（如P、DIV），

螳螂BT

螳螂BT

Mantis是一个易于部署的基于Web的缺陷跟踪工具，用于帮助产品缺陷跟踪。它需要PHP、MySQL和一个Web服务器。请查看我们的演示和托管服务。

热门话题

gmail邮箱登陆入口在哪里

7519

15

1378

52

steam的账户名称是什么格式

81

11

win11激活密钥永久

54

19

NYT连接提示和答案

21

68