기계 학습 분류 모델 평가-파이썬 튜토리얼-php.cn

집

백엔드 개발

파이썬 튜토리얼

기계 학습 분류 모델 평가

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Sep 07, 2024 pm 02:01 PM

개요

모델 평가의 목표는 무엇인가요?
모델 평가의 목적은 무엇이며, 어떤 것들이 있나요? 일반적인 평가 절차는 무엇인가요?
분류정확도의 사용법은 무엇이며, 그 의미는 무엇입니까? 제한이 있나요?
혼란 행렬은 성능을 어떻게 설명합니까? 분류기?
혼란 행렬에서 어떤 측정항목을 계산할 수 있나요?

T모델 평가의 목표는 질문에 답하는 것입니다.

다른 모델 중에서 어떻게 선택하나요?

기계 학습을 평가하는 과정은 모델이 적용에 얼마나 안정적이고 효과적인지 결정하는 데 도움이 됩니다. 여기에는 성능, 지표, 예측 또는 의사 결정의 정확성과 같은 다양한 요소를 평가하는 작업이 포함됩니다.

어떤 모델을 선택하든 다양한 모델 유형, 튜닝 매개변수, 기능 등 모델 중에서 선택할 수 있는 방법이 필요합니다. 또한 모델이 보이지 않는 데이터를 얼마나 잘 일반화할지 추정하려면 모델 평가 절차가 필요합니다. 마지막으로 모델 성능을 정량화하기 위해 다른 절차와 짝을 이루는 평가 절차가 필요합니다.

진행하기 전에 다양한 모델 평가 절차와 작동 방식을 살펴보겠습니다.

모델 평가 절차 및 작동 방식.

동일 데이터에 대한 학습과 테스트
- 훈련 데이터에 "과적 적합"하고 일반화할 필요가 없는 지나치게 복잡한 모델을 보상합니다
학습/테스트 분할
- 데이터 세트를 두 부분으로 분할하여 모델을 다양한 데이터에 대해 훈련하고 테스트할 수 있습니다
- 표본 외 성능에 대한 더 나은 추정치이지만 여전히 "높은 분산" 추정치입니다
- 속도, 단순성, 유연성으로 인해 유용함
K-겹 교차 검증
- 체계적으로 "K" 학습/테스트 분할을 생성하고 결과의 평균을 구합니다
- 표본 외 성능에 대한 더 나은 예측
- 학습/테스트 분할보다 "K"배 느리게 실행됩니다.

위에서 다음과 같이 추론할 수 있습니다.

동일한 데이터에 대한 훈련 및 테스트는 새 데이터에 일반화되지 않고 실제로 유용하지 않은 지나치게 복잡한 모델을 구축하는 과적합의 전형적인 원인입니다.
Train_Test_Split은 샘플 외부 성능에 대해 훨씬 더 나은 추정치를 제공합니다.
K-폴드 교차 검증은 체계적으로 K 열차 테스트를 분할하고 결과를 함께 평균화함으로써 더 나은 성능을 발휘합니다.

요약하자면, train_tests_split은 속도와 단순성으로 인해 교차 검증에 여전히 수익성이 있으며, 이것이 바로 이 튜토리얼 가이드에서 사용할 것입니다.

모델 평가 지표:

선택한 절차를 진행하려면 항상 평가 지표가 필요하며, 지표 선택은 해결하려는 문제에 따라 달라집니다. 분류 문제의 경우 분류 정확도를 사용할 수 있습니다. 하지만 이 가이드에서는 다른 중요한 분류 평가 지표에 중점을 둘 것입니다.

새로운 평가 지표를 알아보기 전에 분류 정확도를 검토하고, 장점과 단점에 대해 이야기해 보겠습니다.

분류 정확도

이 튜토리얼에서는 768명의 환자의 건강 데이터와 당뇨병 상태가 포함된 Pima Indians 당뇨병 데이터세트를 선택했습니다.

Evaluating A Machine Learning Classification Model

데이터를 읽고 데이터의 처음 5개 행을 인쇄해 보겠습니다. 라벨 열에는 환자에게 당뇨병이 있는 경우 1, 당뇨병이 없는 경우 0이 표시되며, 우리는 다음 질문에 답하려고 합니다.

질문: 환자의 건강 상태를 측정하여 당뇨병 상태를 예측할 수 있습니까?

우리는 기능 메트릭 X와 응답 벡터 Y를 정의합니다. train_test_split을 사용하여 X와 Y를 훈련 및 테스트 세트로 분할합니다.

Evaluating A Machine Learning Classification Model

다음으로 훈련 세트에서 로지스틱 회귀 모델을 훈련합니다. 그런 다음 맞춤 단계에서 logreg 모델 개체는 X_train과 Y_train 간의 관계를 학습합니다. 마지막으로 테스트 세트에 대한 클래스 예측을 수행합니다.

Evaluating A Machine Learning Classification Model

이제 테스트 세트에 대한 예측을 수행했으며 간단히 정확한 예측의 백분율인 분류 정확도를 계산할 수 있습니다.

Evaluating A Machine Learning Classification Model

그러나 분류 정확도를 평가 지표로 사용할 때마다 항상 가장 빈번한 클래스를 예측하여 달성할 수 있는 정확도인 Null 정확도와 이를 비교하는 것이 중요합니다.

Evaluating A Machine Learning Classification Model

무정확도가 질문에 답합니다. 내 모델이 지배적인 클래스를 100% 예측한다면 얼마나 자주 정확할까요? 위 시나리오에서 y_test의 32%는 1입니다. 즉, 환자에게 당뇨병이 있다고 예측하는 멍청한 모델은 68% 확률(0)이 맞습니다. 이는 로지스틱 회귀를 측정할 수 있는 기준선을 제공합니다. 모델입니다.

Null 정확도 68%와 모델 정확도 69%를 비교해 보면 우리 모델이 그다지 좋아 보이지는 않습니다. 이는 모델 평가 지표로서 분류 정확도의 한 가지 약점을 보여줍니다. 분류 정확도는 테스트 테스트의 기본 분포에 대해 아무 것도 알려주지 않습니다.

요약:

분류 정확도는 가장 이해하기 쉬운 분류 측정항목입니다.
그러나 반응값의 기본 분포
그리고 분류자가 어떤 오류 "유형"을 하는지 알려주지 않습니다.

이제 혼동행렬을 살펴보겠습니다.

혼란 매트릭스

혼란행렬은 분류 모델의 성능을 설명하는 표입니다.
분류기의 성능을 이해하는 데 유용하지만 모델 평가 지표는 아닙니다. 따라서 scikit이 최고의 혼동 행렬을 사용하여 모델을 선택하도록 지시할 수 없습니다. 그러나 혼동 행렬에서 계산할 수 있는 측정항목이 많으며 모델을 선택하는 데 직접 사용할 수 있습니다.

Evaluating A Machine Learning Classification Model

테스트 세트의 모든 관찰은 정확히 하나의 상자에 표시됩니다.
2개의 응답 클래스가 있으므로 2x2 행렬입니다.
여기에 표시된 형식은 보편적이지

몇 가지 기본 용어를 설명하겠습니다.

참 긍정(TP): 우리는 정확하게 그들이 당뇨병에 걸렸다고
진음성(TN): 우리는 정확하게 그들이 당뇨병에 걸리지
오탐지(FP): 우리는 잘못 그들이 당뇨병에 걸렸다고 예측했습니다("제1종 오류")
거짓 부정(FN): 당뇨병이 없다고 잘못 예측했습니다("제2형 오류")

측정항목을 어떻게 계산하는지 살펴보겠습니다.

Evaluating A Machine Learning Classification Model

결론:

혼동 행렬은 분류기의 성능에 대한 더 완전한 그림을 제공합니다
또한 다양한 분류 지표를 계산할 수 있으며 이러한 지표는 모델 선택을 안내할 수 있습니다

위 내용은 기계 학습 분류 모델 평가의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

성명

본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.

관련 기사

파이썬 : 게임, Guis 등Apr 13, 2025 am 12:14 AM

Python은 게임 및 GUI 개발에서 탁월합니다. 1) 게임 개발은 Pygame을 사용하여 드로잉, 오디오 및 기타 기능을 제공하며 2D 게임을 만드는 데 적합합니다. 2) GUI 개발은 Tkinter 또는 PYQT를 선택할 수 있습니다. Tkinter는 간단하고 사용하기 쉽고 PYQT는 풍부한 기능을 가지고 있으며 전문 개발에 적합합니다.

Python vs. C : 응용 및 사용 사례가 비교되었습니다Apr 12, 2025 am 12:01 AM

Python은 데이터 과학, 웹 개발 및 자동화 작업에 적합한 반면 C는 시스템 프로그래밍, 게임 개발 및 임베디드 시스템에 적합합니다. Python은 단순성과 강력한 생태계로 유명하며 C는 고성능 및 기본 제어 기능으로 유명합니다.

2 시간의 파이썬 계획 : 현실적인 접근Apr 11, 2025 am 12:04 AM

2 시간 이내에 Python의 기본 프로그래밍 개념과 기술을 배울 수 있습니다. 1. 변수 및 데이터 유형을 배우기, 2. 마스터 제어 흐름 (조건부 명세서 및 루프), 3. 기능의 정의 및 사용을 이해하십시오. 4. 간단한 예제 및 코드 스 니펫을 통해 Python 프로그래밍을 신속하게 시작하십시오.

파이썬 : 기본 응용 프로그램 탐색Apr 10, 2025 am 09:41 AM

Python은 웹 개발, 데이터 과학, 기계 학습, 자동화 및 스크립팅 분야에서 널리 사용됩니다. 1) 웹 개발에서 Django 및 Flask 프레임 워크는 개발 프로세스를 단순화합니다. 2) 데이터 과학 및 기계 학습 분야에서 Numpy, Pandas, Scikit-Learn 및 Tensorflow 라이브러리는 강력한 지원을 제공합니다. 3) 자동화 및 스크립팅 측면에서 Python은 자동화 된 테스트 및 시스템 관리와 같은 작업에 적합합니다.

2 시간 안에 얼마나 많은 파이썬을 배울 수 있습니까?Apr 09, 2025 pm 04:33 PM

2 시간 이내에 파이썬의 기본 사항을 배울 수 있습니다. 1. 변수 및 데이터 유형을 배우십시오. 이를 통해 간단한 파이썬 프로그램 작성을 시작하는 데 도움이됩니다.

10 시간 이내에 프로젝트 및 문제 중심 방법에서 컴퓨터 초보자 프로그래밍 기본 사항을 가르치는 방법?Apr 02, 2025 am 07:18 AM

10 시간 이내에 컴퓨터 초보자 프로그래밍 기본 사항을 가르치는 방법은 무엇입니까? 컴퓨터 초보자에게 프로그래밍 지식을 가르치는 데 10 시간 밖에 걸리지 않는다면 무엇을 가르치기로 선택 하시겠습니까?

중간 독서를 위해 Fiddler를 사용할 때 브라우저에서 감지되는 것을 피하는 방법은 무엇입니까?Apr 02, 2025 am 07:15 AM

Fiddlerevery Where를 사용할 때 Man-in-the-Middle Reading에 Fiddlereverywhere를 사용할 때 감지되는 방법 ...

Python 3.6에 피클 파일을로드 할 때 '__builtin__'모듈을 찾을 수없는 경우 어떻게해야합니까?Apr 02, 2025 am 07:12 AM

Python 3.6에 피클 파일로드 3.6 환경 보고서 오류 : modulenotfounderror : nomodulename ...

See all articles

핫 AI 도구

Undresser.AI Undress

사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover

사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool

무료로 이미지를 벗다

Clothoff.io

AI 옷 제거제

AI Hentai Generator

AI Hentai를 무료로 생성하십시오.

뜨거운 도구

mPDF

mPDF는 UTF-8로 인코딩된 HTML에서 PDF 파일을 생성할 수 있는 PHP 라이브러리입니다. 원저자인 Ian Back은 자신의 웹 사이트에서 "즉시" PDF 파일을 출력하고 다양한 언어를 처리하기 위해 mPDF를 작성했습니다. HTML2FPDF와 같은 원본 스크립트보다 유니코드 글꼴을 사용할 때 속도가 느리고 더 큰 파일을 생성하지만 CSS 스타일 등을 지원하고 많은 개선 사항이 있습니다. RTL(아랍어, 히브리어), CJK(중국어, 일본어, 한국어)를 포함한 거의 모든 언어를 지원합니다. 중첩된 블록 수준 요소(예: P, DIV)를 지원합니다.

SecList

SecLists는 최고의 보안 테스터의 동반자입니다. 보안 평가 시 자주 사용되는 다양한 유형의 목록을 한 곳에 모아 놓은 것입니다. SecLists는 보안 테스터에게 필요할 수 있는 모든 목록을 편리하게 제공하여 보안 테스트를 더욱 효율적이고 생산적으로 만드는 데 도움이 됩니다. 목록 유형에는 사용자 이름, 비밀번호, URL, 퍼징 페이로드, 민감한 데이터 패턴, 웹 셸 등이 포함됩니다. 테스터는 이 저장소를 새로운 테스트 시스템으로 간단히 가져올 수 있으며 필요한 모든 유형의 목록에 액세스할 수 있습니다.