시작하기무료로 시작하기

로지스틱 회귀란 무엇인가요?

이번 장에서 적합할 모델은 logistic regression이라고 합니다. 이 모델은 선형 회귀와 매우 비슷하지만, 숫자형 변수를 예측하는 대신 어떤 사건이 일어날 확률(0과 1 사이)을 예측해요.

이 모델을 분류 알고리즘으로 사용하려면, 예측된 확률에 기준값(cutoff)을 하나 정하면 됩니다. 예측 확률이 기준값보다 크면 해당 관측값을 '예'(이 경우에는 항공편이 지연됨)으로 분류하고, 작으면 '아니요'로 분류해요!

여러 하이퍼파라미터의 값을 바꿔 보면서 이 모델을 튜닝할 거예요. 하이퍼파라미터는 데이터에서 추정하는 값이 아니라, 성능을 극대화하기 위해 사용자가 직접 지정하는 값이에요. 이 강의에서는 각각의 수학적 배경을 모두 이해할 필요는 없고, 여러 후보를 시도해 본 뒤 가장 좋은 것을 고르는 게 중요해요.

왜 하이퍼파라미터를 제공할까요?

이 연습은 강의의 일부입니다

PySpark 기초

강의 보기

실습형 인터랙티브 연습문제

이론을 실습으로 바꾸는 인터랙티브 연습 중 하나를 만나보세요

연습 시작