분류를 위한 중심화 및 스케일링
이제 스케일링과 모델 구축을 교차 검증을 위한 파이프라인으로 통합할 것입니다.
여러분의 임무는 music_df 데이터세트의 특성을 스케일링하고, 하이퍼파라미터 C의 다양한 값을 가진 로지스틱 회귀 모델을 사용하여 그리드 서치 교차 검증을 수행하는 파이프라인을 구축하는 것입니다. 여기서 타깃 변수는 "genre"이며, 록 장르는 1로, 다른 모든 장르들은 0으로 표시된 이진 값이 포함됩니다.
여러분을 위해 StandardScaler, LogisticRegression, GridSearchCV가 모두 import 되어 있습니다.
이 연습은 강의의 일부입니다
scikit-learn으로 배우는 지도 학습
연습 안내
- 파이프라인의 단계를 구축하세요:
"scaler"라는 이름의StandardScaler()객체와"logreg"라는 이름의 로지스틱 회귀 모델 - 파이프라인 내의 로지스틱 회귀 모델의
C하이퍼파라미터에 대해0.001부터1.0까지 20개의 균등한 간격 부동소수점 값을 검색하도록parameters를 생성하세요. - 그리드 서치 객체를 인스턴스화하세요.
- 그리드 서치 객체를 학습 데이터에 학습시키세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Build the steps
steps = [("____", ____()),
("____", ____())]
pipeline = Pipeline(steps)
# Create the parameter space
parameters = {"____": np.____(____, ____, 20)}
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2,
random_state=21)
# Instantiate the grid search object
cv = ____(____, param_grid=____)
# Fit to the training data
cv.____(____, ____)
print(cv.best_score_, "\n", cv.best_params_)