시작하기무료로 시작하기

분류를 위한 중심화 및 스케일링

이제 스케일링과 모델 구축을 교차 검증을 위한 파이프라인으로 통합할 것입니다.

여러분의 임무는 music_df 데이터세트의 특성을 스케일링하고, 하이퍼파라미터 C의 다양한 값을 가진 로지스틱 회귀 모델을 사용하여 그리드 서치 교차 검증을 수행하는 파이프라인을 구축하는 것입니다. 여기서 타깃 변수는 "genre"이며, 록 장르는 1로, 다른 모든 장르들은 0으로 표시된 이진 값이 포함됩니다.

여러분을 위해 StandardScaler, LogisticRegression, GridSearchCV가 모두 import 되어 있습니다.

이 연습은 강의의 일부입니다

scikit-learn으로 배우는 지도 학습

강의 보기

연습 안내

  • 파이프라인의 단계를 구축하세요: "scaler"라는 이름의 StandardScaler() 객체와 "logreg"라는 이름의 로지스틱 회귀 모델
  • 파이프라인 내의 로지스틱 회귀 모델의 C 하이퍼파라미터에 대해 0.001부터 1.0까지 20개의 균등한 간격 부동소수점 값을 검색하도록 parameters를 생성하세요.
  • 그리드 서치 객체를 인스턴스화하세요.
  • 그리드 서치 객체를 학습 데이터에 학습시키세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Build the steps
steps = [("____", ____()),
         ("____", ____())]
pipeline = Pipeline(steps)

# Create the parameter space
parameters = {"____": np.____(____, ____, 20)}
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, 
                                                    random_state=21)

# Instantiate the grid search object
cv = ____(____, param_grid=____)

# Fit to the training data
cv.____(____, ____)
print(cv.best_score_, "\n", cv.best_params_)
코드 편집 및 실행