회귀를 위한 중심화 및 스케일링
이제 데이터 스케일링의 이점을 확인해 봤으니, 파이프라인을 사용해 music_df 특성을 전처리하고, 노래의 음량을 예측하는 라쏘 회귀 모델을 구축해 볼 것입니다.
X_train, X_test, y_train, y_test는 music_df 데이터세트에서 생성되었으며, 여기서 타깃은 "loudness"이고 특성은 데이터세트의 다른 모든 열입니다. Lasso과 Pipeline또한 여러분을 위해 이미 가져와져 있습니다.
참고로 "genre"는 이진 특징으로 변환되었으며, 1은 록 노래를 나타내고 0은 다른 장르를 나타냅니다.
이 연습은 강의의 일부입니다
scikit-learn으로 배우는 지도 학습
연습 안내
StandardScaler를 가져오세요.- 파이프라인 객체의 단계를 생성하세요:
"scaler"라는StandardScaler객체와alpha를0.5로 설정한"lasso"라는 라쏘 모델입니다. - 스케일링하고 라쏘 회귀 모델을 구축하기 위해 단계가 있는 파이프라인을 인스턴스화하세요.
- 테스트 데이터에서 R-제곱 값을 계산하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import StandardScaler
____
# Create pipeline steps
steps = [("____", ____()),
("____", ____(alpha=____))]
# Instantiate the pipeline
pipeline = ____(____)
pipeline.fit(X_train, y_train)
# Calculate and print R-squared
print(____.____(____, ____))