훈련 데이터를 지연 변환하기
입력 변수를 전처리하는 일은 Machine Learning에서 매우 중요하며, 대체로 모델의 정확도를 높여 줍니다. 직전 연습 문제들에서는 Spotify 데이터가 미리 전처리되어 있었지만, 직접 전처리하는 방법을 꼭 알아 두셔야 해요.
이 연습에서는 StandardScaler() 객체를 사용합니다. 이 스케일러는 배열의 각 열을 평균 0, 표준편차 1이 되도록 변환해요.
Spotify 곡의 Dask DataFrame은 dask_df로 환경에 준비되어 있습니다. 여기에는 예측 대상인 인기 점수(popularity)와, 이 점수를 예측하는 데 사용한 입력 변수들이 모두 들어 있어요.
이 연습은 강의의 일부입니다
Python에서 Dask로 병렬 프로그래밍
연습 안내
dask_ml.preprocessing에서StandardScaler()클래스를 가져오세요.- DataFrame에서
'popularity'열을 선택해 변수y에 할당하세요. StandardScaler객체를 생성하고X데이터에 맞춰(fit) 주세요.- 스케일러를 사용해
X를 변환하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import the StandardScaler class
from ____ import ____
X = dask_df[['duration_ms', 'explicit', 'danceability', 'acousticness', 'instrumentalness', 'tempo']]
# Select the target variable
y = ____
# Create a StandardScaler object and fit it on X
scaler = ____
scaler.____(____)
# Transform X
X = scaler.____
print(X)