시작하기무료로 시작하기

훈련 데이터를 지연 변환하기

입력 변수를 전처리하는 일은 Machine Learning에서 매우 중요하며, 대체로 모델의 정확도를 높여 줍니다. 직전 연습 문제들에서는 Spotify 데이터가 미리 전처리되어 있었지만, 직접 전처리하는 방법을 꼭 알아 두셔야 해요.

이 연습에서는 StandardScaler() 객체를 사용합니다. 이 스케일러는 배열의 각 열을 평균 0, 표준편차 1이 되도록 변환해요.

Spotify 곡의 Dask DataFrame은 dask_df로 환경에 준비되어 있습니다. 여기에는 예측 대상인 인기 점수(popularity)와, 이 점수를 예측하는 데 사용한 입력 변수들이 모두 들어 있어요.

이 연습은 강의의 일부입니다

Python에서 Dask로 병렬 프로그래밍

강의 보기

연습 안내

  • dask_ml.preprocessing에서 StandardScaler() 클래스를 가져오세요.
  • DataFrame에서 'popularity' 열을 선택해 변수 y에 할당하세요.
  • StandardScaler 객체를 생성하고 X 데이터에 맞춰(fit) 주세요.
  • 스케일러를 사용해 X를 변환하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Import the StandardScaler class
from ____ import ____

X = dask_df[['duration_ms', 'explicit', 'danceability', 'acousticness', 'instrumentalness', 'tempo']]

# Select the target variable
y = ____

# Create a StandardScaler object and fit it on X
scaler = ____
scaler.____(____)

# Transform X
X = scaler.____
print(X)
코드 편집 및 실행