Ліниве перетворення тренувальних даних
Попередня обробка вхідних змінних — ключовий крок у машинному навчанні, який часто підвищує точність побудованої моделі. У двох попередніх вправах дані Spotify вже були підготовлені для вас, але важливо вміти робити це самостійно.
У цій вправі ви використаєте об'єкт масштабування StandardScaler(), який перетворює стовпці масиву так, щоб їхнє середнє було нуль, а стандартне відхилення — один.
Dask-датафрейм із піснями Spotify доступний у вашому середовищі як dask_df. Він містить як цільові бали популярності, так і вхідні змінні, які ви використовували для їхнього прогнозування.
Ця вправа є частиною курсу
Паралельне програмування з Dask у Python
Інструкції до вправи
- Імпортуйте клас
StandardScaler()ізdask_ml.preprocessing. - Виберіть стовпець
'popularity'із датафрейму та присвоїть його зміннійy. - Створіть об'єкт
StandardScalerі навчіть (fit) його на данихX. - Застосуйте масштабувальник, щоб перетворити
X.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the StandardScaler class
from ____ import ____
X = dask_df[['duration_ms', 'explicit', 'danceability', 'acousticness', 'instrumentalness', 'tempo']]
# Select the target variable
y = ____
# Create a StandardScaler object and fit it on X
scaler = ____
scaler.____(____)
# Transform X
X = scaler.____
print(X)