Отложенное преобразование обучающих данных
Предобработка входных переменных — важный шаг в машинном обучении, который нередко повышает точность создаваемой модели. В предыдущих упражнениях данные Spotify уже были предобработаны за вас, однако важно уметь делать это самостоятельно.
В этом упражнении вы будете использовать объект StandardScaler(), который преобразует столбцы массива так, чтобы их среднее значение равнялось нулю, а стандартное отклонение — единице.
Dask DataFrame с данными о песнях Spotify доступен в вашей среде под именем dask_df. Он содержит как целевые оценки популярности, так и входные переменные, которые вы использовали для их предсказания.
Это упражнение является частью курса
Параллельное программирование с Dask на Python
Инструкции к упражнению
- Импортируйте класс
StandardScaler()изdask_ml.preprocessing. - Выберите столбец
'popularity'из DataFrame и присвойте его переменнойy. - Создайте объект
StandardScalerи обучите его на данныхX. - Используйте масштабировщик для преобразования
X.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the StandardScaler class
from ____ import ____
X = dask_df[['duration_ms', 'explicit', 'danceability', 'acousticness', 'instrumentalness', 'tempo']]
# Select the target variable
y = ____
# Create a StandardScaler object and fit it on X
scaler = ____
scaler.____(____)
# Transform X
X = scaler.____
print(X)