НачатьНачать бесплатно

Отложенное преобразование обучающих данных

Предобработка входных переменных — важный шаг в машинном обучении, который нередко повышает точность создаваемой модели. В предыдущих упражнениях данные Spotify уже были предобработаны за вас, однако важно уметь делать это самостоятельно.

В этом упражнении вы будете использовать объект StandardScaler(), который преобразует столбцы массива так, чтобы их среднее значение равнялось нулю, а стандартное отклонение — единице.

Dask DataFrame с данными о песнях Spotify доступен в вашей среде под именем dask_df. Он содержит как целевые оценки популярности, так и входные переменные, которые вы использовали для их предсказания.

Это упражнение является частью курса

Параллельное программирование с Dask на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте класс StandardScaler() из dask_ml.preprocessing.
  • Выберите столбец 'popularity' из DataFrame и присвойте его переменной y.
  • Создайте объект StandardScaler и обучите его на данных X.
  • Используйте масштабировщик для преобразования X.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the StandardScaler class
from ____ import ____

X = dask_df[['duration_ms', 'explicit', 'danceability', 'acousticness', 'instrumentalness', 'tempo']]

# Select the target variable
y = ____

# Create a StandardScaler object and fit it on X
scaler = ____
scaler.____(____)

# Transform X
X = scaler.____
print(X)
Редактировать и запускать код