НачатьНачать бесплатно

Центрирование и масштабирование для регрессии

Теперь, когда вы убедились в пользе масштабирования данных, используйте пайплайн для предобработки признаков набора данных music_df и постройте модель лассо-регрессии для предсказания громкости (loudness) песни.

X_train, X_test, y_train и y_test уже созданы на основе набора данных music_df, где целевой переменной является "loudness", а признаками — все остальные столбцы. Lasso и Pipeline также уже импортированы.

Обратите внимание: столбец "genre" преобразован в бинарный признак, где 1 обозначает рок-песню, а 0 — все остальные жанры.

Это упражнение является частью курса

Обучение с учителем с помощью scikit-learn

Посмотреть курс

Инструкции к упражнению

  • Импортируйте StandardScaler.
  • Создайте шаги для объекта пайплайна: объект StandardScaler с названием "scaler" и модель лассо с названием "lasso", у которой параметр alpha равен 0.5.
  • Создайте экземпляр пайплайна с шагами масштабирования и построения модели лассо-регрессии.
  • Вычислите коэффициент детерминации R² на тестовых данных.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import StandardScaler
____

# Create pipeline steps
steps = [("____", ____()),
         ("____", ____(alpha=____))]

# Instantiate the pipeline
pipeline = ____(____)
pipeline.fit(X_train, y_train)

# Calculate and print R-squared
print(____.____(____, ____))
Редактировать и запускать код