Центрирование и масштабирование для регрессии
Теперь, когда вы убедились в пользе масштабирования данных, используйте пайплайн для предобработки признаков набора данных music_df и постройте модель лассо-регрессии для предсказания громкости (loudness) песни.
X_train, X_test, y_train и y_test уже созданы на основе набора данных music_df, где целевой переменной является "loudness", а признаками — все остальные столбцы. Lasso и Pipeline также уже импортированы.
Обратите внимание: столбец "genre" преобразован в бинарный признак, где 1 обозначает рок-песню, а 0 — все остальные жанры.
Это упражнение является частью курса
Обучение с учителем с помощью scikit-learn
Инструкции к упражнению
- Импортируйте
StandardScaler. - Создайте шаги для объекта пайплайна: объект
StandardScalerс названием"scaler"и модель лассо с названием"lasso", у которой параметрalphaравен0.5. - Создайте экземпляр пайплайна с шагами масштабирования и построения модели лассо-регрессии.
- Вычислите коэффициент детерминации R² на тестовых данных.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import StandardScaler
____
# Create pipeline steps
steps = [("____", ____()),
("____", ____(alpha=____))]
# Instantiate the pipeline
pipeline = ____(____)
pipeline.fit(X_train, y_train)
# Calculate and print R-squared
print(____.____(____, ____))