НачатьНачать бесплатно

Регрессия с категориальными признаками

Теперь, когда вы создали music_dummies — набор данных с бинарными признаками для каждого жанра, — пришло время построить модель гребневой регрессии для предсказания популярности песен.

music_dummies уже загружен для вас, а также Ridge, cross_val_score, numpy под именем np и объект KFold, сохранённый как kf.

Модель будет оцениваться по среднему значению RMSE. Для этого вам нужно будет преобразовать значения метрики для каждого фолда в положительные числа и извлечь из них квадратный корень. Эта метрика показывает среднюю ошибку предсказаний модели и позволяет сравнить её со стандартным отклонением целевой переменной—"popularity".

Это упражнение является частью курса

Обучение с учителем с помощью scikit-learn

Посмотреть курс

Инструкции к упражнению

  • Создайте X, включив все признаки из music_dummies, и y — столбец "popularity".
  • Создайте экземпляр модели гребневой регрессии, задав alpha равным 0.2.
  • Выполните кросс-валидацию на X и y с помощью гребневой модели, установив cv равным kf и используя отрицательное среднеквадратическое отклонение в качестве метрики.
  • Выведите значения RMSE, преобразовав отрицательные scores в положительные и извлекав квадратный корень.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create X and y
X = ____
y = ____

# Instantiate a ridge model
ridge = ____

# Perform cross-validation
scores = ____(____, ____, ____, cv=____, scoring="____")

# Calculate RMSE
rmse = np.____(____)
print("Average RMSE: {}".format(np.mean(rmse)))
print("Standard Deviation of the target array: {}".format(np.std(y)))
Редактировать и запускать код