Регрессия с категориальными признаками
Теперь, когда вы создали music_dummies — набор данных с бинарными признаками для каждого жанра, — пришло время построить модель гребневой регрессии для предсказания популярности песен.
music_dummies уже загружен для вас, а также Ridge, cross_val_score, numpy под именем np и объект KFold, сохранённый как kf.
Модель будет оцениваться по среднему значению RMSE. Для этого вам нужно будет преобразовать значения метрики для каждого фолда в положительные числа и извлечь из них квадратный корень. Эта метрика показывает среднюю ошибку предсказаний модели и позволяет сравнить её со стандартным отклонением целевой переменной—"popularity".
Это упражнение является частью курса
Обучение с учителем с помощью scikit-learn
Инструкции к упражнению
- Создайте
X, включив все признаки изmusic_dummies, иy— столбец"popularity". - Создайте экземпляр модели гребневой регрессии, задав
alphaравным 0.2. - Выполните кросс-валидацию на
Xиyс помощью гребневой модели, установивcvравнымkfи используя отрицательное среднеквадратическое отклонение в качестве метрики. - Выведите значения RMSE, преобразовав отрицательные
scoresв положительные и извлекав квадратный корень.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create X and y
X = ____
y = ____
# Instantiate a ridge model
ridge = ____
# Perform cross-validation
scores = ____(____, ____, ____, cv=____, scoring="____")
# Calculate RMSE
rmse = np.____(____)
print("Average RMSE: {}".format(np.mean(rmse)))
print("Standard Deviation of the target array: {}".format(np.std(y)))