Регресія з категоріальними ознаками
Тепер, коли ви створили music_dummies з бінарними ознаками для кожного жанру пісні, час побудувати модель гребеневої регресії для прогнозування популярності пісень.
music_dummies уже завантажено для вас, так само як і Ridge, cross_val_score, numpy як np, а також об'єкт KFold, збережений у змінній kf.
Модель буде оцінено за середнім RMSE. Але спершу потрібно перетворити бали для кожного фолду на додатні значення та взяти з них квадратний корінь. Ця метрика показує середню помилку прогнозів моделі, тож її можна порівняти зі стандартним відхиленням цільової змінної — "popularity".
Ця вправа є частиною курсу
Кероване навчання зі scikit-learn
Інструкції до вправи
- Створіть
X, що міститиме всі ознаки зmusic_dummies, іy, що складатиметься зі стовпця"popularity". - Ініціалізуйте модель гребеневої регресії, встановивши
alphaрівним 0.2. - Виконайте кросвалідацію на
Xіy, використовуючи гребеневу модель, встановившиcvрівнимkfта використовуючи як метрику негативну середню квадратичну помилку. - Надрукуйте значення RMSE, перетворивши від'ємні
scoresна додатні та взявши квадратний корінь.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create X and y
X = ____
y = ____
# Instantiate a ridge model
ridge = ____
# Perform cross-validation
scores = ____(____, ____, ____, cv=____, scoring="____")
# Calculate RMSE
rmse = np.____(____)
print("Average RMSE: {}".format(np.mean(rmse)))
print("Standard Deviation of the target array: {}".format(np.std(y)))