Regrese s kategorickými příznaky
Teď, když máš vytvořený music_dummies s binárními příznaky pro každý žánr skladby, je čas sestavit model ridge regrese pro předpověď popularity písní.
music_dummies je předem načtený spolu s Ridge, cross_val_score, numpy jako np a objektem KFold uloženým jako kf.
Model bude hodnocen pomocí průměrné hodnoty RMSE. Nejdříve ale budeš muset převést skóre jednotlivých foldů na kladné hodnoty a vypočítat jejich odmocninu. Tato metrika ukazuje průměrnou chybu předpovědí modelu, takže ji lze porovnat se směrodatnou odchylkou cílové proměnné—"popularity".
Toto cvičení je součástí kurzu
Supervised Learning with scikit-learn
Pokyny k cvičení
- Vytvoř
Xobsahující všechny příznaky zmusic_dummiesaytvořené sloupcem"popularity". - Vytvoř instanci modelu ridge regrese a nastav
alphana hodnotu 0.2. - Proveď křížovou validaci na
Xaypomocí ridge modelu, nastavcvnakfa jako metriku hodnocení použij zápornou střední kvadratickou chybu. - Vypiš hodnoty RMSE tak, že záporné
scorespřevedeš na kladné a vypočítáš jejich odmocninu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create X and y
X = ____
y = ____
# Instantiate a ridge model
ridge = ____
# Perform cross-validation
scores = ____(____, ____, ____, cv=____, scoring="____")
# Calculate RMSE
rmse = np.____(____)
print("Average RMSE: {}".format(np.mean(rmse)))
print("Standard Deviation of the target array: {}".format(np.std(y)))