Regression med kategoriska särdrag
Nu när du har skapat music_dummies, med binära särdrag för varje låts genre, är det dags att bygga en ridge-regressionsmodell för att förutsäga låtars popularitet.
music_dummies har förhandsladdats åt dig, tillsammans med Ridge, cross_val_score, numpy som np och ett KFold-objekt lagrat som kf.
Modellen utvärderas genom att beräkna det genomsnittliga RMSE-värdet, men först behöver du konvertera poängen för varje del till positiva värden och ta kvadratroten. Det här måttet visar det genomsnittliga felet i modellens förutsägelser och kan jämföras med standardavvikelsen för målvariabeln—"popularity".
Den här övningen är en del av kursen
Övervakad inlärning med scikit-learn
Övningsinstruktioner
- Skapa
X, som innehåller alla särdrag imusic_dummies, ochy, bestående av kolumnen"popularity". - Instansiera en ridge-regressionsmodell och sätt
alphatill 0,2. - Utför korsvalidering på
Xochymed ridge-modellen, sättcvtillkfoch använd negativt medelkvadratfel som utvärderingsmått. - Skriv ut RMSE-värdena genom att konvertera negativa
scorestill positiva och ta kvadratroten.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create X and y
X = ____
y = ____
# Instantiate a ridge model
ridge = ____
# Perform cross-validation
scores = ____(____, ____, ____, cv=____, scoring="____")
# Calculate RMSE
rmse = np.____(____)
print("Average RMSE: {}".format(np.mean(rmse)))
print("Standard Deviation of the target array: {}".format(np.std(y)))