Kom igångKom igång gratis

Regression med kategoriska särdrag

Nu när du har skapat music_dummies, med binära särdrag för varje låts genre, är det dags att bygga en ridge-regressionsmodell för att förutsäga låtars popularitet.

music_dummies har förhandsladdats åt dig, tillsammans med Ridge, cross_val_score, numpy som np och ett KFold-objekt lagrat som kf.

Modellen utvärderas genom att beräkna det genomsnittliga RMSE-värdet, men först behöver du konvertera poängen för varje del till positiva värden och ta kvadratroten. Det här måttet visar det genomsnittliga felet i modellens förutsägelser och kan jämföras med standardavvikelsen för målvariabeln—"popularity".

Den här övningen är en del av kursen

Övervakad inlärning med scikit-learn

Visa kurs

Övningsinstruktioner

  • Skapa X, som innehåller alla särdrag i music_dummies, och y, bestående av kolumnen "popularity".
  • Instansiera en ridge-regressionsmodell och sätt alpha till 0,2.
  • Utför korsvalidering på X och y med ridge-modellen, sätt cv till kf och använd negativt medelkvadratfel som utvärderingsmått.
  • Skriv ut RMSE-värdena genom att konvertera negativa scores till positiva och ta kvadratroten.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create X and y
X = ____
y = ____

# Instantiate a ridge model
ridge = ____

# Perform cross-validation
scores = ____(____, ____, ____, cv=____, scoring="____")

# Calculate RMSE
rmse = np.____(____)
print("Average RMSE: {}".format(np.mean(rmse)))
print("Standard Deviation of the target array: {}".format(np.std(y)))
Redigera och kör kod