Regresie cu caracteristici categorice
Acum că ai creat music_dummies, care conține caracteristici binare pentru genul fiecărei melodii, este timpul să construiești un model de regresie ridge pentru a prezice popularitatea melodiilor.
music_dummies a fost preîncărcat pentru tine, împreună cu Ridge, cross_val_score, numpy importat ca np și un obiect KFold stocat ca kf.
Modelul va fi evaluat prin calcularea RMSE mediu, dar mai întâi va trebui să convertești scorurile pentru fiecare fold la valori pozitive și să extragi rădăcina pătrată. Această metrică arată eroarea medie a predicțiilor modelului și poate fi comparată cu abaterea standard a variabilei țintă—"popularity".
Acest exercițiu face parte din cursul
Învățare supravegheată cu scikit-learn
Instrucțiuni pentru exercițiu
- Creează
X, care să conțină toate caracteristicile dinmusic_dummies, șiy, format din coloana"popularity". - Instanțiază un model de regresie ridge, setând
alphaegal cu 0.2. - Efectuează validarea încrucișată pe
Xșiyfolosind modelul ridge, setândcvegal cukfși folosind eroarea medie pătratică negativă ca metrică de evaluare. - Afișează valorile RMSE convertind
scoresnegative la pozitive și extragând rădăcina pătrată.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create X and y
X = ____
y = ____
# Instantiate a ridge model
ridge = ____
# Perform cross-validation
scores = ____(____, ____, ____, cv=____, scoring="____")
# Calculate RMSE
rmse = np.____(____)
print("Average RMSE: {}".format(np.mean(rmse)))
print("Standard Deviation of the target array: {}".format(np.std(y)))