Prezicerea ratingului unei aplicații
După ce ai explorat setul de date cu aplicații Google în exercițiul anterior, hai să construim acum un model care prezice ratingul unei aplicații pe baza unui subset de caracteristici ale acesteia.
În acest scop, vei folosi DecisionTreeRegressor din scikit-learn. Deoarece arborii de decizie reprezintă elementele de bază ale multor modele de ansamblu, îți va fi de mare folos să le reîmprospătezi modul de funcționare pe parcursul acestui curs.
Vom folosi MAE (eroarea absolută medie) ca metrică de evaluare. Această metrică este ușor de interpretat, deoarece reprezintă diferența absolută medie dintre ratingurile reale și cele prezise.
Toate modulele necesare au fost deja importate pentru tine. Caracteristicile și variabila țintă sunt disponibile în variabilele X, respectiv y.
Acest exercițiu face parte din cursul
Metode de ansamblu în Python
Instrucțiuni pentru exercițiu
- Folosește
train_test_split()pentru a împărțiXșiyîn seturi de antrenament și de testare. Utilizează 20%, adică0.2, ca dimensiune a setului de testare. - Instanțiază un
DecisionTreeRegressor(),reg_dt, cu următorii hiperparametri:min_samples_leaf = 3șimin_samples_split = 9. - Antrenează regresorul pe setul de antrenament folosind
.fit(). - Prezice etichetele setului de testare folosind
.predict().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Split into train (80%) and test (20%) sets
X_train, X_test, y_train, y_test = ____(____, ____, ____, random_state=42)
# Instantiate the regressor
reg_dt = ____(____, ____, random_state=500)
# Fit to the training set
____
# Evaluate the performance of the model on the test set
y_pred = ____
print('MAE: {:.3f}'.format(mean_absolute_error(y_test, y_pred)))