Předpovídáme hodnocení aplikace
V předchozím cvičení jsi prozkoumал/a dataset aplikací z Google Play. Teď sestrojíme model, který na základě vybraných vlastností aplikace odhadne její hodnocení.
K tomu použijeme DecisionTreeRegressor z knihovny scikit-learn. Rozhodovací stromy tvoří základ mnoha ensemble modelů, takže si jejich fungování dobře zopakuj — bude se ti to v průběhu kurzu hodit.
Jako vyhodnocovací metriku použijeme MAE (střední absolutní chybu). Tato metrika je velmi srozumitelná — udává průměrný absolutní rozdíl mezi skutečným a předpovězeným hodnocením.
Všechny potřebné moduly jsou již naimportovány. Příznaky a cílová proměnná jsou dostupné v proměnných X a y.
Toto cvičení je součástí kurzu
Ensemble Methods in Python
Pokyny k cvičení
- Pomocí
train_test_split()rozdělXayna trénovací a testovací sadu. Jako velikost testovací sady použij 20 %, tedy0.2. - Vytvoř instanci
DecisionTreeRegressor()s názvemreg_dta nastav tyto hyperparametry:min_samples_leaf = 3amin_samples_split = 9. - Natrénuj regresor na trénovací sadě pomocí
.fit(). - Předpověz štítky testovací sady pomocí
.predict().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Split into train (80%) and test (20%) sets
X_train, X_test, y_train, y_test = ____(____, ____, ____, random_state=42)
# Instantiate the regressor
reg_dt = ____(____, ____, random_state=500)
# Fit to the training set
____
# Evaluate the performance of the model on the test set
y_pred = ____
print('MAE: {:.3f}'.format(mean_absolute_error(y_test, y_pred)))