Začněte nyníZačněte zdarma

Předpovídáme hodnocení aplikace

V předchozím cvičení jsi prozkoumал/a dataset aplikací z Google Play. Teď sestrojíme model, který na základě vybraných vlastností aplikace odhadne její hodnocení.

K tomu použijeme DecisionTreeRegressor z knihovny scikit-learn. Rozhodovací stromy tvoří základ mnoha ensemble modelů, takže si jejich fungování dobře zopakuj — bude se ti to v průběhu kurzu hodit.

Jako vyhodnocovací metriku použijeme MAE (střední absolutní chybu). Tato metrika je velmi srozumitelná — udává průměrný absolutní rozdíl mezi skutečným a předpovězeným hodnocením.

Všechny potřebné moduly jsou již naimportovány. Příznaky a cílová proměnná jsou dostupné v proměnných X a y.

Toto cvičení je součástí kurzu

Ensemble Methods in Python

Zobrazit kurz

Pokyny k cvičení

  • Pomocí train_test_split() rozděl X a y na trénovací a testovací sadu. Jako velikost testovací sady použij 20 %, tedy 0.2.
  • Vytvoř instanci DecisionTreeRegressor() s názvem reg_dt a nastav tyto hyperparametry: min_samples_leaf = 3 a min_samples_split = 9.
  • Natrénuj regresor na trénovací sadě pomocí .fit().
  • Předpověz štítky testovací sady pomocí .predict().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Split into train (80%) and test (20%) sets
X_train, X_test, y_train, y_test = ____(____, ____, ____, random_state=42)

# Instantiate the regressor
reg_dt = ____(____, ____, random_state=500)

# Fit to the training set
____

# Evaluate the performance of the model on the test set
y_pred = ____
print('MAE: {:.3f}'.format(mean_absolute_error(y_test, y_pred)))
Upravit a spustit kód