Začněte nyníZačněte zdarma

Sestavení modelu náhodného lesa

Opět budeš pracovat s datasetem Pima Indians a předpovídat, zda má daný jedinec cukrovku – tentokrát pomocí klasifikátoru náhodného lesa. Model natrénuješ na trénovacích datech po rozdělení na trénovací a testovací sadu a pak se podíváš na hodnoty důležitosti příznaků.

Datasety příznaků a cílové proměnné jsou předem načteny jako X a y. Stejně tak jsou k dispozici potřebné balíčky a funkce.

Toto cvičení je součástí kurzu

Redukce dimenzionality v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Nastav velikost testovací sady na 25 % pro rozdělení 75 % / 25 %.
  • Natrénuj klasifikátor náhodného lesa na trénovacích datech.
  • Vypočítej přesnost modelu na testovací sadě.
  • Vypiš důležitost jednotlivých příznaků.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Perform a 75% training and 25% test data split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=____, random_state=0)

# Fit the random forest model to the training data
rf = RandomForestClassifier(random_state=0)
rf.____(____, ____)

# Calculate the accuracy
acc = accuracy_score(____, ____)

# Print the importances per feature
print(dict(zip(X.columns, rf.____.round(2))))

# Print accuracy
print(f"{acc:.1%} accuracy on test set.") 
Upravit a spustit kód