Sestavení modelu náhodného lesa
Opět budeš pracovat s datasetem Pima Indians a předpovídat, zda má daný jedinec cukrovku – tentokrát pomocí klasifikátoru náhodného lesa. Model natrénuješ na trénovacích datech po rozdělení na trénovací a testovací sadu a pak se podíváš na hodnoty důležitosti příznaků.
Datasety příznaků a cílové proměnné jsou předem načteny jako X a y. Stejně tak jsou k dispozici potřebné balíčky a funkce.
Toto cvičení je součástí kurzu
Redukce dimenzionality v Pythonu
Pokyny k cvičení
- Nastav velikost testovací sady na 25 % pro rozdělení 75 % / 25 %.
- Natrénuj klasifikátor náhodného lesa na trénovacích datech.
- Vypočítej přesnost modelu na testovací sadě.
- Vypiš důležitost jednotlivých příznaků.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Perform a 75% training and 25% test data split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=____, random_state=0)
# Fit the random forest model to the training data
rf = RandomForestClassifier(random_state=0)
rf.____(____, ____)
# Calculate the accuracy
acc = accuracy_score(____, ____)
# Print the importances per feature
print(dict(zip(X.columns, rf.____.round(2))))
# Print accuracy
print(f"{acc:.1%} accuracy on test set.")