Natrénuj svůj první klasifikační strom
V tomto cvičení budeš pracovat s datasetem Wisconsin Breast Cancer Dataset z repozitáře UCI machine learning. Budeš předpovídat, zda je nádor maligní, nebo benigní, a to na základě dvou příznaků: průměrného poloměru nádoru (radius_mean) a průměrného počtu konkávních bodů (concave points_mean).
Dataset je již načtený v tvém pracovním prostředí a je rozdělený na 80 % trénovací a 20 % testovací sadu. Matice příznaků jsou přiřazeny do proměnných X_train a X_test, pole štítků pak do y_train a y_test, kde třída 1 odpovídá malignímu nádoru a třída 0 odpovídá benignímu nádoru. Pro zajištění reprodukovatelných výsledků je také definována proměnná SEED s hodnotou 1.
Toto cvičení je součástí kurzu
Machine Learning with Tree-Based Models in Python
Pokyny k cvičení
Importuj
DecisionTreeClassifierz modulusklearn.tree.Vytvoř instanci
DecisionTreeClassifiers názvemdts maximální hloubkou rovnou 6.Natrénuj model
dtna trénovací sadě.Předpověz štítky testovací sady a výsledek ulož do proměnné
y_pred.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import DecisionTreeClassifier from sklearn.tree
from ____.____ import ____
# Instantiate a DecisionTreeClassifier 'dt' with a maximum depth of 6
dt = ____(____=____, random_state=SEED)
# Fit dt to the training set
____.____(____, ____)
# Predict test set labels
y_pred = ____.____(____)
print(y_pred[0:5])