Začněte nyníZačněte zdarma

Rozhodovací strom

V předchozích třech kapitolách sis osvojil/a celou řadu technik, které ti pomůžou zvládnout mnoho aspektů pohovoru z oblasti Machine Learning. V této kapitole se seznámíš s různými způsoby, jak zajistit, aby byl jakýkoliv model – ať už ho máš vytvořit nebo o něm diskutovat – dobře generalizovatelný, správně vyhodnocený a vhodně vybraný z možných alternativ.

V tomto cvičení se ponoříš do ladění hyperparametrů rozhodovacího stromu na datasetu loan_data. Budeš ladit parametr min_samples_split, což je minimální počet vzorků potřebných k vytvoření dalšího binárního větvení, a max_depth, který určuje maximální hloubku stromu. Čím hlubší strom, tím více větvení a tím více informací o datech zachytí.

Matice příznaků X a cílový vektor y jsou již naimportovány.

Všimni si, že opět procházíš všemi kroky pipeline strojového učení!

Machine learning pipeline

Toto cvičení je součástí kurzu

Procvičování otázek k pohovorům z oblasti Machine Learning v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import modules
from sklearn.tree import ____
from sklearn.metrics import accuracy_score

# Train/test split
X_train, X_test, y_train, y_test = train_test_split(____, ____, test_size=0.30, random_state=123)

# Instantiate, Fit, Predict
loans_clf = ____() 
loans_clf.____(____, ____)
y_pred = loans_clf.____(____)

# Evaluation metric
print("Decision Tree Accuracy: {}".format(____(____,____)))
Upravit a spustit kód