Předpověď odchodu zákazníků pomocí rozhodovacího stromu
Teď navážeš na dovednosti z předchozího cvičení a sestavíš složitější rozhodovací strom s dalšími parametry pro předpověď odchodu zákazníků. Problematice predikce churn se budeme podrobněji věnovat v příští kapitole. Zde znovu spustíš klasifikátor rozhodovacího stromu na trénovacích datech, předpovíš míru odchodu na neviděných (testovacích) datech a vyhodnotíš přesnost modelu na obou datových sadách.
Modul tree z knihovny sklearn je již načtený, stejně jako funkce accuracy_score z sklearn.metrics. Příznaky a cílové proměnné jsou importovány jako train_X, train_Y pro trénovací data a test_X, test_Y pro testovací data.
Toto cvičení je součástí kurzu
Machine Learning for Marketing in Python
Pokyny k cvičení
- Inicializuj rozhodovací strom s maximální hloubkou 7 a kritériem gini.
- Přizpůsob model trénovacím datům.
- Předpověz hodnoty na testovací datové sadě.
- Vypiš hodnoty přesnosti pro trénovací i testovací datovou sadu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Initialize the Decision Tree
clf = tree.DecisionTreeClassifier(max_depth = ___,
criterion = 'gini',
splitter = 'best')
# Fit the model to the training data
clf = clf.___(train_X, train_Y)
# Predict the values on test dataset
pred_Y = clf.___(test_X)
# Print accuracy values
print("Training accuracy: ", np.round(clf.score(train_X, train_Y), 3))
print("Test accuracy: ", np.round(___(test_Y, pred_Y), 3))