Förutsäg kundbortfall med ett beslutsträd
Nu ska du bygga vidare på kunskaperna från den tidigare övningen och skapa ett mer komplext beslutsträd med extra parametrar för att förutsäga kundbortfall. I nästa kapitel går du djupare in på bortfallsproblemet. Här kör du beslutsträdsklassificeraren igen på dina träningsdata, förutsäger bortfallsfrekvensen på osedda (test)data och utvärderar modellens noggrannhet på båda datamängderna.
Modulen tree från biblioteket sklearn har laddats in åt dig, liksom funktionen accuracy_score från sklearn.metrics. Särdragsvariablerna och målvariablerna har också importerats som train_X och train_Y för träningsdata, samt test_X och test_Y för testdata.
Den här övningen är en del av kursen
Maskininlärning för marknadsföring i Python
Övningsinstruktioner
- Initiera ett beslutsträd med ett maximalt djup på 7 och med gini-kriteriet.
- Anpassa modellen till träningsdata.
- Förutsäg värdena på testdatamängden.
- Skriv ut noggrannhetsvärden för både tränings- och testdatamängden.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Initialize the Decision Tree
clf = tree.DecisionTreeClassifier(max_depth = ___,
criterion = 'gini',
splitter = 'best')
# Fit the model to the training data
clf = clf.___(train_X, train_Y)
# Predict the values on test dataset
pred_Y = clf.___(test_X)
# Print accuracy values
print("Training accuracy: ", np.round(clf.score(train_X, train_Y), 3))
print("Test accuracy: ", np.round(___(test_Y, pred_Y), 3))