決定木でチャーンを予測する
これまでの演習で身につけたスキルを発展させ、追加パラメータを用いたより複雑な決定木で顧客チャーンを予測します。チャーン予測の詳細は次の章で深掘りします。ここでは、学習データに対して決定木分類器を再度実行し、未知(テスト)データでチャーン率を予測し、両方のデータセットでモデル精度を評価します。
sklearn ライブラリの tree モジュールと、sklearn.metrics の accuracy_score 関数は読み込まれています。特徴量と目的変数も、学習用は train_X, train_Y、テスト用は test_X, test_Y としてインポート済みです。
この演習はコースの一部です
Pythonで学ぶマーケティングのための機械学習
演習の手順
- 最大深さを 7、基準に gini を指定して Decision tree を初期化します。
- 学習データにモデルを適合させます。
- テストデータセットで予測します。
- 学習データセットとテストデータセットの両方について、精度を出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Initialize the Decision Tree
clf = tree.DecisionTreeClassifier(max_depth = ___,
criterion = 'gini',
splitter = 'best')
# Fit the model to the training data
clf = clf.___(train_X, train_Y)
# Predict the values on test dataset
pred_Y = clf.___(test_X)
# Print accuracy values
print("Training accuracy: ", np.round(clf.score(train_X, train_Y), 3))
print("Test accuracy: ", np.round(___(test_Y, pred_Y), 3))