解約率の探索とデータ分割
Chapter 1 の概要を踏まえて、このレッスンでは、解約予測に Machine Learning を使うためのデータ準備をさらに深掘りします。まず解約の分布を確認し、モデリングに進む前にデータを学習用とテスト用に分割します。このステップで解約率の分布を把握し、学習データでモデルを構築し、未使用のテストデータで性能を評価できるように前処理します。
通信会社のデータセットは telcom という名前の pandas のDataFrameとして読み込まれています。目的変数の列名は Churn です。
この演習はコースの一部です
Pythonで学ぶマーケティングのための機械学習
演習の手順
Churn列のユニークな値を表示します。- 各解約グループの比率(サイズ)を計算します。
- データを学習用とテスト用に分割する関数をインポートします。
- データを学習75%、テスト25%に分割します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Print the unique Churn values
print(___(telcom['Churn']))
# Calculate the ratio size of each churn group
telcom.___(['Churn']).size() / telcom.shape[0] * 100
# Import the function for splitting data to train and test
from sklearn.model_selection import ___
# Split the data into train and test
train, test = ___(telcom, test_size = .25)