始める無料で始める

解約率の探索とデータ分割

Chapter 1 の概要を踏まえて、このレッスンでは、解約予測に Machine Learning を使うためのデータ準備をさらに深掘りします。まず解約の分布を確認し、モデリングに進む前にデータを学習用とテスト用に分割します。このステップで解約率の分布を把握し、学習データでモデルを構築し、未使用のテストデータで性能を評価できるように前処理します。

通信会社のデータセットは telcom という名前の pandas のDataFrameとして読み込まれています。目的変数の列名は Churn です。

この演習はコースの一部です

Pythonで学ぶマーケティングのための機械学習

コースを見る

演習の手順

  • Churn 列のユニークな値を表示します。
  • 各解約グループの比率(サイズ)を計算します。
  • データを学習用とテスト用に分割する関数をインポートします。
  • データを学習75%、テスト25%に分割します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Print the unique Churn values
print(___(telcom['Churn']))

# Calculate the ratio size of each churn group
telcom.___(['Churn']).size() / telcom.shape[0] * 100

# Import the function for splitting data to train and test
from sklearn.model_selection import ___

# Split the data into train and test
train, test = ___(telcom, test_size = .25)
コードを編集して実行