データの再サンプリング
Machine Learning プロジェクトの最初のステップは、モデルの学習と評価のために学習用データセットとテスト用データセットを作成することです。テスト用データセットは、モデルが新しいデータでどの程度うまく動作するかを見積もり、過学習を防ぐのに役立ちます。
この演習では、通信会社の顧客情報を含む telecom_df データセットを使います。目的変数は canceled_service で、顧客が契約を解約したかどうかを記録しています。説明変数には、携帯電話やインターネットの利用状況、契約タイプ、月額料金に関する情報が含まれます。
tibble の telecom_df は、すでにセッションに読み込まれています。
この演習はコースの一部です
R での tidymodels によるモデリング
演習の手順
telecom_dfを学習用とテスト用にランダム分割する手順を含むrsampleオブジェクトtelecom_splitを作成します。- データの 75% を学習用に割り当て、
canceled_serviceで層化(stratify)します。
- データの 75% を学習用に割り当て、
telecom_splitオブジェクトを適切なrsample関数に渡して、学習用データセットとテスト用データセットを作成します。- それぞれのデータセットを
nrow()関数に渡して、行数を確認します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create data split object
telecom_split <- ___(___, prop = ___,
strata = ___)
# Create the training data
telecom_training <- ___ %>%
___
# Create the test data
telecom_test <- ___ %>%
___
# Check the number of rows
nrow(___)
nrow(___)