トレーニングデータとテストデータの作成
分類モデルを構築・評価するには、データセットをトレーニング用とテスト用に分割することが重要です。トレーニングデータはモデルの学習に、テストデータは予測精度の評価に使います。
この演習では、前の章で作成したデータセットをトレーニング用とテスト用に分割します。データフレーム df にデータセットが読み込まれており、再現性のための乱数シードはすでに設定済みです。前の動画では、トレーニングセットの行数の上限を便利な関数で設定しました——今度はそれをみなさんに実装していただきます!
この演習はコースの一部です
Rで学ぶSupport Vector Machines
演習の手順
- トレーニングセットに含める行数の上限を求め、
sample_sizeに保存します。 - 80/20 の割合に従ってランダムにトレーニングセットを割り当てるベクトル
trainを作成します。 trainベクトルに含まれる行をデータフレームtrainsetに、残りをデータフレームtestsetに割り当てます。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))
# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)
# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]