始める無料で始める

トレーニングデータとテストデータの作成

分類モデルを構築・評価するには、データセットをトレーニング用とテスト用に分割することが重要です。トレーニングデータはモデルの学習に、テストデータは予測精度の評価に使います。

この演習では、前の章で作成したデータセットをトレーニング用とテスト用に分割します。データフレーム df にデータセットが読み込まれており、再現性のための乱数シードはすでに設定済みです。前の動画では、トレーニングセットの行数の上限を便利な関数で設定しました——今度はそれをみなさんに実装していただきます!

この演習はコースの一部です

Rで学ぶSupport Vector Machines

コースを見る

演習の手順

  • トレーニングセットに含める行数の上限を求め、sample_size に保存します。
  • 80/20 の割合に従ってランダムにトレーニングセットを割り当てるベクトル train を作成します。
  • train ベクトルに含まれる行をデータフレーム trainset に、残りをデータフレーム testset に割り当てます。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))

# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)

# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]
コードを編集して実行