学習用とテスト用に分割する
これでデータフレームが用意できたので、標準的なモデリング手法を適用できます。 この演習では、データを学習用セットとテスト用セットに分割します。
この演習はコースの一部です
R で学ぶネットワークデータの予測分析
演習の手順
- 結果の再現性を保つために、
set.seed()を使ってシードを 7 に設定します。 sample()関数を使い、studentnetworkdataの総行数の範囲から生成した数列のうち 3 分の 2 をサンプリングし、このベクトルをindex_trainと名付けます。studentnetworkdataのうち、index_trainに含まれる行を抽出して学習用データとし、training_setという名前を付けます。studentnetworkdataのうち、index_trainに含まれない行を抽出してテスト用データとし、test_setという名前を付けます。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Set the seed
set.seed(___)
# Creat the index vector
index_train <- sample(1:nrow(___), 2 / 3 * nrow(___))
# Make the training set
training_set <- ___[index_train,]
# Make the test set
___ <- ___[-index_train,]