分類モデリングの例
以前に、分類のためのロシア語ツイートのセットを準備しました。20,000件のツイートのうち、account_type が Left または Right のものを抽出し、それぞれ最初の2,000件を選びました。すでにツイートを単語にトークン化し、ストップワードを除去し、ステミングを行っています。さらに、単語の出現数を、重みとしてTFIDF値を用いたドキュメント-ターム行列に変換し、この行列を left_right_matrix_small として保存しました。
この行列を使って、あるツイートがリベラル寄りのボット(left-leaning)か、保守寄りのボット(right-leaning)によって生成されたかを予測します。ラベルはベクター left_right_labels にあります。
この演習はコースの一部です
Rで学ぶ自然言語処理入門
演習の手順
- 再現性のために乱数シードを
1111に設定します。 - 学習用データとテストデータを作成します。学習用データには75%を使用します。
- 学習用データでランダムフォレストモデルを実行し、応答ベクトル
yにはleft_right_labelsを指定します。 - ランダムフォレストの結果を出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
library(randomForest)
# Create train/test split
set.___(___)
sample_size <- floor(___ * nrow(left_right_matrix_small))
train_ind <- ___(nrow(left_right_matrix_small), size = ___)
train <- left_right_matrix_small[___, ]
test <- left_right_matrix_small[-___, ]
# Create a random forest classifier
rfc <- randomForest(x = as.data.frame(as.matrix(___)),
y = ___[___],
nTree = 50)
# Print the results
___