始める無料で始める

分類モデリングの例

以前に、分類のためのロシア語ツイートのセットを準備しました。20,000件のツイートのうち、account_typeLeft または Right のものを抽出し、それぞれ最初の2,000件を選びました。すでにツイートを単語にトークン化し、ストップワードを除去し、ステミングを行っています。さらに、単語の出現数を、重みとしてTFIDF値を用いたドキュメント-ターム行列に変換し、この行列を left_right_matrix_small として保存しました。

この行列を使って、あるツイートがリベラル寄りのボット(left-leaning)か、保守寄りのボット(right-leaning)によって生成されたかを予測します。ラベルはベクター left_right_labels にあります。

この演習はコースの一部です

Rで学ぶ自然言語処理入門

コースを見る

演習の手順

  • 再現性のために乱数シードを 1111 に設定します。
  • 学習用データとテストデータを作成します。学習用データには75%を使用します。
  • 学習用データでランダムフォレストモデルを実行し、応答ベクトル y には left_right_labels を指定します。
  • ランダムフォレストの結果を出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

library(randomForest)

# Create train/test split
set.___(___)
sample_size <- floor(___ * nrow(left_right_matrix_small))
train_ind <- ___(nrow(left_right_matrix_small), size = ___)
train <- left_right_matrix_small[___, ]
test <- left_right_matrix_small[-___, ]

# Create a random forest classifier
rfc <- randomForest(x = as.data.frame(as.matrix(___)), 
                    y = ___[___],
                    nTree = 50)
# Print the results
___
コードを編集して実行