分类建模示例
您之前已经为分类准备了一组俄语推文。在 20,000 条推文中,您筛选了 account_type 为 Left 或 Right 的推文,并各选取了前 2000 条。您已经将推文分词为词语、移除了停用词,并进行了词干提取。此外,您将词频转换为以 TFIDF 值为权重的文档-词项矩阵,并将该矩阵保存为:left_right_matrix_small。
您将使用此矩阵来预测一条推文是由左倾的推文机器人生成,还是由右倾的推文机器人生成。标签在向量 left_right_labels 中。
本练习是课程的一部分
R 自然语言处理入门
练习说明
- 将随机种子设置为
1111,以确保结果可复现。 - 创建训练集和测试集。训练集使用 75% 的样本。
- 在训练数据上运行随机森林模型,使用
left_right_labels作为响应向量y。 - 打印随机森林的结果。
交互式实操练习
通过完成这段示例代码来试试这个练习。
library(randomForest)
# Create train/test split
set.___(___)
sample_size <- floor(___ * nrow(left_right_matrix_small))
train_ind <- ___(nrow(left_right_matrix_small), size = ___)
train <- left_right_matrix_small[___, ]
test <- left_right_matrix_small[-___, ]
# Create a random forest classifier
rfc <- randomForest(x = as.data.frame(as.matrix(___)),
y = ___[___],
nTree = 50)
# Print the results
___