开始使用免费开始使用

分类建模示例

您之前已经为分类准备了一组俄语推文。在 20,000 条推文中,您筛选了 account_typeLeftRight 的推文,并各选取了前 2000 条。您已经将推文分词为词语、移除了停用词,并进行了词干提取。此外,您将词频转换为以 TFIDF 值为权重的文档-词项矩阵,并将该矩阵保存为:left_right_matrix_small

您将使用此矩阵来预测一条推文是由左倾的推文机器人生成,还是由右倾的推文机器人生成。标签在向量 left_right_labels 中。

本练习是课程的一部分

R 自然语言处理入门

查看课程

练习说明

  • 将随机种子设置为 1111,以确保结果可复现。
  • 创建训练集和测试集。训练集使用 75% 的样本。
  • 在训练数据上运行随机森林模型,使用 left_right_labels 作为响应向量 y
  • 打印随机森林的结果。

交互式实操练习

通过完成这段示例代码来试试这个练习。

library(randomForest)

# Create train/test split
set.___(___)
sample_size <- floor(___ * nrow(left_right_matrix_small))
train_ind <- ___(nrow(left_right_matrix_small), size = ___)
train <- left_right_matrix_small[___, ]
test <- left_right_matrix_small[-___, ]

# Create a random forest classifier
rfc <- randomForest(x = as.data.frame(as.matrix(___)), 
                    y = ___[___],
                    nTree = 50)
# Print the results
___
编辑并运行代码