开始使用免费开始使用

构建文档-词项矩阵

希望在完成这些文本挖掘基础工作后,您还不至于太疲惫!以防万一,我们在从咖啡推文构建文档-词项矩阵的同时,再"续杯"星巴克吧。

coffee.csv 文件开始,我们已经用常见的转换步骤生成了一个干净的语料库 clean_corp

当您希望将每个文档表示为一行时,就会用到文档-词项矩阵。这在您想要按行比较作者,或数据按时间顺序排列并希望保留时间序列时很有用。tm 包使用的是"simple triplet matrix(简单三元组矩阵)"类。不过,通常将 DTM 用 as.matrix() 重新转为常规矩阵后,会更便于操作和查看该对象。

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

练习说明

  • clean_corp 应用 DocumentTermMatrix(),创建 coffee_dtm
  • 使用 as.matrix()coffee_dtm 转为矩阵版本 coffee_m
  • 使用 dim() 函数在控制台打印 coffee_m 的维度。请留意行数和列数。
  • 打印 coffee_m 的一个子集:文档(行)25 到 35,词项(列)"star""starbucks"

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create the document-term matrix from the corpus
coffee_dtm <- ___

# Print out coffee_dtm data
coffee_dtm

# Convert coffee_dtm to a matrix
coffee_m <- ___

# Print the dimensions of coffee_m
___

# Review a portion of the matrix to get some Starbucks
___[___:___, c("star", "___")]
编辑并运行代码