构建文档-词项矩阵
希望在完成这些文本挖掘基础工作后,您还不至于太疲惫!以防万一,我们在从咖啡推文构建文档-词项矩阵的同时,再"续杯"星巴克吧。
从 coffee.csv 文件开始,我们已经用常见的转换步骤生成了一个干净的语料库 clean_corp。
当您希望将每个文档表示为一行时,就会用到文档-词项矩阵。这在您想要按行比较作者,或数据按时间顺序排列并希望保留时间序列时很有用。tm 包使用的是"simple triplet matrix(简单三元组矩阵)"类。不过,通常将 DTM 用 as.matrix() 重新转为常规矩阵后,会更便于操作和查看该对象。
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
- 对
clean_corp应用DocumentTermMatrix(),创建coffee_dtm。 - 使用
as.matrix()将coffee_dtm转为矩阵版本coffee_m。 - 使用
dim()函数在控制台打印coffee_m的维度。请留意行数和列数。 - 打印
coffee_m的一个子集:文档(行)25 到 35,词项(列)"star"与"starbucks"。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create the document-term matrix from the corpus
coffee_dtm <- ___
# Print out coffee_dtm data
coffee_dtm
# Convert coffee_dtm to a matrix
coffee_m <- ___
# Print the dimensions of coffee_m
___
# Review a portion of the matrix to get some Starbucks
___[___:___, c("star", "___")]