创建一个 term-document 矩阵
在开始做一些有趣的可视化和分析之前,您已经快要完成这些不那么令人兴奋但很重要的基础工作了!
在本练习中,您将执行一个类似的过程,但对 document-term 矩阵进行转置。在这种情况下,term-document 矩阵的术语位于第一列,文档作为列名横向排列在顶部。
TDM 通常用于语言分析。这是因为术语往往比作者或文档多,而当行数多于列数时,处理起来通常更简单。一个入手分析的简便方法是对 TDM 使用 as.matrix(),将其转换为普通矩阵。
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
- 对
clean_corp应用TermDocumentMatrix(),创建coffee_tdm。 - 使用
as.matrix()将coffee_tdm转换为矩阵,创建coffee_m。 - 将
coffee_m的维度打印到控制台。请注意行数和列数。 - 打印
coffee_m的一个子集:术语(行)为"star"和"starbucks",文档(列)为第 25 到第 35。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create a term-document matrix from the corpus
coffee_tdm <- ___
# Print coffee_tdm data
coffee_tdm
# Convert coffee_tdm to a matrix
coffee_m <- ___
# Print the dimensions of the matrix
___
# Review a portion of the matrix
___[___, ___]