开始使用免费开始使用

创建一个 term-document 矩阵

在开始做一些有趣的可视化和分析之前,您已经快要完成这些不那么令人兴奋但很重要的基础工作了!

在本练习中,您将执行一个类似的过程,但对 document-term 矩阵进行转置。在这种情况下,term-document 矩阵的术语位于第一列,文档作为列名横向排列在顶部。

TDM 通常用于语言分析。这是因为术语往往比作者或文档多,而当行数多于列数时,处理起来通常更简单。一个入手分析的简便方法是对 TDM 使用 as.matrix(),将其转换为普通矩阵。

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

练习说明

  • clean_corp 应用 TermDocumentMatrix(),创建 coffee_tdm
  • 使用 as.matrix()coffee_tdm 转换为矩阵,创建 coffee_m
  • coffee_m 的维度打印到控制台。请注意行数和列数。
  • 打印 coffee_m 的一个子集:术语(行)为 "star""starbucks",文档(列)为第 25 到第 35。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create a term-document matrix from the corpus
coffee_tdm <- ___

# Print coffee_tdm data
coffee_tdm

# Convert coffee_tdm to a matrix
coffee_m <- ___

# Print the dimensions of the matrix
___

# Review a portion of the matrix
___[___, ___]
编辑并运行代码