开始使用免费开始使用

更改频率权重

到目前为止,您在 DocumentTermMatrixTermDocumentMatrix 中只是对文档里的词项进行计数。在本练习中,您将学习使用 TfIdf 权重来替代简单的词频。TfIdf 是"词频-逆文档频率"(term frequency-inverse document frequency)的缩写,适用于词项多样性较低而语料库很大的场景。

TfIdf 会先统计词项出现次数(即 Tf),再按文档长度进行归一化,并且当某个词在多篇文档中频繁出现时对其进行惩罚。这符合直觉:常见词很重要,但未必有洞见。这个惩罚体现在逆文档频率(即 Idf)中。

例如,查看客服记录时,可能会用"cu"作为"customer"的缩写。一条记录写"the cu has a damaged package",另一条写"cu called with question about delivery"。在"文档频率"权重下,"cu"出现了 2 次,看起来应当是信息量较高的词。然而在 TfIdf 中,因为"cu"出现在所有文档中而受到惩罚。结果是,"cu"不被视为新信息,其取值会被压低到接近 0,从而让其他词项在分析中获得更高的权重。

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create a TDM
tdm <- ___

# Convert it to a matrix
tdm_m <- ___

# Examine part of the matrix
tdm_m[___, ___]
编辑并运行代码