一个简单的词云
此时,您已经喝了太多咖啡。而且,看到诸如 "shop"、"morning"、"drinking" 这样的高频词,也不算特别有启发性。
为了庆祝您走到这里,我们再试一批 1000 条推文。现在您还不知道它们的共同点,但让我们用词云来看看您是否能找出来。推文的词频值已预加载到您的工作空间。
词云是一种对词项的可视化。在词云中,字号通常按频率缩放,有时颜色也会表示另一种度量。现在我们保持简单:字号仅与单词的个体频率相关,并只选择一种颜色。
正如视频中所示,wordcloud() 函数的用法如下:
wordcloud(words, frequencies, max.words = 500, colors = "blue")
文本挖掘分析中常会包含简单的词云。其实它们可能被过度使用了,但仍然有助于快速了解一段文本!
term_frequency 已加载到您的工作空间。
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
- 加载
wordcloud包。 - 打印
term_frequency的前 10 个条目。 - 对
term_frequency使用names()提取词项。将该字符串向量命名为terms_vec。 - 使用
terms_vec作为 words、term_frequency作为 values 创建一个wordcloud()。添加参数max.words = 50和colors = "red"。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Load wordcloud package
# Print the first 10 entries in term_frequency
# Vector of terms
# Create a word cloud for the values in word_freqs