可视化词语网络
查看词语关联的另一种方式是将它们视为网络,类似社交网络。词语网络可以展示术语之间的关联和内聚。需要提醒的是:这类可视化可能会非常密集,视觉上不易解读。
在网络图中,圆点称为"节点"(nodes),表示单个术语;连接圆点的线称为"边"(edges),表示术语之间的连接。
对于"咖啡因过量"的文本挖掘者,qdap 提供了制作词语网络的捷径。word_network_plot() 和 word_associate() 函数都能轻松绘制词语网络!
示例代码为与 "Marvin" 相关的词构建了一个词语网络。
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
将 word_associate() 作图代码更新为适用于咖啡数据。
- 将向量改为
coffee_tweets$text。 - 将匹配字符串改为
"barista"。 - 在停用词中将
"chardonnay"改为"coffee"。 - 将示例代码中的图表标题改为
"Barista Coffee Tweet Associations"。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Word association
word_associate(chardonnay_tweets$text, match.string = "marvin",
stopwords = c(Top200Words, "chardonnay", "amp"),
network.plot = TRUE, cloud.colors = c("gray85", "darkred"))
# Add title
title(main = "Chardonnay Tweets Associated with Marvin")