視覺化詞彙網路
另一種查看詞與詞之間關係的方式,是把它們視為一個網路,類似社群網路。詞彙網路可以呈現詞項之間的關聯性與凝聚程度。提醒你一下:這類視覺化很容易變得非常密集,進而難以解讀。
在網路圖中,圓點稱為「節點」(nodes),代表單一詞項;連接圓點的線稱為「邊」(edges),代表詞項之間的連結。
對於咖啡因上身的文字探勘者,qdap 提供了建立詞彙網路的捷徑。word_network_plot() 和 word_associate() 這兩個函式都能讓你輕鬆產生詞彙網路!
範例程式碼會為與「Marvin」相關的詞建立一個詞彙網路。
本練習屬於課程
R 的 Bag-of-Words 文本探勘
練習說明
將 word_associate() 的繪圖程式碼更新為使用咖啡資料。
- 把向量改成
coffee_tweets$text。 - 把比對字串改成
"barista"。 - 在停用詞中,將
"chardonnay"改為"coffee"。 - 在範例程式碼中,將圖表標題改為
"Barista Coffee Tweet Associations"。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Word association
word_associate(chardonnay_tweets$text, match.string = "marvin",
stopwords = c(Top200Words, "chardonnay", "amp"),
network.plot = TRUE, cloud.colors = c("gray85", "darkred"))
# Add title
title(main = "Chardonnay Tweets Associated with Marvin")