簡單的文字雲
此時,你咖啡喝多了。而且,看到「shop」、「morning」、「drinking」等高頻字,說實話也不怎麼有洞見。
為了慶祝走到這一步,來試試看另一批 1000 則推文吧。現在你還不知道它們的共通點是什麼,不過先用文字雲看看你能不能自己發現。推文的詞頻值已預先載入到你的工作環境。
文字雲是用來視覺化詞彙的圖像。在文字雲中,大小通常依頻率縮放;有時顏色也會用來表示另一種量測。這裡先保持簡單:大小對應單字的出現頻率,而且只使用單一顏色。
正如你在影片中所看到的,wordcloud() 函式的用法如下:
wordcloud(words, frequencies, max.words = 500, colors = "blue")
文字探勘分析常會包含簡單的文字雲。其實它們可能被過度使用了,但仍然有助於快速理解一段文本!
term_frequency 已載入到你的工作環境。
本練習屬於課程
R 的 Bag-of-Words 文本探勘
練習說明
- 載入
wordcloud套件。 - 列印
term_frequency的前 10 筆條目。 - 對
term_frequency使用names()以擷取詞彙。將這個字串向量命名為terms_vec。 - 使用
terms_vec作為 words、term_frequency作為 values,建立一個wordcloud()。另外加入參數max.words = 50與colors = "red"。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Load wordcloud package
# Print the first 10 entries in term_frequency
# Vector of terms
# Create a word cloud for the values in word_freqs