雙詞詞組如何影響文字雲?
現在你已經建立了雙詞詞組的 DTM,可以檢視它並重新製作一個文字雲。新的權杖化(tokenization)方式不只影響矩陣本身,也會影響任何基於這些矩陣的視覺化或建模。
還記得在 chardonnay 的文字雲中,「Marvin」和「Gaye」是分開的詞嗎?使用雙詞詞組時,權杖化會擷取所有兩字的組合。請觀察在本練習中,文字雲會出現什麼變化。
本練習會使用 stringr 的 str_subset。請注意,其他 DataCamp 課程會更詳細介紹正規表示式。提醒一下,正規表示式中的 ^ 會比對雙詞詞組中「開頭」的位置。
本練習屬於課程
R 的 Bag-of-Words 文本探勘
練習說明
chardonnay 的推文已清理並整理成名為 bigram_dtm 的 DTM。
- 將
bigram_dtm轉換為矩陣,建立bigram_dtm_m。 - 以
colSums()作用在bigram_dtm_m上,建立由詞頻組成的物件freq。 - 使用
names(freq)取出詞組的字元向量,指定給bi_words。 - 將
bi_words傳入str_subset(),搭配比對樣式"^marvin",檢視所有以「marvin」開頭的雙詞詞組。 - 繪製簡單的
wordcloud(),將bi_words、freq與max.words = 15傳入函式。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create bigram_dtm_m
___ <- ___(___)
# Create freq
___ <- ___(___)
# Create bi_words
___ <- ___(___)
# Examine part of bi_words
___(___, ___)
# Plot a word cloud
___(___, ___, ___)