開始使用免費開始

雙詞詞組如何影響文字雲?

現在你已經建立了雙詞詞組的 DTM,可以檢視它並重新製作一個文字雲。新的權杖化(tokenization)方式不只影響矩陣本身,也會影響任何基於這些矩陣的視覺化或建模。

還記得在 chardonnay 的文字雲中,「Marvin」和「Gaye」是分開的詞嗎?使用雙詞詞組時,權杖化會擷取所有兩字的組合。請觀察在本練習中,文字雲會出現什麼變化。

本練習會使用 stringrstr_subset。請注意,其他 DataCamp 課程會更詳細介紹正規表示式。提醒一下,正規表示式中的 ^ 會比對雙詞詞組中「開頭」的位置。

本練習屬於課程

R 的 Bag-of-Words 文本探勘

檢視課程

練習說明

chardonnay 的推文已清理並整理成名為 bigram_dtm 的 DTM。

  • bigram_dtm 轉換為矩陣,建立 bigram_dtm_m
  • colSums() 作用在 bigram_dtm_m 上,建立由詞頻組成的物件 freq
  • 使用 names(freq) 取出詞組的字元向量,指定給 bi_words
  • bi_words 傳入 str_subset(),搭配比對樣式 "^marvin",檢視所有以「marvin」開頭的雙詞詞組。
  • 繪製簡單的 wordcloud(),將 bi_wordsfreqmax.words = 15 傳入函式。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create bigram_dtm_m
___ <- ___(___)

# Create freq
___ <- ___(___)

# Create bi_words
___ <- ___(___)

# Examine part of bi_words
___(___, ___)

# Plot a word cloud
___(___, ___, ___)
編輯並執行程式碼