建立適合樹狀圖的 TDM
現在你已經了解建立樹狀圖的步驟,可以把它套用到文字資料。不過在此之前,你需要先用 tm 套件的 removeSparseTerms() 來限制 TDM 中的字詞數量。為什麼要調整 TDM/DTM 的稀疏度呢?
TDM 與 DTM 都很稀疏,也就是大多數位置都是 0。記得嗎?1000 則推文就可能產生一個包含超過 3000 個詞彙的 TDM!這樣的樹狀圖會非常雜亂,幾乎無法解讀,尤其當你處理更多文字時更是如此。
在多數專業情境中,一個好的樹狀圖通常建立在包含 25 到 70 個詞彙的 TDM 上。超過 70 個詞彙,視覺化往往會變得擁擠且難以理解;反過來說,少於 25 個詞彙,樹狀圖可能就畫不出具關聯且有洞見的群集。
使用 removeSparseTerms() 時,sparse 參數會影響 TDM 中保留的總詞彙數。sparse 越接近 1,就會保留越多詞彙。這個值代表在 TDM 中,每個詞允許為 0 的比例門檻。
本練習屬於課程
R 的 Bag-of-Words 文本探勘
練習說明
已使用 chardonnay 推文建立 tweets_tdm。
- 在主控台印出
tweets_tdm的維度。 - 對
tweets_tdm使用removeSparseTerms()並設定sparse = 0.95,建立tdm1。 - 對
tweets_tdm使用removeSparseTerms()並設定sparse = 0.975,建立tdm2。 - 在主控台印出
tdm1,查看剩下多少詞彙。 - 在主控台印出
tdm2,查看剩下多少詞彙。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Print the dimensions of tweets_tdm
___
# Create tdm1
___ <- ___(___, ___)
# Create tdm2
___ <- ___(___, ___)
# Print tdm1
___
# Print tdm2
___