開始使用免費開始

建立適合樹狀圖的 TDM

現在你已經了解建立樹狀圖的步驟,可以把它套用到文字資料。不過在此之前,你需要先用 tm 套件的 removeSparseTerms() 來限制 TDM 中的字詞數量。為什麼要調整 TDM/DTM 的稀疏度呢?

TDM 與 DTM 都很稀疏,也就是大多數位置都是 0。記得嗎?1000 則推文就可能產生一個包含超過 3000 個詞彙的 TDM!這樣的樹狀圖會非常雜亂,幾乎無法解讀,尤其當你處理更多文字時更是如此。

在多數專業情境中,一個好的樹狀圖通常建立在包含 25 到 70 個詞彙的 TDM 上。超過 70 個詞彙,視覺化往往會變得擁擠且難以理解;反過來說,少於 25 個詞彙,樹狀圖可能就畫不出具關聯且有洞見的群集。

使用 removeSparseTerms() 時,sparse 參數會影響 TDM 中保留的總詞彙數。sparse 越接近 1,就會保留越多詞彙。這個值代表在 TDM 中,每個詞允許為 0 的比例門檻。

本練習屬於課程

R 的 Bag-of-Words 文本探勘

檢視課程

練習說明

已使用 chardonnay 推文建立 tweets_tdm

  • 在主控台印出 tweets_tdm 的維度。
  • tweets_tdm 使用 removeSparseTerms() 並設定 sparse = 0.95,建立 tdm1
  • tweets_tdm 使用 removeSparseTerms() 並設定 sparse = 0.975,建立 tdm2
  • 在主控台印出 tdm1,查看剩下多少詞彙。
  • 在主控台印出 tdm2,查看剩下多少詞彙。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Print the dimensions of tweets_tdm
___

# Create tdm1
___ <- ___(___, ___)

# Create tdm2
___ <- ___(___, ___)

# Print tdm1
___

# Print tdm2
___
編輯並執行程式碼