開始使用免費開始

TM 複習(II)

現在來建立一個 Document Term Matrix(DTM)。在 DTM 中:

  • 矩陣的每一列代表一份文件。
  • 每一欄是一個獨特的詞彙標記。
  • 矩陣中的數值對應到單一文件的用詞頻率。

DTM 是許多「bag of words」分析的基礎。之後在本課程中,你也會用到相關的 Term Document Matrix(TDM)。TDM 是 DTM 的轉置;也就是說,欄代表文件,列代表獨特的詞彙標記。

你應該在清理完語料庫(使用 clean_corpus())之後再建立 DTM。為此,請對語料物件呼叫 DocumentTermMatrix()

tm_dtm <- DocumentTermMatrix(tm_clean)

如果你需要更深入的複習,請參考課程[Text Mining with Bag-of-Words in R](https://www.datacamp.com/courses/text-mining-with-bag-of-words-in-r)。希望這兩個練習已經讓你做好準備,開始展開情緒分析之旅!

請注意:這是來自 Twitter 的真實資料,因此可能含有不雅或具攻擊性的內容(本練習以及後續任何同樣使用 Twitter 真實資料的練習皆然)。

本練習屬於課程

R 情感分析

檢視課程

練習說明

我們已建立一個 VCorpus() 物件 clean_text,其中包含 1000 則提到咖啡的推文。這些推文已依前述的前處理步驟清理完畢,你的目標是從中建立一個 DTM。

  • 對語料 clean_text 套用 DocumentTermMatrix(),建立一個以詞頻加權的 DTM,命名為 tf_dtm
  • 使用 as.matrix()DocumentTermMatrix() 物件轉成一般矩陣。將新物件命名為 tf_dtm_m
  • 使用 dim() 檢查矩陣的維度。
  • 使用中括號索引查看矩陣的一個子集。
  • 選取第 16 到 20 列,以及第 2975 到 2985 欄。
  • 留意單字「working」的頻率值。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# clean_text is pre-defined
clean_text

# Create tf_dtm
tf_dtm <- ___

# Create tf_dtm_m
tf_dtm_m <- ___

# Dimensions of DTM matrix
___

# Subset part of tf_dtm_m for comparison
___[___, ___]
編輯並執行程式碼