TM 複習(II)
現在來建立一個 Document Term Matrix(DTM)。在 DTM 中:
- 矩陣的每一列代表一份文件。
- 每一欄是一個獨特的詞彙標記。
- 矩陣中的數值對應到單一文件的用詞頻率。
DTM 是許多「bag of words」分析的基礎。之後在本課程中,你也會用到相關的 Term Document Matrix(TDM)。TDM 是 DTM 的轉置;也就是說,欄代表文件,列代表獨特的詞彙標記。
你應該在清理完語料庫(使用 clean_corpus())之後再建立 DTM。為此,請對語料物件呼叫 DocumentTermMatrix()。
tm_dtm <- DocumentTermMatrix(tm_clean)
如果你需要更深入的複習,請參考課程[Text Mining with Bag-of-Words in R](https://www.datacamp.com/courses/text-mining-with-bag-of-words-in-r)。希望這兩個練習已經讓你做好準備,開始展開情緒分析之旅!
請注意:這是來自 Twitter 的真實資料,因此可能含有不雅或具攻擊性的內容(本練習以及後續任何同樣使用 Twitter 真實資料的練習皆然)。
本練習屬於課程
R 情感分析
練習說明
我們已建立一個 VCorpus() 物件 clean_text,其中包含 1000 則提到咖啡的推文。這些推文已依前述的前處理步驟清理完畢,你的目標是從中建立一個 DTM。
- 對語料
clean_text套用DocumentTermMatrix(),建立一個以詞頻加權的 DTM,命名為tf_dtm。 - 使用
as.matrix()將DocumentTermMatrix()物件轉成一般矩陣。將新物件命名為tf_dtm_m。 - 使用
dim()檢查矩陣的維度。 - 使用中括號索引查看矩陣的一個子集。
- 選取第 16 到 20 列,以及第 2975 到 2985 欄。
- 留意單字「working」的頻率值。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# clean_text is pre-defined
clean_text
# Create tf_dtm
tf_dtm <- ___
# Create tf_dtm_m
tf_dtm_m <- ___
# Dimensions of DTM matrix
___
# Subset part of tf_dtm_m for comparison
___[___, ___]