or
本練習屬於課程
由於文字屬於非結構化資料,需要先進行一定程度的整理,才能轉換成可分析的形式。本章將帶你透過斷詞(tokenize)、清理,並將文字視為類別資料,來為文字加入結構。
當前練習
雖然計數有用,但視覺化更能傳達重點。本章將帶你把 ggplot2 的觀念應用到 tidy 文字資料上。
詞頻與視覺化能提供內容的一些線索,但我們還能做得更多。本章將超越單純的詞頻,分析文字的情緒或情感傾向。
在最後一章,我們將超越詞頻,找出文件集合中的潛在主題。我們會使用一種標準的主題模型──潛在 Dirichlet 分配(latent Dirichlet allocation)。