lda_topics 包含對 Twitter 資料執行 LDA 後輸出的主題。請記住,每個主題都是語料庫中所有不重複單字的機率集合。在這裡,每則推文都是一份文件,而 beta 欄位包含單字的機率。
lda_topics
beta
本練習屬於課程
試著完成這個範例程式碼,體驗一下這個練習。
# Print the output from LDA run ___
由於文字屬於非結構化資料,需要先進行一定程度的整理,才能轉換成可分析的形式。本章將帶你透過斷詞(tokenize)、清理,並將文字視為類別資料,來為文字加入結構。
雖然計數有用,但視覺化更能傳達重點。本章將帶你把 ggplot2 的觀念應用到 tidy 文字資料上。
詞頻與視覺化能提供內容的一些線索,但我們還能做得更多。本章將超越單純的詞頻,分析文字的情緒或情感傾向。
在最後一章,我們將超越詞頻,找出文件集合中的潛在主題。我們會使用一種標準的主題模型──潛在 Dirichlet 分配(latent Dirichlet allocation)。
當前練習