機核密度圖(Kernel density plot)
現在你已經認識機核密度圖了,來動手做一個吧!記住,它就像是平滑過的長條圖,但不會受到 binwidth 的影響。這個練習會帶你用情緒分數來建立機核密度圖。
在這個練習中,你會繪製 2 條機核密度曲線:一條是《阿伽門農》(Agamemnon),另一條是《綠野仙蹤》(The Wizard of Oz)。對兩本書,你都要和「afinn」詞典做一次 inner_join()。回想一下,「afinn」詞典的詞彙分數範圍是 -5 到 5。整理為 tidy 格式後,兩本書都會保留單字及其在詞典中的對應分數。
接著,使用 bind_rows() 把結果按列結合成較大的資料框,並用 ggplot2 建立圖表。
從圖中你可以判斷哪一本書使用較多正向或負向的語言。兩者顯然有重疊,因為桃樂絲也會遇到負面事件;但你可以推論,與《阿伽門農》相比,《綠野仙蹤》的機核密度顯示出更高機率的正向語言。
我們已經載入 ag 和 oz,分別為《阿伽門農》和《綠野仙蹤》的 tidy 版本,並建立了 afinn,作為 tidytext 中 "afinn" 詞典的子集。
本練習屬於課程
R 情感分析
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
ag_afinn <- ag %>%
# Inner join to afinn lexicon
___(___, by = c("term" = "word"))
oz_afinn <- oz %>%
# Inner join to afinn lexicon
___
# Combine
all_df <- ___(agamemnon = ___, oz = ___, .id = "___")