每個問題的平均回答數
上一題你建立的資料表已預先載入為 tagged_answers。你可以用這個資料表來判斷每個問題平均會得到多少個回答。
tagged_answers <- question_answer_counts %>%
inner_join(question_tags, by = c("id" = "question_id")) %>%
inner_join(tags, by = c("tag_id" = "id"))
這個資料表中的重點變數包括:n(每個問題的回答數),以及 tag_name(每個問題所對應的標籤名稱)。
讓我們用幾個常用的 dplyr 動詞來找出每個問題平均會有多少個回答。
本練習屬於課程
使用 dplyr 進行資料表連接
練習說明
- 以
tag_name聚合tagged_answers資料表。 - 彙總
tagged_answers,計算questions的數量與average_answers(平均回答數)。 - 將結果中的
questions欄位依遞減排序。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
tagged_answers %>%
# Aggregate by tag_name
___ %>%
# Summarize questions and average_answers
summarize(questions = ___,
average_answers = ___) %>%
# Sort the questions in descending order
___