變種人的群組
除了依群組計算摘要統計之外,你也可以對欄位進行 mutate,為每個群組計算各自的值。例如,常見的標準化方法是先減去平均數,再除以標準差。你可以用下列程式碼對各群組分別做標準化。
a_tibble %>%
group_by(grp1, grp2) %>%
mutate(normalized_x = (x - mean(x)) / sd(x))
本練習屬於課程
使用 R 的 sparklyr:Spark 入門
練習說明
我們已經為你建立名為 spark_conn 的 Spark 連線。連到 Spark 中曲目中繼資料的 tibble 也已預先定義為 track_metadata_tbl。
- 以
artist_name對track_metadata的內容進行分組。 - 新增名為
time_since_first_release的欄位。- 令此欄位等於群組內的
year減去該藝人首次發行曲目的year(也就是min()的year)。
- 令此欄位等於群組內的
- 依
time_since_first_release的遞減順序排列列。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Group by artist
___ %>%
# Calc time since first release
___ %>%
# Arrange by descending time since first release
___