開始使用免費開始

變種人的群組

除了依群組計算摘要統計之外,你也可以對欄位進行 mutate,為每個群組計算各自的值。例如,常見的標準化方法是先減去平均數,再除以標準差。你可以用下列程式碼對各群組分別做標準化。

a_tibble %>%
  group_by(grp1, grp2) %>%
  mutate(normalized_x = (x - mean(x)) / sd(x))

本練習屬於課程

使用 R 的 sparklyr:Spark 入門

檢視課程

練習說明

我們已經為你建立名為 spark_conn 的 Spark 連線。連到 Spark 中曲目中繼資料的 tibble 也已預先定義為 track_metadata_tbl

  • artist_nametrack_metadata 的內容進行分組。
  • 新增名為 time_since_first_release 的欄位。
    • 令此欄位等於群組內的 year 減去該藝人首次發行曲目的 year(也就是 min()year)。
  • time_since_first_release 的遞減順序排列列。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Group by artist
  ___ %>%
  # Calc time since first release
  ___ %>%
  # Arrange by descending time since first release
  ___
編輯並執行程式碼