始める無料で始める

グループへの mutate 適用

グループ別の要約統計量を計算するだけでなく、グループ固有の値を使って列を mutate することもできます。たとえば、値を正規化する手法として、平均を引いてから標準偏差で割る方法があります。グループ固有の正規化は、次のコードで実行できます。

a_tibble %>%
  group_by(grp1, grp2) %>%
  mutate(normalized_x = (x - mean(x)) / sd(x))

この演習はコースの一部です

sparklyr を使った Spark 入門(R)

コースを見る

演習の手順

Spark への接続は spark_conn として作成済みです。Spark に保存されたトラックのメタデータに紐付けられた tibble は track_metadata_tbl として事前に定義されています。

  • track_metadata の内容を artist_name でグループ化します。
  • time_since_first_release という新しい列を追加します。
    • この列は、グループ内の year からそのアーティストが初めてトラックをリリースした年(つまり min()year)を引いた値にします。
  • time_since_first_release の降順で行を並べ替えます。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Group by artist
  ___ %>%
  # Calc time since first release
  ___ %>%
  # Arrange by descending time since first release
  ___
コードを編集して実行