グループへの mutate 適用
グループ別の要約統計量を計算するだけでなく、グループ固有の値を使って列を mutate することもできます。たとえば、値を正規化する手法として、平均を引いてから標準偏差で割る方法があります。グループ固有の正規化は、次のコードで実行できます。
a_tibble %>%
group_by(grp1, grp2) %>%
mutate(normalized_x = (x - mean(x)) / sd(x))
この演習はコースの一部です
sparklyr を使った Spark 入門(R)
演習の手順
Spark への接続は spark_conn として作成済みです。Spark に保存されたトラックのメタデータに紐付けられた tibble は track_metadata_tbl として事前に定義されています。
track_metadataの内容をartist_nameでグループ化します。time_since_first_releaseという新しい列を追加します。- この列は、グループ内の
yearからそのアーティストが初めてトラックをリリースした年(つまりmin()のyear)を引いた値にします。
- この列は、グループ内の
time_since_first_releaseの降順で行を並べ替えます。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Group by artist
___ %>%
# Calc time since first release
___ %>%
# Arrange by descending time since first release
___